Руководство разработчика по моделям с открытыми весами
Open-weight модели: что дают веса и лицензия, почему сложно запускать frontier-модели и как выбрать API, провайдера или локальную сборку.
Модель с открытыми весами (open-weight model) — это модель, обученные веса которой, то есть выученные параметры, сохранённые в виде файла, публикуются для скачивания, обычно вместе с кодом инференса, необходимым для их запуска, но без обучающих данных и без обучающего пайплайна, с помощью которого они были получены.
Если вы до сих пор обращались к хостинговому API и задумывались, нельзя ли просто скачать модель и запустить её так же, как вы устанавливаете пакет, ответ состоит из двух частей: да, скачать можно; нет, это не значит, что вы сможете её запустить. В этом руководстве разбирается, что входит в релиз с открытыми весами, почему лицензия важнее ярлыка, что проверить перед тем, как строить решение на такой модели, что в действительности означает развёртывание frontier-модели и какие три пути реально доступны разработчику приложений без GPU.
Ключевые выводы
- Релиз с открытыми весами даёт вам файл весов и, как правило, код инференса; обучающие данные и код обучения обычно не публикуются — и именно в этом заключается вся разница с open-source AI.
- «Открытые веса» описывают то, что было опубликовано; лицензия описывает то, что вам разрешено делать, и её условия варьируются от неограниченного коммерческого использования до применения исключительно в исследовательских целях, причём кастомные лицензии — распространённая практика.
- В model card модели Kimi K3 указаны 2,8 трлн параметров суммарно, 104 млрд активируемых на токен, веса в формате MXFP4 с активациями MXFP8 и контекст в 1 048 576 токенов, а её репозиторий содержит около 1,56 ТБ файлов весов.
- Карточка Kimi K3 рекомендует vLLM, SGLang или TokenSpeed для развёртывания и отсылает к хостинговому API; о запуске модели на рабочей станции там не говорится.
- Для разработчика приложений реальные варианты — хостинговый API издателя, сторонний inference-провайдер или квантизованная сборка от сообщества в Ollama либо LM Studio.
Что на самом деле даёт модель с открытыми весами?
Релиз с открытыми весами содержит веса, обычно код инференса и конфиг с описанием архитектуры — и крайне редко хоть что-то о том, как модель обучалась. Веса и есть модель: миллиарды чисел, сохранённых в числовом формате вроде 16-битных float или 4-битного квантизованного типа и размещённых в тензорах, которых ожидает архитектура. Код инференса загружает эти тензоры и выполняет прямой проход. Всё, что находится выше по конвейеру, — обучающий корпус, фильтрация данных, скрипты обучения — остаётся у издателя.
Именно это упущение отличает открытые веса от открытого исходного кода. Open Source AI Definition, опубликованное Open Source Initiative, требует большего, чем файл весов: параметров, кода, который обучает и запускает систему, и описания обучающих данных, достаточно полного, чтобы компетентный инженер мог воссоздать нечто эквивалентное. Самого датасета в этом списке нет. Релиз, в котором есть только веса и код инференса, этой планке не соответствует, каким бы разрешительным ни была его лицензия.
Почему ярлык не говорит ни о чём, а лицензия говорит обо всём
Ярлык «открытые веса» описывает то, что было опубликовано, а не то, что вам разрешено с этим делать. Условия задаёт лицензия, приложенная к весам, и эти условия варьируются от неограниченного коммерческого использования до применения только в исследованиях, причём кастомные лицензии, написанные самим издателем, встречаются часто. Две модели могут быть доступны для скачивания с одного и того же хаба и при этом накладывать совершенно разные обязательства.
Kimi K3 — наглядный пример. Moonshot публикует её веса и сопутствующий код под лицензией, которую написала сама, а не под стандартной. Файл лицензии Kimi K3 разрешает коммерческое использование, модификацию и распространение, но вводит порог по выручке для операторов model-as-a-service и требование атрибуции для развёртываний выше определённого порога по месячной выручке или числу активных пользователей в месяц. Ничего из этого не видно из слова «открытая». Это обнаруживается только чтением файла.
Что проверять в лицензии модели с открытыми весами?
Прежде чем строить решение на модели с открытыми весами, прочитайте её лицензию на предмет четырёх вещей: разрешено ли коммерческое использование, можно ли распространять веса, можно ли дообучать модель и публиковать производные, и что запрещает политика допустимого использования.
- Коммерческое использование. Некоторые лицензии разрешают его безоговорочно, некоторые ограничивают при превышении порога по выручке или числу пользователей, некоторые запрещают. Проверьте, нет ли обязательств, срабатывающих при масштабировании.
- Распространение. Можете ли вы поставлять веса внутри собственного продукта или образа контейнера — или только направлять пользователей к загрузке у издателя?
- Дообучение и производные. Убедитесь, что вам разрешено изменять веса, и проверьте, под какой лицензией должна выходить производная модель и действуют ли правила именования.
- Ограничения допустимого использования. Многие лицензии содержат приложение с политикой использования, запрещающее конкретные сценарии. Читайте его применительно к вашему реальному продукту, а не к демо.
Считайте файл лицензии в репозитории источником истины. Теги в метаданных хаба и сторонние пересказы устаревают.
Бесплатно скачать — не значит бесплатно запустить
Возможность скачать веса модели и возможность их обслуживать — разные вопросы, и для модели с триллионами параметров ответ на второй — это дата-центр, а не ноутбук.
В сводке по модели Kimi K3 указаны 2,8 трлн параметров суммарно в архитектуре mixture-of-experts, из которых 104 млрд активируются на токен, 896 экспертов, из которых на токен выбирается 16, и длина контекста 1 048 576 токенов. Та же таблица приводит числовой формат: веса MXFP4 и активации MXFP8, зафиксированные ещё на этапе обучения, а не применённые к готовой модели. Даже при четырёх битах 2,8 трлн параметров — это хранилище триллионного масштаба: во вкладке Files репозитория видно, что веса разбиты на 96 шардов safetensors общим объёмом около 1,56 ТБ, а типы тензоров указаны как F32, BF16 и U8. Каждый из этих байтов должен находиться в памяти ускорителя, чтобы обслуживать запрос с приемлемой скоростью, и «всего 104 млрд активных» этот объём не уменьшает, потому что набор срабатывающих экспертов меняется на каждом токене.
Сама карточка модели говорит, как её предполагается запускать. В разделе о развёртывании названы vLLM, SGLang и TokenSpeed как движки для использования, а также дана отсылка к хостинговому API; для этой модели существует специальный рецепт TokenSpeed. О локальной установке в карточке не сказано ничего. Moonshot анонсировала Kimi K3 16 июля 2026 года и выложила веса на Hugging Face 27 июля 2026 года — в дату, указанную в том анонсе.
Как реально запустить модель с открытыми весами?
Для разработчика приложений модель с открытыми весами доступна тремя путями: хостинговый API издателя, сторонний inference-провайдер, который запускает опубликованные веса, или более компактная квантизованная сборка от сообщества, работающая локально через инструмент вроде Ollama или LM Studio. Скачивание «сырых» весов frontier-модели в этот список не входит — по причинам, изложенным выше.
| Путь | Кто запускает веса | За что вы платите | Куда уходят промпты | Типичный сценарий |
|---|---|---|---|---|
| Хостинговый API издателя | Издатель модели | Токены (платформа Moonshot также требует пополнить баланс аккаунта, прежде чем kimi-k3 станет доступной) | Серверы издателя | Самый быстрый доступ к полной модели |
| Сторонний inference-провайдер | Провайдер вроде Together AI, который Hugging Face указывает как inference-провайдера для Kimi K3; Modal относится к той же категории | Токены или часы работы оборудования | Серверы провайдера | Те же веса, но другие условия, регион или цена |
| Квантизованная сборка от сообщества | Вы сами, через Ollama или LM Studio | Собственное оборудование и электроэнергия | Никуда | Более компактные модели, приватные данные |
Две оговорки к третьей строке. Квантизации Kimi K3 от сообщества действительно существуют, и Hugging Face перечисляет десятки квантизованных производных, но большинство из них остаются сборками на 2,8 трлн параметров либо прунингованными версиями на сотни миллиардов параметров, а не загрузками «под ноутбук». Локальный путь работает для моделей соответствующего размера — именно им и посвящены руководства по Ollama и Jan.ai.
Хорошая новость в том, что переключение между путями — это в основном смена base_url. Быстрый старт Kimi K3 от Moonshot предоставляет OpenAI-совместимый эндпоинт, как и локальный сервер Ollama:
from openai import OpenAI
# Publisher API
client = OpenAI(base_url="https://api.moonshot.ai/v1", api_key="YOUR_KEY")
# Serving provider (check your provider's docs for its endpoint)
# client = OpenAI(base_url="https://<provider>/v1", api_key="YOUR_KEY")
# Local runtime via Ollama
# client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")
response = client.chat.completions.create(
model="kimi-k3", # model id differs per route
messages=[{"role": "user", "content": "Summarise this licence."}],
)
print(response.choices[0].message.content)
Совместимый не значит идентичный. Kimi K3, например, никогда не отключает рассуждения, принимает поле reasoning_effort со значениями "low", "high" или "max" и возвращает поле reasoning_content, которое каждый последующий шаг в том же диалоге обязан передавать дальше без изменений. Проверьте документацию издателя на наличие подобных полей, прежде чем считать замену бесшовной.
Как выбрать между тремя путями?
Выбор между хостинговым API, сторонним inference-провайдером и локальной квантизованной сборкой сводится к тому, куда уходят ваши данные, какую задержку способен выдержать продукт и что вам предпочтительнее — платить за токены или за часы работы постоянно запущенного оборудования. Если промпты содержат данные, которые не могут покидать вашу инфраструктуру, то локальный путь или провайдер с приемлемым для вас соглашением об обработке данных становится тем ограничением, которое определяет всё остальное. Если функциональность интерактивная, API издателя и inference-провайдеры дают вам полную модель на скорости дата-центра, тогда как квантизованная сборка на ноутбуке меняет качество и пропускную способность на нулевую передачу данных вовне. Если нагрузка неравномерная, оплата по токенам дешева на старте и дорога на объёме; если она стабильна и велика, часы работы оборудования или собственное железо сглаживают кривую. Ответьте на эти три вопроса в указанном порядке, и путь обычно выберется сам.
Заключение
Открытые веса означают, что вы получаете параметры, но не рецепт — и не гарантию, что ваше оборудование сможет с ними хоть что-то сделать. Прочитайте файл лицензии в репозитории, прочитайте раздел карточки о развёртывании и выбирайте путь исходя из данных, задержки и структуры затрат, а не из того, что доступно для скачивания. Если локальный путь вам подходит, начните с руководства по приватному запуску моделей с Jan.ai, которое напрямую опирается на всё сказанное здесь.
Частые вопросы
В чём разница между файлами safetensors и GGUF на Hugging Face?
Safetensors — это формат хранения тензоров от Hugging Face, который издатели используют для оригинальных весов; он хранит только тензоры, поэтому конфиг и токенизатор поставляются отдельными файлами, и загружается без выполнения кода на основе pickle. GGUF — бинарный формат, созданный для llama.cpp и используемый Ollama и LM Studio; один файл объединяет квантизованные тензоры и стандартизованные метаданные. Издатели обычно выпускают safetensors, а сообщество конвертирует их в GGUF для локальных рантаймов.
Могу ли я обращаться к хостинговому API модели с открытыми весами через Anthropic SDK вместо OpenAI SDK?
Да, если издатель предоставляет Anthropic-совместимый эндпоинт, — а это особенность конкретного провайдера, а не свойство открытых весов. У Moonshot он есть: укажите в SDK базовый URL https://api.moonshot.ai/anthropic, и kimi-k3 будет отвечать на эндпоинте Messages по адресу /anthropic/v1/messages. При этом действуют соглашения Anthropic: max_tokens обязателен, уровень усилий на рассуждения задаётся через output_config.effort (low, high или max), а каждый thinking-блок, включая signature, должен возвращаться в точности в том виде, в котором он пришёл.
Распространяется ли на квантизованную сборку от сообщества та же лицензия, что и на оригинальные веса?
Исходите из того, что да. Квантизация GGUF или MLX от сообщества является производной от весов издателя, поэтому на практике условия лицензии издателя, включая условия коммерческого использования, правила атрибуции и любую политику допустимого использования, продолжают действовать — вместе со всем, что добавляет тот, кто повторно выложил модель. Тег лицензии в репозитории на Hugging Face выставляет тот, кто его загрузил, и он может отсутствовать или быть неверным, поэтому читайте исходный файл LICENSE, а не метаданные производной сборки.