27 июля Moonshot AI выложила веса Kimi K3 — модели на 2,8 трлн параметров, которая до этого работала только через платный API. Вместе с весами открыли технический отчёт и три внутренних инструмента, на которых модель обучали.

Разберём релиз по частям: что подтверждено независимыми замерами, что остаётся заявлением компании и на какие детали стоит посмотреть до того, как планировать внедрение.

TL;DR

  • 2,8 трлн параметров, MoE: на каждый токен работают 16 экспертов из 896, это около 50 млрд активных параметров. Контекст — 1 млн токенов, зрение встроено без отдельного модуля.

  • 57 баллов в индексе Artificial Analysis — четвёртое место, уровень Opus 4.8 и GPT-5.5. Среди открытых моделей это лучший результат: GLM-5.2 — 51, DeepSeek V4 Pro — 44.

  • Первое место на LMArena Frontend Code Arena и 76% побед над Claude Fable 5 в слепых сравнениях по фронтенду. Арена узкая, на общий интеллект это не переносится.

  • Заявленный прирост эффективности в 2,5 раза против K2 — цифра из технического отчёта Moonshot, независимо пока не перепроверена.

  • Веса занимают около 1,4 ТБ даже в MXFP4. «Скачать и запустить дома» не выйдет.

  • Лицензия своя, не Modified MIT, как у прошлых моделей: есть порог по выручке и требование показывать бренд в интерфейсе на большом масштабе.

  • Отдельно открыли FlashKDA, MoonEP и AgentENV — куски обучающей инфраструктуры, которые обычно наружу не выходят.

16 экспертов из 896

Kimi K3 устроена как разреженная MoE‑модель. Полный размер — 2,8 трлн параметров, но на обработку одного токена включается только 16 из 896 экспертов, примерно 50 млрд параметров живого вычисления. Схема даёт большую ёмкость знаний при относительно скромной стоимости шага генерации.

В основе — два архитектурных решения: Kimi Delta Attention и Attention Residuals. Первое меняет способ работы с длинной последовательностью, второе — то, как информация проходит через глубину сети. Полностью softmax‑внимание в модели больше не используется: часть слоёв в каждом блоке заменена на KDA.

Здесь начинается первая оговорка. Moonshot заявляет, что архитектура вместе с новым рецептом обучения даёт около 2,5-кратного прироста эффективности масштабирования против K2 — “больше интеллекта на единицу вычислений”. Цифра взята из собственного технического отчёта компании. Отчёт подробный и с методикой, но это внутренний замер, а не независимая проверка.

Что показали независимые замеры

В индексе Artificial Analysis Kimi K3 набрала 57 баллов. Это четвёртое место в общем зачёте и первое среди моделей с открытыми весами.

Как выглядит расстановка:

  • позади Claude Fable 5 и GPT-5.6 Sol;

  • на уровне Claude Opus 4.8 и GPT-5.5;

  • заметно выше открытых конкурентов: GLM-5.2 — 51, DeepSeek V4 Pro — 44.

На агентных задачах прогресс поколения виден яснее всего: в GDPval v2 рейтинг Elo вырос с 1190 у K2.6 до 1668. Отдельная витрина — LMArena Frontend Code Arena, где Kimi K3 заняла первое место, а в слепых парных сравнениях по фронтенду выиграла у Claude Fable 5 в 76% случаев.

Последнюю цифру стоит читать аккуратно. Frontend Code Arena — узкая площадка с конкретным типом задач и субъективной оценкой результата разработчиками. Победа там означает сильный фронтенд‑код, но не общее превосходство над Fable 5; сводный индекс это подтверждает.

1,4 терабайта, о которые всё упирается

Главное практическое ограничение релиза не в качестве модели. Веса Kimi K3 занимают порядка 1,4 ТБ, и это уже в формате MXFP4 — четырёхбитном представлении, которое сжимает модель по сравнению с исходной точностью.

Развернуть такое на рабочей станции нельзя. Речь про многокарточные серверные конфигурации, и сообщения в духе «запустил фронтир‑модель на домашнем железе» пока стоит проверять на предмет того, что именно там запускалось.

Поэтому реальный путь для большинства команд — арендованные мощности. День запуска Moonshot закрыла плотно: поддержку заявили Together AI, Fireworks, DigitalOcean, Nebius Token Factory, Baseten и Modal, а vLLM выкатил оптимизированный инференс в день релиза. По API модель стоит 3 доллара за миллион входных токенов и 15 за миллион выходных, кэшированный вход — 30 центов.

Для сравнения экономики: по расчёту Artificial Analysis полный прогон их индекса обходится в среднем в 0,94 доллара за задачу против 1,04 у GPT-5.6 Sol и 1,80 у Claude Opus 4.8.

Лицензия: свободно до определённого порога

Формулировку «открытые веса» тут стоит уточнить, и это самая недооценённая часть релиза.

Прошлые модели семейства Kimi выходили под Modified MIT. Для K3 Moonshot написала собственную лицензию. Скачивание, дообучение и использование свободны, обязательное условие — сохранять исходный текст лицензии.

Ограничения включаются на масштабе:

  • продукт с аудиторией свыше 100 млн активных пользователей в месяц или выручкой больше 20 млн долларов в месяц обязан показывать «Kimi K3» в интерфейсе;

  • отдельный пункт написан под провайдеров, которые перепродают модель как сервис: им нужно отдельное соглашение с Moonshot.

Для исследователей, стартапов и внутренних корпоративных внедрений это ничего не меняет. Пункт написан под облачные платформы, которые захотят зарабатывать на модели. Но если планируется публичный продукт с расчётом на рост, текст лицензии нужно прочитать целиком до начала интеграции, а не после.

Инфраструктура, которую обычно не отдают

Помимо весов Moonshot открыла три компонента стека:

  • FlashKDA — CUDA‑ядра на CUTLASS под Kimi Delta Attention. Заявленное ускорение обработки входного контекста — в 1,72–2,22 раза относительно flash‑linear‑attention на GPU H20. Это бенчмарк производителя на конкретном железе, на других картах цифры будут другими. Проект был открыт ещё в апреле.

  • MoonEP — библиотека обмена данными между экспертами MoE при распределённом обучении.

  • AgentENV — платформа изолированных песочниц на Firecracker microVM, сделанная вместе с kvcache‑ai. Умеет дешёвые снапшоты, паузу и ветвление окружений, что нужно для обучения агентов с подкреплением в промышленных объёмах.

AgentENV интереснее самой модели с точки зрения того, что вообще редко выходит наружу. Обученные веса выкладывают многие, а инфраструктуру, в которой агентов гоняют тысячами параллельных сессий с возможностью откатить окружение, лаборатории обычно держат при себе.

На что смотреть в ближайшие месяцы

Короткий список того, по чему можно будет судить о реальном эффекте релиза:

  1. Квантизация от сообщества. Если K3 удастся ужать до одной восьмикарточной ноды без заметной потери качества, круг тех, кто может её развернуть, вырастает на порядок. Если нет — открытость остаётся преимуществом для тех, у кого уже есть стойка.

  2. Независимое воспроизведение 2,5×. Пока это цифра из отчёта. Внешние замеры на сопоставимых бюджетах покажут, насколько KDA действительно меняет экономику обучения.

  3. Ответ GLM и DeepSeek. Разрыв в 6 и 13 баллов индекса — не пропасть, и оба конкурента работают в том же цикле выпусков.

  4. Практика по лицензии. Как поведут себя MaaS‑провайдеры и станет ли отдельное соглашение с Moonshot стандартной процедурой.

Отдельный сценарий для команд с ограничениями по передаче данных: открытые веса снимают вопрос, который API не решал ни за какие деньги. Модель в собственном контуре не отправляет запросы на внешние серверы, и обсуждение трансграничной передачи данных на этом заканчивается. Ценой в 1,4 ТБ и стойку под неё.


Отсюда главный вопрос к читателям. Открытые веса, которые физически может развернуть пара сотен организаций в мире, — это про доступность или про репутацию и давление на цены закрытых API? И если вы уже гоняли K3 через API или у провайдеров: как она держится на длинном контексте ближе к верхней границе миллиона токенов и совпадают ли впечатления по фронтенд‑коду с результатами арены?

Ссылки по теме

Источник: Технический отчёт Kimi K3 — Moonshot AI.

Комментарии (0)