
20 августа на OpenRouter появилась строчка stealth/ox-alpha. Без карточки модели и даже намёка, кто её выложил. Провайдер значился как «Anonymous». Цена — ноль. Контекст — мильон. Площадка предупреждала: мы не владелец этой модели, а просто маршрутизируем запросы.
Через шесть дней у анона было имя, десятки триллионов обработанных токенов и полмиллиона разработчиков, которые за это время успели залить в него рабочий код. Спойлер, который уже не спойлер: это оказалась GLM-5.3-Flash от китайской Z.ai.
Но путь от «непонятно что» до «фронтир‑модели» получился драматичным и заслуживает отдельного разбора.Ну а поскольку я лично пялился в этот тред почти неделю, обновляя ленту как одержимый — расскажу вам что там произошло, по порядку.
Зачем выпускать модель без имени
Схема анонимного стелс‑релиза для Z.ai совсем не новая, и это, пожалуй, самое смешное: если вы следите за OpenRouter давно, уже видели этот трюк четыре раза.
До Ox Alpha так же анонимно выходили:
Pony Alpha (в итоге оказался GLM-5 от той же Zhipu),
Hunter Alpha (MiMo‑V2-Pro от Xiaomi),
Elephant Alpha (Lingxi Ling-2.6-flash от Ant Group)
и Owl Alpha (LongCat-2.0 от Meituan)
— и во всех четырёх случаях за псевдонимом обнаруживалась китайская лаборатория. Пятый раз общий паттерн не нарушил.
Логика стелс‑релиза по‑своему имеется: фирма выкладывает необъявленный чекпойнт под кодовым именем, ставит нулевую цену и смотрит, как он ведёт себя на реальном трафике — а не на лабораторных бенчмарках. Получает бесплатную оценку в промышленном масштабе и, если модель хороша, вирусный эффект в придачу.
Шесть дней безумия
Агент OpenCode объявил, что Ox Alpha будет бесплатной ровно неделю с почти неограниченным использованием, а у провайдера якобы есть мощности на 100 триллионов токенов в день. Модель сразу же появилась в OpenRouter и в агентной среде OpenCode, без указания разраба.
К моменту раскрытия панель OpenCode показывала 503 тысячи уникальных пользователей, 13,12 млн завершённых сессий и порядка 44 трлн обработанных токенов (цифра варьируется в источниках от 26 до 62 трлн в зависимости от даты снятия среза, но порядок колоссальный). Ранний прогон оборвал 56-дневную серию DeepSeek на вершине лидерборда OpenCode. В недельном рейтинге OpenRouter Ox Alpha заняла первое место с более чем 23 трлн токенов — вдвое больше, чем у ближайшего преследователя, DeepSeek V4 Flash. На самом OpenRouter она обработала свыше 11 трлн токенов за первые три дня — крупнейший запуск в истории площадки.
Несколько пользователей публично протестировали модель, разберём некоторые такие примеры.
Кейс: SaaS за 4,5 часа
AbdoKerdawy дал Ox Alpha полный доступ к своему компьютеру и спецификацию SaaS‑продукта. Спустя 4,5 часа модель не просто написала код — она купила домен, настроила Vercel, прошла верификацию Polar, подключила DNS, подцепила Supabase и задеплоила весь стек. 41 из 41 теста прошли.
Там были ежедневные раунды, платный рейтинг, реферальная система, крон‑джобы, платежи — то есть реальная продуктовая логика.
Похожий сценарий с покупкой домена, настройкой Vercel и подключением Supabase зафиксировал и другой автор — правда, называет цифру времени чуть иначе:
Кейс: 10,8 часов ради океана
Сколько времени у ИИ‑агента может уйти на создание трёхмерного шейдера?
superalesha показал полную сессию генерации 3D‑сцены с океаном: 2625 записей, 951 ход, 820 вызовов инструментов — и всё это одна непрерывная сессия длиной 10,8 часа. Модель рендерит кадр, делает скриншот, читает картинку обратно, решает, что брызги выглядят плохо, переписывает шейдер, рендерит заново. И так по кругу почти половину суток:
Пайплайн устроен так: референсное видео подавалось напрямую в Ox Alpha через API, модель писала покадровую раскадровку сцены, а дальше уходила в цикл «рендер — самопроверка — правка».
Как вычисляли модель
Версия про принадлежность GLM была одной из первых, но она оставалась лишь догадкой.


Один из реддиторов опубликовал результаты трёх «чёрных ящиков»‑тестов, сравнивающих Ox Alpha с публичной GLM-5.3 на сайте z.ai. Вот по каким признакам выявили модель:
При отправке шести текстов на разных языках и в разных форматах (английский, немецкий, китайский, код, эмодзи) количество токенов у Ox Alpha ровно на 75 больше, чем у GLM-5.3, — при этом смещение абсолютно стабильное на каждом тексте, что указывает на постоянный скрытый системный промпт поверх идентичного токенизатора. Модели вроде Kimi, Qwen, MiMo и MiniMax давали совершенно другие цифры.
При попытке передать некорректный параметр
reasoning_effortOx Alpha возвращала точь‑в-точь ту же строку ошибки под кодом 1210, что и официальная GLM-5.3.На температуре 0 (то есть в детерминированном режиме) обе модели выдавали идентичные форматирования, включая специфичное немецкое написание десятичных дробей в LaTeX — деталь, в которую не встроишь совпадение.
Другой разработчик, Бен Дэвис, заявил, что уверен на 99%: модель принадлежит Zhipu и, скорее всего, представляет собой невыпущенный вариант GLM-5.3. Он сослался на совпадающий видеоэнкодер, токенизатор, стиль ответов и поведение при джейлбрейке. Отдельная экспертиза (проведённая 22 августа) усилила эту догадку: трассировка стека, тот же код ошибки 1214 и совпадение токенизатора 30 из 30 тестовых проб — всё сходилось с семейством GLM. Позже модель совпала с опубликованным словарём GLM-5 на всех 95 пробах, счётчики токенов сходились с GLM-5.3 с постоянной разницей ровно в 75 токенов (та самая цифра из реддит‑разбора).
Утёкший системный промпт предписывал модели представляться исключительно как «модель ox‑alpha, разработанная нераскрытой организацией». Не помогло — токенизатор не соврёшь.
Официальное признание и что было внутри
26 августа Z.ai подтвердила журналистам Bloomberg, что Ox Alpha — новая итерация серии GLM, и в тот же вечер выложила веса на HuggingFace. Твит компании появился с чётким сообщением: представляем GLM-5.3-Flash — нативно мультимодальную модель на 320 млрд параметров (18 млрд активных) с окном контекста в миллион токенов, выпущенную под лицензией MIT, ранее протестированную анонимно как Ox Alpha и работавшую полностью на китайских ИИ‑чипах.
Тут важно не запутаться в названиях. GLM-5.3, вышедшая ещё 14 августа, — линия на базе 743 млрд параметров с фокусом на кибербезопасность, чьи открытые веса выкатывают поэтапно. GLM-5.3-Flash — отдельный мультимодальный вариант на 320 млрд параметров с немедленной публикацией под MIT.
Архитектура
Технически GLM-5.3-Flash — это mixture‑of‑experts: 320 млрд параметров всего, но на каждом токене активны только 18 млрд. По сравнению с GLM-4.5 количество активных параметров упало почти вдвое (с 32 до 18 млрд), а число слоёв — с 92 до 45. Ниже — официальная схема архитектуры.

Главная фишка — гибридная архитектура внимания, впервые применённая в серии GLM: линейное внимание захватывает локальные зависимости через моделирование состояния, а разреженное внимание достаёт релевантный глобальный контекст через лёгкий индексатор. Чтобы индексатор не съедал латентность и память при контексте в миллион токенов, инженеры добавили механизм IndexPool, который сжимает четыре ключевых вектора индексатора в один через взвешенный пуллинг. По заявлению компании, относительно GLM-5.3 вычисления на внимание сократились в 3 раза, а размер KV‑кэша — в 4,4 раза. Отдельно добавлена технология Manifold‑Constrained Hyper‑Connections (mHC) для повышения эффективности масштабирования при обучении.
Обучали всё это на свежем мультимодальном корпусе объёмом 30 трлн токенов — то есть визуальные способности не прикручены поверх текстовой модели постфактум, а вплетены в неё с самого предобучения.
На HuggingFace представитель Z.ai команды подтвердил, что архитектура полной GLM-5.3 (которая ещё готовится к релизу) будет такой же, как у GLM-5.2 — то есть кэш на основе индекса, а не гибридная линейная‑плюс‑разреженная схема, использованная во Flash‑версии. А Flash получила более экспериментальную и более радикальную архитектуру, выйдя раньше.
Бенчмарки
Официальная сравнительная таблица от Z.ai — вот что реально стоит разглядывать внимательно. Здесь сходятся сразу шесть моделей: GLM-5.3-Flash, GLM-5.2, DeepSeek‑V4-Vision‑Exp, Claude Opus 4.8, GPT-5.6 Terra и Gemini 3.7 Flash.

Бенчмарк |
GLM-5.3-Flash |
GLM-5.2 |
DeepSeek‑V4-Vision‑Exp |
Claude Opus 4.8 |
GPT-5.6 Terra |
Gemini 3.7 Flash |
|---|---|---|---|---|---|---|
Terminal Bench 2.1 |
84,3 |
81,0 |
83,9 |
85,0 |
87,4 |
85,8 |
DeepSWE v1.1 |
63,4 |
46,2 |
59,3 |
58,0 |
69,6 |
65,3 |
Toolathlon Verified |
78,4 |
59,9 |
75,9 |
76,2 |
74,9 |
– |
AutomationBench v1.0.6 |
48,8 |
26,2 |
38,8 |
41,0 |
37,2 |
52,3 |
Agents’ Last Exam |
26,3 |
20,4 |
27,3 |
27,0 |
28,0 |
– |
HLE w/ Tools |
55,3 |
54,7 |
55,1 |
57,9 |
– |
– |
GDPval‑AA v2 |
1773 |
1504 |
1675 |
1582 |
1571 |
1527 |
Разница с GLM-5.2 действительно огромная — почти двукратный скачок на DeepSWE (63,4 против 46,2) и почти двукратный на AutomationBench (48,8 против 26,2). А вот против Claude Opus 4.8 картина неоднозначная: где‑то Flash его обходит (Toolathlon Verified, AutomationBench, GDPval‑AA v2), а где‑то заметно отстаёт (Terminal Bench, DeepSWE, HLE w/ Tools).
На внутреннем Z.ai Code Bench v1.0 (прогонялся через Claude Code 2.1.207) GLM-5.3-Flash на максимальном уровне рассуждений набрала 29,0 балла против 29,5 у Claude Opus 4.8 — то есть практически ничья, хотя стоит помнить, что это внутренний бенчмарк самой компании, и независимого прогона всех моделей в одинаковых условиях пока нет.
Artificial Analysis, известная независимой методологией, дала модели 57 баллов по Intelligence Index v4.1.1 при стоимости всего $0,045 за микрозадачу (по льготной цене) — это уровень интеллекта, за который раньше приходилось платить примерно в десять раз больше. Это 10-е место в общем зачёте и третье среди открытых моделей — вслед за Kimi K3 от Moonshot AI и Qwen3.8 2.4T A95B от Alibaba.
Работает на китайских чипах
Z.ai заявила, что весь трафик Ox Alpha всю неделю обслуживался кластером из десятков тысяч ускорителей китайского производства, без уточнения конкретных моделей чипов или производителя. South China Morning Post позже уточнила: кластер насчитывал порядка 100 тысяч домашних чипов, а сама Zhipu исторически сотрудничала с Huawei Technologies, Cambricon Technologies и Moore Threads.
Чтобы обойти ограниченную память и пропускную способность отдельных китайских чипов (по сравнению с топовыми GPU Nvidia), компания построила выделенный инференс‑движок поверх SGLang, который разделяет мультимодальное кодирование, префилл промпта и посимвольный декодинг на независимо масштабируемые пулы воркеров — так называемая EPD‑архитектура (Encode — Prefill — Decode). По словам Z.ai, относительно первоначального бейзлайна на том же железе это дало трёхкратный прирост сквозной производительности обслуживания, приблизив эффективность и цену за токен к уровню мейнстримных видеокарт Nvidia. Забавная деталь: этот стек отчасти оптимизировала сама модель — инфраструктурный агент на GLM-5.3 помогал инженерам писать и оптимизировать кернелы, диагностировать узкие места и улучшать сервинг‑стек, создавая своего рода петлю обратной связи: модель помогала оптимизировать систему, которая обслуживает саму модель.
Китайский интернет и та самая корова
Название «Ox» удачно совпало с корейско‑китайским мемом: пользователи Weibo прозвали модель «Niu Lai» (牛来), обыгрывая название популярного китайского мультфильма о быке, вышедшего совсем недавно.
Практические тесты, проведённые китайскими медиа, описывали модель как «niuma‑friendly» — то есть дружелюбную к «ню‑ма», сленговому обозначению рутинных монотонных рабочих задач, которые обычно ложатся на плечи разработчиков.
Что говорят юзеры
Как модель ведёт себя в реальной работе? Здесь мнения разделились.
У модели отмечают более «естественный» голос модели по сравнению с Claude и GPT, умение работать со сложными задачами через субагентов и, в целом, понимание сути запроса — код он оценил высоко. Из минусов: модель иногда оставляет лишний код, не так тщательна, как GPT-5.6 Sol, и заметно замедляется на высоких уровнях рассуждения. Итоговый вывод Дэвиса: «примерно на уровне среднего эффорта GPT-5.6 Sol».
Ещё в одном случае, при запуске на кодинговых задачах несколько суток подряд, уровень качества был где‑то между Sonnet и Opus — модель делает мало ошибок. Главная проблема — модель периодически впадала в doom loop, зацикливаясь: одна и та же bash‑команда запускалась порядка тысячи раз подряд. Из‑за этого агента нельзя было оставлять без присмотра.
Впрочем, doom loop — это скорее проблема не самой модели, но и обвязки, в которой она работает. Мало какой опенсорсный харнесс сегодня толком умеет с этим справляться.
Куда делся маленький Flash?
Комьюнити встретило релиз с неподдельным раздражением — почему модель на 320 млрд параметров вообще называется «Flash».
Прямо написали: это полноразмерная GLM-4.7 или половина от 5.2, называть это «flash» — очень странный маркетинговый ход. Люди с железом ждали преемника GLM-4.7-Flash (30B‑A3B — модель, которая реально помещалась в видеокарту), а не монстра на 320 миллиардов.
А был ли рекорд?..
Во время тестов GLM-5.3-Flash также независимо прогнали по десяти задачам бенчмарка DeepSWE — и получили 80%, существенно впереди Claude Fable 5 с 65% и GPT-5.6 Sol с 52%. Эта хайповая цифра успела разойтись по интернету (обходит Claude Fable на 15 процентных пунктов!), однако к 23 августа Дэвис закончил полный набор из 113 задач и получил… на 17% меньше — около 63%. Но этот показатель уже увидели не все.
Где получить доступ к GLM-5.3-Flash
Модель можно запустить в нескольких точках доступа:
Что это значит на самом деле
Гадание про то, какая лаборатория стоит за анонимным релизом, оказалось недолгим — сообщество вычислило ответ по токенизатору и коду ошибки, ещё до всякого официального подтверждения.
Куда интереснее другое. Запуск без имени перестал быть просто маркетингом и стал каналом дистрибуции. Модель собрала полмиллиона пользователей и десятки триллионов токенов реальной нагрузки ещё до того, как у неё появились название, цена и лицензия. Обычный релиз с блог‑постом и красивыми графиками столько внимания в моменте не собирает — а вот анонимность, как выяснилось, собирает: целую неделю все обсуждали замеры, скриншоты, и doom‑loop‑истории.
Буквально в тот же день, когда Z.ai официально раскрыла Ox Alpha, Alibaba выпустила Qwen3.8-Flash‑Next — мультимодальное превью новой архитектуры Qwen4, которое активирует 6/125 млрд параметров ради той же цели: снизить стоимость инференса. Кое‑кто успел прогнать её локально на RTX 4090 — с оффлоадом экспертов в обычную DDR4-память — и получить 21 токен/сек генерации при контексте в 250к токенов!
Тут же завязался спор, кто в итоге забирает корону этой недели — GLM 5.3 Flash или Qwen 3.8 Flash Next.
Тем временем Z.ai у себя в блоге прозрачно намекает, куда движется дальше: «мы сейчас масштабируем этот рецепт на модели побольше — GLM-5.3-Flash толкает границу цена‑качество, и уроки, извлечённые при её создании, уже формируют нашу следующую фронтир‑модель». История с анонимными альфа‑релизами почти наверняка не закончилась на пятом эпизоде. Если завтра снова появится строчка с непонятным звериным именем — мы уже знаем, с чего начинать исследование: токенизатор и коды ошибок.
opusmode
Пробовал модель. Выглядела как дистилят Fable. Отвечала так же, но уровень выдачи был ближе к Sonnet 5