В последнее время ИИ-сфера не просто падает, а даже входит в активную стадию конкурентности между несколькими фронтами — корпоративные ИИ (OpenAI и Anthropic, которые тоже между собой соревнуются) против открытых моделей (Qwen, GLM, DeepSeek).
Цены за токен иногда падают, а когда не могут уменьшить цену — создают лёгкие модели с низкой стоимостью. Снижение стоимости вывода (инференс) перестало быть просто побочным эффектом оптимизации и превратилось в главную ось конкуренции. Решение OpenAI снизить цены на GPT 5.6 Sol минимум до ноября 2026 года — это попытка восстановить свою долю на рынке через демпинг. Открытые модели больше не догоняют закрытые по качеству, а даже иногда опережают их в экономике использования, делая доступ к ИИ коммунальной услугой.
В этой статье мы разберём влияние Qwen, GLM и прочих опенсорсных моделей, конкуренцию на рынке ИИ и наконец разберём, куда свернула ИИ-гонка на этот раз.
Демпинг как защита: что стоит за скидками OpenAI

Снижение цен на GPT 5.6 Sol, анонсированное минимум до ноября 2026 года, имеет чёткие временные рамки. Это может и структурное удешевление инфраструктуры, но де-факто это тактический демпинг, направленный на удержание аудитории. OpenAI необходимо перекрыть кислород конкурентам (как и прямым корпоративным, так и открытым) до сезона зимних релизов, ибо именно тогда ожидается обновление флагманских линеек. Компания вынуждена торговаться за каждую долю рынка, ибо конкуренция уже переходит из «у кого модель умнее и прогрессивнее» (в этой сфере открытые модели догоняют, а то и перегоняют ChatGPT) в ожесточённую конкуренцию: кто предложит лучший результат и подешевле цену за токен.
Исторически бизнес-модель закрытых лабораторий строилась на высокой маржинальности. Разработчик платил высокую цену за токен, ибо альтернатив-то было маловато. А ещё, если брать OpenAI, они были первопроходцами в коммерциализации и популяризации ИИ. А ныне разница в качестве ответа между закрытым API и, допустим, грамотно настроенным инференсом стала незаметной для подавляющей части обычных задач.
OpenAI не глупы, и понимают, что команды, видя чек, где одна китайская модель обходится в десятки долларов, а аналогичный запрос в ChatGPT — в сотни долларов, будут выбирать китайскую модель. Оно им, OpenAI, надо? Нет, и поэтому они и выпускают облегчённые модели (gpt-5.6-luna) или просто тормозят и замораживают рост своих цен, как в нашем случае.
Выбранная дата, 21 ноября 2026 года, тоже может быть показательной. Я думаю, что это может быть и привязка к финансовому циклу, ежеквартальному отчёту, или подсчёт времени, пока популярность новых открытых моделей пройдёт.
Пока же OpenAI фактически подтверждает главный тренд рынка: продавать «чистый интеллект» как дорогой премиум-продукт не получится, это скорее сырьё или коммунальная услуга.
Не зря же сам Сэм Альтман в недалёком марте 2026 сказал:
«Мы видим будущее, где интеллект станет коммунальной услугой, как электричество или вода, и люди будут покупать его у нас по счётчику» (источник)
И OpenAI как раз и двигается в эту сторону. Если разобрать это высказывание, то можно понять, что уходят от бизнес-модели подписки, где ты за какую-то фиксированную сумму получаешь доступ, и приходят как раз к модели такой, где за дешёвый запрос платишь меньше, а за сложный — больше. Будем смотреть, что нас ждёт, ведь для того, чтобы ИИ был такой же базовой частью жизни, как подписки или электричество, нужны колоссальные деньги и множество дата-центров, но ресурсы и интерес инвесторов ограниченны.
Qwen 3.8-Flash-Next: хитрость с параметрами
Выход Qwen 3.8-Flash-Next немного был затуманен релизами GLM, но тем не менее вызвал резонанс в сообществе. Даже не из-за новых рекордов в бенчмарках, а из-за чистой математики, заложенной в спецификацию: 125 миллиардов общих параметров при всего 6 миллиардах активных (даже есть специальная пометка a6B — active 6B). Эта архитектурная хитрость позволяет получать вычислительные затраты крошечной модели, но сохраняя доступ к объёму знаний и контексту, характерному для 125-миллиардной модели.
Это классическая архитектура Mixture of Experts (MoE), доведённая до абсолютного минимализма в вопросе активных вычислений. На каждый ваш промпт модель не прогоняет через все 125 миллиардов весов, а маршрутизирует запрос лишь к узкой группе. В итоге для обработки одного токена задействуется эквивалент крошечной 6-миллиардной LLM. Вы получаете вычислительные затраты, потребление памяти и скорость ответа легковесной модели, но при этом пользуетесь контекстным окном, логическими связями и фактологической базой гиганта.
Именно эту концепцию в комментариях к посту об архитектуре окрестили тезисом «Ultimate Cost-Efficiency» (предельная рентабельность). Исторически главной проблемой открытых моделей была не столько сложность тренировки (её ещё можно пережить), сколько невозможность дешёвого масштабирования вывода. Разместить 125-миллиардную плотную модель на сервере medium-тира было физически невозможно, приходилось платить за дорогостоящее железо.
Qwen 3.8-Flash-Next же привносит новый тип моделей, и теперь неважно, насколько огромна модель в файле весов, важна лишь стоимость её обслуживания в моменте. Для опенсорс-сегмента это идеальный вариант. Разработчик теперь волен выбирать умные модели, которые могут быть дешёвыми. То бишь не выбирать между дешёвой, но ограниченной, и умной, но дорогой.
В итоге открытые модели получают неоспоримое структурное преимущество. Они могут позволить себе раздувать общие параметры для роста интеллекта, не боясь разорить пользователя на инференсе. Конечно, это несёт свои минусы и издержки, но, как по мне, вполне себе конкурентоспособный подход к решению проблем экономики ИИ.
Открытие весов как новое оружие: Z.ai Ox Alpha и GLM-5.3-Flash
Если вы следите за миром ИИ, то вы могли заметить, что 20 августа на OpenRouter и OpenCode без лишнего шума появилась анонимная модель с лаконичным названием Ox (или 0x) Alpha. Никаких анонсов, статей, работ — просто модель с пометкой stealth.
Можно вспомнить её ключевые характеристики:
Контекстное окно: 1 048 576 токенов (1M). Этого достаточно, чтобы загрузить целые репозитории, объёмную документацию или длинные логи выполнения задач.
Генерация (Output): до 131 072 токенов на один ответ.
Мультимодальность: модель принимает на вход текст, изображения и даже видео, что является большой редкостью для кодинг-моделей. Поддерживает вызов функций (tool calling) и структурированный вывод.
Специализация: разработчик позиционирует её как reasoning model, созданную для написания кода, длительной автономной работы ИИ-агентов и сурового продакшена.
Цена: в период тестирования модель абсолютно бесплатна и имеет огромную пропускную способность вплоть до 100 триллионов токенов в день.
История с Ox Alpha от Z.ai оказалась забавной. Изначально всем казалось, что это какой-то совершенно новый независимый проект, который появился ниоткуда. Но в итоге компания подтвердила, что Ox Alpha — это просто новая модель из семейства GLM. И самое главное, они сразу пообещали полностью открыть её веса. Зачем так делать? Сказать прямо «мы выпускаем GLM-5» было бы скучно и не вызвало бы такого резонанса. А так они нагенерили интриги, собрали популярности, дали потрогать и выкатили в опенсорс.
Параллельно с этим (и тут же раскрытым) релизом вышел GLM-5.3-Flash. Ox Alpha как раз и был этим самым GLM-5.3-Flash! Да, в последнее время стал популярен постфикс Flash, так как теперь многие хотят не вселенского разума, а просто быструю и дешёвую модель.
А теперь про логику открытого рынка. Если мы уже поняли, что маржа на продаже API стремится к нулю (что мы и видим на примере вынужденных скидок OpenAI), то в чём тогда смысл отдавать топовую модель бесплатно? А смысл-то в захвате инфраструктуры и стандартов. Когда Z.ai отдаёт веса, они говорят разработчикам: «Берите, ставьте на свои сервера, не платите нам за токены». На первый взгляд это экономическое самоубийство.
Но на деле они заставляют вас использовать их стандарты, их форматы весов и их экосистему. Вы, хоть и не платите Z.ai за каждый запрос, всё равно зависите от их архитектуры. А возможные конкуренты, которые пытаются продавать закрытый API по завышенной цене, просто остаются с носом, ибо их продукт становится невостребованным. То есть, отдавая модель, компания целенаправленно уничтожает бизнес конкурентов по продаже доступа к ИИ, при этом сама монетизирует инфраструктуру вокруг этих весов или просто удерживает доминирование на поле, пока другие пытаются выжить.
По моему личному опыту, скажу, что эта модель будет получше, чем DeepSeek, поумнее отвечает, так что модель вполне себе вкусная. Китайцы вообще в последнее время удивляют своими ИИ-моделями.
Технологии удешевления: железо, вертикальная интеграция и государственные резервы
Мы разобрали софтварные хитрости вроде MoE-архитектуры у Qwen и открывания весов, но если копнуть глубже, то чистое удешевление инференса наблюдается во многих сферах. Да и релиз языка Mojo (о котором я готовлю статью) для инференса ИИ — явно признак формирования реальной экономической сферы ИИ.
Возьмём, к примеру, новость про OpenAI Jalapeño. Когда появилась информация, что этот собственный чип OpenAI в тестах обходит свежий Nvidia Blackwell, многие восприняли это просто как очередную померку «кто круче и кого мама больше кормила». Но на деле это жесточайший удар по бизнес-модели Nvidia. OpenAI поняла простую вещь: пока они зависят от железа многоуважаемого Хуанга, они никогда не смогут опустить цены на API ниже определённого пола. Да и эта пословица, что в золотую лихорадку богатеют продавцы лопат, тоже верна.
Аренда кластеров Blackwell стоит безумных денег, и эти издержки всегда перекладываются на разработчика. Создав свой кремний, OpenAI пытается вырваться из этой ловушки. Коли ты сам проектируешь чип под свои конкретные алгоритмы (та же динамическая маршрутизация токенов), ты срезаешь кучу лишних затрат на универсальность, которая нужна обычным GPU для рендеринга игр или других задач. И вот тогда появляется реальная возможность сделать инференс дешёвым структурно, а не за счёт демпинга.
Тот же принцип, только в другом сегменте, мы видим у Apple с их новыми M6 и M5 Ultra, где они делают огромный упор именно на AI compute. Обсуждения архитектур ИИ-чипов сейчас крутятся вокруг того, что эпоха универсальных видеокарт для этих задач уходит. Будущее за узкоспециализированными ускорителями, которые заточены под конкретные операции с матрицами. Если раньше мы пихали огромные модели в потребительские макбуки просто чтобы «было можно», то теперь многие корпорации делают так, чтобы локальный инференс на их железе был не просто возможным и доступным, а экономически выгодным по сравнению с отправкой данных в облако. Тебе не нужно платить за передачу данных и за чужой сервер, если встроенный NPU переваривает Flash-модель за миллисекунды.
Но одно железо не спасёт, нужен софт, который умеет этим железом эффективно управлять, и тут мы видим сумасшедшую консолидацию рынка. Когда Nvidia согласилась купить Hugging Face за 13 миллиардов долларов, это был шок. Зачем производителю чипов крупнейший репозиторий опенсорс-моделей? Ответ очевиден — тем же, зачем и OpenAI делать свой чип: для полного контроля стека. Nvidia понимает, что если чипы дешевеют, то маржа смещается в софт. Они хотят владеть всем: от кремния до того, как модель упакована и разворачивается. Параллельно AWS скупает DuckDB. Казалось бы, при чём тут аналитическая база данных к ИИ? А при том, что дешёвый инференс (особенно в RAG-системах) упирается в скорость выборки данных. Если ты не можешь быстро достать нужный кусок контекста из базы, вся экономия на чипах летит коту под хвост. Облачные гиганты скупают инструменты обработки данных, чтобы их инфраструктура была самодостаточной и не дала разработчикам уйти к конкурентам.
И наконец, физический предел всей этой экономии. Дешёвый инференс на миллионы пользователей требует колоссальных площадей и энергии. А энергетика часто связана с государством. Правительство США начало активно подавлять протесты против строительства дата-центров. Местные жители бастуют из-за того, что ИИ-фабрики съедают всю воду и электричество, но федералы буквально заставляют замолчать это недовольство. Почему? Потому что они осознали: тот, кто сможет обеспечить дешёвую энергию и землю под сервера, тот и выиграет ИИ-гонку. Никакие архитектурные хитрости не сработают, если тебе негде поставить серверы или электричество стоит слишком дорого. Кстати, как по мне, Россия, если бы не санкционное положение вещей, могла бы участвовать в ИИ-гонке как гигант энергетики (в том числе и атомной).
В итоге получается, что снижение стоимости токена — это не просто умные программисты, которые написали хороший код за миллионы долларов. Это грязная, масштабная и очень дорогая война за железо, за софт-стек и за энергоресурсы, и за тугие кошельки инвесторов, которые хотят инвестировать, пока видят результат и инновации. Компании создают собственные чипы, скупают репозитории моделей и базы данных, а правительства прикрывают им спину, игнорируя небольшое народное роптание. Только пройдя через всю эту вертикальную интеграцию, можно позволить себе продавать ИИ по копейкам за токен, не разорившись при этом.
Кроме того, тут ещё и геополитическое сражение идёт, и постоянно нужно догонять и перегонять конкурента.
Заключение
Ныне можно увидеть интересные движения. С одной стороны, нельзя упускать из виду, что ИИ-пузырь может и лопнуть. С другой стороны — невероятная возможность заработать и быть впереди планеты всей. Прибыль всё-таки там огромная, даже если убрать шутки про Crypto AI fintech SaaS стартап, то деньги всё равно распределяются и уходят от создателей моделей к владельцам инфраструктуры.
А может, это пузырь и всё схлопнется, как только будет кризис какого-то ресурса, или все выйдут на IPO и придётся отбивать колоссальные затраты.
Да и перепродажа моделей, оптимизации — всё это размазывает прибыль по цепочке дистрибьюторов, грубо говоря. Маржинальность постепенно падает, на время или навсегда, узнаем позже, но факт остаётся фактом — ИИ будет в повестке дня ещё много времени.
temaweb10
Спасибо за статью :)