Пока все тестируют Qwen 3.8 27B, появилась новая модель от Alibaba с Qwen 4 архитектурой. Это не байт и не шутка: выпущенная пару дней назад новая мультимодальная MoE модель под названием Qwen3.8-Flash-Next является ранним архитектурным превью, используемым в будущей Qwen 4 [1].
Модель играет ту же роль, что и Qwen3-Next для Qwen3.5: гибридная конструкция Gated DeltaNet с Gated Attention, представленная тогда, с тех пор используется в сериях Qwen3.5, Qwen3.6, Qwen3.7 и Qwen3.8. Новая архитектура переосмысливает этот подход, давайте разбираться, что изменилось.
Что нового в архитектуре Qwen 4 (Qwen3.8-Flash-Next)
На базовом уровне это мультимодальная архитектура типа Mixture-of-Experts (MoE). Однако в отличие от привычных MoE, здесь применено несколько решений для эффективной локальной работы с большими контекстными окнами (262K нативно и 1M с YaRN):
-
Разделение общего и активного объема параметров
Общий объем модели: 125 млрд параметров основного MoE-графа + 51 млрд параметров N-gram таблиц + 4 млрд параметров головы MTP (Multi-Token Prediction).
Активные параметры на токен: всего 6B (512 маршрутизируемых экспертов, из которых активны 10 + 1 общий эксперт). То есть по вычислениям на токен модель сопоставима с компактными моделями на 6B, а по уровню знаний превосходит тяжелые 70B+ модели.
-
51B N-gram Embeddings (PLE) и офлоадинг в RAM/SSD
Одной из главных архитектурных новинок стало добавление отдельного слоя N-gram эмбеддингов размером 51B параметров. Рядом с основной моделью живет отдельная таблица на 20 млн записей (биграммы и триграммы). В предыдущей архитектуре число параметров и объем вычислений находились на одной оси (зависели друг от друга). N-gram память позволяет разделить эту зависимость.
N-gram слой не требует квадрирования или сложных матричных умножений, т.к. ключи в этой таблице являются детерминированными хешами от последней пары токенов. Позиции обращений рассчитываются заранее, поэтому всю эту таблицу (51B) незачем держать в видеопамяти.
Подойдет обычная оперативная память или SSD/NVMe, и нужные данные считываются с помощью асинхронного префетчинга через
mmapиз обычного SSD или системной памяти без потери точности, пока видеокарта будет считать остальное в самих экспертах. В итоге эта таблица работает как быстрая память большого объема для частых фраз и локальных паттернов языка. -
Гибридный механизм: GDN + QSA (Qwen Sparse Attention)
Слои Gated DeltaNet идентичны в обеих моделях (конфигурация голов и размерность сохранены). В Qwen 3.8 27B каждый такой слой задействует четыре KV-головы (Gated Attention): это обеспечивает высокую точность, однако вычислительные затраты и объем памяти растут линейно с увеличением контекста, что делает данный слой самым ресурсоемким в стеке.
В Qwen3.8-Flash-Next механизм Gated Attention заменен на Qwen Sparse Attention. Главное отличие нового подхода заключается в детализации отбора. Вместо оценки каждого отдельного токена в истории индексирующий модуль (MQA: 4 query-головы и 1 общая K-голова с размерностью 128) анализирует микроблоки токенов. После этого модель обращается к контексту (активирует внимание) в рамках фиксированного бюджета размером 512 блоков или 2048 токенов.
Таким образом, Gated DeltaNet эффективно запоминает, а QSA точно ищет: 36 слоев (из 48) сжимают историю в состояние фиксированного размера, 12 слоев делают точечный выборочный поиск по настоящей истории. Модель сама решает, сколько информации считывать из каждой ветки и сколько записывать обратно.
В модели 48 слоев:
36 слоев (3 из 4): используют Gated DeltaNet (GDN), линейный рекуррентный механизм, который сжимает историю в рекуррентное состояние фиксированного размера, предотвращая рост KV-кэша.
12 слоев (1 из 4): используют Qwen Sparse Attention (QSA). В отличие от классического Attention, QSA агрегирует последовательность в микроблоки и выбирает только наиболее релевантные области. Это дает до 8.6x прироста скорости Prefill на контекстах в 1 млн токенов.
-
Gated Residual (GR) и MTP
Gated Residual разделяет единый residual-поток на 4 ветки. Поэлементный динамический gate управляет чтением слоя, а единый скалярный gate управляет записью. Интересно то, что одна из этих веток берет на себя роль магистрали для сквозного переноса информации из начальных слоев в глубокие.
Это сохраняет стабильность обучения и емкость слоев неизменными. Вычислительный оверхед на инференсе минимален, в том числе благодаря хранению веток в формате FP8.
По MTP все просто: добавили один слой, обученный на нескольких шагах вперед. Получился готовый драфтер для спекулятивного декодирования, бесплатный буст скорости генерации, без потери точности. Что это такое, можно прочитать в другой моей статье [2]
Сравнение Qwen3.8-Flash-Next vs Qwen 3.8 27B
Для наглядности сравним новую архитектуру с недавно вышедшей моделью Qwen 3.8 27B [3].
Параметр / Характеристика |
Qwen 3.8 27B (Dense) |
Qwen3.8-Flash-Next (Qwen 4 MoE) |
|---|---|---|
Тип модели |
Плотная (Dense) |
MoE (Mixture of Experts) + N-gram |
Общие параметры |
27 млрд |
~180 млрд (125B MoE + 51B N-gram + 4B MTP) |
Активные параметры / токен |
27 млрд |
6 млрд |
Механизм внимания (Attention) |
GDN + Gated Attention (Full Attention) |
GDN + QSA (Sparse Micro-block Attention) |
N-gram память |
Отсутствует |
51B N-gram Embeddings (поддержка |
Residual-связи |
Одиночный поток |
4-поточный Gated Residual (GR) |
Нативный контекст |
262K |
262K (расширяемый до 1M) |
Сравнение в бенчмарках
Несмотря на то что Qwen3.8-Flash-Next использует всего 6B активных параметров на токен (в 4.5 раза меньше, чем Qwen 3.8 27B), архитектура Qwen 4 демонстрирует существенное превосходство в агентских задачах, кодинге и логике:
Бенчмарк |
Qwen3.8-Flash-Next (Qwen 4 MoE) |
Qwen3.8-27B (Dense) |
Улучшение |
|---|---|---|---|
DeepSWE 1.1 (агентский кодинг) |
58.7 |
42.2 |
+16,5 |
SWE-bench Pro |
62.5 |
61.7 |
+0,8 (паритет) |
SWE-bench Multilingual |
81.0 |
73.8 |
+7,2 |
NL2Repo-Bench |
48.1 |
42.3 |
+5,8 |
CoWorkBench (in-house) |
73.9 |
70.7 |
+3,2 |
JobBench |
55.7 |
33.4 |
+22,3 |
Agents’ Last Exam (Score / Pass@1) |
51.2 / 24.3 |
42.9 / 20.4 |
+8,3 / +3,9 |
Toolathlon Verified (Pass@1) |
73.5 |
67.1 |
+6,4 |
IFBench |
81.3 |
79.5 |
+1,8 |
GPQA Diamond |
91.7 |
89.2 |
+2,5 |
HLE (GPT-4o judge) |
35.9 |
30.8 |
+5,1 |
LiveCodeBench v6 |
91.9 |
90.3 |
+1,6 |
Примечательно следующее: если Qwen 3.8 27B по тестам вплотную подбирается к Claude Opus 4.6, то превью новой архитектуры Qwen 4 обходит ее в большинстве тестов и вплотную подбирается к Claude Opus 4.8. Вполне возможно, что Qwen 4 на релизе начнет щупать Claude Fable 5 за мягкое.
Запуск 4-битной версии на 128 ГБ RAM со скоростью 20-30 tok/s
Благодаря тому, что N-gram слой можно выгружать в системную память ОЗУ или через mmap на SSD, требования к VRAM GPU кардинально снизились. Как отмечается в документации Unsloth [4], 4-битные квантованные версии (GGUF UD-Q4_K_XL и UD-IQ4_XS) позволяют использование на системах со 128 ГБ оперативной памяти (например, Mac Studio / MacBook Pro на Apple Silicon с Unified Memory или ПК/сервер со 128GB RAM).
При этом показатели работы при запуске через Unsloth / llama.cpp следующие:
Необходимый объем памяти: ~85-110 ГБ ОЗУ/Unified Memory для полной загрузки 4-битной квантовки.
Скорость генерации: около 20-30 токенов в секунду при инференсе, что является впечатляющим результатом для модели со 180B весов. У меня на 128GB RAM выдает 25-27 токенов в секунду, но видеокарта для получения такой скорости все равно нужна.
Интерактивный режим гибридного мышления (Hybrid Thinking): в Unsloth Desktop из коробки поддерживается переключение режимов
reasoning_effort(xhigh,medium,low,none), а также сохранность цепочки рассуждений (Preserve Thinking) между репликами диалога.
Итоги
Модель Qwen3.8-Flash-Next наглядно задает тренд на развертывание локального ИИ на обычных рабочих станциях со 128 ГБ оперативной памяти. Такой подход исключает затраты на дорогостоящие GPU-кластеры и сохраняет высокую скорость инференса до 30 токенов в секунду, а 6 миллиардов активных параметров гарантируют отличный баланс качества и быстродействия для работы локальных агентов.
Важно отметить, что Alibaba на сегодняшний день остается единственной компанией, предоставляющей в открытый доступ веса полного спектра моделей: от компактных решений меньше 1B до флагманов 100B+ параметров.
Линейка Qwen закрывает все актуальные задачи, объединяя классические рассуждающие LLM, мультимодальные и голосовые системы. Это позволяет бизнесу строить автономные on-premise ансамбли на базе инфраструктуры одного вендора с идеально совместимыми компонентами.
Такой подход открывает доступ к уникальным возможностям, включая каскадную маршрутизацию для удешевления инференса, бесшовное построение мультимодальных конвейеров и эффективную дистилляцию корпоративных знаний.
Update: в комментариях много вопросов о там с какой скоростью будет работать модель на их железе. Вот здесь пользователи делятся получившейся скоростью на своих сборках. Используйте эти данные как ориентир, только помните, что помимо самого железа критически важно правильно настроить под него параметры запуска модели.
References
Комментарии (68)

debagger
27.08.2026 23:42Интереснее скорость префилла. Ждать по полчаса загрузки 100к контекста - это неюзабельно.

Luis2
27.08.2026 23:42Юзабельно это кластер из а100 в серверной, на домашнем железе всегда приходится терпеть компромисс между размером модели и ожиданием ответа)

ToxaBes Автор
27.08.2026 23:42Интереснее скорость префилла.
300-400 t/s
Для сравнения, на Qwen 3.8 27B префил у меня 800-900 t/s.

Joysi
27.08.2026 23:42Звучит интересно, я так понимаю, что на ПК подобному 192Gb DRAM (DDR5-5200) + 16GbVRAM - возможно одно из оптимальных решений.

ToxaBes Автор
27.08.2026 23:42Да, вы правильно понимаете, в конце статьи добавил ссылку на страницу где можно сравнить свою сборку с теми кто уже запускает модель на своем железе.

Joysi
27.08.2026 23:42Получаю 22-24 t/s на i7-265 +DDR5-5200 (192G) + 5070Ti(16G VRAM)
llama-server -m Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf -c 262144 --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --host 0.0.0.0 --port 8080
ToxaBes Автор
27.08.2026 23:42Хороший результат! Все что 20 t/s и выше вполне юзабельно в каждодневном использовании.
Для сравнения, у меня 30-35 t/s на том же 262К контексте, версии модели и настройках. Железо: Threadripper 3970X + DDR4-3200 (128GB quad-channel mode) + RTX A6000 48GB.

AcckiyGerman
27.08.2026 23:42А какой квант запускаете? FP8?

ToxaBes Автор
27.08.2026 23:42А какой квант запускаете? FP8?
Для сравнения запускал тот же квант, что и у автора комментария, на который отвечал: Qwen3.8-Flash-Next-UD-Q4_K_XL

vitaliy-sn
27.08.2026 23:42Эта же модель на 96GB DDR4-3500 + 5070 Ti + 5060 Ti выдает 17-19 t/s tg и 360-370 t/s pp на задаче с ~10к контекста на входе.

max-daniels
27.08.2026 23:42А если у меня 64 Гб RAM + 24 Гб VRAM? Мне особо не светит юзать данную модель?

McHack
27.08.2026 23:42Эту модель на данный момент - нет. Однако, я думаю быстренько появятся либо по умному пережатые модельки, по типу APEX или ещё что. Либо REAP модельки где часть экспертов выкинули. В одном из этих случаев - залезет

Mijka64
27.08.2026 23:42Почему? В Q1 она 72ГБ, и существенная часть на SSD. Должно влезть (я не пробовал, теоретизирую, у меня 96+24 и только в планах на выходные)

HyperWin
27.08.2026 23:42Все что ниже Q4 лучше даже не пробовать

ToxaBes Автор
27.08.2026 23:42Это справедливо в общем случае, но не для этой модели. Эту стоит попробовать. Главный минус Q1 не то что он выдают "всего" 80% от оригинальной точности, а то что в них нет MTP голов из-за чего генерация чуть медленнее.

melodicmsk
27.08.2026 23:42В статье же написано, что 50В можно хранить хоть на ссд. Поэтому должно скорее всего полететь.

Ndochp
27.08.2026 23:42Вот только какой запускатор сумеет правильно разложить между NVME, RAM, VRAM интересно. Не встречали еще инструкций для какого-нибудь дешманского 1ТБ/64/16?

Luis2
27.08.2026 23:42Четырехбитная квантовка весит под 100 гигов, в твои 88 гигов суммарной памяти оно влезет исключительно с жестким свопом, файл подкачки убьет скорость до нуля

AcckiyGerman
27.08.2026 23:42Ответ неверен. Уже вчера на реддит подобрали конфиги llama, которые оставляют весь N-gram (-50gb) на SSD. Ничего сложного нет, см. мои недавние комментарии.

ToxaBes Автор
27.08.2026 23:42Требуемый размер памяти (RAM+VRAM) в зависимости от квантования:
UD-Q4_K_XL 111.3 GB
UD-IQ4_XS 93.7 GB
UD-Q3_K_XL 90 GB
UD-IQ3_XXS 82 GB
UD-Q2_K_XL 78.9 GB
UD-IQ1_M 74.5 GB
UD-IQ1_S 72.5 GB
По идее, у вас должна заработать нижняя половина списка.

tonx92
27.08.2026 23:42Unsloth gguf q1 там 3 файла, 10мб 50гб и 22.5 тот что 50 по идее можно даже на диск, но пока что в оперативу. А 22.5 у вас влезает в видеопамять, и в случае с мое не обязательно всему kv кэшу в видеопамять помещаться, по логике должна не просто запуститься так ещё и скорость давать. Но вот надо ли оно, сам сижу и думаю q1 у нее это 80% top1% Accuracy, 27b я могу в q6k_xl и это около 98%, в swe pro у моделей разница почти никакая 62,5 у flash и 61,7 у 27b. Но по всей видимости будет быстрее, в общем выглядит так как будто эта модель создана именно для того что бы ее исключительно на ОЗУ гонять. Т.к. с видеокартой 27b должна быть сильно умней при том же занимаемом объеме ГПУ.

leen_vl
27.08.2026 23:42Светит. И греет) Я подцепил эту модель в UD_Q2_K кванте к лламе (пока к ветке pr-27742, пулреквест еще не вмержили в main), развернул на ноуте I7-1362H, 32 ГБ, RTX5070 8 ГБ VRAM. Запускал с маппингом, так что чтение экспертов в VRAM идет напрямую с SSD, плюс в оперативке немного болтается. Префилл удручающий - порядка 20 - 40 т/с, генерация на коротких контекстных окнах 10-20, на длинных 5 - 10. Шевелится, хотя и пыхтит. В окошке рассуждения здравые, холодный запуск секунд 5-10, подгрузка эксперта меньше секунды. Пока балуюсь с max reasoning, по ощущениям весьма неплохо. Оговорюсь - тестов не делал, сравнений с цифрами на руках не проводил, этого и без меня в сети хватает. Все на личных впечатлениях. Блок запуска лламы из ини-файла:
[Qwen3.8-Flash-Next]
model = /home/user/models/Qwen3.8-Flash-Next-UD-Q2_K_XL-00001-of-00003.gguf
mmproj = /home/user/models/Qwen3.8-Flash-Next-Uncensored.mmproj-Q8_0.gguf
ctx-size = 70000
threads = 8
threads-batch = 4
temperature = 0.7
jinja = true
top-p = 0.95
top-k = 64
repeat-penalty = 1.1
ngl = auto
parallel = 1
AcckiyGerman
27.08.2026 23:42

Bardakan
27.08.2026 23:42эта статья - нейрослоп. Иначе как объяснить, что указаны 4 источника данных, но ни в одном "qwen 4" даже не упоминается

ToxaBes Автор
27.08.2026 23:42эта статья - нейрослоп. Иначе как объяснить, что указаны 4 источника данных, но ни в одном “qwen 4” даже не упоминается
У меня есть для вас упражнение:
Открываете первую ссылку из источников: https://qwen.ai/blog?id=qwen3.8-flash-next
Читаете там первое предложение первого абзаца: In this release we are opening the weights of Qwen3.8-Flash-Next, a multimodal MoE model that also serves as an early preview of the architecture used in Qwen4.
Выдыхаете.
Повторяйте по утрам натощак.

Bardakan
27.08.2026 23:42в названии и в тексте вашей статьи указано "qwen 4" (через пробел), в статьях указано "qwen4". Как я должен догадаться, что у вас опечатка? Тем более, что вы ее до сих пор не исправили.
Зато сразу лезете минусовать профиль и выписываете всякую чушь в комментариях. И "qwen 4" по вашим ссылкам действительно нет.

ToxaBes Автор
27.08.2026 23:42У вас какое-то недомогание, иначе я не могу этого объяснить. Выздоравливайте.

Dhwtj
27.08.2026 23:42Выпейте водки 50 грамм
Глаза сфокусируются

Bardakan
27.08.2026 23:42А эту статью надо было после 50 грамм читать? Тогда понятно. Я просто непьющий - изображение не расползается.
Кстати оскорблять человека и одновременно ставить ему минусы в карму за «грубое общение» - вам самим не смешно?

nikulin_krd
27.08.2026 23:42Вы прибежали, обвинили человека что его статья нейрослоп, а когда вам мягко указали на то что вы не правы, вы вместо того чтобы признать свою ошибку и извиниться продолжаете нести чушь, а теперь удивляетесь минусам

Bardakan
27.08.2026 23:42Т.е. моя фраза про опечатки в статье - это "нести чушь", а три чела включая автора написали в духе "иди лечись" - это "мягко указали", и я еще после этого извиниться должен? На что вы расчитываете?
Единственное, что меня удивляет после этого - в статье про stackoverflow кто-то жаловался на местную систему кармы. Тем временем хабр:


Luis2
27.08.2026 23:42Благодаря тому, что N-gram слой можно выгружать в системную память ОЗУ или через mmap на SSD
Костыль века, хоть и рабочий. Пси-ай шина будет дымиться от постоянных свопов, зато в оперативку влезет

ToxaBes Автор
27.08.2026 23:42Да, все так. Стратегия Alibaba заключается в закрытии всех ниш своими моделями. Вот и дошла очередь позаботиться о пользователях без мощных видеокарт и дать им возможность пощупать фронтир модель на ОЗУ. При правильной настройке эта модель вполне может стать для них ежедневным помощником. В том числе и поэтому я решил о ней написать.

Mijka64
27.08.2026 23:42Нет, не так.
Pci-E шина дымилась при плотной архитектуре, когда все веса были нужны на каждый токен.
Оффлоад экспертов уже сносно работал, хотя и ограничивал скорость.
Ngram-слой на ssd вообще не будет узким местом.

ToxaBes Автор
27.08.2026 23:42Я имел ввиду, что у большинства пользователей в оффлоад уйдет не только Ngram-эмбеддинги, но и заметная часть слоев основной архитектуры. И вот это уже даст нагрузку.


DasProtoss
“У меня на 128GB RAM выдает 25-27 токенов в секунду, но видеокарта для получения такой скорости все равно нужна”
Так какая видеокарта-то? ЭТО ЖЕ ОСНОВНОЕ. На чистой памяти оно могло выдать у тебя ~1 токен/сек…
ToxaBes Автор
Без карты тоже должно работать, все зависит от того прочитал ли пользователь какие параметры выставлять, от его проца, а также от скорости и поколения DDR памяти:
M1 Ultra 128G выдает примерно 20 t/s,
AMD EPYC 7763 + 128GB DDR4 RAM выдает примерно 45 t/s
Intel i9 12900k128 GB DDR4 3600 MT/s + RTX 3090 примерно 65 t/s
Это данные от пользователей. Моя система не показатель тк там все патчено-перепатчено под различные штуки.
Akela_wolf
Вот это красота. То есть на моем Ryzen 5950 можно добавить +64 Гб до 128 и получить настолько нормальную скорость?
mirwide
Неизвестно что они там запускали.
Ryzen 9950x3d 128 Gb DDR5-6000 + RTX 4070 ti super 16 Gb
Примерно с такой же скоростью работает генерация для DeepSeek-V4-Flash-UD-Q3_K_XL у которой активных параметров в 2 раза больше. Но менее стабильно, потому что немного не влазит в 128 Gb.
ToxaBes Автор
Добавил в конец статьи апдейт со ссылкой на страницу где пользователи делятся результатами на своих сборках и часто публикуют настройки. Возможно, это поможет вам настроить свой запуск на большую скорость.
mirwide
Нет там чудо параметров. Вы не ту циферку взяли.
Примерно тоже самое. Слабая память и не самый мощный проц компенсируется большим объемом GPU RAM. На одном i9 хорошо если будет 5 t/s.
ToxaBes Автор
Да, вы правы, прошу прощения, привык что первым идет prompt processing, потом decoding.
Покрутил настройки на своей системе, поднял скорость до 32-35 токенов в секунду. Похоже, что настройки для данной модели нужно подбирать вручную под каждую систему.
Luis2
Скорость упрется в пропускную способность твоей ddr4. Трансформеры это memory bound задача, тут частота памяти решает гораздо больше объема