Результат прошлого бенча Qwen3.8-27 в 0.789 из прошлого поста - не тот конфиг, вышел новый Qwen3.8-Flash-Next и я возвращаюсь меньше чем через сутки к тестам. Тестируем новую архитектуру на старой RTX PRO 6000 и прикидываем ее на 5090 c 32GB VRAM.
Модель |
Прогонов |
Балл |
σ |
Прошло |
ток/с |
|---|---|---|---|---|---|
Flash-Next, Q3_K_XL |
3 |
0.786 |
0.017 |
43/50 |
79.1 |
Flash-Next, Q4_K_XL |
3 |
0.785 |
0.021 |
44/50 |
77.4 |
Qwen3.8-27B, продакшн (исправлено) |
3 |
0.769 |
0.007 |
41/50 |
70.0 |
Ornith-35B (MoE) |
2 |
0.732 |
0.004 |
42/50 |
238.1 |
Ornith-9B |
3 |
0.590 |
0.037 |
30/50 |
121.4 |
Продакшн-версия две недели была как неактуальна в NVFP4A16
Все уже наверняка прочитали, что Qwen3.8-Flash-Next - превью архитектуры, которая ляжет в основу Qwen4: 125 млрд параметров, 6 активных на токен, плюс 51 млрд в n-gram-эмбеддинге, который вообще не считается как в dense-модели - данные n-gram читаются точечными обращениями с диска. Естественный вопрос: как это будет в сравнении рядом с тем, что уже крутится в проде?
Я человек простой, вышла новая модель - пошел сверять конфиг для честного сравнения и обнаружил, что строка «Qwen3.8-27B, своя карта» в таблице из прошлого поста (0.789/46) была не про боевой сервер. Она осталась от раздачи трёхнедельной давности: сторонний чекпойнт от unsloth, MTP выключен, через туннель на порт, которого давно не существует. УЖАС? Казалось бы :)
Реальный прод - официальный Qwen3.8-27B-NVFP4A16, MTP включён, делит карту с Ornith-35B, который у меня занимается расчетами в фоне, постоянно адаптируя и обновляя мои основные репозитории. Никто не проверял их рядом, потому что оба выглядели правдоподобно. Пересчитал заново, заморочился на три прогона: 0.769.
Три прогона вместо одного - и всё сошлось
Собственная методика уже год как знает мою дельту — 0.043 при одинаковой конфигурации (напоминаю, что идеал 1.0). Три модели из пяти уместились внутри 0.02 друг от друга. Flash-Next и продакшн-27B статистически неотличимы: 0.786 против 0.769, разница меньше половины разброса. Более точный квант (Q4 против Q3) тоже ничего не дал - 0.785 против 0.786, при том что у Q4 вдвое лучше метрика восстановления по данным самого unsloth. На этом наборе задач лишний бит как будто бы только съел VRAM (4.3 ГБ вместо 24.7) и не дал измеримой разницы.
Ornith-35B стабильно ниже лидеров на 0.05 — но это честный компромисс: декод в 3.4 раза быстрее. Ornith-9B — предсказуемо последняя, и разброс у неё реальный (0.037), не то что у остальных, но за свои-то деньги (честно использую у себя на Маке довольно часто)!
Модели-судьи уставали пять раз за ночь
Кручу бенчи в основном ночными сессиями, отсюда и заголовок. Ещё в прошлом посте один прогон поймал PermissionDeniedError от OR разом от всех трёх судей. Думал - у успеху шел, не подфартило, разовая случайность. За вчерашнюю ночь словил это пять раз, от 3 до 18 задач одновременно за прогон (как только сыпятся ошибки - мне приходят уведомления). Ответы были содержательными и полными (finish_reason: stop), просто судьи молчали минуту-другую под нагрузкой. Каждый раз решалось через “подождать восстановления, перезапустить именно эти задачи с паузой между вызовами, не смешивать со старым баллом”. Разница по деньгам небольшая - 111 судейских вызовов на полный прогон стоят около 70 центов; но времени уходит значительно. Учтено, поправлено.
Итого
Flash-Next актуален только на llama.cpp (сегодня кажется выкатили прод-релиз) - у vLLM и SGLang пока нет сборок под новую архитектуру (Gated DeltaNet, разреженное внимание, n-gram-таблица). В проде MTP-спекуляция и вся зрелая инфраструктура vLLM — реальная стоимость перехода, за которой по идее можно будет погоняться. Для меня наверное главная мысль - три прогона всё ещё маленькая выборка для категорий с реальным разбросом, думаю делать больше, но денег придется тратить тоже больше, дилемма.
Комментарии (2)

whocoulditbe
28.08.2026 14:26и прикидываем ее на 5090 c 32GB VRAM
А где это в статье?
Честно говоря, весь текст похож на какие-то заметки на полях, понятные только автору.
Altair2021
А почему у flash q3 балл выше, а пройденных задач меньше, чем у q4? 43/50 у q3 и 44 у q4