Результат прошлого бенча Qwen3.8-27 в 0.789 из прошлого поста - не тот конфиг, вышел новый Qwen3.8-Flash-Next и я возвращаюсь меньше чем через сутки к тестам. Тестируем новую архитектуру на старой RTX PRO 6000 и прикидываем ее на 5090 c 32GB VRAM.

Модель

Прогонов

Балл

σ

Прошло

ток/с

Flash-Next, Q3_K_XL

3

0.786

0.017

43/50

79.1

Flash-Next, Q4_K_XL

3

0.785

0.021

44/50

77.4

Qwen3.8-27B, продакшн (исправлено)

3

0.769

0.007

41/50

70.0

Ornith-35B (MoE)

2

0.732

0.004

42/50

238.1

Ornith-9B

3

0.590

0.037

30/50

121.4

Продакшн-версия две недели была как неактуальна в NVFP4A16

Все уже наверняка прочитали, что Qwen3.8-Flash-Next - превью архитектуры, которая ляжет в основу Qwen4: 125 млрд параметров, 6 активных на токен, плюс 51 млрд в n-gram-эмбеддинге, который вообще не считается как в dense-модели - данные n-gram читаются точечными обращениями с диска. Естественный вопрос: как это будет в сравнении рядом с тем, что уже крутится в проде?

Я человек простой, вышла новая модель - пошел сверять конфиг для честного сравнения и обнаружил, что строка «Qwen3.8-27B, своя карта» в таблице из прошлого поста (0.789/46) была не про боевой сервер. Она осталась от раздачи трёхнедельной давности: сторонний чекпойнт от unsloth, MTP выключен, через туннель на порт, которого давно не существует. УЖАС? Казалось бы :)

Реальный прод - официальный Qwen3.8-27B-NVFP4A16, MTP включён, делит карту с Ornith-35B, который у меня занимается расчетами в фоне, постоянно адаптируя и обновляя мои основные репозитории. Никто не проверял их рядом, потому что оба выглядели правдоподобно. Пересчитал заново, заморочился на три прогона: 0.769.

Три прогона вместо одного - и всё сошлось

Собственная методика уже год как знает мою дельту — 0.043 при одинаковой конфигурации (напоминаю, что идеал 1.0). Три модели из пяти уместились внутри 0.02 друг от друга. Flash-Next и продакшн-27B статистически неотличимы: 0.786 против 0.769, разница меньше половины разброса. Более точный квант (Q4 против Q3) тоже ничего не дал - 0.785 против 0.786, при том что у Q4 вдвое лучше метрика восстановления по данным самого unsloth. На этом наборе задач лишний бит как будто бы только съел VRAM (4.3 ГБ вместо 24.7) и не дал измеримой разницы.

Ornith-35B стабильно ниже лидеров на 0.05 — но это честный компромисс: декод в 3.4 раза быстрее. Ornith-9B — предсказуемо последняя, и разброс у неё реальный (0.037), не то что у остальных, но за свои-то деньги (честно использую у себя на Маке довольно часто)!

Модели-судьи уставали пять раз за ночь

Кручу бенчи в основном ночными сессиями, отсюда и заголовок. Ещё в прошлом посте один прогон поймал PermissionDeniedError от OR разом от всех трёх судей. Думал - у успеху шел, не подфартило, разовая случайность. За вчерашнюю ночь словил это пять раз, от 3 до 18 задач одновременно за прогон (как только сыпятся ошибки - мне приходят уведомления). Ответы были содержательными и полными (finish_reason: stop), просто судьи молчали минуту-другую под нагрузкой. Каждый раз решалось через “подождать восстановления, перезапустить именно эти задачи с паузой между вызовами, не смешивать со старым баллом”. Разница по деньгам небольшая - 111 судейских вызовов на полный прогон стоят около 70 центов; но времени уходит значительно. Учтено, поправлено.

Итого

Flash-Next актуален только на llama.cpp (сегодня кажется выкатили прод-релиз) - у vLLM и SGLang пока нет сборок под новую архитектуру (Gated DeltaNet, разреженное внимание, n-gram-таблица). В проде MTP-спекуляция и вся зрелая инфраструктура vLLM — реальная стоимость перехода, за которой по идее можно будет погоняться. Для меня наверное главная мысль - три прогона всё ещё маленькая выборка для категорий с реальным разбросом, думаю делать больше, но денег придется тратить тоже больше, дилемма.

Комментарии (2)


  1. Altair2021
    28.08.2026 14:26

    А почему у flash q3 балл выше, а пройденных задач меньше, чем у q4? 43/50 у q3 и 44 у q4


  1. whocoulditbe
    28.08.2026 14:26

    и прикидываем ее на 5090 c 32GB VRAM

    А где это в статье?

    Честно говоря, весь текст похож на какие-то заметки на полях, понятные только автору.