Пока все тестируют Qwen 3.8 27B, появилась новая модель от Alibaba с Qwen 4 архитектурой. Это не байт и не шутка: выпущенная пару дней назад новая мультимодальная MoE модель под названием Qwen3.8-Flash-Next является ранним архитектурным превью, используемым в будущей Qwen 4 [1].

Модель играет ту же роль, что и Qwen3-Next для Qwen3.5: гибридная конструкция Gated DeltaNet с Gated Attention, представленная тогда, с тех пор используется в сериях Qwen3.5, Qwen3.6, Qwen3.7 и Qwen3.8. Новая архитектура переосмысливает этот подход, давайте разбираться, что изменилось.

Что нового в архитектуре Qwen 4 (Qwen3.8-Flash-Next)

На базовом уровне это мультимодальная архитектура типа Mixture-of-Experts (MoE). Однако в отличие от привычных MoE, здесь применено несколько решений для эффективной локальной работы с большими контекстными окнами (262K нативно и 1M с YaRN):

  1. Разделение общего и активного объема параметров

    • Общий объем модели: 125 млрд параметров основного MoE-графа + 51 млрд параметров N-gram таблиц + 4 млрд параметров головы MTP (Multi-Token Prediction).

    • Активные параметры на токен: всего 6B (512 маршрутизируемых экспертов, из которых активны 10 + 1 общий эксперт). То есть по вычислениям на токен модель сопоставима с компактными моделями на 6B, а по уровню знаний превосходит тяжелые 70B+ модели.

  2. 51B N-gram Embeddings (PLE) и офлоадинг в RAM/SSD

    Одной из главных архитектурных новинок стало добавление отдельного слоя N-gram эмбеддингов размером 51B параметров. Рядом с основной моделью живет отдельная таблица на 20 млн записей (биграммы и триграммы). В предыдущей архитектуре число параметров и объем вычислений находились на одной оси (зависели друг от друга). N-gram память позволяет разделить эту зависимость.

    N-gram слой не требует квадрирования или сложных матричных умножений, т.к. ключи в этой таблице являются детерминированными хешами от последней пары токенов. Позиции обращений рассчитываются заранее, поэтому всю эту таблицу (51B) незачем держать в видеопамяти.

    Подойдет обычная оперативная память или SSD/NVMe, и нужные данные считываются с помощью асинхронного префетчинга через mmap из обычного SSD или системной памяти без потери точности, пока видеокарта будет считать остальное в самих экспертах. В итоге эта таблица работает как быстрая память большого объема для частых фраз и локальных паттернов языка.

  3. Гибридный механизм: GDN + QSA (Qwen Sparse Attention)

    Слои Gated DeltaNet идентичны в обеих моделях (конфигурация голов и размерность сохранены). В Qwen 3.8 27B каждый такой слой задействует четыре KV-головы (Gated Attention): это обеспечивает высокую точность, однако вычислительные затраты и объем памяти растут линейно с увеличением контекста, что делает данный слой самым ресурсоемким в стеке.

    В Qwen3.8-Flash-Next механизм Gated Attention заменен на Qwen Sparse Attention. Главное отличие нового подхода заключается в детализации отбора. Вместо оценки каждого отдельного токена в истории индексирующий модуль (MQA: 4 query-головы и 1 общая K-голова с размерностью 128) анализирует микроблоки токенов. После этого модель обращается к контексту (активирует внимание) в рамках фиксированного бюджета размером 512 блоков или 2048 токенов.

    Таким образом, Gated DeltaNet эффективно запоминает, а QSA точно ищет: 36 слоев (из 48) сжимают историю в состояние фиксированного размера, 12 слоев делают точечный выборочный поиск по настоящей истории. Модель сама решает, сколько информации считывать из каждой ветки и сколько записывать обратно.

    В модели 48 слоев:

    • 36 слоев (3 из 4): используют Gated DeltaNet (GDN), линейный рекуррентный механизм, который сжимает историю в рекуррентное состояние фиксированного размера, предотвращая рост KV-кэша.

    • 12 слоев (1 из 4): используют Qwen Sparse Attention (QSA). В отличие от классического Attention, QSA агрегирует последовательность в микроблоки и выбирает только наиболее релевантные области. Это дает до 8.6x прироста скорости Prefill на контекстах в 1 млн токенов.

  4. Gated Residual (GR) и MTP

    Gated Residual разделяет единый residual-поток на 4 ветки. Поэлементный динамический gate управляет чтением слоя, а единый скалярный gate управляет записью. Интересно то, что одна из этих веток берет на себя роль магистрали для сквозного переноса информации из начальных слоев в глубокие.

    Это сохраняет стабильность обучения и емкость слоев неизменными. Вычислительный оверхед на инференсе минимален, в том числе благодаря хранению веток в формате FP8.

    По MTP все просто: добавили один слой, обученный на нескольких шагах вперед. Получился готовый драфтер для спекулятивного декодирования, бесплатный буст скорости генерации, без потери точности. Что это такое, можно прочитать в другой моей статье [2]

Сравнение Qwen3.8-Flash-Next vs Qwen 3.8 27B

Для наглядности сравним новую архитектуру с недавно вышедшей моделью Qwen 3.8 27B [3].

Параметр / Характеристика

Qwen 3.8 27B (Dense)

Qwen3.8-Flash-Next (Qwen 4 MoE)

Тип модели

Плотная (Dense)

MoE (Mixture of Experts) + N-gram

Общие параметры

27 млрд

~180 млрд (125B MoE + 51B N-gram + 4B MTP)

Активные параметры / токен

27 млрд

6 млрд

Механизм внимания (Attention)

GDN + Gated Attention (Full Attention)

GDN + QSA (Sparse Micro-block Attention)

N-gram память

Отсутствует

51B N-gram Embeddings (поддержка mmap)

Residual-связи

Одиночный поток

4-поточный Gated Residual (GR)

Нативный контекст

262K

262K (расширяемый до 1M)

Сравнение в бенчмарках

Несмотря на то что Qwen3.8-Flash-Next использует всего 6B активных параметров на токен (в 4.5 раза меньше, чем Qwen 3.8 27B), архитектура Qwen 4 демонстрирует существенное превосходство в агентских задачах, кодинге и логике:

Бенчмарк

Qwen3.8-Flash-Next (Qwen 4 MoE)

Qwen3.8-27B (Dense)

Улучшение

DeepSWE 1.1 (агентский кодинг)

58.7

42.2

+16,5

SWE-bench Pro

62.5

61.7

+0,8 (паритет)

SWE-bench Multilingual

81.0

73.8

+7,2

NL2Repo-Bench

48.1

42.3

+5,8

CoWorkBench (in-house)

73.9

70.7

+3,2

JobBench

55.7

33.4

+22,3

Agents’ Last Exam (Score / Pass@1)

51.2 / 24.3

42.9 / 20.4

+8,3 / +3,9

Toolathlon Verified (Pass@1)

73.5

67.1

+6,4

IFBench

81.3

79.5

+1,8

GPQA Diamond

91.7

89.2

+2,5

HLE (GPT-4o judge)

35.9

30.8

+5,1

LiveCodeBench v6

91.9

90.3

+1,6

Примечательно следующее: если Qwen 3.8 27B по тестам вплотную подбирается к Claude Opus 4.6, то превью новой архитектуры Qwen 4 обходит ее в большинстве тестов и вплотную подбирается к Claude Opus 4.8. Вполне возможно, что Qwen 4 на релизе начнет щупать Claude Fable 5 за мягкое.

Запуск 4-битной версии на 128 ГБ RAM со скоростью 20-30 tok/s

Благодаря тому, что N-gram слой можно выгружать в системную память ОЗУ или через mmap на SSD, требования к VRAM GPU кардинально снизились. Как отмечается в документации Unsloth [4], 4-битные квантованные версии (GGUF UD-Q4_K_XL и UD-IQ4_XS) позволяют использование на системах со 128 ГБ оперативной памяти (например, Mac Studio / MacBook Pro на Apple Silicon с Unified Memory или ПК/сервер со 128GB RAM).

При этом показатели работы при запуске через Unsloth / llama.cpp следующие:

  • Необходимый объем памяти: ~85-110 ГБ ОЗУ/Unified Memory для полной загрузки 4-битной квантовки.

  • Скорость генерации: около 20-30 токенов в секунду при инференсе, что является впечатляющим результатом для модели со 180B весов. У меня на 128GB RAM выдает 25-27 токенов в секунду, но видеокарта для получения такой скорости все равно нужна.

  • Интерактивный режим гибридного мышления (Hybrid Thinking): в Unsloth Desktop из коробки поддерживается переключение режимов reasoning_effort (xhigh, medium, low, none), а также сохранность цепочки рассуждений (Preserve Thinking) между репликами диалога.

Итоги

Модель Qwen3.8-Flash-Next наглядно задает тренд на развертывание локального ИИ на обычных рабочих станциях со 128 ГБ оперативной памяти. Такой подход исключает затраты на дорогостоящие GPU-кластеры и сохраняет высокую скорость инференса до 30 токенов в секунду, а 6 миллиардов активных параметров гарантируют отличный баланс качества и быстродействия для работы локальных агентов.

Важно отметить, что Alibaba на сегодняшний день остается единственной компанией, предоставляющей в открытый доступ веса полного спектра моделей: от компактных решений меньше 1B до флагманов 100B+ параметров.

Линейка Qwen закрывает все актуальные задачи, объединяя классические рассуждающие LLM, мультимодальные и голосовые системы. Это позволяет бизнесу строить автономные on-premise ансамбли на базе инфраструктуры одного вендора с идеально совместимыми компонентами.

Такой подход открывает доступ к уникальным возможностям, включая каскадную маршрутизацию для удешевления инференса, бесшовное построение мультимодальных конвейеров и эффективную дистилляцию корпоративных знаний.

Update: в комментариях много вопросов о там с какой скоростью будет работать модель на их железе. Вот здесь пользователи делятся получившейся скоростью на своих сборках. Используйте эти данные как ориентир, только помните, что помимо самого железа критически важно правильно настроить под него параметры запуска модели.

References

  1. Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency, Qwen Blog (2026)

  2. Нейронные сети нетрадиционного ускорения, Habr (2026)

  3. Qwen/Qwen3.8-27B, Hugging Face (2026)

  4. Qwen3.8-Flash-Next: How to Run Locally, Unsloth Docs (2026)

Комментарии (68)


  1. DasProtoss
    27.08.2026 23:42

    “У меня на 128GB RAM выдает 25-27 токенов в секунду, но видеокарта для получения такой скорости все равно нужна”
    Так какая видеокарта-то? ЭТО ЖЕ ОСНОВНОЕ. На чистой памяти оно могло выдать у тебя ~1 токен/сек…


    1. ToxaBes Автор
      27.08.2026 23:42

      Без карты тоже должно работать, все зависит от того прочитал ли пользователь какие параметры выставлять, от его проца, а также от скорости и поколения DDR памяти:

      • M1 Ultra 128G выдает примерно 20 t/s,

      • AMD EPYC 7763 + 128GB DDR4 RAM выдает примерно 45 t/s

      • Intel i9 12900k128 GB DDR4 3600 MT/s + RTX 3090 примерно 65 t/s

      Это данные от пользователей. Моя система не показатель тк там все патчено-перепатчено под различные штуки.


      1. Akela_wolf
        27.08.2026 23:42

        Intel i9 12900k128 GB DDR4 3600 MT/s + RTX 3090 примерно 65 t/s

        Вот это красота. То есть на моем Ryzen 5950 можно добавить +64 Гб до 128 и получить настолько нормальную скорость?


        1. mirwide
          27.08.2026 23:42

          Неизвестно что они там запускали.
          Ryzen 9950x3d 128 Gb DDR5-6000 + RTX 4070 ti super 16 Gb

          llama-cli --model Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf -c 200000 --load-mode mlock -t 16
          [ Prompt: 39.8 t/s | Generation: 20.9 t/s ]
          
          llama-cli --model Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf -c 200000 --load-mode mlock -t 16 -ngl 0
          [ Prompt: 34.3 t/s | Generation: 7.4 t/s ]

          Примерно с такой же скоростью работает генерация для DeepSeek-V4-Flash-UD-Q3_K_XL у которой активных параметров в 2 раза больше. Но менее стабильно, потому что немного не влазит в 128 Gb.


          1. ToxaBes Автор
            27.08.2026 23:42

            Добавил в конец статьи апдейт со ссылкой на страницу где пользователи делятся результатами на своих сборках и часто публикуют настройки. Возможно, это поможет вам настроить свой запуск на большую скорость.


            1. mirwide
              27.08.2026 23:42

              Нет там чудо параметров. Вы не ту циферку взяли.

              19 t/s decoding

              65 t/s prompt processing

              Примерно тоже самое. Слабая память и не самый мощный проц компенсируется большим объемом GPU RAM. На одном i9 хорошо если будет 5 t/s.


              1. ToxaBes Автор
                27.08.2026 23:42

                Да, вы правы, прошу прощения, привык что первым идет prompt processing, потом decoding.

                Покрутил настройки на своей системе, поднял скорость до 32-35 токенов в секунду. Похоже, что настройки для данной модели нужно подбирать вручную под каждую систему.


        1. Luis2
          27.08.2026 23:42

          Скорость упрется в пропускную способность твоей ddr4. Трансформеры это memory bound задача, тут частота памяти решает гораздо больше объема


  1. debagger
    27.08.2026 23:42

    Интереснее скорость префилла. Ждать по полчаса загрузки 100к контекста - это неюзабельно.


    1. Luis2
      27.08.2026 23:42

      Юзабельно это кластер из а100 в серверной, на домашнем железе всегда приходится терпеть компромисс между размером модели и ожиданием ответа)


    1. ToxaBes Автор
      27.08.2026 23:42

      Интереснее скорость префилла.

      300-400 t/s

      Для сравнения, на Qwen 3.8 27B префил у меня 800-900 t/s.


  1. Joysi
    27.08.2026 23:42

    Звучит интересно, я так понимаю, что на ПК подобному 192Gb DRAM (DDR5-5200) + 16GbVRAM - возможно одно из оптимальных решений.


    1. ToxaBes Автор
      27.08.2026 23:42

      Да, вы правильно понимаете, в конце статьи добавил ссылку на страницу где можно сравнить свою сборку с теми кто уже запускает модель на своем железе.


      1. Joysi
        27.08.2026 23:42

        Получаю 22-24 t/s на i7-265 +DDR5-5200 (192G) + 5070Ti(16G VRAM)
        llama-server -m Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf -c 262144 --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --host 0.0.0.0 --port 8080


        1. ToxaBes Автор
          27.08.2026 23:42

          Хороший результат! Все что 20 t/s и выше вполне юзабельно в каждодневном использовании.

          Для сравнения, у меня 30-35 t/s на том же 262К контексте, версии модели и настройках. Железо: Threadripper 3970X + DDR4-3200 (128GB quad-channel mode) + RTX A6000 48GB.


          1. AcckiyGerman
            27.08.2026 23:42

            А какой квант запускаете? FP8?


            1. ToxaBes Автор
              27.08.2026 23:42

              А какой квант запускаете? FP8?

              Для сравнения запускал тот же квант, что и у автора комментария, на который отвечал: Qwen3.8-Flash-Next-UD-Q4_K_XL


        1. vitaliy-sn
          27.08.2026 23:42

          Эта же модель на 96GB DDR4-3500 + 5070 Ti + 5060 Ti выдает 17-19 t/s tg и 360-370 t/s pp на задаче с ~10к контекста на входе.


          1. dkeiz
            27.08.2026 23:42

            а до сотни контекста разогнать можно? так то рабочие показатели


  1. Abcolyt
    27.08.2026 23:42

    Интересно. Ещё бы столько оперативной памяти было(


  1. max-daniels
    27.08.2026 23:42

    А если у меня 64 Гб RAM + 24 Гб VRAM? Мне особо не светит юзать данную модель?


    1. McHack
      27.08.2026 23:42

      Эту модель на данный момент - нет. Однако, я думаю быстренько появятся либо по умному пережатые модельки, по типу APEX или ещё что. Либо REAP модельки где часть экспертов выкинули. В одном из этих случаев - залезет


      1. Mijka64
        27.08.2026 23:42

        Почему? В Q1 она 72ГБ, и существенная часть на SSD. Должно влезть (я не пробовал, теоретизирую, у меня 96+24 и только в планах на выходные)


        1. HyperWin
          27.08.2026 23:42

          Все что ниже Q4 лучше даже не пробовать


          1. ToxaBes Автор
            27.08.2026 23:42

            Это справедливо в общем случае, но не для этой модели. Эту стоит попробовать. Главный минус Q1 не то что он выдают "всего" 80% от оригинальной точности, а то что в них нет MTP голов из-за чего генерация чуть медленнее.


    1. melodicmsk
      27.08.2026 23:42

      В статье же написано, что 50В можно хранить хоть на ссд. Поэтому должно скорее всего полететь.


      1. Ndochp
        27.08.2026 23:42

        Вот только какой запускатор сумеет правильно разложить между NVME, RAM, VRAM интересно. Не встречали еще инструкций для какого-нибудь дешманского 1ТБ/64/16?


    1. Luis2
      27.08.2026 23:42

      Четырехбитная квантовка весит под 100 гигов, в твои 88 гигов суммарной памяти оно влезет исключительно с жестким свопом, файл подкачки убьет скорость до нуля


      1. AcckiyGerman
        27.08.2026 23:42

        Ответ неверен. Уже вчера на реддит подобрали конфиги llama, которые оставляют весь N-gram (-50gb) на SSD. Ничего сложного нет, см. мои недавние комментарии.


    1. ToxaBes Автор
      27.08.2026 23:42

      Требуемый размер памяти (RAM+VRAM) в зависимости от квантования:

      • UD-Q4_K_XL 111.3 GB

      • UD-IQ4_XS 93.7 GB

      • UD-Q3_K_XL 90 GB

      • UD-IQ3_XXS 82 GB

      • UD-Q2_K_XL 78.9 GB

      • UD-IQ1_M 74.5 GB

      • UD-IQ1_S 72.5 GB

      По идее, у вас должна заработать нижняя половина списка.


    1. reqvar
      27.08.2026 23:42

      Подожди ещё недельку-две.


    1. tonx92
      27.08.2026 23:42

      Unsloth gguf q1 там 3 файла, 10мб 50гб и 22.5 тот что 50 по идее можно даже на диск, но пока что в оперативу. А 22.5 у вас влезает в видеопамять, и в случае с мое не обязательно всему kv кэшу в видеопамять помещаться, по логике должна не просто запуститься так ещё и скорость давать. Но вот надо ли оно, сам сижу и думаю q1 у нее это 80% top1% Accuracy, 27b я могу в q6k_xl и это около 98%, в swe pro у моделей разница почти никакая 62,5 у flash и 61,7 у 27b. Но по всей видимости будет быстрее, в общем выглядит так как будто эта модель создана именно для того что бы ее исключительно на ОЗУ гонять. Т.к. с видеокартой 27b должна быть сильно умней при том же занимаемом объеме ГПУ.


    1. leen_vl
      27.08.2026 23:42

      Светит. И греет) Я подцепил эту модель в UD_Q2_K кванте к лламе (пока к ветке pr-27742, пулреквест еще не вмержили в main), развернул на ноуте I7-1362H, 32 ГБ, RTX5070 8 ГБ VRAM. Запускал с маппингом, так что чтение экспертов в VRAM идет напрямую с SSD, плюс в оперативке немного болтается. Префилл удручающий - порядка 20 - 40 т/с, генерация на коротких контекстных окнах 10-20, на длинных 5 - 10. Шевелится, хотя и пыхтит. В окошке рассуждения здравые, холодный запуск секунд 5-10, подгрузка эксперта меньше секунды. Пока балуюсь с max reasoning, по ощущениям весьма неплохо. Оговорюсь - тестов не делал, сравнений с цифрами на руках не проводил, этого и без меня в сети хватает. Все на личных впечатлениях. Блок запуска лламы из ини-файла:
      [Qwen3.8-Flash-Next]
      model = /home/user/models/Qwen3.8-Flash-Next-UD-Q2_K_XL-00001-of-00003.gguf
      mmproj = /home/user/models/Qwen3.8-Flash-Next-Uncensored.mmproj-Q8_0.gguf
      ctx-size = 70000
      threads = 8
      threads-batch = 4
      temperature = 0.7
      jinja = true
      top-p = 0.95
      top-k = 64
      repeat-penalty = 1.1
      ngl = auto
      parallel = 1



  1. Tsimur_S
    27.08.2026 23:42

    Интересно что они таки не стали пропускать 4, как обычно в Азии делают.


    1. Belarus
      27.08.2026 23:42

      Видимо, новое поколение не такое суеверное.


    1. reqvar
      27.08.2026 23:42

      Чушь поришь. В какой Азии? Сибирь - это Азия. И Грузия - это Азия. И Владивосток - это Азия. И Дубайщина - это Азия.


      1. AcckiyGerman
        27.08.2026 23:42

        Аляска это запад или восток?


  1. Bardakan
    27.08.2026 23:42

    эта статья - нейрослоп. Иначе как объяснить, что указаны 4 источника данных, но ни в одном "qwen 4" даже не упоминается


    1. ToxaBes Автор
      27.08.2026 23:42

      эта статья - нейрослоп. Иначе как объяснить, что указаны 4 источника данных, но ни в одном “qwen 4” даже не упоминается

      У меня есть для вас упражнение:

      1. Открываете первую ссылку из источников: https://qwen.ai/blog?id=qwen3.8-flash-next

      2. Читаете там первое предложение первого абзаца: In this release we are opening the weights of Qwen3.8-Flash-Next, a multimodal MoE model that also serves as an early preview of the architecture used in Qwen4

      3. Выдыхаете.

      Повторяйте по утрам натощак.


      1. Bardakan
        27.08.2026 23:42

        в названии и в тексте вашей статьи указано "qwen 4" (через пробел), в статьях указано "qwen4". Как я должен догадаться, что у вас опечатка? Тем более, что вы ее до сих пор не исправили.

        Зато сразу лезете минусовать профиль и выписываете всякую чушь в комментариях. И "qwen 4" по вашим ссылкам действительно нет.


        1. ToxaBes Автор
          27.08.2026 23:42

          У вас какое-то недомогание, иначе я не могу этого объяснить. Выздоравливайте.


        1. Dhwtj
          27.08.2026 23:42

          Выпейте водки 50 грамм

          Глаза сфокусируются


          1. Bardakan
            27.08.2026 23:42

            А эту статью надо было после 50 грамм читать? Тогда понятно. Я просто непьющий - изображение не расползается.

            Кстати оскорблять человека и одновременно ставить ему минусы в карму за «грубое общение» - вам самим не смешно?


            1. Dhwtj
              27.08.2026 23:42

              Какие минусы? Это не я!

              Честно, не я
              Честно, не я
              Анонимус жесток, но это не я
              Анонимус жесток, но это не я


            1. nikulin_krd
              27.08.2026 23:42

              Вы прибежали, обвинили человека что его статья нейрослоп, а когда вам мягко указали на то что вы не правы, вы вместо того чтобы признать свою ошибку и извиниться продолжаете нести чушь, а теперь удивляетесь минусам


              1. Bardakan
                27.08.2026 23:42

                Т.е. моя фраза про опечатки в статье - это "нести чушь", а три чела включая автора написали в духе "иди лечись" - это "мягко указали", и я еще после этого извиниться должен? На что вы расчитываете?

                Единственное, что меня удивляет после этого - в статье про stackoverflow кто-то жаловался на местную систему кармы. Тем временем хабр:


        1. HyperWin
          27.08.2026 23:42

          Мои соболезнования.


  1. Luis2
    27.08.2026 23:42

    Благодаря тому, что N-gram слой можно выгружать в системную память ОЗУ или через mmap на SSD

    Костыль века, хоть и рабочий. Пси-ай шина будет дымиться от постоянных свопов, зато в оперативку влезет


    1. ToxaBes Автор
      27.08.2026 23:42

      Да, все так. Стратегия Alibaba заключается в закрытии всех ниш своими моделями. Вот и дошла очередь позаботиться о пользователях без мощных видеокарт и дать им возможность пощупать фронтир модель на ОЗУ. При правильной настройке эта модель вполне может стать для них ежедневным помощником. В том числе и поэтому я решил о ней написать.


      1. Mijka64
        27.08.2026 23:42

        Нет, не так.

        Pci-E шина дымилась при плотной архитектуре, когда все веса были нужны на каждый токен.

        Оффлоад экспертов уже сносно работал, хотя и ограничивал скорость.

        Ngram-слой на ssd вообще не будет узким местом.


        1. ToxaBes Автор
          27.08.2026 23:42

          Я имел ввиду, что у большинства пользователей в оффлоад уйдет не только Ngram-эмбеддинги, но и заметная часть слоев основной архитектуры. И вот это уже даст нагрузку.