В пятницу вышла Qwen3.8-27B. Скажу честно, с середины мая я отказался от подписок и сидел исключительно на локальной Qwen3.6 (для всех своих домашних проектов), у меня даже статья была на эту тему. Поэтому мне было очень интересно увидеть на что способна новая Qwen3.8-27B. Тут на Хабре было несколько статей о том, что 3.8 слишком долго думает и что у 3.8 слишком много галлюцинаций (что, как мне кажется, не совсем корректно), поэтому я решил поделиться настройками, которые работают (у меня), надеюсь они будут кому-нибудь полезны. Qwen3.8-27B превзошла мои самые смелые ожидания, и уж что-что а задумчивой она не кажется.

Загрузка

Так получилось, что я не использую GGUF файлы от Unsloth. Как-то давно я попробовал их GGUF и качество мне очень не понравилось, не знаю уж как они его готовят, но почему-то качество работы той старой модели было не очень (много галлюцинаций и повторов), поэтому я обычно конвертирую gguf самостоятельно (прошу не ругаться и тапками не кидаться).

Сообщение о том что модель доступна для скачивания пришло минут на 40 раньше чем я ожидал, ну окей, создал новую папку и загрузил веса.

hf download Qwen/Qwen3.8-27B --repo-type model --local-dir ./Qwen3.8-27B_official_sources_from_Qwen

Далее создал gguf файл:

pipenv run python convert_hf_to_gguf.py ~/models1/Qwen3.8-27B/Qwen3.8-27B_official_sources_from_Qwen/   --outfile ~/models1/Qwen3.8-27B/my_conversions/Qwen3.8-27B-F16.gguf --outtype f16

Насколько я понимаю данная операция просто переупаковывает тензоры в один файл формата GGUF с точностью F16, GPU на этом этапе не используется и скорость зависит только от CPU и диска. В моем случае это заняло примерно 14 минут.

Я запускаю модель на старенькой 4090, поэтому следующим шагом идет квантование. Использую Q4_K_M, поэтому следующей командой, которую я запустил была:

llama-quantize Qwen3.8-27B-F16.gguf    Qwen3.8-27B-Q4_K_M.gguf    Q4_K_M

тут пришлось еще минут 5 подождать.

Запуск

И вот модель готова к запуску! Я дрожащими руками настраиваю llama.cpp… Шучу конечно! Но мне действительно не терпелось запустить модель, поэтому я тупо скопировал файл настроек для 3.6 поменял обозначение модели на 3.8 и запустил как есть. Собственно вот настройки:

llama-server -m ~/models1/Qwen3.8-27B/my_conversions/Qwen3.8-27B-Q4_K_M.gguf \
    -ngl 99 \
    --port 8882 \
    --temp 0.6 \
    --top-p 0.95 \
    --top-k 20 \
    --min-p 0.00 \
    -t 6 \
    -c 180000 \
    --cache-type-k q8_0 \
    --cache-type-v q8_0 \
    --parallel 1 \
    --flash-attn on \
    --presence-penalty 0.52 \
    --repeat-penalty 1.0 \
    --repeat-last-n 206 \
    --reasoning-budget 4096 \
    --reasoning-budget-message "Let's move on to the final answer."
    --cache-ram 32768 

Ну и оно заработало! Без Overthinking, без галлюцинаций, практически идеально! За прошедшие 3 дня я прогнал модель почти по всем сценариям в которых я ее использую и со всеми скиллами, которые я написал за последние месяцы. Во всех случаях модель существенно превосходила 3.6.

Больше всего меня впечатлила работа модели в агентном режиме. У меня есть довольно длинный сценарий из 27 шагов, в ходе которого модель должна скачивать данные из интернета, заполнять таблицу в csv файле, использовать Python и статистические методы для анализа данных и по результатам формировать отчет. Qwen3.6 не справлялась с полным сценарием и обычно останавливалась после 8-12 шагов, пришлось разбить сценарий на фазы и запускать их по-очереди. Qwen3.8 справилась с полным сценарием и за 22 минуты корректно выполнила все 27 шагов с логгированием промежуточных результатов в markdown файл и построением финального отчета.

reasoning-budget

Отдельно нужно сказать про такой параметр как reasoning-budget. В Qwen3.6-27B я добавил этот параметр потому, что модель довольно долго думала. Значение параметра для 3.6 было 2048 с ним модель думала примерно 20-30 секунд до начала ответа, и мысли модели мне не очень нравились, она периодически зацикливалась и ее приходилось останавливать, пришлось даже добавить: --presence-penalty 0.52, --repeat-penalty 1.0, --repeat-last-n 206 (вы можете видеть эти параметры в моих настройках). Однако новая Qwen3.8-27B меня очень приятно удивила. Она начала отвечать сразу! Т.е. 3.6 даже на простой вопрос - сначала думала (да не так долго, но думала), а 3.8 ответила сразу, размышление 1 секунда. Поэтому в данный момент я увеличил лимит рассуждения до 4090 токенов (можно видеть в настройках llama.cpp) и честно сказать подумываю о том, чтобы увеличить его еще в 2 раза, или вообще убрать.

Я не претендую на то, что параметры запуска, которые я привел, единственно правильные, более того, они не совпадают с официально рекомендованными, и получились случайно (как я сказал - я скопировал настройки, которые использовал для 3.6) но для меня они работают очень хорошо. Тут на Хабре было несколько статей о том, что 3.8 слишком долго думает и что у 3.8 слишком много галлюцинаций (что, как мне кажется, не совсем корректно), поэтому я решил поделиться настройками, которые работают, надеюсь они будут кому-нибудь полезны.

Комментарии (36)


  1. Politura
    19.08.2026 02:24

    reasoning-budget на самое лучшее решение, это как мешком по голове, чтоб все мысли убрать. У 3.8 можно гораздо гибче размышления настраивать с помощью reasoning-effort.

    Попробуй такой параметр для llama-server:

    --chat-template-kwargs '{"reasoning_effort": "low"}'

    Можно задавать low, medium, high, и кажется xhigh


    1. Mintavrus
      19.08.2026 02:24

      xhigh ставится по умолчанию, если не ставить другой параметр. От этого и идут жалобы что модель якобы очень много думает


    1. rtrgdfb Автор
      19.08.2026 02:24

      кажется возникло недопонимание по поводу reasoning-budget
      Изначально я добавил эту настройку для 3.6, потому, что 3.6 периодически зацикливалась на: "...I will provide the best answer, I will provide ..." и так по-кругу.
      Т.е. reasoning-budget для 3.6 использовался как ограничитель, чтобы модель остановилась, если ушла в цикл. Нужно отметить, что reasoning-budget не обрывает рассуждение на середине, а довольно мягко способствует тому, чтобы модель в него уложилась.
      3.8 в этом плане гораздо лучше, за последние 4 дня она ни разу не уходила в подобный цикл. Поэтому я увеличил reasoning-budget и планирую его еще увеличить. Т.е. меня полностью устраивает как она рассуждает и я готов дать ей еще немного пространства для рассуждения (не ограничить, а добавить), рассуждения выглядят обоснованными и вполне логичными, и не затягиваются надолго, если задача сложная модель может потратить больше токенов, но для простых задач тратит совсем немного (значительно меньше чем тратила 3.6), т.е. выглядит так, что 3.8 эффективние использует бюджет.
      (вообще конечно нужно поиграть с настройками, но вроде как все и так работает, а времени пока нет)


  1. m0xf
    19.08.2026 02:24

    Почему использован --temp 0.6, если разработчиками модели рекомендуется 1.0?


    1. rtrgdfb Автор
      19.08.2026 02:24

      так получилось. Я редко использую модель для написания красивых текстов, на письма и что-то короткое 0.6 - нормально, а излишнее творчество мне ни к чему, пусть лучше на один и тот-же вопрос она отвечает более-менее одинаково.


      1. Mintavrus
        19.08.2026 02:24

        Как я понял температура 1.0 в qwen3.6 не тоже самое что температура 1.0 в qwen3.8. Поэтому для одних и тех же сценариев для qwen3.6 разработчики рекомендуют 0.6, а для qwen3.8 - 1.0


  1. neco
    19.08.2026 02:24

    а если не секрет, на каком железе это запускается?


    1. Mintavrus
      19.08.2026 02:24

      В тексте написано, что на RTX4090. Все остальные параметры железа глубоко вторичны.


    1. rtrgdfb Автор
      19.08.2026 02:24

      на виртуалке с Arch и проброшенной внутрь RTX4090


      1. jarkevithwlad
        19.08.2026 02:24

        а можно вопрос? для чего именно виртуалка с арчем? я только что повторил то же самое сразу на вин11


        1. rtrgdfb Автор
          19.08.2026 02:24

          просто я как-то давно вместо винды установил Arch, у него rolling release, вот он так и катится от обновления к обновлению. Виртуалка удобна для экспериментов, потому, что если что-то сломается не нужно все переустанавливать, ну а Arch на виртуалке - потому, что удобно иметь одну систему везде.


          1. AntonSn
            19.08.2026 02:24

            На windows система достаточно значительное количество VRAM резервирует, даже если подключить монитор к igpu процессора. На cachy os, используя beellama и сжатие kv кеша kvarn6 у меня получилось запустить модель в 5q без mtp на 24 ГБ vram


            1. KoIIIeY
              19.08.2026 02:24

              Гугл мне сказал что разницы между q4 и q5 практически нет.

              Или вы имеете ввиду что скорость адекватная?


              1. AntonSn
                19.08.2026 02:24

                Качество модели по идее должно быть лучше. Но я разницы не заметил, если честно :D. Сразу скажу, что я не программист, мои задачи просты: системное администрирование - настрой, установи; задачи связанные с таблицами - напиши скрипт на python - pandas. Кстати, Glimmer для этих задачи мне показался поприятнее - работает быстрее в плане размышлений и в плане ток/сек.


            1. rtrgdfb Автор
              19.08.2026 02:24

              (спасибо! попробую mtp и разные квантования)


  1. ros_molodezh
    19.08.2026 02:24

    спасибо очень полезная информация


  1. jarkevithwlad
    19.08.2026 02:24

    пользуюсь unsloth там кстати внутри и mtp есть сразу, я вот так включаю

    --spec-type draft-mtp --spec-draft-n-max 2

    и ещё рекомендую всем турбоквант, у меня эта модель в q4_k_m влазит полностью в gpu 24gb с 128к контекста и место ещё остаётся


    1. KoIIIeY
      19.08.2026 02:24

      А сколько токенов в секунду? У меня на 7900хтх максимум 14 почему то


      1. jarkevithwlad
        19.08.2026 02:24

        у меня на 3090 40-60ток/с с mtp и 25-30 без mtp


        1. KoIIIeY
          19.08.2026 02:24

          Не покажете конфиг запуска? :)

          У меня 14 с мтп


          1. jarkevithwlad
            19.08.2026 02:24

            llama-server.exe -m “C:\models\Qwen3.8-27B-Q4_K_M\Qwen3.8-27B-Q4_K_M.gguf” --ctx-size 128000 -ngl all --load-mode none -fa on --jinja --temp 0.6 --repeat-penalty 1.1 --top-k 20 --top-p 0.95 --min-p 0.0 --port 8080 --no-context-shift -ctk tbqp3 -ctv tbq3 --spec-type draft-mtp --spec-draft-n-max 2


            1. KoIIIeY
              19.08.2026 02:24

              –flash-attn on -ngl 99 --chat-template-kwargs ‘{“reasoning_effort”:“low”}’ --parallel 1 --cache-type-k q8_0 --cache-type-v q8_0

              у меня видеокарта через окулинк воткнута, и вот с таким подходом 50-75 токенов сделал


    1. rtrgdfb Автор
      19.08.2026 02:24

      unsloth у меня как-то не зашел, а на счет mtp - хорошая идея, попробую. Спасибо!


      1. jarkevithwlad
        19.08.2026 02:24

        вашим способом gguf даже меньше чем у unsloth

        и при этом mtp так же в нём уже есть и работает

        пример скорости с mtp


        1. rtrgdfb Автор
          19.08.2026 02:24

          Спасибо! У вас кстати скорость получилась больше чем у меня (у меня примерно 45-50 токенов в секунду)


          1. jarkevithwlad
            19.08.2026 02:24

            я думаю это из-за виртуалки с пробросом gpu, я раньше в wsl запускал и у меня скорость вроде как меньше была чем в вин11, хотя у меня сейчас должна быть скорость меньше чем у вас (особенно учитывая что у меня только 3090), т.к. турбоквантование контекста сжимает потребление памяти контекстом в 4.74x и уменьшает скорость в 0.87x при этом качество в сравнении с контекстом f16 даже выше на 8%


            1. rtrgdfb Автор
              19.08.2026 02:24

              нашел!!! :) я поставил ограничение мощности видеокарты на 360 Ватт а потом об этом забыл! :))) Так-что виртуалка тут ни при чем


              1. jarkevithwlad
                19.08.2026 02:24

                странно, но моя выдаёт такую скорость при 350 ватт-ах, стоковые экстрим параметры на 420 ватт не использую))


  1. jarkevithwlad
    19.08.2026 02:24

    поправьте, у вас вместо gguf -> guff

    --outfile ~/models1/Qwen3.8-27B/my_conversions/Qwen3.8-27B-F16.guff


    1. rtrgdfb Автор
      19.08.2026 02:24

      Поправил. Спасибо!


  1. jarkevithwlad
    19.08.2026 02:24

    залил сорсы своего форка llama.cpp (only cuda), суть такая: это последняя версия llama.cpp но с поддержкой турбоквантования контекста, не уверен насчёт сборки для линукс но может и выйдет что то, тестировал у себя только для вин 11 под rtx 3090
    для контекста в режиме турбокванта рекомендую -ctk tbqp3 -ctv tbq3
    а для mtp --spec-type draft-mtp --spec-draft-n-max 2


  1. sgnppv
    19.08.2026 02:24

    К сожалению в распоряжении ПК с 4090 24гб нет, зато есть две 5080 16гб, у кого был опыт использования двух видеокарт для этих целей?


    1. jarkevithwlad
      19.08.2026 02:24

      у меня опыта нет, но в целом должно быть юзабельно, gpt говорит вот так следует делать:

      Скрытый текст


      1. sgnppv
        19.08.2026 02:24

        У GPT я и сам уже спросил, но мне интересен личный опыт - он, как показывают даже комментарии к этому посту, весьма неоднороден


    1. Mintavrus
      19.08.2026 02:24

      2 5080 16 ГБ это гораздо лучше для запуска qwen3.8-27b чем одна 4090. Можно использовать менее заквантованную модель и больше контекста


  1. jarkevithwlad
    19.08.2026 02:24

    нашёл ещё более быстрый вариант "FastMTP" внутри модели "HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF"

    но нужно собирать особую сборку llama.cpp

    HauhauCS FastMTP: up to 3.02x document TG and 1.93x reasoning TG versus non-MTP — plus up to 35.2% more document TG and 21.1% more reasoning TG than standard embedded MTP.