https://huggingface.co/Qwen/Qwen3.8-27B

Кратко:

  • Размер модели относительно небольшой, довольно быстро работает на карточках с 24+ GB VRAM.

  • "Понимает" изображения и видео

  • по некоторым бенчмаркам - лучше чем Opus 4.6

  • контекст: 262K, с помощью YARN можно увеличить до 1M

Так как большинство используют llama.cpp для запуска, то кванты можно взять вот тут:

https://huggingface.co/unsloth/Qwen3.8-27B-GGUF

Поддерживается MTP (спекулятивное предсказание)

Я тестировал на RTX 5090 (32GB VRAM).

Квант UD-Q6_K_XL:

  • помещается контекст только 48k

  • скорость генерации: 100 т/с

Квант UD-Q5_K_XL:

  • помещается контекст только 125k

  • скорость генерации: 120 т/с

Команда для запуска:

llama-server \
 -hf unsloth/Qwen3.8-27B-GGUF:UD-Q6_K_XL \
 --host 0.0.0.0  --port 8080 \
 --fit off --gpu-layers all --gpu-layers-draft all \
 --ctx-size 48000 \
 --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --repeat-penalty 1.0 \
 --spec-type draft-mtp

Если вы запускаете на RTX 3090 / RTX 4090 (24GB VRAM), то вам надо будет брать квант поменьше и / или квантовать контекст и / или частично выгружать в обычную память.

Вот тут выложили специальный квант для запуска на карточках с 16GB VRAM:
https://huggingface.co/cHunter789/Qwen3.8-27B-i1-IQ4_KS_KT-GGUF
Я этот квант не пробовал. Если кто попробует - отпишитесь к комментариях.

Что можно сделать, чтобы поместить побольше контекста на GPU?

  • квантизировать KV cache: --cache-type-k, --cache-type-v
    Народ пишет что это может делать модель "тупее", особенно в кодинге. Я не пробовал.

  • не использовать MTP
    Если убрать опцию –-spec-type draft-mtp, то при кванте UD-Q5_K_XL, помещается на 46k больше контекста.
    При этом скорость генерации токенов становится в ~2 раза медленнее.

  • не использовать слой для работы с изображением. Его можно вообще не грузить: --no-mmproj, или грузить в обычную память вместо VRAM: --no-mmproj-offload.
    При кванте UD-Q5_K_XL, помещается на 19k больше контекста.
    В обычной памяти обработка изображений в 5 раз медленнее на процессоре с 16 ядрами и в 10 раз медленнее на процессоре в 8 ядрами. На скорость работы с текстом эти опции не влияют, - только на работу с изображениями. Например запрос с одним изображением обрабатывается 13 секунд на GPU, но 76 секунд на 16-ядерном AMD 9950x3d.

На RTX 5090 (32GB VRAM), при кванте UD-Q5_K_XL, без слоя для работы с изображениям, без MTP, помещается контекст 190k.

По личным ощущениям, качество модели очень хорошее, - модель стала заметно "умнее". Думаю, что на сегодня, это лучшая модель, которую с адекватной скоростью можно запустить у себя на компьютере.

В Docker можно запустить вот так:

services:
  llama:
    image: ghcr.io/ggml-org/llama.cpp:server-cuda12-b10423
    container_name: llama
    devices:
      - "nvidia.com/gpu=all"
    ports:
      - "8080:8080"
    environment:
      - NVIDIA_VISIBLE_DEVICES=all
      - NVIDIA_DRIVER_CAPABILITIES=compute,utility
    volumes:
      - ~/.cache:/root/.cache
    entrypoint: ["./llama-server"]
    command: >
      --host 0.0.0.0  --port 8080
      --ctx-size 125000
      --fit off --gpu-layers all --gpu-layers-draft all
      -hf unsloth/Qwen3.8-27B-GGUF:UD-Q5_K_XL
      --spec-type draft-mtp
      --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --repeat-penalty 1.0

Цена

Интересно, что у самой Qwen это модель пока недоступна по API:
https://modelstudio.console.alibabacloud.com/ap-southeast-1

OpenRouter предлагает эту модель по довольно немаленькой цене: $0.45 / $3.20 per 1M:
https://openrouter.ai/qwen/qwen3.8-27b

Вот на этой одно-киловатной грелке работает у меня Qwen 3.8 27B на RTX 5090. Комната нагревается прям очень заметно.
Вот на этой одно-киловатной грелке работает у меня Qwen 3.8 27B на RTX 5090. Комната нагревается прям очень заметно.

Комментарии (101)


  1. ToxaBes
    14.08.2026 22:15

    • по некоторым бенчмаркам - лучше чем Opus 4.6

    В задачах программирования для миддл+ не дотягивает до Опуса. Проверял на Qwen 3.8 27B Q8. Пока ощущение, что это улучшенная на ~10% Qwen 3.6 35B А3B Q8. Т.е. прогресс конечно есть, но не wow. Посмотрю детальнее на выходных.

    В общих задачах прогресс оценить еще сложнее тк в предыдущих версиях все с этим было хорошо и так.


    1. jetnet
      14.08.2026 22:15

      У меня первое впечатление как раз “вау”. Такого красивого тетриса мне еще ни одна модель локальная не генерила:

      скриншот
      Двойной тетрис
      Двойной тетрис


      1. ToxaBes
        14.08.2026 22:15

        Помимо синтетики большинство моделей сейчас активно прокачивают по тетрисам, квейку и что там еще на ютубе первым делом проверяют. Я писал о немного других задачах, например, собрать один датасет из нескольких, правильно переиндексировав метки, затем использовать этот датасет для обучения определенной архитектуры.


      1. SlavikF Автор
        14.08.2026 22:15

        Я с первого же запроса получил зачётную трёхмерную змейку:

        https://s3.fursov.family/shares/snake3d.html

        Раньше с этим справлялся только Opus.


        1. glorden
          14.08.2026 22:15

          поиграл с удовольствием 78 длину собрал) спасибо


          1. kox
            14.08.2026 22:15

            Побил ваш результат- 84.))))


            1. baimkin
              14.08.2026 22:15

              а я ваш побил) 87
              забавная штуковина получилась


              1. Lev3250
                14.08.2026 22:15

                Реально интересная вариация змейки! Где-то после 95, когда змейка уже длиннее окружности сферы, приходится подключать 3д мышление. Во времена SnakeII на Nokia, очень мне заходила их 3d гексагональная реализация!

                Скрытый текст


                1. xidden
                  14.08.2026 22:15

                  103, забавная получилась змейка

                  103
                  103


            1. sleepingfox
              14.08.2026 22:15

              114


              1. ZimBazo
                14.08.2026 22:15

                Там реально сложно становится после 80
                Там реально сложно становится после 80


        1. Guronn
          14.08.2026 22:15

          Покажите пожалуйста промт!


          1. SlavikF Автор
            14.08.2026 22:15

            write snake game on the sphere. The head of the snake it fixed in the center and the sphere is rotating. use HTML, CSS and JavaScript. The visible part of sphere shall be fully visible in the webView, not partially. The starting length of the snake shall be 3 and increasing every time the snake hit the food. Use keyboard control: LEFT and RIGHT arrows.


            1. Nemoumbra
              14.08.2026 22:15

              Какой же я наивный... Мне и в голову не пришло, что это не нативное приложение.


        1. Altair_Bergadler
          14.08.2026 22:15

          Жду 3д шахматы в вашем с квен исполнении)


          1. edyapd
            14.08.2026 22:15

            Как выглядят 3D шахматы не знаю, а вот 3D крестики-нолики (3х3х3) думаю можно попробовать реализовать.


        1. Dmitry_Barovik
          14.08.2026 22:15

          Долго мучались, или есть прям single-shot промпт, вставили и получили код для змейки. Поделите, если прям с промпта, а не много итераций, хочу проверить сам. ООО, спасибо, увидел выше промпт


      1. netricks
        14.08.2026 22:15

        Да они все примерно одно и то же рисуют.


      1. alex09102026
        14.08.2026 22:15

        мое впечатление тоже "вау" но жду модель МОЕ ибо 6 токенов в сек :-(


        1. remzalp
          14.08.2026 22:15

          Strix Halo(Ryzen AI Max 395), 7 токенов в секунду, но скорость смотрел на коротких контекстах. Утрамбованная до UD_Q8_K_XL - 15 т/с, что уже довольно терпимо


          1. Uint32
            14.08.2026 22:15

            Запускалась через vulkan или rocm?


          1. ToxaBes
            14.08.2026 22:15

            Странно, я почему-то был уверен что стриксы на инференс будут пошустрее.

            Чисто для справки, Q8 на RTX A6000 со спекулятивным декодигом (MTP) выходит примерно 50 т/с.


            1. nidalee
              14.08.2026 22:15

              У стриксов узкое место - ПСП памяти.


      1. Vest
        14.08.2026 22:15

        Вот хрен с ним, с тетрисом, вы пробовали натравливать её на какой-нибудь большой проект и попробовать порефакторить его или же объяснить как работают его блоки?

        Я пользуюсь опусом и в незнакомой мне части он выручает меня, когда некого спросить, а читать много.


    1. Vakavakas
      14.08.2026 22:15

      Точно не на ~10%, проект на котором буксовал 3.6 35В А3В, 3.8 27В сделал даже не запнувшись, причем 3.8 27В все разложил по полочкам и практически полностью переписал проект, сам написал тесты о которых я даже не просил, протестировал и собрал готовый бинарник. Второй сложный проект 3.6 35В А3В не мог в принципе осилить он его ломал и закончить не смог, 3.8 27В его собрал за ночь и утром проснувшись увидел готовое приложение.

      Так что тут явно не ~10% гораздо больше.


      1. ToxaBes
        14.08.2026 22:15

        Точно не на ~10%

        Линейкой или рулеткой измеряли? Я описал прирост на своих задачах, вы на своих. Очевидно, что прирост у нас может быть разным.


      1. arantar
        14.08.2026 22:15

        На чем запускали модель (железо) и где (harness)?


  1. Mintavrus
    14.08.2026 22:15

    У меня с первого раза вышел зачетный пеликан на велике :))) Модель unsloth/Qwen3.8-27B-UD-Q8_K_XL.gguf , промпт: "Generate clean SVG code for a whimsical illustration of a friendly pelican riding a vintage bicycle, transparent background, minimalist vector style "


    1. Mintavrus
      14.08.2026 22:15

      Для сравнения unsloth/Qwen3.6-27B-UD-Q8_K_XL.gguf 


    1. Leo_sk
      14.08.2026 22:15

      Это вероятно давно устаревший тест. Теперь нужно придумать что-нибудь другое. Крокодил на самокате там или ещё что. Хотя так тоже близковато


      1. Mintavrus
        14.08.2026 22:15

        Устаревший, неустаревший, однако большинство моделей с ним не справляются. Для чистоты эксперемента, вот код который сгенерила модель для рендеринга указанной выше картинки (можно вставить в txt файл, поменять разрешение на svg и открыть любым просмоторщиком)

        <svg xmlns="http://www.w3.org/2000/svg" xmlns:xlink="http://www.w3.org/1999/xlink"
             width="700" height="580" viewBox="0 0 700 580" role="img" aria-labelledby="title desc">
          <title id="title">Friendly pelican riding a vintage bicycle</title>
          <desc id="desc">Minimalist flat vector illustration of a white pelican with a big orange beak and a red scarf, pedaling a red vintage bicycle with fenders and a headlamp. Transparent background.</desc>
        
          <defs>
            <g id="wheel">
              <circle r="88" fill="none" stroke="#264653" stroke-width="12"/>
              <circle r="74" fill="none" stroke="#264653" stroke-width="3.5"/>
              <g stroke="#264653" stroke-width="3.5" opacity="0.85">
                <line x1="0" y1="-74" x2="0" y2="74"/>
                <line x1="-74" y1="0" x2="74" y2="0"/>
                <line x1="-52" y1="-52" x2="52" y2="52"/>
                <line x1="-52" y1="52" x2="52" y2="-52"/>
              </g>
              <circle r="9" fill="#264653"/>
            </g>
          </defs>
        
          <!-- Ground shadow -->
          <ellipse cx="400" cy="532" rx="235" ry="16" fill="#1E293B" opacity="0.10"/>
        
          <!-- Motion lines -->
          <g stroke="#264653" stroke-width="6" stroke-linecap="round" opacity="0.28">
            <line x1="96" y1="372" x2="146" y2="372"/>
            <line x1="78" y1="410" x2="142" y2="410"/>
            <line x1="96" y1="448" x2="146" y2="448"/>
          </g>
        
          <!-- Far-side leg and pedal -->
          <g>
            <path d="M360 292 C356 322 357 362 359 388" fill="none" stroke="#E08E2B" stroke-width="8" stroke-linecap="round"/>
            <rect x="347" y="385" width="30" height="10" rx="5" fill="#E08E2B" stroke="#264653" stroke-width="3"/>
            <line x1="390" y1="430" x2="361" y2="400" stroke="#1B2A38" stroke-width="7" stroke-linecap="round"/>
            <rect x="346" y="395" width="28" height="9" rx="4" fill="#1B2A38"/>
          </g>
        
          <!-- Wheels -->
          <use href="#wheel" xlink:href="#wheel" transform="translate(250 430)"/>
          <use href="#wheel" xlink:href="#wheel" transform="translate(550 430)"/>
        
          <!-- Chain -->
          <g stroke="#264653" stroke-width="3" opacity="0.75">
            <line x1="390" y1="411" x2="252" y2="421"/>
            <line x1="390" y1="449" x2="252" y2="439"/>
          </g>
        
          <!-- Frame -->
          <g fill="none" stroke="#E63946" stroke-linecap="round">
            <line x1="390" y1="430" x2="250" y2="430" stroke-width="7"/>
            <line x1="342" y1="304" x2="250" y2="430" stroke-width="7"/>
            <line x1="390" y1="430" x2="342" y2="304" stroke-width="9"/>
            <line x1="390" y1="430" x2="506" y2="308" stroke-width="9"/>
            <line x1="344" y1="302" x2="502" y2="306" stroke-width="9"/>
            <line x1="504" y1="300" x2="515" y2="333" stroke-width="13"/>
            <path d="M515 333 C528 362 542 395 550 430" stroke-width="8"/>
            <line x1="504" y1="300" x2="496" y2="262" stroke-width="8"/>
            <path d="M496 262 C494 246 486 236 470 232" stroke-width="8"/>
            <line x1="342" y1="304" x2="334" y2="282" stroke-width="7"/>
          </g>
          <circle cx="468" cy="231" r="5.5" fill="#264653"/>
          <circle cx="487" cy="239" r="5.5" fill="#FFD166" stroke="#264653" stroke-width="3"/>
        
          <!-- Fenders -->
          <g fill="none" stroke="#264653" stroke-width="8" stroke-linecap="round">
            <path d="M158 377 A106 106 0 0 1 342 377"/>
            <path d="M475 355 A106 106 0 0 1 625 355"/>
          </g>
          <circle cx="524" cy="357" r="8" fill="#FFD166" stroke="#264653" stroke-width="4"/>
        
          <!-- Saddle -->
          <path d="M258 272 Q304 254 350 263 Q361 267 353 276 Q304 285 274 281 Q261 278 258 272 Z" fill="#5A3825" stroke="#264653" stroke-width="3"/>
        
          <!-- Chainring and near pedal -->
          <circle cx="390" cy="430" r="20" fill="#C1272D" stroke="#264653" stroke-width="3.5"/>
          <circle cx="390" cy="430" r="4.5" fill="#264653"/>
          <line x1="390" y1="430" x2="420" y2="458" stroke="#264653" stroke-width="7" stroke-linecap="round"/>
          <rect x="402" y="454" width="36" height="10" rx="5" fill="#40566B"/>
        
          <!-- Near leg -->
          <path d="M372 270 C382 332 402 402 416 452" fill="none" stroke="#F5A623" stroke-width="9" stroke-linecap="round"/>
          <rect x="400" y="443" width="46" height="13" rx="6.5" fill="#F5A623" stroke="#264653" stroke-width="3"/>
          <line x1="434" y1="448" x2="443" y2="453" stroke="#264653" stroke-width="2.5" stroke-linecap="round"/>
        
          <!-- Pelican -->
          <path d="M268 196 C240 188 220 194 208 208 C220 206 232 210 240 218 C226 220 216 230 212 242 C224 236 236 238 244 246 C252 230 260 212 268 196 Z" fill="#FDFDFD" stroke="#264653" stroke-width="4" stroke-linejoin="round"/>
          <path d="M352 118 C415 118 448 165 448 215 C448 272 405 292 352 292 C300 292 258 268 258 215 C258 160 290 118 352 118 Z" fill="#FDFDFD" stroke="#264653" stroke-width="4.5" stroke-linejoin="round"/>
          <path d="M330 168 C285 175 262 215 272 248 C280 272 310 280 335 268 C355 258 362 232 355 210 C349 190 344 172 330 168 Z" fill="#E3EBF3" stroke="#264653" stroke-width="4" stroke-linejoin="round"/>
          <path d="M300 240 C310 246 322 248 332 244 M302 224 C312 230 324 232 334 228" fill="none" stroke="#264653" stroke-width="3" stroke-linecap="round" opacity="0.45"/>
          <circle cx="420" cy="95" r="46" fill="#FDFDFD" stroke="#264653" stroke-width="4.5"/>
          <path d="M402 52 C398 38 404 28 414 25 M418 50 C418 34 428 26 438 25 M434 53 C438 40 447 34 456 33" fill="none" stroke="#264653" stroke-width="4" stroke-linecap="round"/>
          <path d="M450 114 L583 108 C589 110 588 116 581 121 C545 169 480 171 452 132 C448 124 448 118 450 114 Z" fill="#F79A3E" stroke="#264653" stroke-width="4" stroke-linejoin="round"/>
          <path d="M450 84 L583 99 C591 101 591 107 583 109 L452 116 C446 102 446 96 450 84 Z" fill="#FFB84C" stroke="#264653" stroke-width="4" stroke-linejoin="round"/>
          <line x1="468" y1="96" x2="478" y2="99" stroke="#264653" stroke-width="3" stroke-linecap="round"/>
          <circle cx="428" cy="74" r="9.5" fill="#264653"/>
          <circle cx="431.5" cy="70.5" r="3.2" fill="#FFFFFF"/>
          <ellipse cx="437" cy="111" rx="8.5" ry="5" fill="#FFB4A2" opacity="0.85"/>
        
          <!-- Scarf -->
          <path d="M378 128 Q412 148 448 136 L443 156 Q410 168 384 148 Z" fill="#E76F51" stroke="#264653" stroke-width="3.5" stroke-linejoin="round"/>
          <path d="M384 148 C350 156 330 146 306 154 C290 159 279 168 272 180 L288 184 L276 196 C292 194 306 186 318 178 C336 166 358 164 378 168 Z" fill="#E76F51" stroke="#264653" stroke-width="3.5" stroke-linejoin="round"/>
        </svg>


        1. Leo_sk
          14.08.2026 22:15

          Я в том плане что как только какой-то специфический тест достаточно широко распространяется то высока вероятность что в тренировочном корпусе появляется датасет специально под этот тип задач. Или даже вовсе под одну конкретную свгшку. И тот факт что какая-то сетка хорошо с ним справляется с какого-то момента особо ничего не говорит.


          1. Rive
            14.08.2026 22:15

            Недавно была статья с проверкой, занимаются ли разработчики пеликанмаксингом (спойлер: не занимались по крайней мере месяц назад)


            1. Moog_Prodigy
              14.08.2026 22:15

              Вот и у меня руки дошли. Нафиг пеликана.

              "Нарисуй средствами SVG красивую стюардессу модницу 1950годов "

              изображение png но код тоже есть разумеется
              изображение png но код тоже есть разумеется

              Честно говоря я в афиге.

              Но думало оно где-то минут 40


              1. jetnet
                14.08.2026 22:15

                А я попросил модельку, как профессионального UI дизайнера и художника, нарисовать качественного Чебурашку (мой любимый ЧебурБЕНЧ).

                Результат через полчаса


                1. Moog_Prodigy
                  14.08.2026 22:15

                  Достойно.

                  Предлагаю теперь новый бенч. Пущай напишет простое музыкальное произведение в midi нотации...


                  1. jetnet
                    14.08.2026 22:15

                    Он нас опередил: сам музон встроил в Тетрис, только я пока не понял откуда звуки берутся :)


    1. a3d
      14.08.2026 22:15

      Неплохой промпт для теста.
      1. Шедевр от Суверенного АИ, Алисы ;)
      2. Qwen 3.6 27b
      3. Gemini 3.6 flash

      Всегда считал что Жемини хорошо рисует интерфейсы, модифицирует фотки, ну короче с дизайном там неплохо, жаль много остального у неё - печаль.


      1. GuessWho
        14.08.2026 22:15

        У Алисы какая-то инвалидная коляска получилась


        1. a3d
          14.08.2026 22:15

          Это прямо олицетворение возможностей Алисы, даже по сравнения с локальным 3.6 27b q3 это днище, дно... годы отставания. И так во всём, я ради поржать попробовал там покодить ;)


      1. balamutang
        14.08.2026 22:15

        а алиса какая, локальная есть?

        так то онлайн гигачат мне такое нарисовал

        Скрытый текст


        1. GuessWho
          14.08.2026 22:15

          он вам не svg нарисовал, кажется, svg - это текстовый формат


          1. balamutang
            14.08.2026 22:15

            мде, я поверил первой картинке и не стал проверять. приложенный код рисует это.

            локальная gemma 4 12B и то нарисовала получше


      1. Moog_Prodigy
        14.08.2026 22:15

        Первая картинка топ, такой фотореалистичности достичь даже нано-бананам нереально. Ну серьезно, как живой! А работа с освещением! И нет лишних пальцев (обычные ошибки нейросетей). Идеально. Я думал живой художник рисовал. Велосипед тоже наш, суверенный, не то что древние модели на других рисунках - скучно выглядят да и устарел концепт на сто лет. Алиса топчик прям, даже не ожидал от нее такого!


        1. psemilanceata
          14.08.2026 22:15

          Нана банана рисует в свг, я что-то пропустил?


    1. Antra
      14.08.2026 22:15

      Может модель перекачать...

      У вас сколько токенов потратила и сколько по времени заняло? 14 тыс токенов и конца не видно... Внутри Bionic LM Studio, вообще без дополнительного софта.


      1. Kromster80
        14.08.2026 22:15

        Попробуйте Reasoning Effort поставить на Low (вместо дефолтного Extra High). Модель действительно ужасно много думает без особого толку (или валится).


        1. Antra
          14.08.2026 22:15

          В MLX не было таких параметров.

          Перекачал unsloth - там и efforts, и MTP. Небо и земля. Так можно пользоваться.


  1. maxnoosphere
    14.08.2026 22:15

    а что конкретно лучше? ну типо математика или код пишет?


    1. SlavikF Автор
      14.08.2026 22:15

      Больше всего заметны улучшение в написании кода. И в работе с агентами - использовании tools.


  1. kox
    14.08.2026 22:15

    Я кодом и картинками модель не проверял, но первое, что бросилось в глаза- объём рассуждений. По сравнению с qwen3.6-27b рефлексирует раза в 3-4 больше и ход мыслей мне нравится.


    1. Antra
      14.08.2026 22:15

      Как по мне, даже на простую задачу капец, как долго рассуждает. А на сложной я даже думал, что зациклилась, пришлось просить Agy разобраться, в чем дело

      И из-за этих рассуждений итогового ответа ждать очень долго.

      Мне в этом плане больше nemotron-cascade-2-30b-a3b зашел с его адаптивным CoT. На простой задаче буквально через 150-200 токенов размышлений ответ выдает. При этом на сложной - больше думает.

      В общем, пока не заметил, какую из своих моделей я бы на qwen-3.8 заменил. Та же gemma-4-31b очень подробные объяснения выдает. Разве что не в скрытом CoT, а в финальном ответе.
      Не сравнивали их на своих задачах?


      1. Mintavrus
        14.08.2026 22:15

        Не пробовали изменить глубину размышлений? Доступны 4 настройки (xhigh, medium, low, nonе)


        1. Antra
          14.08.2026 22:15

          Не пробовал, все по дефолту.

          Впрочем, и не вижу где. Поставил Bionic и там то ли бедненько с настройками. Ну или я пока не разобрался.

          Вижу только Вкл/Выкл Reasoning Section Parsing. Впрочем, я даже TTL в настройках модели там не нашел, в отличие от привычной LM Studio.

          Может в промпте можно указать уровень размышлений...


        1. krabdb
          14.08.2026 22:15

          Уже стату на продовых серверах набрали (клиентская аналитика).

          xhigh, thinking 88,2 с

          medium, thinking 68,8 с

          low, thinking 68,1 с

          thinking выключен 21,5 с

          Выводы: medium и low быстрее xhigh примерно на 22–23%, но по структуре результата не хуже.

          MTP=4


  1. Anton1906
    14.08.2026 22:15

    Контекст можно относительно безвредно кватновать в q8 (по умолчанию он в fp16).


    1. jarkevithwlad
      14.08.2026 22:15

      а можно турбоквант использовать и получить меньше потребление памяти и качество выше чем в fp16


  1. g1t5
    14.08.2026 22:15

    Прямо в момент выхода пилил небольшой проект с Qwen3.6-27b. Скачал, запустил, не то чтобы прям ВАУ, но прирост интеллекта явно заметен.

    Дал очередную среднюю по сложности правку по проекту. Думала долго, по опыту с 3.6 уже начал ожидать что как обычно сделает кучу мелких ошибок при реализации но нет, с первого раза выдала хороший рабочий результат, попутно найдя и исправив баги которые перед этим сделала 3.6.

    При этом на простых задачах думает заметно меньше. В целом качество размышлений заметно выше. Разработчикам огромный респект.


    1. Ahelios
      14.08.2026 22:15

      А что за проект? Почему не используете облачные llm?


      1. Prohoziy2202
        14.08.2026 22:15

        Только сегодня читал про красное повышение цен на Дипсик с 16.08, думаю остальные за ним подтянутся. Цены на облачные ИИ растут, локальные модели "умнеют", так что я думаю в скором будущем большинство физлиц и мелких контор на локалки уйдут.


      1. g1t5
        14.08.2026 22:15

        По множеству разных причин.

        Есть железо которое позволяет запускать локально большой спектр конкурентоспособных локальных моделей (не сильно отстающих от облачных). При этом я не ограничен лимитами, ценами и не завишу от блокировок/перебоев с сетью и т.п.

        Локальные модели уже позволяют уверенно закрывать средние по сложности задачи, более 'умные' модели на мой взгляд для них просто избыточны.

        Скорость генерации которую я получаю на своём железе приемлема для того чтобы успевать отслеживать ход рассуждений моделей, что на мой взгляд позволяет лучше контролировать процесс разработки и даёт больше опыта в использовании ИИ. Более высокая скорость генерации также на мой взгляд избыточна.

        Также много экспериментирую с лёгкими моделями, смотрю насколько они пригодны для создания приложений работающих прямо на устройствах пользователей.

        Всё перечислять слишком долго, причин на самом деле много...


      1. g1t5
        14.08.2026 22:15

        Извиняюсь, отвечал на вторую часть вопроса и совсем забыл про первую.

        Проекты в основном для личного использования, автоматизация рутины, инструменты для мониторинга/управления, замена облачных сервисов локальными (перевод, инфраструктура), свои аналоги используемого софта (по сути своя кроссплатформенная оболочка на основе хромиума), эксперименты...


      1. leon_sergey
        14.08.2026 22:15

        Спасибо!


  1. leon_sergey
    14.08.2026 22:15

    Прилично прокачалась в инфографике и управлении общими тулами и дебаг-тулами. Я слегка удивился, когда она начала сама двигать курсор в браузере и кликать мышой по кнопкам О_О.

    Как уже отметили выше, на xhigh часто заходит в петли рассуждения на коротком контексте (70к не хватает, она думает до компактирования, а после - начинает заново размышлять и детализировать).

    из забавного: первый раз увидел текстовыделитель при размышлениях (возможно это какая-то фича нового опенкод):



    По детализации уделывает DS v4 flash.



    Тестил в Q4_K_M на 3090, сейчас буду спускаться до Q4_0 так как очевидно нужен контекст 100+


  1. anonymous
    14.08.2026 22:15


    1. jarkevithwlad
      14.08.2026 22:15

      используйте турбоквантование контекста, 256к без проблем в Q4_K_M на 3090


  1. Sdima1357
    14.08.2026 22:15

    Сначала не запустилась Qwen 3.8 27B (unsloth ud5) llama.cpp server с claude code.(error 500)
    Рецепт тут https://github.com/ggml-org/llama.cpp/issues/27107
    Сейчас эта модель у меня лидирует на rtx 5090. Потратила ~10 минут на работающий лисп интерпретатор на "С"
    Qwen3.6 справилась за полчаса


  1. aaoo
    14.08.2026 22:15

    Народ, а подскажите, пожалуйста, как расширять контекст до 1 млн? И сколько это памяти отъедает?


    1. jetnet
      14.08.2026 22:15

      recipe
      ---
      recipe_version: "1"
      name: Qwen3.8-27B-Unsloth-NVFP4-TP2-Service
      summary: Unsloth Qwen 3.8 27B Dynamic V3 NVFP4 with 512K YaRN context
      model: unsloth/Qwen3.8-27B-NVFP4
      container: vllm/vllm-openai:v0.27.1
      cluster_only: true
      solo_only: false
      
      defaults:
        port: 8040
        host: 0.0.0.0
        tensor_parallel: 2
        gpu_memory_utilization: 0.55
        max_model_len: 524288
        max_num_batched_tokens: 16384
        max_num_seqs: 5
      
      env:
        VLLM_ALLOW_LONG_MAX_MODEL_LEN: "1"
        VLLM_BLOCKSCALE_FP8_GEMM_FLASHINFER: "0"
      
      command: |
        model_root=/root/.cache/huggingface/safetensors/unsloth
        model_name=Qwen3.8-27B-NVFP4
        served_name=qwen3.8-27b-unsloth-nvfp4
        chat_template="$model_root/$model_name/chat_template.jinja"
        chat_kwargs='{{"enable_thinking":false}}'
        mm_limits='{{"image":1,"video":0}}'
        spec_config='{{"method":"mtp","num_speculative_tokens":2}}'
        hf_overrides='{{"text_config":{{"rope_parameters":{{"mrope_interleaved":true,'\
        '"mrope_section":[11,11,10],"rope_type":"yarn","rope_theta":10000000,'\
        '"partial_rotary_factor":0.25,"factor":2.0,'\
        '"original_max_position_embeddings":262144}}}}}}'
        kernel_config='{{"enable_flashinfer_autotune":false,'\
        '"enable_cutedsl_warmup":false,"enable_jit_warmup":false}}'
        vllm serve "$model_root/$model_name" \
          --served-model-name "$served_name" \
          --host {host} \
          --port {port} \
          --tensor-parallel-size {tensor_parallel} \
          --gpu-memory-utilization {gpu_memory_utilization} \
          --max-model-len {max_model_len} \
          --hf-overrides "$hf_overrides" \
          --max-num-batched-tokens {max_num_batched_tokens} \
          --max-num-seqs {max_num_seqs} \
          --kv-cache-dtype fp8 \
          --kv-cache-memory-bytes 20G \
          --max-parallel-loading-workers 1 \
          --mm-processor-cache-gb 0 \
          --skip-mm-profiling \
          --mm-encoder-tp-mode data \
          --kernel-config "$kernel_config" \
          --load-format safetensors \
          --attention-backend flashinfer \
          --enable-prefix-caching \
          --enable-chunked-prefill \
          --enable-auto-tool-choice \
          --tool-call-parser qwen3_xml \
          --reasoning-parser qwen3 \
          --chat-template "$chat_template" \
          --default-chat-template-kwargs "$chat_kwargs" \
          --trust-remote-code \
          --limit-mm-per-prompt "$mm_limits" \
          --speculative-config "$spec_config" \
          -O3 \
          --no-enable-log-requests
      

      Log:

      Using max model len 524288
      GPU KV cache size: 1,188,900 tokens
      Maximum concurrency for 524,288 tokens per request: 2.27x
      

      VRAM - 35,5Gb на каждой ноде (всего 2).


      1. aaoo
        14.08.2026 22:15

        Спасибо!


        1. jetnet
          14.08.2026 22:15

          не за что! Вот, только что тест закончился на 512к:

          90% контекста проверено:

           - 471 858 токенов
           - заполнение ровно 90.0%
           - exact retrieval: pass
           - prefill: 736.2 с
           - весь запрос: 741.8 с
           - эффективная скорость: 636 ток/с
          
          monitoring 500k prefill
          Заполнение и генерация
          Заполнение и генерация


  1. habranon
    14.08.2026 22:15

    Спасибо, скачал)


  1. Sgr887
    14.08.2026 22:15

    Да лучшая модель для локальной, очень долго думает, зато первая локальная модель которая на threejs сделала в 3d игрушку и сразу заработала, делала через codex агент 40 минут(симулятор гонок на квадракоптере). На RTX2080ti 22GB с небольшим разгоном Q4 квант 148тысяч контекст с MTP дает 25-55 токенов в секунду ( в зависимости от текущего использованияглубины контекста, сначала 55 токенов в секунду, потом снижается по мере использования всего контекста до 25 токенов в секунду).


    1. arantar
      14.08.2026 22:15

      Где брали эту видеокарту?


      1. leon_sergey
        14.08.2026 22:15

        На авито продают, 35к примерно. Отличный вариант как по мне.


      1. Sgr887
        14.08.2026 22:15

        На авито продают. Самое интересное, что две такие 44 GB VRAM и в tensor режиме дают 35-75 токенов в секунду на Q8 кванте 265тыс контекст q8 KV cache. Что больше чем на одной и меня сильно удивило и порадовало. За 70 тыс рублей пока самый недорогой вариант получить модель для кодинга уровня почти GPT 5.5


  1. GrakovNe
    14.08.2026 22:15

    Попробовал на реальной задаче на программирование

    Baked for 10h 12m 46s

    Q6K при скорости 9 токенов в секунду за ночь добил задачку до состояния "ревью человеком / Fable" и можно отдавать в тестирование

    В сравнении с Qwen 3.6 27B она прям получше: она добивает задачи до состояния "реально работает", а не врет о том что все готово при падающих тестах

    Зацикливается как и все квены: три часа реального времени пыталась решить проблему с CORS которые настраивала криво, прогоняла тест и возвращалась к патчингу

    Но из зацикливания вышла сама, довела задачу до конца и прибрала (вот уж неслыханно) за собой мусор из worktree

    Я гоняю на Strix Halo, поэтому с утра не выдержал и прикрутил к ней MTP-бошку - 9 токенов превратились хотя бы в 20 и стало терпимо


    1. riky
      14.08.2026 22:15

      А качество с МТР заметно падает?


      1. vpman
        14.08.2026 22:15

        По теории и тестам MTP не влияет качество инференса


      1. GrakovNe
        14.08.2026 22:15

        я не заметил + два тестовых прогона показали бит-в-бит одинаковый ответ

        Вообще нам гарантируют "zero quality degradation" для старых моделей (https://huggingface.co/RDson/Qwen3.6-27B-MTP-Q4_K_M-GGUF), так что я бы и для новых не ждал потерь


  1. fermentum
    14.08.2026 22:15

    У меня провайдер ростело стал сбрасывать соединение до CDN HF.

    Есть еще кто-то с проблемой скачивания моделей?


    1. Moog_Prodigy
      14.08.2026 22:15

      Иногда наблюдаются проблемы, причем на разных провайдерах, что-то с самим HF происходит, отваливается наглухо так, что никакие веселые три буквы не помогают. Потом опять работает.


    1. balamutang
      14.08.2026 22:15

      с ростелека мособл качаю, не всегда стабильно и не быстро, но потихоньку льется ~1-5 мб/с


  1. Cayenne007
    14.08.2026 22:15

    Strix halo llama + mtp + Vulkan . Q4 дает < 25 токенов в секунду, что сходится с тем, что пишут AMD, совсем мало, жду MOE. В Hermes Agent модель стала заметно умнее по сравнению с 3.6 q4 xl, по крайней мере с тестами на генерацию аудио и фото через удаленный comfy ui справилась сама без подсказок.


  1. nullc0de
    14.08.2026 22:15

    Очень крутая модель. Пожалуй это лучшая модель ниже 35B. По сравнению с версией 3.5-3.6 это огромный скачек вперед. Использовал Q5_K_XL квантование. Рассуждения вышли на другой уровень, задачи решает более комплексно и лучше.


    1. MoscowStyle
      14.08.2026 22:15

      Если вы используете 35b, стоит её менять на 3.8 27b?


      1. nullc0de
        14.08.2026 22:15

        Точно стоит, если вам не важна скорость генерации. Где-то видел тесты, что Qwen 27B набирала больше балов во всех тестах чем 35B A3B. Гугл говорит, что выбор модели зависит от того, что вам важнее скорость генерации или качество ответов.

        Сравнение Qwen 35B-A3B (MoE) и 27B (Dense) показывает выбор между высокой скоростью работы экспертной смеси и точностью плотной архитектуры. Модель 27B умнее в сложных логических задачах и кодинге, тогда как 35B-A3B быстрее генерирует токены и требует меньше активных ресурсов на один шаг инференса. [1, 2, 3]

        Архитектура и производительность

        • Qwen 35B-A3B: Использует архитектуру MoE (Mixture of Experts) с 36B общих параметров, но задействует всего около 3B активных параметров на токен. Обеспечивает высокую скорость генерации (до ~150 токенов/сек в облаке) и низкую задержку. [1]

        • Qwen 27B: Плотная (dense) модель с ~27.8B параметров. Работает медленнее (~77 токенов/сек), но демонстрирует более высокие результаты на бенчмарках интеллекта, логики и агентского кодинга. [1, 2, 3]

        Запуск локально (VRAM)

        • 35B-A3B: Из-за природы MoE требует объема памяти под полный набор весов, хотя активная часть мала. Для хорошей квантизации на ПК требуется мощная видеокарта (или связка с RAM), иначе на слабых GPU модель упирается в узкое горлышко пропускной способности памяти. [1]

        • 27B: Плотная модель отлично масштабируется под стандартные потребительские видеокарты с 16–24 ГБ VRAM при грамотном подборе квантования (например, GGUF/NVFP4), обеспечивая стабильное и предсказуемое качество без «промахов» экспертов


  1. alex09102026
    14.08.2026 22:15

    https://huggingface.co/cHunter789/Qwen3.8-27B-i1-IQ4_KS_KT-GGUF

    Проверка на RTX 5060 Ti 16Гб с запуском через ik_llama.cpp

    Оффлоад 65/65 слоёв в GPU (12.78 ГБ весов)
    VRAM всего 15.1 / 16 ГБ — влезает с запасом (KV-кэш сжат HyperAttention: 2.0 ГБ на 105k токенов вместо ~3.7 ГБ)
    Prefill 33.9 t/s
    Генерация 21.2 t/s
    Качество «У Алисы 3 яблока, у Боба 5…» → «8 яблок» ✓, рассуждения работают
    API/v1/chat/completions — HTTP 200, OpenAI-совместимый

    А это уже не 6-7 токенов в секунду!


    1. SlavikF Автор
      14.08.2026 22:15

      Prefill 33.9?

      Это какое-то нереальное значение. Проверьте на более длинном промпте.

      У меня prefill около 4000


      1. kox
        14.08.2026 22:15

        4000 на какой карте? На 5060ti? Уточните, а то слюна потекла. У меня такая же карта.))) Но сомневаюсь, что на 5060ti.


        1. alex09102026
          14.08.2026 22:15

          cHunter789 обещал 45 токенов в сек на 5070ti на 5060ti вдвое меньше CUDA ядер и вдвое меньше скорость, как бы логично все


      1. alex09102026
        14.08.2026 22:15

        Prefill (некэшированная часть) 456.7 t/s (~900 t/s полный на batch 512)
        Генерация 25.0 t/s стабильно
        Итоговый контекст 10 442 токена
        ngram-спекуляция 288 черновиков, 217 принято (75.3%)
        VRAM 15.9 / 16.3 ГБ

        -khad/-vhad пришлось отключить из параметров запуска, с ними карта не выходила на полную мощность и при длинном промте скорость кратно падала (при этом потребление карты колебалось на уровне 50 вт при загрузке GPU 99-100%)


  1. Yuri_BY
    14.08.2026 22:15

    Мой опыт тестовой задачи на 2-х RTX-3060/12GB

    CGroup: /system.slice/llama-server.service

    └─68683 /usr/bin/llama-server -m /srv/models/Qwen3.8-27B/Qwen3.8-27B-Q5_K_S.gguf -t 8 -c 32768 -b 1024 -ngl 99 --host 0.0.0.0 --port 8080 --parallel 1 --tensor-split 48,43 --temp 0.2 --top-p 0.8 --top-k 20 --min-p 0.00 --presence-penalty 0.0 --repeat-penalty 1.0 --frequency-penalty 0.0 -ctk q8_0 -ctv q8_0 --spec-type draft-mtp -fa on --jinja -ub 512 --reasoning auto


    авг 16 13:22:25 rtx run-llama.sh[68683]: 9.41.123.147 I slot print_timing: id 0 | task 2 | prompt eval time = 2340.66 ms / 949 tokens ( 2.47 ms per token, 405.44 tokens per second)

    авг 16 13:22:25 rtx run-llama.sh[68683]: 9.41.123.153 I slot print_timing: id 0 | task 2 | eval time = 531337.13 ms / 11272 tokens ( 47.14 ms per token, 21.21 tokens per second)

    авг 16 13:22:25 rtx run-llama.sh[68683]: 9.41.123.154 I slot print_timing: id 0 | task 2 | total time = 533677.79 ms / 12221 tokens

    авг 16 13:22:25 rtx run-llama.sh[68683]: 9.41.123.155 I slot print_timing: id 0 | task 2 | graphs reused = 3708

    авг 16 13:22:25 rtx run-llama.sh[68683]: 9.41.123.171 I slot print_timing: id 0 | task 2 | draft acceptance = 0.66827 ( 7522 accepted / 11256 generated), mean len = 3.00

    авг 16 13:22:25 rtx run-llama.sh[68683]: 9.41.123.250 I slot release: id 0 | task 2 | stop processing: n_tokens = 12223, truncated = 0



    1. rrrrex
      14.08.2026 22:15

      32к контекста для этой модели мало, она слишком много думает.


  1. Millog
    14.08.2026 22:15

    Две 5060ti 16gb крутит проект по квантованию в районе 3-5к строк кода с мат частью и обёрткой её в код работает гораздо лучше чем 3.6. Агент так же квиновский. Что заметил в отличии от 3.6 делает сама заметки по проекту. Расставляя акценты. Так же если ей дать невнятное тз которое противоречит изначальной идеии будет дефать артефакт(фокус) парадигму. Думать стала больше. Что несколько замедляет работу. Однако её автономность это компинсирует. Появилась уверенность что на тестовом запуске не будит сдесяток ошибок. В целом куда лучше держит структуру проэкта что облегчает разработку. В целом прогресс на лицо.


  1. gambito
    14.08.2026 22:15

    Добрый день. А на macbook с 64 gb ram такое можно запустить ?


    1. alex09102026
      14.08.2026 22:15

      конечно, кстати отпишись потом сколько токенов в сек генерит мак бук


  1. Yuri_BY
    14.08.2026 22:15

    похоже, на пеликана её тренировали специально,
    "мой" пеликан - один к одному с предыдущим. Но время генерации неприятно удивило.


    1. Mintavrus
      14.08.2026 22:15

      Ну можно пеликана заменить например на бобра :)) Тоже получается гораздо лучше чем у других нейросетей


  1. alex09102026
    14.08.2026 22:15

    тесты по кодингу и администрированию линукс сервера, всего 20 вопросов в тесте (оценивал grok):


  1. lieff
    14.08.2026 22:15

    А кто-то пытался сравнивать насколько становится хуже на 512к - 1м контексте?