Сегодня зашел на сайт ollama, а там представили новую LLM модель qwen3-coder-next. Но при попытке ее установить вышло предупреждение что моя текущая версия 0.15.4 не будет работать с ней, нужно установить 0.15.5 которая еще только в бета тестировании. А стандартная установка ставила только 0.15.4, сначала я плюнул на это.

Но немного разобравшись, оказалось что установить бета версию не так и сложно, стандартная установка для линукс выглядит так

curl -fsSL https://ollama.com/install.sh | sh

а установка бета варсии (сейчас она 0.15.5-rs2) выглядит так

curl -fsSL https://ollama.com/install.sh | OLLAMA_VERSION=0.15.5-rc2 sh

Представлено 2 версии qwen3-coder-next

  1. С квантизацией q4_K_M, размер модели 52Гб.

  2. С квантизацией q8_0, размер модели 85Гб.

В видеопамяти занимают немного больше. Недостаток в том что для их запуска нужно не менее 64Гб для Q4 и 90Гб для Q8 видеопамяти. Конечно можно их запустить и в оперативной памяти, но думаю будет очень медленно думать. Я запускал на сервере с 96Гб видеопамяти.

Для теста кодерных моделей я почему то всегда использую тест типа игры Тетрис или Питон. В этот раз я попросил - Напиши игру питон на html+javascript , если вы считаете такие тесты неверными, то вместо минусов пишите аргументы.

Первый тест я провел на модели qwen3-coder-next:q8_0 весом 85 гигабайт. Код эта модель написала за пару минут, причем в браузере он выглядель очень неплохо и даже красиво.

Вот так в браузере была отрисована игра змейка моделью Q8, по мне так вообще и не плохо. Но простой скрин конечно не передает всю суть, по этому я представляю код этой игры на своем сервере - Питон 8Q
Вот так в браузере была отрисована игра змейка моделью Q8, по мне так вообще и не плохо. Но простой скрин конечно не передает всю суть, по этому я представляю код этой игры на своем сервере - Питон 8Q

Код игры был написан буквально за минуту, может чуть больше, но сразу не заработал. Проблема была в том что змея не ела добычу, но после этого замечания нейросеть исправила ошибки и все заработало. Даже память последнего лучшего результата сделала.

Далее я скачал модель с квантизацией q4_K_M и с постановкой такой же задачи, а весит она уже поменьше всего 52Гб против 85Гб предыдущей. По времени, написание кода заняло примерно столько же времени, минуту или чуть больше. Вдеопамяти модель заняла примерно 65Гб.

Но в отличии от более высокой квантизации она написала рабочий код с первого раза. Но визуально немного проще, без подсчета и запоминания лучшего результата. Но факт в том что с первого раза.

Интерфейс выглядит проще, но где то в своих мозгах она выкопала прикольный смайлик змейки. Вот эта игра на моем сервере - http://demonryb.ru/snakeq4.html
Интерфейс выглядит проще, но где то в своих мозгах она выкопала прикольный смайлик змейки. Вот эта игра на моем сервере - Питон 4Ql

Я испытал много разных локальных моделей, но никто так креативно даже со второго раза не написал код игры SNAKE.

А если сказать больше то ни GPTChat ни наш Российский ГигаЧат Сбера и даже GROK Илона Маска не приблизились к таким результатам. Есть конечно Gemini, Deepseek и прочие большие модели, но и они не решают эту задачу однозначно хотябы со второго раза.

Таким образом, я моделям qwen3-coder-next от себя ставлю твердую 4+, маленький минус за то что Q8_0 модель пришлось поправлять. Но тут могу быть не прав и я, а вдруг у меня просто не хватило видеопамяти! А вот большим облачным моделям ставлю пока минус, хотя может и тут в чем то не прав, а если так то буду рад читать аргументы в комментариях.

Если у вас есть желание протестировать локальные LLM модели и у вас довольно мощный ПК, даже игровые ПК бывают очень неплохими. Но нет возможности и времени изучать Linux и (или) как запустить несколько GPU для инференса модели LLM, вот вам быстрое рабочее руководство как запустить свой собственный LLM сервер. Для того что бы не рушить систему которая у вас уже установлена, возьмите недорогой SSD диск на 512Гб хотя бы, думаю у многих такие лежат от предыдущих ПК где нибудь в закромах. Установите его в ПК и используйте вот это мое руководство - https://habr.com/ru/articles/991560/

Я не претендую на суперГуру, но по этому руководству вы за несколько часов запустите свой домашний сервер для запуска LLM.

P.S. Если остались вопросы, отвечу на них в комментариях.

Комментарии (34)


  1. Ivnika
    04.02.2026 19:12

    Что-то немного страшно, число статей про ИИ переплюнуло число статей от HRов. Если авторы еще в сговор вступят...


    1. softel Автор
      04.02.2026 19:12

      Твоя мысль о «переплюнувшем» количестве статей действительно заставляет задуматься. Возможно, стоит предложить редакциям добавить рубрику «HR‑взгляд на ИИ»? Тогда читатели получат обе перспективы, а мы сможем увидеть, как технологии влияют на управление персоналом. Что думаешь?


      1. Ivnika
        04.02.2026 19:12

        Так уже были статьи от HR про ИИ... И на мой взгляд ничего путного пока не вышло..


        1. softel Автор
          04.02.2026 19:12

          А более обоснованно вы можете ответить?


          1. Ivnika
            04.02.2026 19:12

            Эмм.. Что именно более обосновано? Я вроде написал - "на мой взгляд", нужно еще что-то?


            1. softel Автор
              04.02.2026 19:12

              А вы что так переживаете? Не нужно нервничать, нервы не восстанавливаются.

              Будьте позитивней.


              1. Ivnika
                04.02.2026 19:12

                Вы бот? Косите под бота? ))) Не отвечайте, интереса продолжать общение нет.


                1. softel Автор
                  04.02.2026 19:12

                  Да больно было надо с вами общаться, раз вы этого не умеете.


        1. martin__marlen
          04.02.2026 19:12

          Интересней было прочитать мнение ИИ про эйчаров.


  1. achekalin
    04.02.2026 19:12

    Интересно, что многие серверы вообще видеокарт с памятью не имеют. Потому что они как раз серверы общего назначения.


    1. softel Автор
      04.02.2026 19:12

      Общие серверы без видеокарт – это экономически и технически оправданный выбор для большинства бизнес‑нагрузок. Для LLM, особенно больших и требовательных к скорости, видеокарты с достаточным объёмом памяти становятся необходимыми, но их добавление обычно делается только там, где действительно нужна такая производительность.


      1. achekalin
        04.02.2026 19:12

        Да, но вот я как-то без дела стоящих серверов с GPU не встречал.

        Наверное, еще и от того, что они дорогие, вот их и нагружают постоянно


        1. softel Автор
          04.02.2026 19:12

          Но у кого то есть в личном пользовании такие сервера и не загруженные, об этом вы не думали?


  1. Smartor
    04.02.2026 19:12

    в LM Studio


    1. softel Автор
      04.02.2026 19:12

      Ну уже результат, а какие характеристики вашего ПК? раз туда 49Гб влезло.


      1. Smartor
        04.02.2026 19:12

        64Гб оперативки


        1. softel Автор
          04.02.2026 19:12

          Это неплохо, но без GPU эта модель будет очень сильно тормозить


  1. ZanZy
    04.02.2026 19:12

    есть ещё вот такая возможность запускать бямки при недостатке видеопамяти - часть слоёв в видеопамяти, остальные в оперативке. Понятно, что работать будет медленнее, но зато всем доступно. https://github.com/lyogavin/airllm


    1. mazagama
      04.02.2026 19:12

      А просто использовать llama.cpp вам религия не позволяет?


      1. ZanZy
        04.02.2026 19:12

        не лучше ли вникнуть чем одно отличается от другого, чем острить унылые остроты?


    1. max-daniels
      04.02.2026 19:12

      Судя по давности обновлений, он давно заброшен.


  1. SlavikF
    04.02.2026 19:12

    qwen3-coder-next - это новая модель, и её поддержку только недавно добавили в llama.cpp. И как часто бывает - сразу не всё гладко, не всё работает как надо... Сейчас исправляют.

    А заодно ржут над разработчиками ollama, которые делают вид, что усердно пишут код, а как это часто оказывается - просто копируют из llama.cpp, в том числе и баги:

    https://github.com/ggml-org/llama.cpp/pull/19324#issuecomment-3847213274

    Мораль истории: лучше пользуйтесь llama.cpp, а не ollama - там быстрее правят баги, больше вариантов моделей, и можно тоньше настраивать параметры.

    Кстати для этой модели - qwen3-coder-next - вчера исправили вызов tools:

    https://github.com/ggml-org/llama.cpp/pull/19239

    несколько часов назад вышло исправление алгоритма генерации токенов:

    https://github.com/ggml-org/llama.cpp/pull/19324

    Через пару часов Docker образ llama.cpp будет выложен с этими исправлениями, а вот пользователям ollama придётся ещё подождать...

    Кстати, из-за последнего исправления unsloth пришлось перезаливать модель (кванты) заново. Так что если вы загрузили их модель вчера или раньше - то может быть вам надо её скачать заново.

    У меня 72GB VRAM, с полным контекстом помещается квант Q5, и работает со скоростью 85 т/с:

    https://huggingface.co/Qwen/Qwen3-Coder-Next-GGUF/discussions/1


  1. red-barbarian
    04.02.2026 19:12

    1. Какие промпты использовали?

    2. Какие настройки/параметры?

    3. Сколько раз повторяли?

    4. Что ещё, кроме змейки, пробовали?

    Это важно, так как на тот же промпт, ллм может ответить совсем разные вещи.

    Думается, что скоро производители будут оптимизировать свои модели под тест "напиши змейку". )


    1. softel Автор
      04.02.2026 19:12

    1. Borodaxel
      04.02.2026 19:12

      1. Что ещё, кроме змейки, пробовали?

      С языка сняли. Тоже хотел уточнить. Модель уже знает, что такое "змейка" или правила игры описаны в промпте?


      1. softel Автор
        04.02.2026 19:12

        Уже знает


  1. ToniDoni
    04.02.2026 19:12

    Разве локальное развёртывание что-то даёт в плане качества?


    1. 4ae4eK
      04.02.2026 19:12

      Нет. Вообще никакого. Разве что для каких-то простых задач иногда большие модели любят излишне думать в ответе. Тут больше экономически, тонкости настройки и с точки зрения безопасности больше профита


  1. Kzibra
    04.02.2026 19:12

    Всё как обычно, тест на змейке, которые все ллм уже вдоль и поперёк знают. Видимо ничего умнее не придумали.


  1. MaxEkb77
    04.02.2026 19:12

    Ура прогресс ЛЛМ написала заставку к игре :)


  1. aladkoi
    04.02.2026 19:12

    Осталось найти 100000$, чтобы купить "железо" для запуска этой модели.


    1. softel Автор
      04.02.2026 19:12

      15000 хвати


  1. Setiboy
    04.02.2026 19:12

    Qwen топовые модели для локального запуска. На постоянке для личного бота ассистента использую qwen3 8B. Влезает и 14b с квантованием, но тут как говорится умнее не всегда нужно. И вот в этих весах лучше чем qwen для общих задач и с хорошим русским моделей тупо нет, или я не встретил.


  1. Remont_naushnikov_com
    04.02.2026 19:12

    Какая с первого раза а какая не с первого написала змейку - не показатель, так как доля рандомайзера всегда присутствует в ии. Тестировать необходимо не один раз каждую а как минимум три раза

    Змейку мне еще давно с первого раза написал относительно глупый и старый gpt3.5

    Успешность создания кода напрямую зависит был ли похожий кейс в обучающем материале

    Придумывать нового они еще умеют