Сегодня зашел на сайт ollama, а там представили новую LLM модель qwen3-coder-next. Но при попытке ее установить вышло предупреждение что моя текущая версия 0.15.4 не будет работать с ней, нужно установить 0.15.5 которая еще только в бета тестировании. А стандартная установка ставила только 0.15.4, сначала я плюнул на это.
Но немного разобравшись, оказалось что установить бета версию не так и сложно, стандартная установка для линукс выглядит так
curl -fsSL https://ollama.com/install.sh | sh
а установка бета варсии (сейчас она 0.15.5-rs2) выглядит так
curl -fsSL https://ollama.com/install.sh | OLLAMA_VERSION=0.15.5-rc2 sh
Представлено 2 версии qwen3-coder-next
С квантизацией q4_K_M, размер модели 52Гб.
С квантизацией q8_0, размер модели 85Гб.
В видеопамяти занимают немного больше. Недостаток в том что для их запуска нужно не менее 64Гб для Q4 и 90Гб для Q8 видеопамяти. Конечно можно их запустить и в оперативной памяти, но думаю будет очень медленно думать. Я запускал на сервере с 96Гб видеопамяти.
Для теста кодерных моделей я почему то всегда использую тест типа игры Тетрис или Питон. В этот раз я попросил - Напиши игру питон на html+javascript , если вы считаете такие тесты неверными, то вместо минусов пишите аргументы.
Первый тест я провел на модели qwen3-coder-next:q8_0 весом 85 гигабайт. Код эта модель написала за пару минут, причем в браузере он выглядель очень неплохо и даже красиво.

Код игры был написан буквально за минуту, может чуть больше, но сразу не заработал. Проблема была в том что змея не ела добычу, но после этого замечания нейросеть исправила ошибки и все заработало. Даже память последнего лучшего результата сделала.
Далее я скачал модель с квантизацией q4_K_M и с постановкой такой же задачи, а весит она уже поменьше всего 52Гб против 85Гб предыдущей. По времени, написание кода заняло примерно столько же времени, минуту или чуть больше. Вдеопамяти модель заняла примерно 65Гб.
Но в отличии от более высокой квантизации она написала рабочий код с первого раза. Но визуально немного проще, без подсчета и запоминания лучшего результата. Но факт в том что с первого раза.

Я испытал много разных локальных моделей, но никто так креативно даже со второго раза не написал код игры SNAKE.
А если сказать больше то ни GPTChat ни наш Российский ГигаЧат Сбера и даже GROK Илона Маска не приблизились к таким результатам. Есть конечно Gemini, Deepseek и прочие большие модели, но и они не решают эту задачу однозначно хотябы со второго раза.
Таким образом, я моделям qwen3-coder-next от себя ставлю твердую 4+, маленький минус за то что Q8_0 модель пришлось поправлять. Но тут могу быть не прав и я, а вдруг у меня просто не хватило видеопамяти! А вот большим облачным моделям ставлю пока минус, хотя может и тут в чем то не прав, а если так то буду рад читать аргументы в комментариях.
Если у вас есть желание протестировать локальные LLM модели и у вас довольно мощный ПК, даже игровые ПК бывают очень неплохими. Но нет возможности и времени изучать Linux и (или) как запустить несколько GPU для инференса модели LLM, вот вам быстрое рабочее руководство как запустить свой собственный LLM сервер. Для того что бы не рушить систему которая у вас уже установлена, возьмите недорогой SSD диск на 512Гб хотя бы, думаю у многих такие лежат от предыдущих ПК где нибудь в закромах. Установите его в ПК и используйте вот это мое руководство - https://habr.com/ru/articles/991560/
Я не претендую на суперГуру, но по этому руководству вы за несколько часов запустите свой домашний сервер для запуска LLM.
P.S. Если остались вопросы, отвечу на них в комментариях.
Комментарии (34)

achekalin
04.02.2026 19:12Интересно, что многие серверы вообще видеокарт с памятью не имеют. Потому что они как раз серверы общего назначения.

softel Автор
04.02.2026 19:12Общие серверы без видеокарт – это экономически и технически оправданный выбор для большинства бизнес‑нагрузок. Для LLM, особенно больших и требовательных к скорости, видеокарты с достаточным объёмом памяти становятся необходимыми, но их добавление обычно делается только там, где действительно нужна такая производительность.

ZanZy
04.02.2026 19:12есть ещё вот такая возможность запускать бямки при недостатке видеопамяти - часть слоёв в видеопамяти, остальные в оперативке. Понятно, что работать будет медленнее, но зато всем доступно. https://github.com/lyogavin/airllm

SlavikF
04.02.2026 19:12qwen3-coder-next - это новая модель, и её поддержку только недавно добавили в llama.cpp. И как часто бывает - сразу не всё гладко, не всё работает как надо... Сейчас исправляют.
А заодно ржут над разработчиками ollama, которые делают вид, что усердно пишут код, а как это часто оказывается - просто копируют из llama.cpp, в том числе и баги:
https://github.com/ggml-org/llama.cpp/pull/19324#issuecomment-3847213274
Мораль истории: лучше пользуйтесь llama.cpp, а не ollama - там быстрее правят баги, больше вариантов моделей, и можно тоньше настраивать параметры.
Кстати для этой модели - qwen3-coder-next - вчера исправили вызов tools:
https://github.com/ggml-org/llama.cpp/pull/19239
несколько часов назад вышло исправление алгоритма генерации токенов:
https://github.com/ggml-org/llama.cpp/pull/19324
Через пару часов Docker образ llama.cpp будет выложен с этими исправлениями, а вот пользователям ollama придётся ещё подождать...
Кстати, из-за последнего исправления unsloth пришлось перезаливать модель (кванты) заново. Так что если вы загрузили их модель вчера или раньше - то может быть вам надо её скачать заново.
У меня 72GB VRAM, с полным контекстом помещается квант Q5, и работает со скоростью 85 т/с:
https://huggingface.co/Qwen/Qwen3-Coder-Next-GGUF/discussions/1

red-barbarian
04.02.2026 19:12Какие промпты использовали?
Какие настройки/параметры?
Сколько раз повторяли?
Что ещё, кроме змейки, пробовали?
Это важно, так как на тот же промпт, ллм может ответить совсем разные вещи.
Думается, что скоро производители будут оптимизировать свои модели под тест "напиши змейку". )

ToniDoni
04.02.2026 19:12Разве локальное развёртывание что-то даёт в плане качества?

4ae4eK
04.02.2026 19:12Нет. Вообще никакого. Разве что для каких-то простых задач иногда большие модели любят излишне думать в ответе. Тут больше экономически, тонкости настройки и с точки зрения безопасности больше профита

Kzibra
04.02.2026 19:12Всё как обычно, тест на змейке, которые все ллм уже вдоль и поперёк знают. Видимо ничего умнее не придумали.

Setiboy
04.02.2026 19:12Qwen топовые модели для локального запуска. На постоянке для личного бота ассистента использую qwen3 8B. Влезает и 14b с квантованием, но тут как говорится умнее не всегда нужно. И вот в этих весах лучше чем qwen для общих задач и с хорошим русским моделей тупо нет, или я не встретил.

Remont_naushnikov_com
04.02.2026 19:12Какая с первого раза а какая не с первого написала змейку - не показатель, так как доля рандомайзера всегда присутствует в ии. Тестировать необходимо не один раз каждую а как минимум три раза
Змейку мне еще давно с первого раза написал относительно глупый и старый gpt3.5
Успешность создания кода напрямую зависит был ли похожий кейс в обучающем материале
Придумывать нового они еще умеют

Ivnika
Что-то немного страшно, число статей про ИИ переплюнуло число статей от HRов. Если авторы еще в сговор вступят...
softel Автор
Твоя мысль о «переплюнувшем» количестве статей действительно заставляет задуматься. Возможно, стоит предложить редакциям добавить рубрику «HR‑взгляд на ИИ»? Тогда читатели получат обе перспективы, а мы сможем увидеть, как технологии влияют на управление персоналом. Что думаешь?
Ivnika
Так уже были статьи от HR про ИИ... И на мой взгляд ничего путного пока не вышло..
softel Автор
А более обоснованно вы можете ответить?
Ivnika
Эмм.. Что именно более обосновано? Я вроде написал - "на мой взгляд", нужно еще что-то?
softel Автор
А вы что так переживаете? Не нужно нервничать, нервы не восстанавливаются.
Будьте позитивней.
Ivnika
Вы бот? Косите под бота? ))) Не отвечайте, интереса продолжать общение нет.
softel Автор
Да больно было надо с вами общаться, раз вы этого не умеете.
martin__marlen
Интересней было прочитать мнение ИИ про эйчаров.