Это история о том, как я собрал полностью локальную ИИ-среду разработки (и почему вам стоит сделать то же самое).
Переезд из Евросоюза в Москву казался большим приключением — ровно до того момента, как я открыл ноутбук и попытался работать. Я обычный пользователь экосистемы GCP. Ничего сверхъестественного: обычное API Gemini, Vertex AI Studio, Antigravity, иногда Claude и так далее. У меня было три корпоративных заказчика, ждущих кастомные ИИ-решения, куча личных проектов и слепая уверенность, что «всё само собой заработает».
Как вы уже догадались — не заработало.
С 15 апреля 2026 года Россия не просто заблокировала VPN — их научились вылавливать с пугающей эффективностью. Речь о 99% мгновенной смертности коммерческих VPN, как только ваше устройство подключается к сети. Продвинутые кастомные VPS-связки, судя по некоторым Telegram-каналам, работают — но только если вы настроили их до прилёта.
И тут началась паническая мысль: «И как же плохо всё может быть?»
Кладбище VPN
Я перепробовал всё. Каждого провайдера, о котором слышал, каждый протокол, каждый шёпот на Reddit в духе «гарантированно работает в России» — безрезультатно. Пара мобильных решений иногда выживали, но их быстро выкашивали. А ноутбук? Город-призрак с таймаутами подключения. Забудьте. Моим единственным напарником стала ΌΨΗ (arpa.chat) на расширенном тарифе — единственная западная модель, всё ещё доступная без VPN. Она помогала мне тестировать то, что шло дальше.
Qoder, GigaIDE и другие тупики
ΌΨΗ посоветовала забыть об Antigravity, если только я не подниму свой VPS. В отчаянии я переключился на альтернативные IDE. Qoder — IDE на базе Qwen — сначала выглядел многообещающе. Китайский же, санкции не должны касаться? Так-то оно так, но нет! Частью их сделки для продаж в ЕС и США является запрет на обслуживание в России. Жёсткий блок.
Потом я попробовал GigaIDE — сборку на базе GigaChat, российского аналога ChatGPT от Сбера, обученного на архитектуре DeepSeek. Мне очень хотелось её полюбить. Правда. Но интерфейс, производительность и качество ответов заставили меня активно скучать по Gemini 3.1 Pro, как по отрезанной руке. Всё казалось тормознутым, картонным и отставало на три шага от того, к чему я привык.
Дальше — VSCode с KODA, российским плагином. Он говорит. Отвечает. Исключительно на русском. Я мог вбить системные инструкции капсом — он всё равно отвечал: «Конечно, но я расскажу тебе по-русски». Не совсем то, что нужно для корпоративных клиентов.
Свой собственный мозг (на SSD)
Тогда я сделал то, на что способен любой загнанный в угол разработчик — достал тяжёлую артиллерию. У меня хватило ума взять с собой офлайн-модели на портативном SSD. Gemma 4, Qwen 2.5 Coder 3B, Qwen 3.5 9B, DeepSeek Coder 7B и ещё несколько — можно сказать, старые друзья. Я скачал Ollama, последовал инструкциям arpa.chat, открыл терминал — и запустил их локально.
Самым простым и, честно говоря, красивым путём оказалась связка VSCode + плагин Continue + Ollama. Я глубоко залез в config.yaml, назначив разные модели для автодополнения, чата и генерации кода. Разные промпты, разные температуры, разные контексты. Я настраивал, матерился, снова настраивал. Всё работало на CPU и RAM, потому что с VRAM у меня было смешно, а аренда у западных провайдеров — очевидно, не вариант.

И потом… после нескольких итераций оно заработало. Не «кое-как». После серьёзной доводки я добился приемлемой, стабильной производительности. Такой, что ты откидываешься в кресле и смеёшься, потому что ты собрал всю среду разработки из злости и горстки GGUF-файлов. Агенты теперь понимали репозитории, которые я им подсовывал, планировали, работали по шагам и фазам, оценивали себя, решали сложные многошаговые задачи, управляли git и запускали тесты. Вдобавок я поставил Skillware и использовал скилл переписывания промптов, чтобы сжимать токены, сохраняя тот же контекст и результат.
Вывод
Думаю, я не скоро вернусь к платным ИИ-подпискам. Не потому что не могу, а потому что весь этот бардак научил меня важной вещи: ограничения выталкивают тебя за рамки привычного. Когда теряешь доступ к лакированным корпоративным решениям «в один клик», учишься собирать свой собственный стек. Коллекционировать модели как покемонов, настраивать локальный инференс, затачивать модели под конкретные задачи и мириться с терминалом.
Это было бесяче, но ещё это было интересно, увлекательно и дико познавательно. Теперь у меня есть полностью офлайн-ИИ для разработки, который не смогут отнять ни санкционные органы, ни борьба с VPN, ни корпоративная политика.
Так что вот мой непрошеный совет: если вы подсели на коммерческие ИИ-модели и облачные IDE — возьмите выходные и представьте, что завтра они исчезнут. Настройте локальную модель. Научитесь дообучать маленькую модель для своего стека. Возьмите SSD с открытыми весами, если поедете в такие места, как Россия (и, возможно, настройте тот самый кастомный VPS до вылета).
P.S. К тому моменту, как я закончил с локальной настройкой, я понял, что Cursor работает отлично — но только с автопилотом Cursor (не Gemini, Claude и т.д.). Мало ли, окажетесь в похожей ситуации и захотите сэкономить немного нервов. :D
Комментарии (10)

mmMike
02.06.2026 21:28Gemma 4, Qwen 2.5 Coder 3B, Qwen 3.5 9B, DeepSeek Coder 7B Всё работало на CPU и RAM
И потом… после нескольких итераций оно заработало. Не «кое-как». После серьёзной доводки я добился приемлемой, стабильной производительности.
К тому моменту, как я закончил с локальной настройкой, я понял, что Cursor работает отлично
Ой врет… врет нагло. Если бы сам не знал на что способны или не способны локальные модели на GPU c VRAM 16Gb то может быть даже и поверил.

rosspeili Автор
02.06.2026 21:28Do you quant your models? And yes it can suck if your continue yaml file is default. You need to configure it so that it correctly handles your gear, has context limits, and hard constraints.

Politura
02.06.2026 21:28И какой-же лимит контекста вы используете с Qwen 2.5 Coder 3B и DeepSeek Coder 7B? :)
Упоминать эти модели в разрезе кодинга в середине 2026 года будет либо идиот, либо человек бесконечно далекий от локальных моделей которому LLM-ка текст сгенерировала, а он и не проверил.Какой-то зачаточно-терпимый результат можно получить от Qwen 3.5 9B, но используя только процессор и ОЗУ это все будет бесконечно медленно. Чат еще можно вытерпеть, но не кодинг. Это надо с простейшей задачкой его на ночь оставлять, проще за 15 минут самому руками накодить ту-же задачку.

rosspeili Автор
02.06.2026 21:28Ставишь Ollama с Qwen 3.5 Coder 9B в квантизации Q4_K_M (~6 ГБ ОЗУ, 8–15 токенов/сек на твоём i7) для чата и редактирования, плюс Qwen 2.5 Coder 1.5B для молниеносного автокомплита. В config.json Continue назначаешь маленькую модель в "tabAutocompleteModel", а 7B — в "models" с "contextLength": 8192, "temperature": 0.1, и самое важное — отключаешь "applyCodeBlock" и включаешь "toolUse": true, чтобы агент работал без визуальных тормозов. Добавляешь файл .continue-rules в корень репозитория с инструкциями для агента (стандарты кода, тесты). Лайфхак: закрой Chrome, подними приоритет Ollama в процессоре, а для автокомплита выставь debounceDelay: 150 и maxPromptTokens: 1024 — получишь вполне рабочую агентную разработку на Surface Laptop 3 без единого облака.
Translated. I can't write in Russian.

Politura
02.06.2026 21:28Я пробовал года полтора назад автокомплит с Qwen 2.5 Coder разные версии, вплоть до 7b, которая давала ощутимый лаг на мобильном видео 3080 с 16Гб памяти (да, были такие видюхи). Результат меня даже тогда не устроил по качеству, у тогдашнего Копилота был заметно лучше. Использовать его сейчас? Уж лучше без автокомплита вообще.
Qwen 3.5 Coder моделей нет, или чей-то файнтюн? Если честно, я не видел файнтюнов которые были-бы лучше чем оригинальный Qwen 3.5.
9B Q4_K_M может и дадут 8-15 токенов в сек генерацию, но для кодинга очень важен prompt processing, ибо в модель уходит дофига всего, на каждый запрос она может читать разные файлы, а на ноутбучном i7 он будет 100 токенов в секунду максимум.
Я пытался использовать для кодинга MoE Gemma 4-26b на макбуке M4 Pro, у нее prompt processing был в районе 600 токенов в секунду и даже на не слишком большой кодовой базе это было убийство. Сидишь ждешь минуты, пока только первый токен появится.
Имея 100 токенов в секунду, можно дать простую задачу и пойти покушать, потом кино посмотреть.

rosspeili Автор
02.06.2026 21:28I get you and ideally I'd like qwen 3.5 but it is too laggy with ollama for my laptop.
Also on my main machine I have an old 2070 Ti Super, it easily runs Llama 3.1 and Gemma with 50+ t/s.
What woukd you suggest would be a good alternative to my build in Russia? Ideally locally. Thanks.

Politura
02.06.2026 21:28Сейчас проверил, Qwen 2.5 Coder вышел в ноябре 2024. Неужели нет более современных моделей с fill in the middle?
x89377
Это Россия, детка.
AndreyDmitriev
Я б сказал, это реклама, самая обыкновенная реклама.
rosspeili Автор
Ad about what? Every model is free and open source.