Это история о том, как я собрал полностью локальную ИИ-среду разработки (и почему вам стоит сделать то же самое).

Переезд из Евросоюза в Москву казался большим приключением — ровно до того момента, как я открыл ноутбук и попытался работать. Я обычный пользователь экосистемы GCP. Ничего сверхъестественного: обычное API Gemini, Vertex AI Studio, Antigravity, иногда Claude и так далее. У меня было три корпоративных заказчика, ждущих кастомные ИИ-решения, куча личных проектов и слепая уверенность, что «всё само собой заработает».

Как вы уже догадались — не заработало.

С 15 апреля 2026 года Россия не просто заблокировала VPN — их научились вылавливать с пугающей эффективностью. Речь о 99% мгновенной смертности коммерческих VPN, как только ваше устройство подключается к сети. Продвинутые кастомные VPS-связки, судя по некоторым Telegram-каналам, работают — но только если вы настроили их до прилёта.

И тут началась паническая мысль: «И как же плохо всё может быть?»

Кладбище VPN

Я перепробовал всё. Каждого провайдера, о котором слышал, каждый протокол, каждый шёпот на Reddit в духе «гарантированно работает в России» — безрезультатно. Пара мобильных решений иногда выживали, но их быстро выкашивали. А ноутбук? Город-призрак с таймаутами подключения. Забудьте. Моим единственным напарником стала ΌΨΗ (arpa.chat) на расширенном тарифе — единственная западная модель, всё ещё доступная без VPN. Она помогала мне тестировать то, что шло дальше.

Qoder, GigaIDE и другие тупики

ΌΨΗ посоветовала забыть об Antigravity, если только я не подниму свой VPS. В отчаянии я переключился на альтернативные IDE. Qoder — IDE на базе Qwen — сначала выглядел многообещающе. Китайский же, санкции не должны касаться? Так-то оно так, но нет! Частью их сделки для продаж в ЕС и США является запрет на обслуживание в России. Жёсткий блок.

Потом я попробовал GigaIDE — сборку на базе GigaChat, российского аналога ChatGPT от Сбера, обученного на архитектуре DeepSeek. Мне очень хотелось её полюбить. Правда. Но интерфейс, производительность и качество ответов заставили меня активно скучать по Gemini 3.1 Pro, как по отрезанной руке. Всё казалось тормознутым, картонным и отставало на три шага от того, к чему я привык.

Дальше — VSCode с KODA, российским плагином. Он говорит. Отвечает. Исключительно на русском. Я мог вбить системные инструкции капсом — он всё равно отвечал: «Конечно, но я расскажу тебе по-русски». Не совсем то, что нужно для корпоративных клиентов.

Свой собственный мозг (на SSD)

Тогда я сделал то, на что способен любой загнанный в угол разработчик — достал тяжёлую артиллерию. У меня хватило ума взять с собой офлайн-модели на портативном SSD. Gemma 4, Qwen 2.5 Coder 3B, Qwen 3.5 9B, DeepSeek Coder 7B и ещё несколько — можно сказать, старые друзья. Я скачал Ollama, последовал инструкциям arpa.chat, открыл терминал — и запустил их локально.

Самым простым и, честно говоря, красивым путём оказалась связка VSCode + плагин Continue + Ollama. Я глубоко залез в config.yaml, назначив разные модели для автодополнения, чата и генерации кода. Разные промпты, разные температуры, разные контексты. Я настраивал, матерился, снова настраивал. Всё работало на CPU и RAM, потому что с VRAM у меня было смешно, а аренда у западных провайдеров — очевидно, не вариант.

Мой опыт с ИИ в России глазами европейца ?
Мой опыт с ИИ в России глазами европейца ?

И потом… после нескольких итераций оно заработало. Не «кое-как». После серьёзной доводки я добился приемлемой, стабильной производительности. Такой, что ты откидываешься в кресле и смеёшься, потому что ты собрал всю среду разработки из злости и горстки GGUF-файлов. Агенты теперь понимали репозитории, которые я им подсовывал, планировали, работали по шагам и фазам, оценивали себя, решали сложные многошаговые задачи, управляли git и запускали тесты. Вдобавок я поставил Skillware и использовал скилл переписывания промптов, чтобы сжимать токены, сохраняя тот же контекст и результат.

Вывод

Думаю, я не скоро вернусь к платным ИИ-подпискам. Не потому что не могу, а потому что весь этот бардак научил меня важной вещи: ограничения выталкивают тебя за рамки привычного. Когда теряешь доступ к лакированным корпоративным решениям «в один клик», учишься собирать свой собственный стек. Коллекционировать модели как покемонов, настраивать локальный инференс, затачивать модели под конкретные задачи и мириться с терминалом.

Это было бесяче, но ещё это было интересно, увлекательно и дико познавательно. Теперь у меня есть полностью офлайн-ИИ для разработки, который не смогут отнять ни санкционные органы, ни борьба с VPN, ни корпоративная политика.

Так что вот мой непрошеный совет: если вы подсели на коммерческие ИИ-модели и облачные IDE — возьмите выходные и представьте, что завтра они исчезнут. Настройте локальную модель. Научитесь дообучать маленькую модель для своего стека. Возьмите SSD с открытыми весами, если поедете в такие места, как Россия (и, возможно, настройте тот самый кастомный VPS до вылета).

P.S. К тому моменту, как я закончил с локальной настройкой, я понял, что Cursor работает отлично — но только с автопилотом Cursor (не Gemini, Claude и т.д.). Мало ли, окажетесь в похожей ситуации и захотите сэкономить немного нервов. :D

Комментарии (10)


  1. x89377
    02.06.2026 21:28

    Это Россия, детка.


    1. AndreyDmitriev
      02.06.2026 21:28

      Я б сказал, это реклама, самая обыкновенная реклама.


      1. rosspeili Автор
        02.06.2026 21:28

        Ad about what? Every model is free and open source.


  1. mmMike
    02.06.2026 21:28

    Gemma 4, Qwen 2.5 Coder 3B, Qwen 3.5 9B, DeepSeek Coder 7B Всё работало на CPU и RAM

    И потом… после нескольких итераций оно заработало. Не «кое-как». После серьёзной доводки я добился приемлемой, стабильной производительности.

    К тому моменту, как я закончил с локальной настройкой, я понял, что Cursor работает отлично

    Ой врет… врет нагло. Если бы сам не знал на что способны или не способны локальные модели на GPU c VRAM 16Gb то может быть даже и поверил.


    1. rosspeili Автор
      02.06.2026 21:28

      Do you quant your models? And yes it can suck if your continue yaml file is default. You need to configure it so that it correctly handles your gear, has context limits, and hard constraints.


      1. Politura
        02.06.2026 21:28

        И какой-же лимит контекста вы используете с Qwen 2.5 Coder 3B и DeepSeek Coder 7B? :)
        Упоминать эти модели в разрезе кодинга в середине 2026 года будет либо идиот, либо человек бесконечно далекий от локальных моделей которому LLM-ка текст сгенерировала, а он и не проверил.

        Какой-то зачаточно-терпимый результат можно получить от Qwen 3.5 9B, но используя только процессор и ОЗУ это все будет бесконечно медленно. Чат еще можно вытерпеть, но не кодинг. Это надо с простейшей задачкой его на ночь оставлять, проще за 15 минут самому руками накодить ту-же задачку.


        1. rosspeili Автор
          02.06.2026 21:28

          Ставишь Ollama с Qwen 3.5 Coder 9B в квантизации Q4_K_M (~6 ГБ ОЗУ, 8–15 токенов/сек на твоём i7) для чата и редактирования, плюс Qwen 2.5 Coder 1.5B для молниеносного автокомплита. В config.json Continue назначаешь маленькую модель в "tabAutocompleteModel", а 7B — в "models" с "contextLength": 8192, "temperature": 0.1, и самое важное — отключаешь "applyCodeBlock" и включаешь "toolUse": true, чтобы агент работал без визуальных тормозов. Добавляешь файл .continue-rules в корень репозитория с инструкциями для агента (стандарты кода, тесты). Лайфхак: закрой Chrome, подними приоритет Ollama в процессоре, а для автокомплита выставь debounceDelay: 150 и maxPromptTokens: 1024 — получишь вполне рабочую агентную разработку на Surface Laptop 3 без единого облака.

          Translated. I can't write in Russian.


          1. Politura
            02.06.2026 21:28

            Я пробовал года полтора назад автокомплит с Qwen 2.5 Coder разные версии, вплоть до 7b, которая давала ощутимый лаг на мобильном видео 3080 с 16Гб памяти (да, были такие видюхи). Результат меня даже тогда не устроил по качеству, у тогдашнего Копилота был заметно лучше. Использовать его сейчас? Уж лучше без автокомплита вообще.

            Qwen 3.5 Coder моделей нет, или чей-то файнтюн? Если честно, я не видел файнтюнов которые были-бы лучше чем оригинальный Qwen 3.5.

            9B Q4_K_M может и дадут 8-15 токенов в сек генерацию, но для кодинга очень важен prompt processing, ибо в модель уходит дофига всего, на каждый запрос она может читать разные файлы, а на ноутбучном i7 он будет 100 токенов в секунду максимум.

            Я пытался использовать для кодинга MoE Gemma 4-26b на макбуке M4 Pro, у нее prompt processing был в районе 600 токенов в секунду и даже на не слишком большой кодовой базе это было убийство. Сидишь ждешь минуты, пока только первый токен появится.

            Имея 100 токенов в секунду, можно дать простую задачу и пойти покушать, потом кино посмотреть.


            1. rosspeili Автор
              02.06.2026 21:28

              I get you and ideally I'd like qwen 3.5 but it is too laggy with ollama for my laptop.

              Also on my main machine I have an old 2070 Ti Super, it easily runs Llama 3.1 and Gemma with 50+ t/s.

              What woukd you suggest would be a good alternative to my build in Russia? Ideally locally. Thanks.


          1. Politura
            02.06.2026 21:28

            Сейчас проверил, Qwen 2.5 Coder вышел в ноябре 2024. Неужели нет более современных моделей с fill in the middle?