Кратко: Я собрал локального ИИ‑ассистента на базе двух видеокарт по 12 ГБ. Система объединяет языковую модель с RAG, графовой памятью, MCP инструментами, голосовым вводом/выводом и доступом к локальной инфраструктуре. Ассистент обрабатывает документы, почту, календарь, Telegram, умный дом и рутинные рабочие процессы. Главный вывод: моделей на 9B–27B параметров уже вполне достаточно для задач такого класса. Локальная модель становится действительно полезной не тогда, когда догоняет облачные сервисы по «чистому интеллекту», а когда получает долговременную память, доступ к инструментам и возможность взаимодействовать с реальным окружением пользователя.
В сезон свободного времени появилась идея создать персонального AI‑ассистента, заточённого под мои личные задачи и стиль общения. Главное требование — использование исключительно локальных решений: все данные должны оставаться у меня, от корпоративных документов, до личной переписки. Второй не менее важный фактор — экономия. Облачные сервисы обходятся дорого и могут быть недоступными, поэтому система должна работать на собственном железе. Оба этих фактора довольно актуальны для большого числа пользователей.
Что нужно уметь персональному агенту‑ассистенту:
умение работать с документами разных форматов, междокументный анализ идей и взаимосвязей, их графическое представление;
умение взаимодействовать с внешним миром — инфраструктура Google (календарь, gmail, drive и так далее), Telegram (как бот, так и от моего имени), внешние базы данных и так далее;
агент должен учится и наращивать свои знания и навыки — чем больше ты с ним работаешь, тем лучше он тебя понимает и подстраивается под тебя;
помощник изначально конципируется под голосовое взаимодействие, он должен понимать мой родной язык и говорить на нём, в особенности быть транскрайбером с LLM обработкой и переводом;
ассистент должен быть автономным 24/7 и сам инициировать действия, если это требуется в дневном workflow — считывать данные умного дома, внешних сенсоров и так далее
Как видно из задач, фокус лежит на агентских способностях управлять встроенными инструментами. Локальный ассистент это не замена облачному чат‑боту. Поэтому мы не ожидаем запуска моделей >35B, более того, модели не будут работать на 100% нагрузки и большую часть времени будут находиться в режиме ожидания. Это позитивно сказывается на требованиях к ПК и потребляемой энергии, отсюда и возникла тема «домашнего» железа — адаптировать то, что уже и так есть в домашней/офисной инфраструктуре.
«Домашнее» железо
Граница, которая отделяет десктопное «железо» от рабочих станций — это количество PCI‑Express линий: 24–28 против 64–128. Разрыв в ценах между обеими сегментами составляет 3–5 раз. Это означает, что мы ограничены одной или двумя графическими платами при запуске локального агента. Причем во втором варианте теряется половина скорости по PCIe шине (режим x8/x8, 63 ГБ/с против 31.5 ГБ/с для PCIe 5.0) и половина скорости из‑за параллелизации вычислений (Pipeline Parallelism, когда модель разрезается на две части, итеративно выполняется сначала первая часть в одной GPU, потом передаются данные по PCIe шине и выполняется вторая часть во втором GPU).
Второе размышление касается текущей ценовой обстановки для RTX5090, когда разница между 5080 и 5090 составляет примерно 4 раза, а разница по производительности и VRAM менее двух раз. Поэтому, оставаясь в разумном ценнике, мы будем фокусироваться на 2x GPU решении в десктопном сегменте и варианте не топовых карт. Особенно интересны Ti/Super версии 5060, 5070 и 5080 с расширенной памятью до 48 ГБ VRAM. Windows запускает только один драйвер для двух GPU, для минимизации проблем стоит использовать две карты одного поколения.
Отдельно стоит отметить энергопотребление и охлаждение. Для варианта 2x 5080Ti мы ожидаем порядка 1 кВт при полной нагрузке, 2x 5070Ti — 800 Вт. Для сравнения — две 5090 потребляют уже полтора киловатта и требуют жидкостного охлаждения. Без вычислений вся система потребляет всего 50–70 Вт. Мы будем измерять реальное потребление энергии для ассистента с 2x GPU.
Установка
Для тестов имеется средняя система — два i7 Windows PC 64+32ГБ RAM, объеденные в PAIR кластер. Есть две RTX 4070 Super и Ti, суммарно 24 ГБ VRAM и 3080 с 10 ГБ. Тестировались два варианта: 1) обе 4070 в одном и 3080 во втором ПК, 2) обе 4070 находится в разных ПК, а 3080 не использовалась. PCIe 4.0 в x8 дает только ~15.75 ГБ/с, что медленнее RTX5000x — это тоже будем учитывать. По тестам, энергопотребление каждой платы находилось в районе 110–120 Вт, что не сказывалось на общем тепловом потоке в корпусе, обе платы не нагреваются выше 50°С-60°C. Однако при вертикальном расположении корпуса тепловой поток от нижней платы будет дополнительно нагревать верхнюю плату. Поэтому для них нужно предусмотреть интенсивный воздухообмен и располагать корпус горизонтально. Блока питания на 850 Вт оказалось достаточно.

Из инфраструктуры я тестировал anythingLLM, сrewAI и openClaw — это три разных философских подхода к агентам. Я сначала увлёкся openClaw, но этих тестов понял, что нужен только один агент, который меняет свои роли с глубиной действий в 3–4 шага. Поэтому я вернулся к anythingLLM, отчасти потому, что большая часть работы с документами и RAG уже там реализованы.
Память агента: векторная база (RAG) через LanceDB, хотелось бы иметь также и графы. Поэтому я добавил официальный MCP Memory server, и agent flow процедуру одновременной записи в векторную и графовую память. LLM сам выбирает сущности, наблюдения и связи между ними. Отдельная головная боль — google‑workspace‑mcp через OAuth 2.0 и локальные TTS модели — без помощи Gemini, ChatGPT и Сlaude я бы не справился. Фактически один облачный бот программировал другого локального бота.
Из моделей: микро‑агент с 0.4B-2B (типа FunctionGemma), младший агент — 8B-9B, средний — 12B-14B, старший — 26B-32B. Тестировались Qwen, Gemma, Ministral и так далее. Сравнительный анализ для 2x GPU сетапа показан в таблице ниже. Контекст для работы с документами — 30k-40k, в целом скорость генерации для 27В моделей комфортная (>25т/сек) и отличается для настроек Ollama (OL) и LM Studio (LM).
Сравнительный анализ производительности для 2x GPU 4070 Ti/Super сборки
Модель / Квантование |
VRAM (GB) |
Распределение (CPU/GPU) |
Контекст |
Скорость (токен/с) |
Распределение GPU1/GPU2 |
DeepSeek‑R1-Distill‑Qwen-32B‑Q4_K_S |
18.8 |
100% GPU |
4k |
23.4 (LM) |
50/50 |
Qwen3.8–27B |
17 GB |
100% GPU |
32k, 50k |
27.3 (OL), 58.4 (LM) |
50/50 |
Qwen3.8–27B |
|
100% GPU |
32k |
54.3 (LM) |
50/50 |
Qwen3.8–27B |
22 GB |
7% CPU / 93% GPU |
32k |
17.3 (OL) |
40/40 |
Gemma-4-26B‑Q4_K_M |
18 GB |
100% GPU |
8k |
93.26 (OL) |
50/50 |
Qwen3-14B Q4_K_M |
15 GB |
100% GPU |
32k |
48.8 (OL) |
50/50 |
Qwen3.5–9B_Q5_K_M |
8.2 GB |
100% GPU |
32k |
64.52 (OL) |
50/50 |
Граница оффлоада в память находится на уровне 19–20 ГБ, при этом nvidia‑smi показывает 22 ГБ свободной VRAM. Тест с Ollama (v. 0.34.0) и LM Studio (v.0.4.24) подтвердил, что из свободных 22 ГБ, только порядка 19.5 ГБ доступны для загрузки модели + контекст.
Из других моделей — whisper‑large‑v3 через Lemonade — отличное качество распознавания голоса, транскрайбер работает в реальном времени с около‑нулевой задержкой; TTS через Speaches c Piper (docker) для генерации приятного женского голоса со всеми интонациями. Модель для графики SD‑Turbo‑GGUF через Lemonade, anythingLMM использует внутренний генератор графики Recharts, заменил его на Mermaid MCP. Дополнительно установил Stability Matrix, подтянул Stable Diffusion Forge и пару моделей. Для меня красивый графический вывод является достаточно важным. Для улучшения транскрайбера для работы во внешних программах поставил typeWhisper, он использует тот же самый Lemonade с его моделями. Для обработки данных реального времени с внешних сенсоров и умного дома написан небольшой MCP сервер на питоне. Весь AI стек запускается одним BAT‑файлом, выполняется в фоновом режиме и не мешается при нормальной работе.
Использование
Одной из первых задач был речевой ввод для инструментов, связанных с инфраструктурой Google. Вставить встречу в календарь, показать план на неделю, подобрать материал для встречи и так далее. В общем‑то, то, что и так делается. Здесь очень удобно связать Google Workspace с быстрым управлением — все делается голосом в простой форме и по запросу даётся графический анализ. Система делает краткий брифинг по емайлам/сообщением/новостям. Все это экономит каждый раз по 10–15 минут только за счёт более быстрого взаимодействия.
Transcriber + LLM — это реальный хит: пользуюсь кругом и везде, начиная от написания email‑ов, коротких текстов, формулирования мыслей. Увеличивает скорость набора текста примерно раз в 10. Transcriber‑ов много, здесь фишка в том, что я могу проводить RAG индексацию, всё остается строго локально и ассистент дообучается на моем тексте. Речь не идёт о генерации текста через ИИ. Это мой собственный текст, которую модель преобразует в слова, причёсывает, избавляет от грамматических ошибок и переводит, причем очень хорошо.
Telegram дает возможность дистанционного управления локальным железом. Я получаю информацию через Telegram‑бот только о каких‑то неожиданных ситуациях, которые требуют внимания. Если же нужна дополнительная информация, я просто прошу агента дать подробный отчет по заданной теме. Их этого применения вышла тема локального менеджера умных устройств. Обычно управляющие агенты посылают API запросы к облачным сервисам, так, например, работает наша тепличная ферма (см. https://arxiv.org/pdf/2608.09949). Это потребляет достаточно много токенов. Локальный LLM помощника, например, со специализированной по растениям pllama-13b моделью, представляет бесплатную альтернативу облачным сервисам, с приемлемым качеством. Это особенно актуально, когда они оказываются недоступными.
Центральным применением помощника является работа с документами, на это приходится больше половины загрузки GPU. Анализ и визуализация ключевых идей и взаимосвязей, которые содержит совокупность документов. Обобщение и поиск закономерностей/нелогичностей. Помощник научился своего рода брейнстормингу, когда мы оба переключаемся в режим генерации идей — здесь RAG, графы и Mermaid дополняют друг друга. Это незаменимая помощь для тех, кто работает с информацией и радикально отличается от облачных чат‑ботов, которые быстро все забывают. Помощник хранит информацию столько, сколько тебе нужно.
Как ответвление этого приложения — автоматизация документооборота и предварительной бухгалтерии. Здесь опыта применения пока что не так много, но даже для тех документов, которые мы загрузили, система работает действительно хорошо. Мы получаем цифровой отпечаток документооборота, товарооборота, принятой отчетности, причем система сама собирает цифры, готовит таблицы, делает выводы и представляет их в удобоваримой форме. По предварительной оценке, мы экономим половину ставки одного человека, что уже существенно.
«Планировщик жизни» — ассистент помогает выделить главное и отбросить второстепенное в красивой графической форме. Этот момент нельзя недооценивать в общем каркасе тайм‑менеджмента. Однако здесь интересен другой элемент — это приложение постепенно преобразуется в project management tools, с задачами, этапами и фиксацией результатов.
Младшего агента, типа Qwen3.5–9B, полностью хватает на управление инструментами, включая переводчика — чем я был приятно удивлен. Он реагирует мгновенно, хорошо держится в цепочках действий, ему хватило одной 4070. Старшие агенты на 2x GPU дают хороший анализ, например, при построении дорожной карты из документа, 9B предложил типично линейную структуру, а в 27B появились нелинейности, большее количество критических точек, деталей и замечаний.
Отрицательные моменты и что еще нужно доделать
Частенько возникала ситуация, когда помощник докладывал, что задача выполнена, хотя он даже и не вызывал инструменты. Обычно я сам контролирую, вызывались ли инструменты, поскольку их список дается в системном чате. Вероятно, более оптимальным решением является использование дообученного микроагента для запуска инструментов, а младший агент только контролирует микроагента.
Всем агентам нужна процедурная память, они должны запоминать удачные последовательности действий. Определение workflow и skills для каких‑то постоянных последовательностей спасает ситуацию, каждый агент также ведет свой собственный журнал работы в формате .md; однако нужен более формальный и компактный механизм/инструмент.
Для ассистента присутствует проблема переполнения инструментов, что забивает контекстное окно и мешает выполнению задач. Встроенный селектор может выключить нужный инструментов в самое неподходящее время, поэтому он не используется. Пока эта проблема решается за счет оптимизации — у агента в распоряжении только уникальные инструменты, часть из которых объединена в навыках (skills).
Агенту не разрешено свободно гулять по интернету, для безопасности всегда используется прослойка из MCP сервера. Защита от промп инжекта стоит остро и, по всей видимости, эта проблема будет увеличиваться с течением времени. Для всех инструментов исключается возможность неконтролируемого апдейта.
Если подвести итог
Начальные затраты времени на установку — примерно одна неделя. Стоимость железа — 0, поскольку адаптировалось то, что и так было под рукой. Агент получился как конструктор, к которому можно прикрутить что‑то новое, причем очень быстро. Все данные строго локально. Стоимость сходных коммерческих сервисов — 20$-40$ в месяц.
Можно дискутировать насколько большие модели нужны для мелких повседневных задач. Мы получали сходные ответы и цепочки действий для всех 9B-27B, но в случае более крупной моделей они были более расширенными и подробными. Показатели скорости генерации отличаются между программами (зависят в т.ч. от speculative/MTP decoding), но в целом она комфортна для прямого взаимодействия. При повседневном использовании, еще не встретилась ситуацию, когда ассистент не смог выполнить бы свою задачу. В каком‑то смысле, мы получили очень нужный ИИ‑инструмент просто оптимизируя имеющуюся инфраструктуру.
Нужно сказать, что ассистент — это не замена чат‑боту или кодеру, хотя он и обладает преимуществом «не забывания информации». Это помощник, которому ты доверяешь, который подстраивается под тебя и снимает 25%-30% повседневной нагрузки. Эта система, которая имеет доступ к твоему локальному железу, типа умного дома, локальных сенсоров, 3D фермы, теплицы или сходным системам, и является их интеллектуальным менеджером. Она продолжает работать даже в том случае, когда облачный API недоступен.
Если в работе используется только один GPU, второй GPU большую часть времени простаивает без работы. Это минимизируется с 5060Ti, однако будет узким местом при запуске старших моделей. Мы не заметили увеличенного потребления энергии ассистентом по сравнению с обычным использованием ПК, особенности с игровыми режимами.
Поэтому вердикт — 1x GPU c 24 ГБ VRAM или 2x GPU c 16 ГБ достаточно для ассистента при <27B моделях. При текущих ценах, 2x GPU 16 ГБ получается примерно в два раза дешевле, чем 1x GPU 24 ГБ в топ карте, потеря скорости до 25–30 т/с приемлема.
Система на вырост — это 2x 5070–5080 Ti/Super с 48ГБ для 70B‑моделей, которые по отдельным задачам можно сравнивать с ранними версиями GPT-4. После этого варианта начинается еще один скачок цены в 4–5 раз. Это справедливо для текущей ситуации и в дальнейшем может измениться. Здесь мы уже приближаемся к ассистенту для небольшой фирмы. Если стоит задача дообучения моделей или нужен умный агент для локального анализа — это очень доступный вариант.
В заключении отмечу, что облачные чат‑боты значительно понижают порог вхождения в те технологии, в которые без них даже и не рискнул бы входить. Это отличается от обычного кодера, поскольку бот активно дебагит локальную систему, находит в ней причину проблемы, тестирует варианты и в конце концов получает рабочее решение. На моих глазах бот итеративно написал/переписал MCP сервер, перенастроил windows, установил дополнительные пакеты и все это произошло в течение 30 минут. Как мне кажется, именно этот момент и представляет новую технологическую революцию для широких масс, которую мы сейчас переживаем.
Комментарии (3)

InsiderCrush
18.09.2026 10:11А что у вас с безопасностью ассистента? Хотелось бы понять как этот пласт у вас обработан? вижу что вы выпускаете его из песочницы. Что по защите от OWASP топ 10 угроз ии агентам в целом и по промпт инъекциям в частности? Ваша бд защищена? Ваш парсер как работает? Как вы защищаете БД от отравления? Есть какие то гейты? Карантины для принесенного из интернета?

Ka463
18.09.2026 10:11Поэтому вердикт — 1x GPU c 24 ГБ VRAM или 2x GPU c 16 ГБ достаточно для ассистента при <27B моделях.
У вас еще жирно, я у себя умудряюсь на 1х12гб запускать на своем агенте, и норм, скорость в диапазоне 10-46т.с. среднее 25т.с зависит от модели =)
ToxaBes
Спасибо, четко и по делу.
Неистово плюсую.