Локальный домашний инференс обычно ассоциируется с полноразмерным ПК с несколькими видеокартами (иногда объединенными SLI/NVLink) и мощным блоком питания. При этом основными ограничениями такого решения зачастую являются объем оперативной и видеопамяти, а также их пропускная способность.

На волне популярности LLM-моделей для локального инференса востребованными оказались Mac miniTM. Тому есть несколько причин. За счет унифицированной памяти для загрузки модели доступен весь объем за исключением занятого системой. Пропускная способность этой памяти на порядок больше таковой в сравнении с DDR5. Также набор инструментов для локального инференса развился до состояния, пригодного для быстрого разворачивания.

С такими вводными Mac miniTM с памятью 24 или 48 ГБ — интересная альтернатива инференсу на десктопе. Совмещая локальную LLM-модель среднего размера и OpenClaw, пользователи организуют различные сценарии, используя персонального ИИ-агента. В этой статье попробуем запустить несколько моделей локально и проверим, оправдан ли хайп вокруг Mac miniTM.

Насколько прожорлив OpenClaw

OpenClaw не является моделью. Это ИИ-агент или ИИ-ассистент, как его иногда позиционируют, работающий поверх LLM. Также у него есть интеграции с популярными сервисами: Discord, Google Chat, iMessage®, Matrix и другими. В документации OpenClaw называют self-hosted шлюзом для связи приложений и мессенджеров с возможностью подключения ИИ-агентов для программирования.

Минимальные системные требования и правда малы: одно ядро процессора,  512 МБ ОЗУ, 1 ГБ диска и сеть 1 Мбит/c. Такая инсталляция заявлена как персональный бот на бюджетном облачном сервере / Raspberry Pi® для тестов или разработки. 

Production- и heavy-сценарии более требовательны к ресурсам: 2/4+ ядра процессора, 8/16 ГБ ОЗУ, 20/50+ ГБ диска и сеть 10/25+ Мбит/с. В такой инсталляции связка OpenClaw + LLM может работать в рамках команды или компании, обеспечивать работу мультиагентных воркфлоу и пайплайнов автоматизации. Все перечисленные системные требования не учитывают локальное размещение модели.

Наш тестовый Mac miniTM оснащен процессором M4 Pro, 48 ГБ ОЗУ и 2 ТБ диска. «На бумаге» железо позволяет развернуть OpenClaw в самом требовательном к ресурсам сценарии. Из-за архитектуры Mac miniTM с унифицированной памятью (UMA) пул доступной оперативной памяти един для процессора и графики. Это накладывает ограничения на выбор модели: чем больше модель, тем меньше памяти останется для OpenClaw и системы.

Установка OpenClaw и настройка локального инференса

Для тестов нужно локально развернуть LLM-модель с OpenAI-совместимым API. Одно из готовых решений — LM Studio. Оно позволяет скачивать и локально запускать модели, а также обеспечивает эндпоинты с OpenAI-совместимым API. 

Кроме LM Studio существуют другие решения со схожим функционалом: llama.cpp, Ollama (на базе llama.cpp), vLLM и другие. LM Studio выигрывает для задачи «скачать модель и получить API» за счет GUI, встроенного каталога моделей и минимальной настройки. Аналоги «из коробки» требуют больше действий для такого же результата.

Установка LM Studio поддерживается в двух форматах: GUI и headless. Для тестовых целей подойдет GUI-вариант, который позволяет быстро настраивать параметры загрузки моделей и генерации и скачивать модели. Headless подойдет для развертывания на удаленной машине, например, на выделенном сервере, для использования разными клиентами. Сам процесс установки прост — скачать DMG-файл и установить.

Далее для локального запуска нужно загрузить модели и настроить доступ к ней по API.

Загрузить модель можно в меню Model Search. По умолчанию модели отсортированы в порядке Best Match, начиная с самых больших и подходящих для устройства. Для тестового Mac miniTM LM Studio оценивает доступный для модели объем памяти в 40 ГБ.

Предложение моделей в LM Studio на момент написания статьи.
Предложение моделей в LM Studio на момент написания статьи.

После скачивания весов модели и загрузки в память можно пингануть модель и получить ответ.

Модель работает, на пинг отвечает.
Модель работает, на пинг отвечает.

Для запуска локального сервера нужно переключиться в меню Developer и переключить статус. Тут же видны логи.

Информация о локальном сервере в LM Studio. Тут можно смотреть логи, информацию о модели и изменять параметры загрузки, например, размер контекста.
Информация о локальном сервере в LM Studio. Тут можно смотреть логи, информацию о модели и изменять параметры загрузки, например, размер контекста.

После загрузки модели LM Studio оценивает объем занятой памяти в 21 ГБ.

Сводка по железу тестового Mac miniTM, там же есть настройка гардрейлов в части перегрузки ресурсов системы.
Сводка по железу тестового Mac miniTM, там же есть настройка гардрейлов в части перегрузки ресурсов системы.

После настройки локальной модели перейдем к установке OpenClaw.

Обратите внимание, что для лаконичности инструкции используются команды, которые скачивают неизвестный скрипт и выполняют его с правами суперпользователя. Это небезопасно, так как скрипт может быть изменен и содержать вредоносный контент.

Такой подход допустим для краткосрочных проектов на чистом сервере, однако в продуктовой среде рекомендуется устанавливать ПО вручную из доверенных источников.

curl -fsSL https://openclaw.ai/install.sh

Скрипт ставит необходимые пакеты и запускает мастер настройки. Проходим его с минимальными настройками. После завершения откроем дашборд и отправим запрос на проверку состояния системы — Check system health.

Агент ответил, информацию о себе рассказал.
Агент ответил, информацию о себе рассказал.

«Самодиагностика» в порядке, можно переходить к тестам.

Тесты OpenClaw с бекэндом LM Studio

В каталоге LM Studio есть разные модели как по архитектуре, так и по размеру. Перед тестами были загружены несколько моделей из топа подходящих под железо и минимально проверена их работоспособность: модель загружается и дает скорость, пригодную для интерактивной работы (на глаз). Часть моделей не подошла из-за таймаута при генерации ответа на запрос через OpenClaw, часть не удалось загрузить. Загрузка одной из моделей привела к перезагрузке Mac miniTM по неустановленной причине. В результате осталось три модели: google/gemma-4-26b-a4b-qat, qwen/qwen3.6-35b-a3b, google/gemma-4-31b.

Пинг

Протестируем скорость отклика агента. Попробуем пропинговать агента с разными моделями и сравним время их ответа. Для улучшения точности замеров предварительно закроем все тяжелые приложения в системе и будем поочередно загружать модели с контекстом 64k.

Модель

Квантизация

Формат

Время, с

google/gemma-4-26b-a4b-qat

4bit

MLX

4

qwen/qwen3.6-35b-a3b

Q4_K_M

GGUF

3

google/gemma-4-31b

Q4_K_M

GGUF

12

Каталог готовых ИИ-моделей

Сервис для запуска и управления LLM в облаке Selectel. Выберите модель, конфигурацию и получите готовый эндпоинт для работы с ней.

Подробнее →

Сводка новостей

Попросим OpenCLaw рассказать новости о компании Selectel. Запрос: «Расскажи новости про Selectel за последний квартал». Далее приведены полученные ответы от каждой из тестируемых моделей.

qwen/qwen3.6-35b-a3b

Вот основные новости по Selectel за последний квартал (Q1 2026):

1. Финансовые итоги Q1 2026 (опубликованы 15 мая)

  • Выручка выросла на 14% г/г до 5 млрд руб. (включая 4,3 млрд от облачных инфраструктурных сервисов, тоже +14%)

  • Скорректированная EBITDA2,7 млрд руб. (+5% г/г), рентабельность 54%

  • Чистая прибыль0,9 млрд руб. (+4% г/г), рентабельность 18%

  • Клиентская база достигла 36,6 тыс. (прирост 8,1 тыс. за год)

  • Чистый долг / EBITDA LTM1,8x — комфортный уровень

Общий фон: двузначный рост на фоне устойчивого спроса на облачную инфраструктуру в России.

2. Итоги 2025 года (аудированная отчётность по МСФО, опубликована 1 апреля)

  • Выручка за 2025 — 18,3 млрд руб. (+39% г/г)

  • Компания подвела итоги года и опубликовала аудированную отчётность

3. Сделка: Catalytic People приобрела 25% Selectel (июнь 2026)

  • Catalytic People (совместное предприятие Т-Технологий и Интеррос Владимира Потанина) приобрела 25% акций Selectel за 16 млрд руб.

  • Доли в Catalytic People: Т-Технологии — 50,01%, Интеррос — 49,99%

  • Сделка осуществляется в рамках стратегии вложений в высокотехнологичный сектор, в том числе для развития отечественных AI-моделей

  • Это уже вторая волна подобных новостей: ранее (конец 2025) сообщалось о подготовке сделки

4. Перспективы

  • Аналитики (в т.ч. T-Bank Invest, Sector IT) отмечают, что снижение ключевой ставки ЦБ положительно скажется на долговой нагрузке компании

  • Выручка облачных сервисов растёт быстрее рынка — драйвером является спрос на AI-инфраструктуру

  • Selectel рассчитывает удержать темпы роста и в 2026 году

Ответ содержит ошибку в п. 3. Сделка была объявлена 29 декабря 2025 года, а не в июне 2026. Сам текст написан разнородно: в отсутствие аналитики остается компиляция заголовков. На генерацию ответа ушло примерно 60 секунд.

google/gemma-4-26b-a4b-qat

На основе финансовых отчетов за первый квартал 2026 года (который завершился в марте), можно выделить следующие ключевые новости и показатели Selectel:

? Финансовые показатели (за I квартал 2026)

  • Выручка: Составила 5 млрд рублей.

  • Динамика: Компания продолжает расти двузначными темпами, демонстрируя уверенную динамику даже на фоне напряженной экономической ситуации.

?️ Инвестиции и развитие (CAPEX)

Selectel продолжает активно расширять свои мощности. За прошедший квартал объем капитальных вложений (CAPEX) составил 2,8 млрд рублей, которые были распределены следующим образом:

  • 1,7 млрд руб. — на закупку серверного оборудования;

  • 0,9 млрд руб. — на развитие инфраструктуры дата-центров.

? Общий итог

Отчетность за первый квартал характеризуется как «спокойная и качественная». Основной фокус компании остается на расширении инфраструктуры и поддержании темпов роста за счет наращивания серверных мощностей.

В тексте нет ошибок. По форме это больше как аналитическая заметка, а по содержанию ближе к пересказу пресс-релиза. Генерация заняла также около 60 секунд.

google/gemma-4-31b

Главная новость за последний квартал — финансовые результаты Selectel по итогам первого квартала 2026 года:

  • Выручка: составила 5 млрд рублей.

  • Рост: выручка увеличилась на 14% по сравнению с аналогичным периодом прошлого года.

  • Отчетность: данные основаны на управленческой отчетности, соответствующей принципам МСФО.

Остальные новости в этот период носили преимущественно информационный характер, подтверждающий стабильный рост компании как независимого провайдера ИТ-инфраструктуры.

Этот ответ получился краткий и точный, но малоинформативный. Кроме того, на его генерацию ушло гораздо больше времени — 300 секунд.

Время ответа моделей собрано в таблице ниже.

Модель

Время, с

google/gemma-4-26b-a4b-qat

60

qwen/qwen3.6-35b-a3b

60

google/gemma-4-31b

300

Самый детальный ответ дала модель qwen3.6-35b-a3b за минимальное из всех моделей время. Модель gemma-4-31b генерировала ответ дольше всех, однако детализированность ответа меньше таковой у gemma-4-26b-a4b-qat.

Синтетические бенчмарки

Посмотрим, сколько «попугаев» в синтетических тестах покажет Mac miniTM M4 Pro. Воспользуемся Anubis — open-source приложением для тестирования производительности локальных LLM-моделей на процессорах линейки Apple Silicon.

Список моделей тот же — для сравнимости. В таблице указаны средние значения результатов 20 запусков.

Модель

Токенов в секунду

Джоулей на 1 токен

TTFT, мс

Задержка генерации токена, мс

google/gemma-4-26b-a4b-qat

59

0,38

237

17

qwen/qwen3.6-35b-a3b

50

0,45

96

20

google/gemma-4-31b

10

2,73

1 217

97

  • Самой быстрой моделью по генерации токенов оказалась gemma-4-26b-a4b-qat — она же, по версии Anubis, еще и самая энергоэффективная. При схожей с qwen3.6-35b-a3b задержке генерации показатель TTFT (Time to First Token, время до первого токена) у модели Gemma оказался выше. 

  • Во всех тестах загруженность CPU не превышала 10%, в то время как загрузка GPU стабильно находилась около 99%. Такая загрузка показывает, что вычисления ложатся на GPU-часть Apple Silicon. Это ожидаемо для LLM-инференса через ML-фреймворки.

  • gemma-4-31b — последняя по скорости и энергоэффективности. Плотная модель на 31B параметров без квантования ожидаемо проигрывает MoE-архитектурам: 10 токенов/с против 50–59, энергозатраты выше примерно в 6–7 раз.

  • Обе MoE-модели gemma-4-26b-a4b-qat и qwen3.6-35b-a3b лидируют по пропускной способности. У них меньше активных параметров и быстрее инференс.

  • Модель gemma-4-31b менее детальна, чем gemma-4-26b-a4b-qat. Плотная 31B-модель при 5-кратной разнице во времени генерации (300 с vs 60 с) выдала худший по детализации результат, чем квантованная 26B MoE.

  • Модель qwen3.6-35b-a3b дает самый детальный ответ при наименьшем числе активных параметров. Казалось бы, модель с меньшим числом активных параметров должна выдавать менее развернутые ответы, но, вероятно, пропорциональной потери качества не происходит за счет архитектуры и качества обучающей выборки.

Заключение

По результатам тестов локальный запуск LLM на Mac miniTM выглядит вполне юзабельным. LLM-модели среднего размера выдают ответы с небольшой задержкой, что в сочетании с OpenClaw позволяет сделать из Mac miniTM полноценного ИИ-ассистента без использования подписок провайдеров LLM. Арендовать Mac miniTM в Selectel можно на странице выделенных серверов.

А для моделей большего размера можно рассмотреть выделенные или облачные серверы с более производительными GPU, в том числе с GPU NVIDIA® H300.

Комментарии (1)


  1. KorP
    23.07.2026 11:52

    Временно нет в наличии

    Как быстро разобрали :)

    Да и какой смысл брать в аренду за 24к, если за год отобьется покупка собственного?