Каждый раз, когда заходит разговор "что дешевле — поднять у себя открытую модель или платить за API", его почему-то ведут в ценах за токен. И почти всегда это спор не в тех единицах.
Во-первых, self-hosting — это постоянные затраты, а API — переменные. Значит, ответ зависит не от цены за токен, а от того, насколько плотно вы это железо загрузите. Во-вторых, токены вообще никто не покупает как цель. Покупают решённые задачи. А модели очень по-разному тратят токены на одну и ту же задачу.
И вот что изменилось за последний год: открытые модели догнали топ лидербордов. На SWE-bench Verified DeepSeek V4 Pro берёт 80,6 %, Kimi K3 — 93,4 %, вплотную к лучшим закрытым. То есть во многих сегментах выбор «своё железо vs API» перестал быть выбором по качеству — он стал чисто экономически/операционным. Ниже это то, как я предлагаю его считать.
Part 1. Токены и точка безубыточности
Блендированная цена API
Провайдеры берут за вход и выход по-разному — выход обычно в 3–5 раз дороже (у Claude Opus 4.8 это $5 против $25 за миллион токенов). Если у вашей нагрузки соотношение входных и выходных токенов равно , то блендированная цена за миллион токенов такая:
Здесь важно, что зависит от задачи и двигает цену в 2–3 раза. Генерация поверх длинного контекста (RAG,
) выходит куда дешевле, чем длинная генерация с нуля (
).
Модель |
вход / выход, $/млн |
|
|
|---|---|---|---|
Claude Opus 4.8 |
5,00 / 25,00 |
15,00 |
6,82 |
Kimi K3 |
3,00 / 15,00 |
9,00 |
4,09 |
DeepSeek V3.2 |
0,229 / 0,343 |
0,286 |
0,239 |
Цены проверены при подготовке текста (Claude Opus 4.8 — $5/$25; Kimi K3 — $3/$15; DeepSeek — $0,229/$0,343, кэш $0,074, на 25 июля 2026).
Во что обходится своё железо в месяц
Обозначим за полную месячную стоимость инфраструктуры. Если арендуете — это ставка × часы. Если владеете — амортизируем:
где — цена железа,
— срок амортизации в месяцах,
— энергия и охлаждение.
Вы могли заметить, что в формуле нет операционных расходов. Я выбросил их намеренно. Не потому что их нет, а потому что они процентов на девяносто состоят из зарплатной доли, а она является слишком волатильной.
У этого есть приятный побочный эффект. Раз я недосчитываю затраты на своё железо, моя оценка self-hosting выходит оптимистичной нижней границей. В реальности оно только дороже. А значит все выводы про безубыточность ниже — консервативные: стоит добавить эксплуатацию, и точка сдвинется ещё дальше в сторону API, а не наоборот.
Порядок цифр:
Нода 8×H200 HGX при покупке — примерно $320–420 тыс. (типично ~$370 тыс., то есть ~$46 тыс. за GPU).
Амортизация на 36 месяцев → ~$10,3 тыс./мес до учёта $E$. С учётом остаточной стоимости ~25 % через три года → ~$7,7 тыс./мес.
Аренда той же ноды: долгосрочный резерв — $14,40–20/час (~$10,5–14,6 тыс./мес), on-demand у гиперскейлеров — $36–56/час (~$26–41 тыс./мес).
Энергия: ~8 кВт биллинговой мощности (7,84 кВт GPU при PUE 1,4) × 730 ч ≈ 5 840 кВт·ч/мес → при $0,10–0,15 за кВт·ч это $580–880/мес по члену
Собственно безубыточность
Своё железо за миллион токенов сравнивается с API при месячном объёме
Но целевой объём бессмыслен, если железо физически его не вывозит. Месячная ёмкость при устойчивой пропускной способности (токенов/с) и утилизации
:
Отсюда self-hosting оправдан только когда
Утилизация приоритетна. При
требуемая пиковая пропускная способность утраивается — и API становится дешевле независимо от того, какая модель «лучше».

Граница безубыточности в плоскости
для трёх блендированных цен API (
), при
(амортизированная 8×H200). Смысл картинки: чтобы вытеснить дорогой API (Claude Opus 4.8,
), хватает скромной пропускной способности; а конкурировать с дешёвым API (DeepSeek V3.2,
) на своём железе почти нереально — требуемая
на два порядка выше.
Part 2. Стоимость решённой задачи
Цена за токен всё ещё исходит из того, что модели потокенно взаимозаменяемы. Это не так: они отличаются и долей решённых задач, и числом токенов на попытку. Считаем честнее:
Если используется несколько попыток, то вместо стоимости одной попытки подставляется суммарная стоимость всех попыток.
где — стоимость одной попытки (токены на попытку по цене из формулы выше или по self-hosted-эквиваленту,
— доля решённых задач.
Долю берём из опубликованных результатов SWE-bench Verified. И вот тут надо остановиться и разобрать что это за число такое и почему оно не совсем корректно.
Опубликованные между собой несопоставимы. Их получают в разных обвязках: Kimi K3 меряют на своём KimiCode, Claude Opus мерят на Claude Code, OpenAI на Codex или OpenHands. Агентный бенчмарк тестирует не модель в вакууме, а всю систему «модель + харнесс». Разброс только от смены обвязки — 10–26 баллов, и это перекрывает разницу между самими моделями. Добавьте сюда разное число попыток и разные token budget. То есть если я просто поставлю вендорские
в столбик, поделю и объявлю победителя — это будет ровно та подмена, за которую я весь текст ругаю цену-за-токен.
Поэтому таблицу ниже строю честно, двумя приёмами. Первое: рядом с каждым пишу, в каком харнессе он получен, — чтобы несопоставимость была видна. Второе: в колонке
я намеренно фиксирую бюджет токенов (1,5 млн,
) — не потому что он одинаков в жизни, а чтобы изолировать один эффект: как цена и solve-rate двигают стоимость задачи при прочих равных. Реальные пер-модельные бюджеты токенов надо мерить — про это отдельный разговор.
Модель |
|
харнесс / условия |
цена/млн, $ ( |
основа цены |
|
|---|---|---|---|---|---|
Claude Opus 4.8 |
0,886 |
вендор (Claude/Codex) |
6,82 |
API |
$11,54 |
Kimi K3 |
0,934 |
вендор (KimiCode) |
4,09 |
API |
$6,57 |
DeepSeek V3.2 |
0,731 |
лидерборд |
0,239 |
API (deepseek) |
$0,49 |
DeepSeek V3.2 |
0,731 |
тот же |
функция $U$ |
self-hosted |
$4,37 † |
посчитан при фиксированном бюджете 1,5 млн токенов/попытку и
— это не реальная стоимость задачи, а индекс «цена × (1 / solve-rate)» при прочих равных. self-hosted при
; это не константа, а функция утилизации (график 2).
Как читать эту таблицу. Это не рейтинг моделей: из-за разных харнессов строки закрытых моделей между собой напрямую не сравнимы, и я специально не пишу «X победил Y». Единственное честное сравнение здесь — две строки DeepSeek, API против self-hosted. У них общий и общий бюджет токенов, эффект харнесса сокращается, и разница — чисто про экономику размещения. Вот это и есть результат на данный момент; всё остальное в таблице — референсные якоря для контекста.
И этот кусок ещё раз показывает смысл первой части. Смотрите на две строки DeepSeek: self-hosted (при) — $4,37, а свой же API — $0,49. Своё железо не обгоняет дешёвый API той же модели ни при какой реалистичной утилизации — потому что провайдер крутит это железо на несравнимо большей загрузке, чем вы. Self-hosting выигрывает только у дорогих закрытых API: свой DeepSeek дешевле Claude примерно с
и дешевле Kimi K3 — с
. Существующие же сравнения тарифицируют открытые модели по ставкам хостинг-провайдера и тем самым прячут эту зависимость от
.

Self-hosted
как функция утилизации
(кривая) против трёх API-линий: Claude Opus 4.8 ($11,54), Kimi K3 ($6,57) и того же DeepSeek через API ($0,49). Видно главное: кривая опускается ниже дорогих закрытых API с ростом
, но никогда не опускается ниже дешёвого API той же модели. Иллюстративно: 1,5 млн токенов/попытку,
,
ток/с — заменить измеренными.
Пара оговорок: первое это то, что с SWE-bench переносится на задачи по Python-репам, но не на произвольную нагрузку — числа будут другие. Второе:
означает время человека на ревью между попытками. Так что мой
— нижняя оценка, и к моделям с большим
добрее.
Part 3. Что формула не ловит
А теперь самое интересное — то, из-за чего решение часто принимают вообще мимо всех этих цифр.
Резидентность данных. Когда выбор вообще не про деньги, пример: данные клиента не могли покидать его контур. Это выбивает API целиком, по любой цене. Когда упирается сюда — части 1 и 2 просто нерелевантны.
Привязка к вендору и волатильность цен. Цены и доступность моделей меняются по расписанию провайдера, а не вашему. Свежий пример структурного риска: в июле 2026 Moonshot AI приостановила приём новых подписок на Kimi K3 примерно через 48 часов после запуска — спрос превысил доступную GPU-ёмкость. Модель формально «есть», а пропускной способности под неё — нет, и это вне вашего контроля.
Асимметрия апдейтов. Мы как клиенты API получаем обновление модели бесплатно, инженерно. Команда на self-hosting за каждый апгрейд платит полным циклом переквантизации и переоценки.
Амортизация железа. Свои ускорители дешевеют по темпу релизов NVIDIA, а не по вашему бухгалтерскому графику. По рыночным оценкам нода 8×H200 сохраняет ~25 % стоимости через три года (~$92,5 тыс. остаточной на систему за $370 тыс.), то есть теряет ~$277,5 тыс. за срок владения. И задаёт эту траекторию выход следующего поколения (B300 и далее), а не ваш план амортизации.
Вывод
Из этого всего вопрос "API или self-hosting" — это не вопрос стоимости токена. Это вопрос загрузки инфраструктуры, требований к данным и операционных ограничений. Пока своё железо простаивает значительную часть времени, дешёвый API будет выигрывать практически всегда.