Разработчики агентных систем оказались в странной ситуации. Модели становятся дешевле, но задачи решают хуже. Провайдеры соревнуются в снижении цены за токен, а команды радостно переходят на облегчённые версии, экономя на вычислениях. Экономия очевидна — до первого столкновения с реальной задачей.

Только потом выясняется, что агент на дешёвой модели делает в три раза больше вызовов инструментов, чем на дорогой. Он теряет способность планировать, начинает галлюцинировать и ходить по кругу, переспрашивать и исправлять ошибки новыми ошибками. Счёт за токены незаметно растёт, время выполнения задачи увеличивается, а многие начинают нервничать.

Это история не про жадность разработчиков как таковую, а про то, как — и главное, почему так — устроен рынок ИИ, и почему ваша следующая экономия на модели может оказаться самой дорогой инвестицией в жизни проекта.


Нет, эта статья не проплачена OpenAI или Anthropic, чтобы вы покупали их топовые модели.

За последние два года индустрия ИИ пережила невиданный бум вычислений и рост пузыря. Китай вложил 140 миллиардов долларов в закупку видеокарт, США строят дата-центры по полмиллиарда долларов каждый и проектируют АЭС для запитки. Оперативная память, SSD, видеокарты — всё это вы и без меня знаете. А ещё инвестиции когда-то придётся отбивать…

Провайдеры моделей оказались перед выбором — ведь число запросов к ним растёт экспоненциально, вычислительные мощности упираются в физический предел производства и закупки чипов. А самый простой способ обслужить всех — выпускать упрощённые версии моделей, которые требуют меньше ресурсов на инференс, и соответственно понизить им цену, сделав их привлекательными.

А что? Простые маленькие модели едят мало, стоят дёшево. Быстро, легко и дёшево-сердито! По формальным тестам почти не уступают старшим моделям.

Почти.

Потому что бенчмарки вроде MMLU или GSM8K измеряют способность модели отвечать на изолированные вопросы. Они не измеряют планирование, не измеряют способность выстраивать длинные цепочки рассуждений, не измеряют устойчивость к ошибкам в многокомпонентных задачах. Но именно эти качества критичны для агентных систем.

Возьмём простейший сценарий: агенту нужно найти файл в Google Диске, извлечь из него данные, отправить отчёт в какую-нибудь CRM. На дорогой модели он напишет небольшой скрипт и завершит задачу. А дешёвая модель может сначала написать один скрипт, затем прочитать заново, затем поискать в интернете, затем ещё один скрипт, затем дебаг. Условно, вместо тысяч токенов — десятки или сотни тысяч токенов. Зато дёшево! Или нет?..

Проблема усугубляется тем, что разработчики привыкли доверять бенчмаркам и не замечают деградацию, пока не столкнутся с ней в бою. Модель с отличными результатами на тестах может оказаться бесполезной в реальном пайплайне, потому что тесты не проверяют все реальные маршруты работы.

В этой статье мы разберём, как работает эта скрытая экономия, почему стандартные метрики вводят в заблуждение и как на самом деле считать стоимость модели для вашего продукта.

Иллюзия эффективности, или почему вам кажется, что вы выиграли

Провайдеры больших языковых моделей не снижают цены из альтруизма. Частично это демпинг цен, пока ИИ-пузырь жив и инвестиции идут, но это тема для другой статьи (кстати, я частично разбирал тему пузыря ИИ в этой статье). Они снижают цены, потому что ничего личного, только бизнес.

За два года количество запросов к OpenAI, Anthropic и их китайским аналогам выросло на порядки. Пользователи привыкли, что нейросеть всегда под рукой, и пишут ей каждые пять минут — по поводу и без. Стартапы строят агентов, которые сами дёргают API в цикле. Или нужно открыть ещё один крипто-AI SaaS B2B стартап. Интеграции с IDE, чат-ботами, CRM — всё это создаёт непрерывный поток токенов, который нужно обработать.

Вычислительные мощности при этом упираются в железный потолок. Да, Nvidia печатает H100 как блины, но дата-центры строятся годами, АЭС для их питания проектируются десятилетиями, а китайские ограничения на экспорт чипов только подогревают дефицит. Инвестиции в инфраструктуру исчисляются сотнями миллиардов, и их когда-то придётся отбивать. Но если спрос растёт быстрее, чем вы строите новые серверы, у вас два пути.

Первый — повысить цены, отсечь часть пользователей и жить в нише премиум-продукта. Второй — научиться обслуживать больше запросов на тех же мощностях.

Первый путь могут себе позволить OpenAI да Anthropic, как никак IPO близится. А вот остальная индустрия выбрала второй путь.

Технически это означает дистилляцию, квантизацию и прореживание весов. Модель сжимают до размеров, которые позволяют запускать её на вдвое меньшем количестве видеокарт. Она отвечает быстрее, и это ощущается как прогресс. Пользователь видит уменьшение задержки, разработчик видит уменьшение счёта за токены — все счастливы! Кроме одного «но».

Дистилляция режет не размер словаря и не скорость генерации, а глубину рассуждения и мышления, обдумывания. Модель становится менее способна удерживать длинный контекст, выстраивать многошаговую логику, видеть неочевидные связи. Она превращается из аналитика в клерка, который быстро отвечает на стандартные вопросы, но теряется, как только задача выходит за рамки инструкции.

Вы не можете запихнуть тот же уровень интеллекта в модель с вдвое меньшим количеством параметров, не потеряв что-то по пути. Жертвой всегда становится самое дорогое с точки зрения вычислений — способность планировать.

А агентные системы без планирования — это просто дорогой скрипт, который имитирует деятельность.

Эффект скрытой пошлины

Давайте проведём мысленный эксперимент. Возьмём реальный сценарий, который в разных вариациях встречается в каждом втором агенте. Пользователь просит найти файл в Google Диске, извлечь из него данные и отправить отчёт в CRM. Звучит как три действия. Дорогая модель — скажем, GPT-4o или Claude Opus — видит это как три действия. Она пишет один скрипт, который делает все три вещи, или вызывает три инструмента в правильном порядке, и задача закрыта.

Дешёвая модель, та же GPT-4o-mini или Claude Haiku, видит то же самое описание иначе. Она не уверена, где искать файл. Она вызывает поиск, получает результаты, пытается их спарсить. Парсинг не сходится — она вызывает другой инструмент. Получает ошибку, пытается её продебажить, вызывает поиск в интернете, находит пример кода, пытается применить его к своей задаче. Вместо трёх вызовов инструментов — десять. Вместо пары тысяч токенов на вход и выход — десятки тысяч. Задача выполнена, но ценой, которая перекрывает всю экономию на «дешёвом» токене.

В бенчмарке AIM Enterprise, где модели тестировали на 69 реальных бизнес-задачах, GPT-5.6 Luna показала 55,3 балла при стоимости $0,032 за задачу. Claude Sonnet 5 набрал 53,2 балла при стоимости $1,46 за задачу — в 46 раз дороже за результат, который на 2,1 балла хуже. Казалось бы, Луна — очевидный выбор. Но если посмотреть глубже: у более дешёвых моделей корреляция между стоимостью за задачу и качеством составляет всего 0,48. Цена почти не предсказывает результат в средней зоне — у девяти моделей, которые укладывались в диапазон от 127 до 569 секунд на задачу, корреляция между скоростью и качеством и вовсе упала до –0,06. То есть быстрый ответ и дешёвый токен могут означать ровно то, что модель просто не стала глубоко вникать.

Ещё один бенчмарк, DecisionBench, показал, что модели с доступом к инструментам «на лету» показывают худшие результаты на сложных задачах GAIA, чем модели, которые получают описание инструментов заранее. То есть экономия на каждом вызове — когда система передаёт схему инструмента только в момент его вызова — приводит к тому, что модель чаще ошибается. А каждая ошибка — это ещё один вызов и трата токенов.

А еще работа с кэшированием! В теории префиксное кэширование должно сокращать затраты на повторные вызовы в разы. На практике, как пишут инженеры из Nous Research, в системах с интенсивным использованием инструментов накладные расходы на входные токены достигают 70% — и это при включённом кэшировании. Почему? Потому что каждый новый вызов инструмента чуть меняет контекст. Меняется JSON-ответ от API — где-то порядок ключей сбивается, где-то формат числа другой. Кэш перестаёт попадать, и модель перечитывает весь контекст заново, раз за разом. А это уже безумие, точное повторение одного и того же действия раз за разом в надежде на изменение.

Вот здесь и прячется «скрытая пошлина».

Вы экономите на цене токена — например, GPT-4o-mini стоит примерно в 15–20 раз дешевле GPT-4o за миллион входных токенов. Но ваш агент на мини-версии делает в 3–4 раза больше шагов. Каждый шаг — это новый запрос с полным контекстом, который кэш не покрывает. В итоге вы платите не за один дешёвый токен, а за десяток дешёвых токенов, которые суммарно обходятся дороже, чем один дорогой.

Скупой платит дважды, а то и трижды, как говорится.

Ложь, наглая ложь и бенчмарки

Как известно, существуют три вида лжи: ложь, наглая ложь и статистика бенчмарки. Их коварство заключается в том, что в таблице с результатами MMLU, HumanEval, GSM8K мы видим разницу в пару процентов и думаем: «Ну, дешевле на порядок, а качество почти то же — беру».

И тут как раз и кроется ошибочка. С академической точки зрения здесь две отдельные проблемы, и обе убивают доверие к бенчмаркам.

Например, современные модели обучаются на всём интернете, на всех данных, а дынные могут загрезняться… А бенчмарки вроде MMLU, HumanEval и GSM8K есть в интернете целиком, со всеми вопросами и ответами. Модель их просто может запомнить во время обучения!

Оценки масштаба разнятся, но исследования показывают эффект «инфляции» от 6 до 40% в зависимости от бенчмарка и метода оценки. На MMLU, например, модели показывают статистически значимый рост точности просто за счёт того, что видели похожие вопросы.

Есть прямой эксперимент: исследователи взяли вопросы, на которых модель ошибалась, обучили её на них через LoRA (имитация утечки данных), а потом проверили — модель стала отвечать правильно на основе одного лишь фрагмента вопроса из семи слов, без полного контекста. В бенчмарке MMLU-CF, который был специально спроектирован так, чтобы избежать загрязнения, модели показали значительное падение результатов, а их ранжирование в лидербордах изменилось кардинально. Та модель, что была на вершине MMLU, может оказаться середняком на «чистой» версии.

Также есть проблема с насыщением, когда тесты для моделей уже не такие сложные

В 2022 году 540-миллиардная PaLM едва перевалила за 60% в MMLU. В 2024 году Microsoft той же планки достигла моделью с параметрами 3,8 миллиарда. Сейчас ведущие модели закрывают MMLU, GSM8K и HumanEval под 95–99%.

В 2026 году только 4 из 16 ведущих моделей вообще сообщают результаты по старому MMLU. И 4 из 16 — по HumanEval. Индустрия молча отказалась от этих бенчмарков, потому что они потеряли смысл. Их сменили более сложные версии — MMLU-Pro и LiveCodeBench, — но, увы, проблема осталась: модель, которая решает изолированный вопрос, всё ещё не умеет планировать длинную цепочку действий.

Это не измеряется ни MMLU, ни HumanEval, ни даже их усложнёнными версиями. В бенчмарке EnterpriseOps-Gym топовые модели завершили только 37,4% реальных корпоративных пайплайнов. И узким местом оказалось именно планирование — способность разложить многошаговую задачу на шаги до того, как нажать «Execute».

Медицинский пример ещё жестче. Модели, которые на стандартных медэкзаменах показывают 92%, на реальных клинических задачах из электронных карт пациентов падают до 44,8%. Разрыв в два раза — и это топ-модели, не дешёвые. Потому что в реальности текст не отформатирован как вопрос с четырьмя вариантами ответа, в нём нет подсказок, и решение требует контекста, которого на экзамене нет.

Когда вы смотрите на таблицу сравнений, где GPT-4o-mini «почти не уступает» GPT-4o на MMLU, вы видите просто аномалию, выброс. Модель может быть загрязнена — она просто запомнила ответы. Или тест уже слишком прост для обеих моделей, и он не показывает их реальную пропускную способность. Или, что хуже всего, тест вообще не измеряет те качества, которые вам нужны для агента.

Это как нанимать сотрудника по результатам теста на знание правил дорожного движения для работы водителем такси по незнакомому городу. Правила он знает, но навигацию не построит, пробки не объедет, пассажира довезёт с тремя пересадками и опозданием, причём построит маршрут такой, что потратит бензина в 2–3 раза больше. Шахматист, который выучил все дебюты по книгам, но проигрывает в мидле, потому что не умеет просчитывать варианты на пять ходов вперёд, — вот точная метафора современной LLM, натренированной на бенчмарках.

Как считать правильно?

Мы уже выяснили, что цена за миллион токенов — это так, маркетинговая уловка. Как выбирать модель, если бенчмарки врут, а дешёвый токен оборачивается дорогой задачей?

Ответ лежит на поверхности, но большинство команд проходят мимо. Нужно считать не стоимость токена, а стоимость закрытой задачи. И измерять не скорость ответа, а эффективность пути, которым агент к этому ответу пришёл.

В основном все приходят к трём метрикам. Первая и самая важная — Cost per Task, стоимость выполнения задачи. В этой метрике учтены все траты: все вызовы модели и ретраи, инструменты, входные и выходные токены. Суммируете затраты на все попытки выполнить задачу (включая неудачные!) и делите на количество успешно завершённых задач. Получаете реальную цифру, которую можно сравнивать между моделями.

Вторая метрика — Tool Call Efficiency, или эффективность использования инструментов.

Сколько вызовов инструментов в среднем делает агент на один завершённый диалог? Исследования показывают, что именно объём вызовов инструментов является самым сильным предсказателем агентной производительности — корреляция достигает 0,7, что выше, чем у длительности задачи (0,3) или количества попыток (0,5). Это логично: каждая лишняя итерация съедает токены, время и увеличивает шанс ошибки.

Если ваш агент на GPT-4o-mini делает в среднем восемь вызовов на задачу, а на GPT-4o — три, вы уже знаете, что дешёвая модель обходится дороже, даже не считая точные цифры.

И последняя метрика — Failure Rate, или частота, с которой агент сдаётся, уходит в бесконечный цикл или совершает необратимые действия без разрешения.

Это самая дорогая, но редкая метрика из всех.

В реальных корпоративных сценариях топовые модели завершают только около 37–51% многошаговых пайплайнов. Даже лучшая модель на EnterpriseOps-Gym, где агентов тестировали на 1150 задачах из восьми доменов (HR, IT, клиентский сервис) с 164 таблицами и 512 инструментами, показала лишь 51% успешных завершений. И это в изолированной среде, без учёта сетевых задержек и грязных данных.

В OWASP называют это «Excessive Agency» (чрезмерная агентность, если переводить буквально). Агент может иметь доступ к инструментам, которые ему не нужны, права на удаление данных, которые должен только читать, или автономию для необратимых действий без одобрения человека. В EnterpriseOps-Gym обнаружили, что агенты часто не умеют отказываться от невыполнимых задач. Кстати, это тянется также и из LLM, которые чаще предпочтут соврать, чем сказать, что они не знают.


Что делать с этими метриками на практике? Всё просто как два пальца об забор. Перестать выбирать модель исключительно по таблице бенчмарков; если есть ресурсы — то собрать свой тестовый набор (реальные сценарии из продакшена), прогнать каждую модель-кандидата и посчитать метрики. И не верьте результатам одного прогона: агенты недетерминированы, и один и тот же запрос может выполниться за три вызова или за десять — в зависимости от того, как модель «решила» подойти к задаче. Потом можно найти арифметическое/гармоническое среднее или медиану.

Ну и логируйте каждый шаг агента: каждый вызов инструмента, каждое решение, каждый токен. Без трассировки вы не сможете понять, где именно дешёвая модель начинает плодить лишние итерации и заблудится в трёх соснах.

Наш сервис Bothub даёт доступ к десяткам моделей через единый API — от дешёвых «легковесов» до флагманских решений. Вы можете взять несколько моделей на тест, прогнать их через свои сценарии и посчитать реальную стоимость владения. Увидеть своими глазами, сколько лишних шагов делает дешёвая модель на ваших данных, и сравнить это с цифрами в бенчмарках.

Вместо заключения

И вот, наконец, подошли к ответу. Ответ простой — посчитать TCO, Total Cost of Ownership. Да, из бизнес-терминологии взято — совокупная стоимость владения. В нашем случае — владения ИИ-агентом.

И вот тут открывается неприятная правда. В исследовании, где сравнивали реальную стоимость агентных систем на 30 задачах EnterpriseBench, картина выглядит так. Конфигурация с Sonnet 4.5 и Ody показывала эффективность 66,7% при полной стоимости $7,36, что давало $0,409 за успешную задачу. А конфигурация с gpt-oss и 7B Forge v2 при эффективности 53,3% обходилась в $1,79 суммарно и $0,119 за успешную задачу. Казалось бы, дешёвая сборка выигрывает в три раза по стоимости за успех. Но если посмотреть глубже, картина меняется. При расчёте только стоимости агентских вызовов разница между этими конфигурациями была 13,4 раза. А при полном TCO она сжалась до 4,1 раза.

Источник: https://huggingface.co/datasets/ufukkaraca/ody-bench/blob/main/methodology/TCO_HONEST.md
Источник: https://huggingface.co/datasets/ufukkaraca/ody-bench/blob/main/methodology/TCO_HONEST.md

Отдельного разговора заслуживает многоагентная композиция. Если каждый агент в цепочке имеет 98% точности, то система из десяти агентов даст общую надёжность 81,7%. Почти каждый пятый запрос провалится. Но на практике LLM не имеют 98% точности на структурированных выходах в открытых задачах, потому что у них нет единственно правильного ответа. Правильность нужно обеспечивать структурно, а не предполагать. Когда ошибка одного агента переходит к следующему, она множится в геометрической прогрессии, проще говоря.

И вот здесь мы подходим к главному. Gartner прогнозирует, что более 40% проектов агентного ИИ будут отменены к 2027 году. Причины называются разные: эскалация затрат, неясная бизнес-ценность и неадекватный контроль рисков.

Что в итоге? В итоге стоит понять, что ИИ-агенты слишком умны, чтобы считать стоимость за них как при оптовых закупках, и слишком тупы, чтобы надеяться на бенчмарки.

Комментарии (0)