На днях SemiAnalysis опубликовали исследование с довольно убийственным для OpenAI выводом: подписка Claude якобы дает более чем в пять раз больше ценности, чем сопоставимая подписка ChatGPT.

Но как обычно бывает, всё не так однозначно....
На тарифах за $200 цифры выглядят особенно эффектно:
Claude Max 20x |
ChatGPT Pro 200 |
|
|---|---|---|
Модель |
Claude Opus 5.5 |
GPT-6.1 Sol |
Цена подписки |
$200 |
$200 |
Эквивалент использования через API |
$11 726 |
$2 084 |
То есть платим одни и те же $200, а получаем либо почти $12 тысяч API-эквивалента в Claude, либо чуть больше $2 тысяч в ChatGPT.
Звучит так, что можно покупать Claude и больше никогда не вспоминать про ChatGPT, но как обычно всё не так однозначно и есть нюанс:
$11 726 против $2 084 — цифры настоящие, но вот вывод, что «Claude в 5,6 раза выгоднее» из них напрямую не следует.
Чтобы понять почему, придется разобраться, что именно измеряли SemiAnalysis, сколько токенов на самом деле дают обе подписки, а самое интересное, сколько токенов сами модели тратят на решение одной и той же задачи.
Откуда вообще взялись $11 726
У подписок Claude и ChatGPT нет простого публичного лимита вида «вам положено 500 миллионов токенов в месяц»: есть окна использования, недельные ограничения, разные коэффициенты для моделей и разные способы расходования лимита.
SemiAnalysis сделали довольно занятную вещь: экспериментально измерили расход лимитов подписок, оценили доступный объем использования и посчитали, сколько аналогичный объем стоил бы при оплате через официальный API.
Для обычного агентского сценария, когда идёт длинный диалог и по сути большая часть токенов достаётся из кэша, у них получились следующие цифры:
Подписка |
Эквивалент API |
|---|---|
Claude Pro ($20) |
$1 178 |
ChatGPT Plus ($20) |
$211 |
Claude Max 5x ($100) |
$5 725 |
ChatGPT Pro ($100) |
$1 055 |
Claude Max 20x ($200) |
$11 726 |
ChatGPT Pro ($200) |
$2 084 |
Разрыв стабилен: примерно 5,4–5,6 раза в пользу Anthropic.
Одинаковая цена — не то же самое, что одинаковое количество работы
Посмотрим на API-прайсы.
GPT-6.1 Sol стоит $2 за миллион обычных входных токенов, $0,10 за миллион cached input и $10 за миллион output.
Claude Opus 5.5 стоит $4 за миллион input, $0,20 за cached input и $20 за миллион output.
То есть в основных категориях токен Opus 5.5 стоит примерно в два раза дороже токена GPT-6.1 Sol.
Представим на секунду две подписки:
дает 100 единиц ресурса, каждый из которых продается через API по $2.
дает 200 единиц ресурса, каждый из которых продается через API по $10.
Суммарная ценность второй подписки выглядит в разы больше, но это еще не означает, что с ней можно решить пропорционально больше задач. И SemiAnalysis этот эффект не скрывает. Поэтому кроме долларового эквивалента они приводят еще одну, гораздо более интересную метрику: реальное количество токенов.
В токенах преимущество уже не 5,6×, а 2,8×
Для тарифов за $200 SemiAnalysis получили примерно:
Claude Max 20x |
ChatGPT Pro $200 |
|
|---|---|---|
Модель |
Opus 5.5 |
GPT-6.1 Sol |
Токенов в месяц |
28,6 млрд |
10,2 млрд |
Соотношение выходит 2.8:1!
То есть преимущество Claude никуда не исчезает, оно по прежнему огромное, но из-за разницы в цене оно уже сократилось в два раза.
Но и 2,8× вроде бы выглядит как разгром. Если одна подписка дает почти втрое больше токенов, разве не означает это примерно втрое больше работы?
А вот здесь и начинается самое интересное.
А сколько токенов модели тратят на одну задачу?
Чтобы ответить хотя бы приблизительно, можно посмотреть на независимые тесты Artificial Analysis.
Мне очень нравится этот ресурс своими бенчмарками и оценками. Очень удобно сравнивать модели между собой и выбирать наиболее подходящую под разные задачи. Возможно про это я тоже напишу в будущем статью.
На момент написания статьи их сравнение GPT-6.1 Sol и Claude Opus 5.5 с режимами рассуждений на уровне Max выглядит так:
GPT-6.1 Sol Max |
Claude Opus 5.5 Max |
|
|---|---|---|
Intelligence Index |
52 |
58 |
Output tokens / task |
38k |
119k |
Reasoning tokens / task |
25k |
84k |
Cost / task |
$0,72 |
$5,98 |
И вот теперь картинка становится намного интереснее.
Opus 5.5 получает в Artificial Analysis примерно на 11,5% более высокий Intelligence Index. Но для одной benchmark-задачи он при этом генерирует: в 3,13 раза больше выходных токенов и использует примерно в 3,36 раза больше токенов на рассуждения.
Всё это приводит к тому, что эта же задача обходится примерно в 8,3 раза дороже чем в GPT.
А теперь вернёмся к подпискам
SemiAnalysis показывают, что Claude дает примерно в 2,8 раза больше токенов. В это же время по официальным API-прайсам цена одного токена Opus в два раза выше.
Artificial Analysis одновременно показывают, что в их наборе тестов Opus может тратить на одну задачу примерно в три раза больше токенов, чем Sol.
Не будем делать такой же ошибочный вывод и говорить, что ChatGPT выполняет больше задач за то же количество токенов. Методологии разные — input/cache/output нельзя просто сложить в одну колонку, а синтетические бенчмарки вообще не являются вашим реальным рабочим проектом.
Но это прекрасно показывает главную проблему исходной метрики:
Количество доступных токенов не равно количеству выполненной работы.
А долларовая стоимость этих токенов тем более.
Парадокс: дорогая модель делает подписку «выгоднее»
Представим модель, которая решает задачу за миллион токенов и вторую модель, которая решает ту же задачу за сто тысяч.
Допустим, подписка первой дает вам два миллиарда токенов, а второй — один миллиард. По метрике «токенов в подписке» первая победит в два раза, но задач вы сможете решить: 2 000 на первой модели; 10 000 на второй.
Если токены первой модели вдобавок стоят в API в пять раз дороже, подписка внезапно будет выглядеть в десять раз ценнее, несмотря на то, что полезной работы в нашем примере выполняется в пять раз меньше.
Конечно, Opus и Sol отличаются не настолько радикально и этот пример специально утрирован, но он показывает, что показатель API-эквивалент стоимость подписки надо читать буквально:
сколько стоил бы доступный объем токенов, если покупать его через API.
а не:
сколько полезной работы выполнит подписка.
Тогда Claude вообще не выгоднее?
Здесь было бы ошибкой перегнуть в другую сторону.
Даже если полностью выбросить долларовый API-эквивалент, то результаты SemiAnalysis все равно очень сильные для Anthropic.
28,6 млрд против 10,2 млрд токенов — это почти трехкратный запас.
Кроме того, Opus 5.5 показывает более высокий результат у Artificial Analysis: Intelligence Index 58 против 52 у GPT-6.1 Sol. На отдельных тестах разница отличается, но в агрегированном индексе преимущество сейчас у Claude. Вероятно, это достигается за счёт большого количества токенов на размышлениях.
Anthropic при этом явно позиционирует Opus 5.5 как рабочую модель для сложных кодинг и агентских задач.
А что с самыми мощными моделями?
Есть еще одна деталь, которая особенно хорошо показывает, почему нельзя распространять «5.6×» вообще на Claude против ChatGPT.
На флагманском уровне у SemiAnalysis картина совсем другая.
Для $200-планов:
Эквивалент API |
Intelligence Index |
|
|---|---|---|
GPT-6 Astra в ChatGPT Pro |
$2 897 |
53 |
Claude Fable 5.1 в Max 20x |
$2 485 |
53 |
То есть здесь OpenAI даже немного впереди по той же самой метрике, по которой Opus разгромил Sol. Но у Claude есть нюанс: Fable в этом расчете может израсходовать только часть общей недельной квоты, остальную квоту можно потратить только на более слабые модели.
Какую метрику хотелось бы увидеть на самом деле
Если мы хотим понять экономику AI-подписки для разработчика, то идеальной метрикой был бы не API-эквивалент стоимости и даже не число токенов, которые входят в подписку. Нам нужен примерно такой показатель:
количество успешно выполненных задач одной подпиской
Берем набор реальных задач: исправить баг, реализовать новую фичу, провести рефакторинг кодовой базы, разобраться в неизвестном репозитории, провести code review, найти причину падения. После этого считаем сколько задач модель успешно закрыла до исчерпания месячного лимита подписки. При этом на количество токенов нам по факту всё равно.
Именно такой бенчмарк позволил бы действительно ответить на вопрос, какая подписка выгоднее для разработчика. А пока его нет, нам приходится собирать картину из нескольких несовершенных метрик и делать ошибки в выводах.
Что в итоге
Я ни в коем случае не опровергаю исследование SemiAnalysis, скорее наоборот: оно вскрыло вещь, которую компании очень не любят показывать напрямую — реальные лимиты подписок отличаются колоссально.
На $200-тарифах Anthropic сейчас действительно выглядит очень щедро, но цифра 5,6× отвечает только на вопрос:
во сколько раз отличается стоимость доступного объема использования при пересчете по API-тарифам?
Но при этом на вопрос:
во сколько раз больше полезной работы я получу за свои деньги?
она ответа не дает.
Artificial Analysis добавляет сюда важный кусок пазла: Opus 5.5 в их тестах действительно показывает более высокий интеллект, но ценой использования примерно втрое больше выходных и мыслительных токенов на задачу, чем у GPT-6.1 Sol.
Поэтому вывод у меня получился не таким красивым, как исходный заголовок SemiAnalysis. Доказательств, что он дает в пять с лишним раз больше выполненной работы, пока нет. Скорее даже наоборот, другие бенчмарки приводят нас к выводу, что особой разницы в результате между подписками мы не увидим.
Но самый важным выводом я считаю то, что нам пора перестать считать токены.
Пора считать законченные задачи.
ShadowMaster
Надо считать сколько потрачено на решенную задачу, а не какие-то абстрактные токены. Разные обвязки по-разному нарезают токены и по-разному их тратят. Плюс еще всякие fastmode/ultrafastmode. Иногда можно взять модель попроще, иногда проще взять более умную модель, кардинально быстрее будет. То есть смотреть нужно от конкретных задач.
WebProd Автор
Собственно это и есть главный вывод статьи :)
Токены я здесь использую не как финальную метрику эффективности, а скорее чтобы показать, почему пересчёт лимитов подписки в стоимость токенов по API сам по себе мало что говорит.