Opus 5.5, Fable 5.1, GPT-6, DeepSeek и Grok: цены и скорость

Осень 2026 года выдалась плотной: 1 сентября Anthropic выпустила Claude Fable 5.1, 3 сентября OpenAI показала GPT-6 Astra, следом отчитались остальные. Разбираться в этом потоке приходится по цифрам, а цифры бывают трёх сортов, и мешать их нельзя. Ниже — что именно мерят источники, где расходятся и как из этого считать стоимость работы, а не стоимость токена.

Шаг 1. Разделить цифры производителей и независимые замеры

Таблицы компаний рисуются в свою пользу. Выбор тестов, уровень рассуждения, собственная обвязка — программа подачи задач и проверки ответов — всё это настраивается под нужный результат. Один и тот же тест в разных обвязках даёт разные числа: Terminal-Bench 4.0 для Grok 4.7 — 37,6 % у xAI и 33 % у Artificial Analysis. Поэтому по таблицам компаний можно сравнивать только грубо.

Terminal-Bench 4.0 по данным производителей. Данные: анонсы Anthropic и xAI. График: Технозаметки
Terminal-Bench 4.0 по данным производителей. Данные: анонсы Anthropic и xAI. График: Технозаметки

Независимые замеры (Artificial Analysis) держат одинаковые условия для всех. Их сводный индекс — десять тестов, сведённые в одно число, плюс отдельные замеры скорости вывода, времени до первого токена, выходных токенов и цены задачи. Слабость индекса известна: это средняя температура по больнице. Модель, сильная в нише, в индексе проигрывает.

Третий сорт — прямые сравнения. Издания и блогеры берут одно задание на 2–3 модели и мерят время, доллары и оценивают результат. Это ближе всего к реальной работе, но выборка крошечная: три задания или один «Тетрис» — иллюстрация, не статистика.

Ловушка в том, что за сутки на агрегаторах появляются десятки пересказов. Расхождения индекса Artificial Analysis для одной модели доходят до 15 баллов, а цена GPT-6.1 Sol «десять центов» в прейскуранте OpenAI вообще отсутствует. Сверяться нужно с первоисточниками: анонсами, прейскурантами и страницами моделей на Artificial Analysis.

Отдельно про уровень рассуждения: ступени идут от low до max, и одна модель на разных ступенях ведёт себя как разные модели. Opus 5.5 low против max — 16 баллов индекса и цена задачи в 11 раз выше. Сравнивать лучшие результаты стоит только на самом высоком измеренном уровне.

Шаг 2. Пересчитать прейскурант в цену задачи

Прейскурант — это цена слова, а платёж идёт за решённую задачу. Расход слов на задачу у моделей очень разный, а токены размышлений оплачиваются по цене выхода. Artificial Analysis считает среднюю стоимость задачи индекса на заданном уровне рассуждения, и картина получается неочевидная.

Индекс Artificial Analysis и цена одной задачи индекса. Данные: Artificial Analysis, 3 октября 2026 года. График: Технозаметки
Индекс Artificial Analysis и цена одной задачи индекса. Данные: Artificial Analysis, 3 октября 2026 года. График: Технозаметки

Самая дорогая задача — у Sonnet 5.5: $7,67 на максимальном уровне. У Fable 5.1 — $7,63, у Opus 5.5 — $5,98. При этом за токен Sonnet вдвое дешевле Opus и впятеро дешевле Fable. Причина в многословии Sonnet 5.5: 420 млн выходных токенов на прогон против медианы класса 81 млн. У Opus 5.5 — 260 млн, у Fable — 190 млн.

GPT-6 Astra при дорогом токене даёт $3,26 за задачу, вдвое дешевле Opus. GPT-6.1 Sol: 67 млн токенов на прогон, 52 балла индекса, 72 цента за задачу — лучшее соотношение качества и цены среди моделей выше 50 баллов. Grok 4.7 по прейскуранту в пять раз дешевле Astra, но задача стоит $3,74: 81 тысяча выходных токенов на задачу против 36 тысяч у Grok 4.6.

Снизу по цене: GPT-6 Luna — 38 баллов за 7 центов, DeepSeek V4.1 Flash — 39 баллов за 27 центов, DeepSeek V4 Pro — 36 баллов за 67 центов. Старшая DeepSeek дороже Flash при худшем результате, и после летнего подорожания она не очевидный выбор по цене. Вывод простой: модель выбирают по цене решённой задачи, а не по прейскуранту — при одинаковой цене за токен счёт может разойтись вдвое.

Шаг 3. Сверить индекс с отраслевыми тестами

Сводный индекс Artificial Analysis на 3 октября, лучшие результаты: Claude Opus 5.5 — 58 баллов, первое место из 224 моделей; Claude Sonnet 5.5 — 56; Claude Fable 5.1 — 53; GPT-6 Astra — 53; GPT-6.1 Sol — 52; Grok 4.7 — 46; DeepSeek V4.1 Flash — 39; GPT-6 Luna — 38; DeepSeek V4 Pro — 36. Пять первых мест делят две американские компании, разрыв между ними шесть баллов. Это меньше, чем разница между ступенями low и medium у одной модели: наверху плотная группа, и настройка решает не меньше, чем поставщик.

Terminal-Bench 4.0 проверяет агентов в терминале: Sonnet 5.5 — 70,6 %, Opus 5.5 — 66,4 %, GPT-6 Astra — 57,9 %, Fable 5.1 — 55,8 %, Grok 4.7 — 37,6 %, Grok 4.6 — 20,3 %. У GPT-6.1 Sol, Luna и DeepSeek результат не опубликован. OSWorld: Opus 5.5 — 81,8 %, Sonnet 5.5 — 80,1 %. В AutomationBench по данным OpenAI GPT-6.1 Sol обходит Opus 5.5 на 2,2 пункта. В научной версии Terminal-Bench лидирует Astra, в Harvey — Grok 4.7 с 19,6 % против 6,7 % у Fable 5.1.

У каждой модели своя ниша, и выводы источников совпадают: длинные агентные задачи в программировании — за Claude, лучшее соотношение качества и цены — у GPT-6.1 Sol, Grok 4.7 вырос, но до флагманов не дотягивает. DeepSeek — лучший среди открытых моделей, но независимые замеры DeepSeek ниже собственных отчётов компании.

Итог

Считать цену задачи по расходу токенов, а не по прейскуранту, проверять уровень рассуждения при любом сравнении и сверяться с первоисточниками — эти три правила снимают большую часть расхождений между публикациями. Ограничения метода тоже понятны: сводный индекс усредняет нишевые модели, прямые сравнения опираются на выборку в одно-два задания, а по части моделей независимых замеров на нужном уровне рассуждения просто нет, и результат остаётся неопубликованным.

В полной версии разобраны скорость печати и время до первого слова, быстрые режимы, длина ответа на больших документах, а также работа из России и проверка моделей на собственных задачах.

Комментарии (2)


  1. Chemist_modeler
    03.10.2026 02:37

    Прошу прощения за детский вопрос: а как учитывать стоимость ручной работы белкового тела после получения ответа нейронки? Баллы - вещь... мм... относительная. Как сравнить реальную стоимость работы?


  1. ProfDonda
    03.10.2026 02:37

    Простите, а это вообще расчёты для кого? Для жителей США и Канады? Для ситизенов Западной Европы? Если для граждан Российской Федерации, то как учтена стоимость платежа долларами и стоимость доступа к этим моделям? Объясните новичку, если не трудно.