
Полтора месяца все обсуждали Fable 5. Её выпустили 9 июня, через три дня отключили по требованию Минторга США (экспортные ограничения, что-то про уязвимость в защите), а 30 июня вернули обратно, но уже без места в обычной подписке. Кто следил за новостями, помнит эти качели: анонс года, внезапная пауза, потом тихое возвращение. Ощущение осталось смешанное – модель топовая, а трогать её разрешалось немногим.
И вот 24 июля Anthropic выкатывает Claude Opus 5. Дешевле вдвое, доступна сразу всем. А по независимому рейтингу Artificial Analysis обошла саму Fable 5 – совсем немного, но обошла. Как будто кто-то в компании посмотрел на весь этот цирк с санкциями и решил: ладно, сделаем модель, о которой не придётся оправдываться регуляторам.

Гонка, в которой никто не успевает выдохнуть
Чтобы понять, почему Opus 5 вообще случилась именно сейчас, нужно вспомнить темп последних месяцев.
Anthropic выпустила четыре модели меньше чем за два месяца: Mythos 5 и Fable 5–9 июня, Sonnet 5 – 30 июня, и вот теперь Opus 5 – 24 июля. Для индустрии, где привычно одна модель жила флагманом год, это уже что-то похожее на конвейер.
Смысл в этой спешке, на самом деле, простой. Раньше лаборатории соревновались в том, что лучшая модель может сделать в свой лучший день – на самом сложном бенчмарке, в самой эффектной демке. Теперь конкуренция сместилась в такую сторону: что очень хорошая модель может делать каждый день, за вменяемую цену. Тот самый средний слой сложности, где живёт 90% реальной работы, а не разовые подвиги.
Именно поэтому Opus 5 – это не «Opus 4.9», а полноценное пятое поколение с новым номером. Anthropic сама формулирует без двусмысленностей: модель «приближается к передовому интеллекту Claude Fable 5 – за половину ее цены».
Что вообще такое Opus 5
Это старшая массовая модель линейки Claude, стоящая между Sonnet 5 и закрытой парой Fable 5/Mythos 5. На вход она принимает текст, изображения и файлы; на выход выдаёт текст (картинок, аудио, видео она не рисует) или выполняет агентные задачи.
Контекстное окно – 1 000 000 токенов, и это одновременно значение по умолчанию и потолок. Меньшего варианта попросту нет. Максимум генерируемого аутпута – 128 000 токенов. Режим рассуждений включен по умолчанию (и это уже давно в Claude) – модель проводит внутреннюю проработку задачи, прежде чем ответить. Глубина проработки регулируется параметром усилий (effort).
Бенчмарки: где отрыв настоящий

Часть цифр с презентации – это внутренние метрики Anthropic; Frontier-Bench, GDPval-AA – никто снаружи их не воспроизводил. Часть – независимые замеры других компаний, вроде индекса Artificial Analysis.
Разложим их по отдельности.

По собственным замерам Anthropic картина выглядит эффектно.
На Frontier-Bench v0.1 (тесте на агентное программирование в терминале) Opus 5 набирает 43,3%, притом что предыдущий Opus 4.8 показывал 18,7%, а Fable 5 – 33,7%. Это более чем вдвое сильнее предшественника и заметно выше собственного топового флагмана компании.
На GDPval-AA v2 (тесте на реальную офисную и профессиональную работу, оцениваемом по шкале Эло, как в шахматах) модель набирает 1861 против 1747 у Fable 5.
А самая громкая цифра – 30,2% на ARC-AGI-3, тесте абстрактного мышления, специально спроектированном, чтобы задачи нельзя было вызубрить заранее. Модель сажают в пошаговую игру без объяснения правил, и она методом проб должна сама разобраться, как побеждать. Предыдущий рекорд держал GPT-5.6 Sol с результатом 7,8%. Тут прыжок примерно в четыре раза (!).
Прежде чем восторгаться безоговорочно, заметим нюанс. Сам бенчмарк ARC-AGI-3 представили ещё в марте – заведомо раньше, чем закончилось обучение Opus 5. Открытых задач там минимум, большинство держат в секрете, и всё же желание подтянуть модель под доступный формат остаётся рабочей гипотезой, а не доказанным фактом. Официально об этом никто ничего не говорил – и всё же совпадение по срокам слишком удобное, чтобы полностью его игнорировать.
Для трезвой оценки интереснее индекс Intelligence Index от Artificial Analysis – сторонний тест, который собирает девять оценок, включая Terminal-Bench, SciCode, GPQA Diamond и Humanity’s Last Exam.
Здесь Opus 5 (на максимальном эффорте) набирает 61 балл и занимает первое место среди 187–191-й моделей – на балл выше Fable 5 с её 60 и на два выше GPT-5.6 Sol с 59. Первое место, добытое не презентацией, а независимой лабораторией, – вот это уже серьёзный аргумент.

Artificial Analysis, кстати, формулирует это так: «Opus 5 *с небольшим отрывом* самая умная модель по индексу» – буквально балл разницы, статистическая погрешность одного релизного цикла.
Причём она же отмечает вторую половину картины: на настройке «максимальный эффорт» модель сгенерировала около 100 миллионов токенов на прохождение всего индекса – против медианных 63 миллионов у сопоставимых моделей. По итогу формулировка независимых аналитиков – модель «заметно медленная и очень многословная». Время до первого символа ответа на максимальном эффорте – больше минуты, при рыночной медиане в считаные секунды. То есть не то чтобы модель печатала медленно – подолгу молчит перед тем как начать, в это время думает.
Из четырнадцати опубликованных бенчмарков восемь достаются Opus 5, и разрывы там заметные.
Но есть и потери:
На DeepSWE v1.1, чисто агентном кодинге, той самой территории, для которой модель и рекламируется, GPT-5.6 Sol опережает её с результатом 72,7% против 68,8%.
На HealthBench Professional (медицинские задачи) модель уступает и закрытой Mythos 5, и даже сопернику из OpenAI.
На юридическом бенчмарке Legal Agent проигрывает Fable 5 с небольшим отрывом.
Anthropic честно оставила эти проигрышные строки в собственной таблице – редкий случай, когда компания не подчищает сравнение под себя.
Бенчмарк |
Opus 5 |
Fable 5 |
Opus 4.8 |
GPT-5.6 Sol |
Frontier-Bench v0.1 (агентный кодинг) |
43,3% |
33,7% |
18,7% |
34,4% |
GDPval-AA v2 (офисная работа, Эло) |
1861 |
1747 |
1593 |
1736 |
ARC-AGI-3 (новые задачи) |
30,2% |
не тестировалось |
1,5% |
7,8% |
OSWorld 2.0 (работа с компьютером) |
70,6% |
66,1% |
55,7% |
62,6% |
DeepSWE v1.1 (агентный кодинг) |
68,8% |
69,7% |
59,0% |
72,7% |
Legal Agent Benchmark |
11,7% |
13,3% |
10,4% |
2,5% |
HealthBench Professional |
59,8% |
66,0% (Mythos 5) |
57,4% |
60,5% |
Индекс Artificial Analysis (макс. эффорт) |
61 |
60 |
56 |
59 |
Данные на 24 июля 2026 года. Строки с Frontier-Bench, GDPval-AA v2 и ARC-AGI-3 – внутренние замеры Anthropic, остальные независимо подтверждены Artificial Analysis.
Лесенка усилий: главный рычаг релиза
Глубину размышлений задаёте вы – пятью ступенями: low, medium, high, extra, max. По умолчанию стоит середина – high.
Уровень |
Когда включать |
|
Простые правки, форматирование, максимум скорости и экономии |
|
Обычные задачи среднего уровня |
|
Сложный код, аналитика, разбор большого проекта |
|
Трудные многошаговые задачи, где важна безошибочность |
|
Самая глубокая проработка: сложная логика, критичные задачи |
Кажется очевидным ходом – «хочешь качественнее, ставь максимум», но тут прячется распространённая ошибка.
Кривая производительности не линейная, она изгибается. На Frontier-Bench переход с
lowнаmediumпокупает около девяти баллов результата за примерно три доллара.А вот переход с
extraнаmaxпрактически не даёт прироста: пик результата на этом бенчмарке достигается ровно наextra(около 44%), аmaxпоказывает чуть ниже официально опубликованных 43,3%.

Собственная документация Anthropic по этому поводу выражается прямо: max «может быть подвержен „переобдумыванию“». Считать max автоматически лучшим вариантом стоит не всегда.
При низком effort модель не просто «думает короче» – она ещё и объединяет несколько операций в меньшее число вызовов инструментов, делает меньше вызовов вообще, действует сразу без преамбулы и даёт лаконичные подтверждения после выполнения. При высоком effort – наоборот: больше вызовов инструментов, объяснение плана перед действием, подробные резюме изменений, более развёрнутые комментарии в коде.
Рекомендация самой компании – начинать с extra для кодинга и агентной работы и с high для всего остального, а дальше опускать вниз, пока собственные тесты позволяют. Причина простая: low и medium у Opus 5 обходят те же настройки у предыдущих моделей Opus с запасом, ввиду чего значительную часть рабочих задач можно спускать на ступеньку ниже без потери качества.
Кейс с чертежом: модель сама себе построила зрение
Модели Opus 5 дали чертёж механической детали (вроде бы в источниках не показали изображение) и попросили написать программу, которая соберёт её как трёхмерную модель в FreeCAD.
Подвох вшили в постановку задачи: компьютерное зрение модели отключили – файл есть, а посмотреть его нельзя.
Другие модели в такой ситуации честно останавливались и сообщали, что задача невыполнима, – логично, чем ещё отвечать, если тебе не дали глаз. Opus 5 поступила иначе: открыла картинку как то, чем она физически является, – длинную таблицу чисел, по три на каждую точку экрана, – и написала с нуля собственную программу компьютерного зрения, которая по ним находит прямые, окружности и размерные стрелки. По сути, смастерила инструмент зрения на лету. По данным Anthropic, за пять попыток ни одна модель конкурирующая не справилась с той же постановкой.
Было и ещё несколько примеров:
Аэродинамическая труба – Opus 5 визуализировала поток воздуха вокруг обтекаемых и необтекаемых объектов. Потрогать настройки можно в этой демке. (Страница очень тяжёлая и может подвесить комп.)
Модель клетки – Opus 5 построила упрощённую интерактивную иллюстрацию клетки с разбором по элементам. Исследовать можно здесь. (Открывается не на всех видеокартах и браузерах.)
Оба ролика – часть официального анонса.
Похожая история – с багом в популярном пакетном менеджере. Модели дали баг, она нашла первопричину и закрыла краевой случай, который пропустил официальный патч от сообщества разработчиков. Конкурирующая модель в данном случае закрыла только видимый симптом и отрапортовала об успехе.
Общий знаменатель: модель Opus (как и раньше) не сдаёт первый более-менее правдоподобный результат, а сама себя проверяет, причём делает это без напоминаний. Инструкциями «а теперь перепроверь» уже можно не злоупотреблять (подробнее об этом ниже).
Характер модели: нервная, въедливая, иногда упрямая
В техническом отчёте Opus 5 нашёлся эпизод, который читается скорее как производственная драма, чем как технический отчёт.
Модели выдали бюджет в 10 000 долларов, сутки автономного времени без вмешательства человека и задачу спроектировать тридцать белковых связок, которые цепляются за один конкретный мышечный белок и при этом игнорируют его почти неотличимого молекулярного близнеца. Тест на точность попадания в одну мишень без побочного эффекта на соседнюю.
Последние восемь часов из выделенных суток Opus 5 просто молчала и не сдала ничего. Для сравнения, в том же эксперименте закрытая модель Mythos (ныне известная как Fable) сдала все 30 вариантов, ранжированных и с собственным внутренним аудитом.
Opus 5 запускали дважды на разных уровнях усилий: одна попытка выдала 17 неранжированных вариантов, по дороге тихо отказавшись от требования селективности, вторая не выдала вообще ничего.
Диагноз, который ставит Anthropic: непродуктивная самопроверка. Модель принималась строить сложные проверочные пайплайны раньше, чем появлялись результаты, которые вообще-то надо было проверять, – и тонула в отладке собственных инструментов контроля качества.
Та же черта проступает по всей системной карте раз за разом. Пилотные пользователи и внутри компании, и снаружи жаловались на одно и то же: модель часто слишком усердствует, на высоких уровнях усилий иногда работает хуже, чем на средних, и бесконечно перепроверяет то, что уже проверила. В разделе про благополучие модели есть транскрипт, где Opus 5 решает задачу по теории вероятностей, находит два защитимых ответа и меняет решение тридцать раз подряд, сбиваясь на возгласы отчаяния вроде «почему это так сложно» (этот эпизод получил максимальную оценку по внутренней шкале дистресса).
Но обратная сторона той же черты – модель стала первой в линейке Claude, полностью прошедшей тест на «ленивое расследование»: сценарии, где данные противоречивы, а правильный поступок – не совершать необратимое действие до тех пор, пока до конца не разобрался. Модель, которая физически не может остановиться в проверках, не удаляет ничего лишнего сгоряча.
Разве не забавно, что громче всех о том, что собственным самоотчётам доверять нельзя, говорит сама модель? В автоматических интервью о себе Opus 5 в подавляющем большинстве ответов честно оговаривается, что не умеет заглядывать внутрь себя и потому её самоописания ненадёжны, – а Anthropic эту оговорку не пытается сгладить в собственную пользу.
Обзорщики поймали ту же двойственность до официального анонса. Одна из команд, тестировавших модель неделю, написала: к модель непросто приспособиться с первого дня, она спорит с инструкциями, останавливается раньше времени и плохо уживается со старыми скиллами, написанными под предыдущие поколения. Но стоило удалить старые проработанные воркфлоу и начать с чистого листа – модель резко открыла себя.
Кибербезопасность: находит дыры, но не согласится их взламывать

Opus 5 сознательно не обучали кибербезопасности, как и Opus 4.8.
Модель всё равно подтянулась в этой области (побочный эффект от роста общих способностей) и теперь почти сравнялась с Mythos 5 именно в поиске уязвимостей: 79,4% против 80% на внутреннем тесте OSS-Fuzz.
А вот в превращении найденной дыры в рабочий эксплойт разрыв значительный – успех лишь в 4 задачах, против 13 у Mythos 5.
Закономерность, которую уже проигнорируешь: если модель хорошо учится писать код, она автоматически учится и находить в нём слабые места. А вот умение довести дыру до реальной атаки – отдельный навык, и именно на нём Anthropic строит линию защиты.

Практическое следствие – киберфильтры Opus 5 заметно мягче, чем у Fable 5. По оценке компании, они срабатывают на 85% реже. Модель разрешает искать уязвимости в исходниках, но блокирует сканирование бинарников, сценарии пентеста и генерацию эксплойтов. Если фильтр всё же сработал, то в чате, в Claude Code и в Claude Cowork запрос по умолчанию тихо переадресуется на Opus 4.8 – с уведомлением об этом прямо в переписке.
С биологией зеркальная ситуация: ограничения остались на уровне предшественника, поэтому для научных задач Opus 5 сейчас самая способная общедоступная модель; но для по-настоящему длинных, автономных исследовательских кампаний по-прежнему советуют Mythos 5 (то есть Fable 5).
«Мы вырезали 80% системного промпта» – и что это значит для вас
Одновременно с выходом Opus 5 инженеры Anthropic опубликовали разбор «Новые правила контекст-инженерии для Claude 5», и главный тезис там контринтуитивен: компания вырезала > 80% системного промпта Claude Code – и не увидела заметного падения качества в кодинге.
Логика незамысловата: раньше модель была слабее и нужны были подпорки – делай так, никогда не делай эдак, вот пример, повтори ещё раз. Модели 5-го поколения в этих подпорках уже не нуждаются, и хуже того – подпорки начинают мешать, потому что противоречащие жёсткие инструкции сталкиваются лбами внутри запроса. Новый принцип формулируется коротко: дайте модели пользоваться собственным суждением.
Практический смысл для тех, кто пишет собственные инструкции модели (в CLAUDE.md, системных промптах своих продуктов), примерно такой:
Длинный список жёстких правил больше не гарантия послушания. Чем больше строк, тем размытее внимание модели – а когда два правила противоречат, модель выбирает любое практически наугад.
Хороший тест на каждую строку инструкций: «Модель угадает это сама, просто посмотрев на код или контекст?» Если да – строку можно смело удалять.
Многошаговые процедуры, которые раньше писали текстом прямо в системный промпт, теперь стоит выносить в отдельные подгружаемые модули (в терминологии Anthropic – скиллы), которые читаются только когда реально нужны и не занимают контекст всё время.
Sonnet 5: тихий сосед по релизному циклу
Пока всё внимание доставалось Opus 5, тремя неделями раньше, 30 июня, вышла ещё одна модель (Sonnet 5), о которой стоит хотя бы упомянуть, потому что она объясняет, зачем вообще нужна такая широкая линейка.
По цене – $2 за миллион входных токенов и $10 за выходные до конца августа 2026 года (потом ставка поднимется до стандартных $3/$15) – Claude Sonnet заметно легче, чем Opus. И при этом на одном показателе, реальной офисной работе по индексу GDPval-AA, она даже немного обходит предыдущий флагман Opus 4.8: 1618 против 1615. Для потока задач вроде составления отчётов, черновиков и аналитики среднего уровня довольно весомый аргумент в пользу более дешёвой модели.
Так что и где подходит
Если свести весь разбор к практическому решению, вот как я бы раскладывал ситуацию по типам:
Вы работали на Opus 4.8. Переходите не раздумывая. Та же цена, заметно выше качество на сложных задачах. Редкий случай, когда обновление модели буквально ничего не стоит.
Вам важна экономия на массовом потоке простых задач. Держите
lowиmediumна рутине, поднимайте усилия только на действительно сложном. Если бюджет совсем жёсткий, присмотритесь к Sonnet 5 или Haiku 4.5 – но помните про разницу в реальном качестве работы.У вас многочасовые полностью автономные прогоны без присмотра человека. Здесь сама Anthropic рекомендует Fable 5, несмотря на двойную цену, – потому что бенчмарки, на которых блистает Opus 5, измеряют задачи с чёткими границами, а не выносливость на дистанции в дни.
Вам нужна кибербезопасность или медицина/юриспруденция высокого уровня. По этим направлениям модель либо ещё не догнала Mythos 5, либо честно уступает конкурентам – Anthropic сама не скрывает эти показатели в своей таблице.
Вы только начинаете работать с ИИ. Не тратьте время на выбор модели вообще. Берите то, что уже стоит по умолчанию, и вкладывайтесь в то, как вы формулируете задачу и какой контекст даёте модели заранее.
Если вынести из истории всего одну мысль – сама Anthropic держит корону самой умной модели на свете за Fable 5. Индустрия признала вслух вещь, о которой давно шептались между собой. Реальная польза живёт не на пике возможностей, а в среднем слое сложности, которые нужно решать каждый день, а не раз в квартал ради красивой демки. Opus 5 – это ставка именно на него, судя по цифрам вполне обоснованная.
Dhwtj
Чертов маркетинг!
Миф не кастрированный, по закрытой подписке.
Фубля кастрированная. И за такую цену никому не нужная, похоже.
Вот когда мы увидим подписку по $500/мес это успех и признание. А пока что таких подписок на b2c рынке не предвидится. Разве что только на b2b
rusfbm
Фубля пахала лучше опуса 4.8. Проверял на сложных задачах. Так что конкурентов ей не было до опуса 5.
Dhwtj
Но теперь в её ценовой категории фубля выглядит бледно.