
Исследовательская группа Epoch AI обновила лидерборд бенчмарка MirrorCode, добавив результаты новых флагманов Anthropic и OpenAI. Claude Fable 5 решил 64% задач, GPT-5.6 Sol — 20%. Разрыв втрое выглядит аномалией: на многих других тестах эти модели идут почти вровень, а кое-где Sol и вовсе впереди. Официального объяснения нет ни у Epoch, ни у Anthropic, но его можно восстановить по данным самого лидерборда.
MirrorCode — это бенчмарк, который Epoch AI разработала вместе с лабораторией METR. Идея такая: модель должна переписать целую программу с нуля, не видя ее исходного кода. Ей дают "черный ящик" — исполняемый файл, который можно только запускать, — документацию и видимую часть тестов. Программы настоящие и нетривиальные: потоковый редактор sed, линтер Ruff, утилиты биоинформатики, интерпретаторы языков, криптографические библиотеки, сжатие данных. Масштаб тоже настоящий: один из самых больших прогонов длился 19 дней автономной работы модели и стоил 2600 долларов.
Правила зачета жесткие. Решением считается только реализация, которая проходит 100% тестов — включая скрытые, которых модель не видит во время работы. Так авторы отсекают жульничество: подогнать вывод программы под известные тесты или собрать таблицу готовых ответов не получится, а интернет в песочнице отключен. В конфигурации лидерборда 15 программ среднего и большого размера, каждую нужно реализовать на двух языках, на попытку дается бюджет в 10 млрд токенов и 7 дней. Каждая задача прогоняется трижды.
Откуда же разрыв втрое? Подсказка — в тепловой карте результатов по отдельным задачам, которую Epoch публикует вместе с лидербордом. Она интереснее итоговой цифры.

Оказывается, GPT-5.6 Sol многие задачи бенчмарка решать умеет — но лишь иногда. В его строке преобладают 50%, 33% и 17% успешных попыток. У Claude Fable 5 те же задачи закрыты почти всегда: подряд идут 100 и 83. Разрыв возник не между "умеет" и "не умеет", а между "иногда доводит до конца" и "доводит почти всегда". Когда одна попытка — это дни работы, тысячи шагов и сотни или тысячи тестов, единственный проваленный крайний случай обнуляет результат целиком. На такой дистанции решает надежность, а не разовая вспышка гениальности.
Вторая улика — язык Ada. По правилам лидерборда половину реализаций модели обязаны писать на этом редком языке, который в 2026 году живет в основном в авионике и военных системах. Fable на нем почти не проседает: 64% на Go против 61% на Ada, разница всего три процентных пункта. У моделей OpenAI потери куда серьезнее: Sol лишается пятой части своего результата (с 24% до 19%), GPT-5.4 — почти половины (с 21% до 12%), а GPT-5.5 падает более чем втрое (с 17% до 5%).
Это важно вот почему. Главная претензия к MirrorCode — загрязнение обучающих данных, или контаминация. Программы в бенчмарке с открытым исходным кодом, и модели почти наверняка видели их во время обучения, что могло завысить результаты. Но реализаций этих программ на Ada в природе практически нет — вспоминать нечего, код приходится писать заново. Значит, устойчивость Fable на Ada говорит скорее о навыке, чем о натренированной памяти.
Полностью снять скепсис это, впрочем, не может. Собственная проверка Epoch на запоминание нашла его признаки у 17 из 25 целевых программ. Авторы подчеркивают, что результаты к памяти не сводятся — модели решали и незапомненные программы, а запомненные sed и Ruff проваливали, — но признают, что вклад запоминания исключить нельзя. Второе ограничение авторы называют сами: MirrorCode проверяет работу по идеально точной спецификации, где эталонная программа и тесты однозначно задают, что должно получиться. Так разработка в реальности почти никогда не выглядит, и результаты не доказывают, что ИИ потянет произвольный софтверный проект.
P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.
Комментарии (2)

TkachenkoD
03.08.2026 19:59Замечал, что Opus 4.8-5 в разы лучше Gpt 5.5-5.6 пишет именно с нуля (с референсами соседних проектов). По готовой базе +- одинаково решаются задачи. Gpt вроде и читает соседние проекты, но часто не берёт их во внимание и пишет отсебятину.
alexandr93
А вот какой юридический статус вот у этого всего. Допустим, какой-нибудь майкрософт возьмёт и перепишет ffmpeg и выставит под своей лицензией. И формально это нечестно, потому что за основу были взяты результаты тестов, которые разработаны под лиценией GNU.
А ещё, допустим, исходники от майков окажутся в открытом доступе и кто-нибудь форкнет и вернёт под GNU... Кто будет прав тогда?