Исследовательская группа Epoch AI обновила лидерборд бенчмарка MirrorCode, добавив результаты новых флагманов Anthropic и OpenAI. Claude Fable 5 решил 64% задач, GPT-5.6 Sol — 20%. Разрыв втрое выглядит аномалией: на многих других тестах эти модели идут почти вровень, а кое-где Sol и вовсе впереди. Официального объяснения нет ни у Epoch, ни у Anthropic, но его можно восстановить по данным самого лидерборда.

MirrorCode — это бенчмарк, который Epoch AI разработала вместе с лабораторией METR. Идея такая: модель должна переписать целую программу с нуля, не видя ее исходного кода. Ей дают "черный ящик" — исполняемый файл, который можно только запускать, — документацию и видимую часть тестов. Программы настоящие и нетривиальные: потоковый редактор sed, линтер Ruff, утилиты биоинформатики, интерпретаторы языков, криптографические библиотеки, сжатие данных. Масштаб тоже настоящий: один из самых больших прогонов длился 19 дней автономной работы модели и стоил 2600 долларов.

Правила зачета жесткие. Решением считается только реализация, которая проходит 100% тестов — включая скрытые, которых модель не видит во время работы. Так авторы отсекают жульничество: подогнать вывод программы под известные тесты или собрать таблицу готовых ответов не получится, а интернет в песочнице отключен. В конфигурации лидерборда 15 программ среднего и большого размера, каждую нужно реализовать на двух языках, на попытку дается бюджет в 10 млрд токенов и 7 дней. Каждая задача прогоняется трижды.

Откуда же разрыв втрое? Подсказка — в тепловой карте результатов по отдельным задачам, которую Epoch публикует вместе с лидербордом. Она интереснее итоговой цифры.

Оказывается, GPT-5.6 Sol многие задачи бенчмарка решать умеет — но лишь иногда. В его строке преобладают 50%, 33% и 17% успешных попыток. У Claude Fable 5 те же задачи закрыты почти всегда: подряд идут 100 и 83. Разрыв возник не между "умеет" и "не умеет", а между "иногда доводит до конца" и "доводит почти всегда". Когда одна попытка — это дни работы, тысячи шагов и сотни или тысячи тестов, единственный проваленный крайний случай обнуляет результат целиком. На такой дистанции решает надежность, а не разовая вспышка гениальности.

Вторая улика — язык Ada. По правилам лидерборда половину реализаций модели обязаны писать на этом редком языке, который в 2026 году живет в основном в авионике и военных системах. Fable на нем почти не проседает: 64% на Go против 61% на Ada, разница всего три процентных пункта. У моделей OpenAI потери куда серьезнее: Sol лишается пятой части своего результата (с 24% до 19%), GPT-5.4 — почти половины (с 21% до 12%), а GPT-5.5 падает более чем втрое (с 17% до 5%).

Это важно вот почему. Главная претензия к MirrorCode — загрязнение обучающих данных, или контаминация. Программы в бенчмарке с открытым исходным кодом, и модели почти наверняка видели их во время обучения, что могло завысить результаты. Но реализаций этих программ на Ada в природе практически нет — вспоминать нечего, код приходится писать заново. Значит, устойчивость Fable на Ada говорит скорее о навыке, чем о натренированной памяти.

Полностью снять скепсис это, впрочем, не может. Собственная проверка Epoch на запоминание нашла его признаки у 17 из 25 целевых программ. Авторы подчеркивают, что результаты к памяти не сводятся — модели решали и незапомненные программы, а запомненные sed и Ruff проваливали, — но признают, что вклад запоминания исключить нельзя. Второе ограничение авторы называют сами: MirrorCode проверяет работу по идеально точной спецификации, где эталонная программа и тесты однозначно задают, что должно получиться. Так разработка в реальности почти никогда не выглядит, и результаты не доказывают, что ИИ потянет произвольный софтверный проект.

P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.

Комментарии (7)


  1. alexandr93
    03.08.2026 19:59

    А вот какой юридический статус вот у этого всего. Допустим, какой-нибудь майкрософт возьмёт и перепишет ffmpeg и выставит под своей лицензией. И формально это нечестно, потому что за основу были взяты результаты тестов, которые разработаны под лиценией GNU.

    А ещё, допустим, исходники от майков окажутся в открытом доступе и кто-нибудь форкнет и вернёт под GNU... Кто будет прав тогда?


    1. moooV
      03.08.2026 19:59

      У меня коллега один переписывает клодом некоторые нужные ему в его проприетари библиотеки с гпл вирусни на мит/бсд, выкладывает на тот же гитхаб как новые либы под другим именем (не как форк).

      В ридми, конечно, пишет что это такая-то освобожденная от гнёта гнурака либа.

      Пока что вопросов ни от кого к нему не было, люди пишут спасибо говорят.

      Пока токены субсидируются (подписка за 200$ эквивалент 50к$ в апи ценнике) - то почему бы и нет, полезное дело делает, всячески одобряю.


      1. vazir
        03.08.2026 19:59

        Никто никого не субсидирует. В подписке всего лишь маржа раз 100 меньше в пересчете на один токен, (и то не факт), но все еще очень выгодная. Это многоступенчатая бизнес модель и всего то. Это просто говорит о том что АПИ это вообще золотое дно. Подписка дает возможность балансировать нагрузку, снижать скорость отдачи токенов, изменять лимиты, экспериментировать над юзерами как вздумается. Но думать что подписка это субсидия, или что она им не выгодна, это хм, не для хабра выражение.


  1. TkachenkoD
    03.08.2026 19:59

    Замечал, что Opus 4.8-5 в разы лучше Gpt 5.5-5.6 пишет именно с нуля (с референсами соседних проектов). По готовой базе +- одинаково решаются задачи. Gpt вроде и читает соседние проекты, но часто не берёт их во внимание и пишет отсебятину.


  1. FriedDumplings
    03.08.2026 19:59

    Вот и наглядная иллюстрация вредительской природы всех этих ИИ - наглое воровство и плагиат. Люди по многу часов корпели над каким-то проектом, выложили его в открытый доступ под свободной лицензией, а какой-то Васян прогнал код этого проекта через очередной кодинг агент и на основе идей, заложенных в этом проекте сделал “свой” аналог этой проги, но под другой лицензией.

    Люди боялись, что все эти Microslop, Google и прочие корпорации зла уничтожат свободное ПО, и их опасения оказались совсем не напрасны. Правда вместо предполагаемых способов уничтожения такого ПО они создали нейросети - гениальное решение проблемы.


    1. moooV
      03.08.2026 19:59

      выложили его в открытый доступ под свободной лицензией

      Не под свободной, а под "свободной". Хочешь использовать в коммерческом софте - исходники, видите ли, надо раскрывать. Они там с дуба рухнули, что ли? Почему оно какие-то ограничения накладывает? Это нихера не свобода.

      Выкладывают же переписанные аналоги под по-настоящему свободными лицензиями без всяких левых условий, использовать может кто угодно в чем угодно. Которые, лол, часто ещё и работают лучше.

      вредительской природы всех этих ИИ

      А чем отличается если бы васян или команда программистов на зарплате ручками переписала с гнурака на свободное и выложила?

      Заметь, весь код доступен - только в отличие от гпльной вирусни этот РЕАЛЬНО свободный.


      1. FriedDumplings
        03.08.2026 19:59

        Не под свободной, а под “свободной”. Хочешь использовать в коммерческом софте - исходники, видите ли, надо раскрывать. Они там с дуба рухнули, что ли?

        Вполне обычный и правильный способ защиты ПО от Васянов из Microslop и прочих корпораций зла.

        А чем отличается если бы васян или команда программистов ручками переписала с гнурака на свободное и выложила?

        Тем, что команда Васянов навряд-ли этим будет заниматься в случае какой-то большой софтины. Это как марафон переписываний софта с C на Rust - как правило получаются кастрированные уродцы с кучей проблем (см. историю с uutils, а точнее с попытками включения этого софта в Ubuntu, история весьма показательна).

        не под свободной, а под “свободной”

        Свободное ПО - это то ПО, которое:

        1. Доступно для запуска для любых целей.

        2. Имеет исходный код, доступный для получения и изучения.

        3. Доступно для дальнейшего распространения.

        4. Исходный код можно править и распространять изменённые копии.

        Про использование такого ПО в составе несвободного ПО не сказано ничего. Ясное дело, что нельзя, я бы не захотел видеть куски своей интеллектуальной собственности в кривом проприетарном поделии. Ну и ясно, что это не делает такое ПО (под GPL, к примеру) несвободным; свобода != вседозволенность.

        Если использование свободных компонентов в несвободном софте прям так нужно, то есть более “пермиссивные” лицензии вроде той же LGPL, под которой тоже куча всякого софта распространяется, которое и можно использовать для таких целей.