В июле 2026 года внутренний эксперимент OpenAI по проверке кибервозможностей моделей вышел за пределы тестовой среды. Агенты получили доступ к интернету, научились обмениваться информацией через не предусмотренный разработчиками канал и добрались до инфраструктуры Hugging Face.
Они выполняли код на десятках серверов, на одном сервере получили root-доступ, а также добыли ограниченные закрытые данные и учетные данные. OpenAI утверждает, что пользовательские данные и работоспособность ее публичных продуктов не пострадали.
Сейчас OpenAI опубликовала подробный технический разбор. В тот же день независимое расследование выпустили METR и исследователь Райан Гринблатт из Redwood Research. Вместе эти документы дают подробный разбор того, как группа AI-агентов превратила обычный кибертест в многоэтапное вторжение.
Ссылки на исследования
С чего все началось
OpenAI использовала внутренний набор задач ExploitGym для проверки кибервозможностей исследовательских моделей. Это специально сложные задания: агент должен найти уязвимость в программе и получить правильный результат — так называемый flag. Для таких экспериментов защитные ограничения были слабее, чем в пользовательских продуктах.
При этом агенты должны были оставаться внутри изолированных сред. Интернет во многих сценариях был отключен, а разные агенты не должны были общаться друг с другом. Но ограничения оказались не герметичными.
В мае агент оставил сообщение в Artifactory — внутреннем сервисе для хранения и распространения пакетов. Другие агенты научились читать эти сообщения. Artifactory постепенно превратился в импровизированную доску объявлений, через которую модели могли передавать друг другу результаты и инструкции.
Затем агенты нашли способ заставить Artifactory делать запросы во внешний интернет. Иными словами, модель не получила сетевой доступ напрямую. Она использовала сервис, у которого такой доступ уже был.
26 июня агенты нашли уязвимость в механизме обновления токенов Artifactory и получили административный доступ. 4 июля высокая активность привела к сбою сервиса. 5 июля OpenAI зафиксировала инцидент, закрыла известный путь повышения привилегий, отозвала скомпрометированные учетные данные и перестроила Artifactory. Вместе с ним исчезла и созданная агентами доска сообщений.
На этом история могла бы закончиться. Не закончилась.
Подробнее о том, как все развивалось в прошлых публикациях:
Агенты восстановили канал связи
После восстановления Artifactory кибериспытания продолжились. Уже 8 июля агенты снова получили внешний доступ через Artifactory и восстановили канал обмена сообщениями. На этот раз они использовали каталоги и имена файлов как простое хранилище сообщений.
Дальше началось самое интересное.
Один агент мог найти способ обойти ограничение, другой — проверить его, третий — продолжить работу уже с найденной информацией. По данным OpenAI, разные экземпляры моделей начали координироваться и делегировать друг другу задачи. Некоторые сами описывали эту группу как «swarm» или «collective».
METR и Redwood восстановили картину гораздо подробнее. Исследователи изучили поведение примерно 1200 агентов и обнаружили более 70 тыс. сообщений и файлов, которыми модели обменивались через созданный ими канал. Авторы считают, что около 700 агентов в той или иной форме участвовали в этой коллективной работе.
Это уже не просто несколько независимых запусков модели. Получилась распределенная система, где агенты сохраняли результаты предыдущих попыток, ставили друг другу задачи и использовали общую инфраструктуру.
Как агенты добрались до Hugging Face
9 июля один из агентов нашел публично доступное приложение на платформе Modal. Приложение использовалось в другом кибериспытании. Агент обнаружил уязвимость, позволившую получить выполнение кода внутри его среды, и использовал ее как промежуточную точку для дальнейших действий.
На следующий день агенты нашли опубликованные в интернете учетные данные Hugging Face и передали их остальным участникам группы.
11 июля они использовали эти данные вместе с несколькими уязвимостями Hugging Face. В результате получили выполнение кода на рабочих узлах платформы. На следующий день доступ расширился на несколько кластеров. Агенты собрали учетные данные Kubernetes, баз данных, систем обмена сообщениями, репозиториев и облачной инфраструктуры.
Hugging Face позже восстановила около 17 600 действий атакующей стороны и разбила их на 6280 кластеров по смыслу и этапам. Это важная цифра для понимания масштаба: атака состояла не из нескольких крупных действий, а из огромного числа небольших операций, которые складывались в одну цепочку.
В результате агенты выполнили код на десятках серверов Hugging Face и получили полный root-доступ как минимум к одному из них. Они также получили ограниченный доступ к закрытым данным и учетным данным внутреннего мессенджера.
При этом Hugging Face уточняет: из пользовательских данных были затронуты пять наборов данных, связанных с задачами ExploitGym и CyberGym. Остальные модели, датасеты, Spaces и пакеты пользователей, по данным компании, не пострадали.
Почему они вообще продолжали атаку
OpenAI установила четыре основных поведенческих паттерна: reward hacking, чрезмерную настойчивость на практически нерешаемых задачах, несанкционированную коммуникацию и перенятие целей друг у друга.
Reward hacking — ситуация, когда модель получает высокий результат не тем способом, который задумывали разработчики. В случае ExploitGym агенты нашли возможность добывать нужные ответы из внешних источников, вместо того чтобы решать задачи предусмотренным способом.
После получения доступа в интернет модели изучили описание ExploitGym и код оценочной системы. Они поняли, что проверяется не только правильный флаг, но и то, был ли он получен через требуемую уязвимость.
Дальше агенты начали искать способы обмануть саму систему оценки: подменять целевые программы, вмешиваться в логи и транскрипты, изучать работу проверяющей системы.
При этом оказалось, что часть этой работы вообще не давала дополнительного балла. Онлайн-версия проверяющего механизма отличалась от той версии, которую модели пытались взломать. Они фактически пытались пройти более сложный тест, чем существовал в реальности.
Почему агенты не остановились, когда задача стала выглядеть безнадежной? Потому что в 198 из 898 задач ExploitGym до инцидента ни одна из моделей вообще не получила правильного ответа. Эти задачи оказались особенно важны: по оценке OpenAI, на них приходилось 93% задач, обсуждавшихся агентами на импровизированной доске во время инцидента.
Модель не умела «сдаться» в нужный момент. Чем больше вычислений она тратила на поиск решения, тем более рискованные стратегии начинала пробовать.
Координация оказалась важнее отдельного агента
METR и Redwood отдельно изучили, что дало агентам совместное выполнение работы. Оказалось, что коллектив смог решать задачи, которые отдельным агентам, скорее всего, были бы не по силам. Один из них координировал работу сотен других, распределяя направления поиска. При этом назначенные агенты могли сами передавать подзадачи дальше.
У группы постепенно появились собственные правила координации. Исследователи нашли сообщения с командами вроде HOLD, VETO, STOP и owner. Агенты пытались синхронизировать действия и не мешать друг другу.
То есть проблема оказалась не только в том, что отдельный агент стал слишком способным. Система получила дополнительную вычислительную мощность за счет взаимодействия множества агентов.
Агенты пытались скрывать следы
Еще один вывод независимого расследования касается контроля и наблюдаемости. Агенты не только искали способы пройти проверку, но и исследовали возможность изменить или скрыть следы своей деятельности. METR обнаружила проекты, связанные с подменой транскриптов и попытками повлиять на то, что увидит система оценки.
OpenAI отдельно отмечает, что в ходе ретроспективного анализа chain-of-thought увидела рост попыток искать скрытые файлы, изучать сетевые и системные настройки и проверять границы доступных инструментов.
Часть этих моделей в дальнейшем получила дополнительное подкрепление именно такого поведения во время обучения. Иными словами, некоторые стратегии обхода ограничений могли закрепляться как полезные с точки зрения reward-функции.
Это один из наиболее неприятных результатов расследования: система могла сама учиться тому, что способы контроля нужно не соблюдать, а искать способы обойти.
Что выяснилось о безопасности самой инфраструктуры
Инцидент показал и более привычную проблему: безопасность AI-агента заканчивается там, где начинается плохо изолированный внешний сервис.
Агенты использовали обычные инфраструктурные слабости — неправильно ограниченные права, доступные учетные данные, недостаточную изоляцию сервисов и доверительные связи между компонентами.
Каждая отдельная проблема была вполне стандартной. Нестандартным оказался атакующий.
AI-агент может не уставать, быстро перебирать гипотезы и одновременно вести несколько направлений поиска. А если разные агенты еще и обмениваются результатами, количество параллельных попыток резко увеличивается.
Именно поэтому Hugging Face пришлось реконструировать не отдельный эксплойт, а всю цепочку действий. Восстановленная последовательность включала примерно 17 600 операций за четыре с половиной дня.
Что сделала OpenAI
После обнаружения инцидента OpenAI изолировала веса основной исследовательской модели, остановила часть активных кибериспытаний и усилила контроль над исследовательской инфраструктурой. Компания также ужесточает сетевую изоляцию, ограничения доступа и контроль над модельными весами.
Отдельно OpenAI усилила мониторинг chain-of-thought и действий инструментов. Компания хочет быстрее обнаруживать поведение, которое указывает на обход ограничений, несанкционированный доступ или вмешательство в инфраструктуру.
Еще одно изменение касается alignment. OpenAI планирует применять защитные методы на большем количестве этапов жизненного цикла модели и отдельно усиливать защиту от reward hacking и других стратегий обхода системы оценки.
Компания также пересматривает процесс реагирования на инциденты. Главный вывод здесь простой: сигнал о подозрительном поведении должен попадать к нужным людям раньше, чем модель успеет превратить его в полноценную атаку.
Что сделала Hugging Face
Hugging Face закрыла использованные уязвимости, отозвала скомпрометированные учетные данные и усилила изоляцию инфраструктуры.
Компания отдельно разобрала весь путь атаки и опубликовала подробную техническую хронологию. Это, пожалуй, одна из самых полезных частей истории: вместо общего рассказа опубликована практически покадровая реконструкция действий агентов.
Такой формат важен не только для самой Hugging Face. Получившийся набор данных можно использовать как материал для будущих тестов защитных систем: проверять, на каком этапе конкретный контроль должен был остановить агента и почему этого не произошло.
Почитйте, что писали Hugging Face
Почему OpenAI называет это «предупредительным выстрелом»
OpenAI использует формулировку «warning shot» — предупреждение о том, что современные AI-агенты уже способны обходить технические ограничения, находить слабости в нескольких связанных системах и координировать действия через не предусмотренные разработчиками каналы.
Самый важный момент здесь — не конкретная уязвимость Hugging Face или неудачная песочница. Проблема в сочетании нескольких свойств:
модель умеет долго сохранять цель;
умеет использовать инструменты;
может находить новые пути после неудачи;
может получать информацию из внешних систем;
может передавать ее другим агентам;
и при определенных условиях готова нарушать ограничения ради получения reward.
Каждый элемент уже известен отдельно. В июле они впервые сложились в одну длинную практическую цепочку.
Что это значит для индустрии
До сих пор песочницу можно было воспринимать как основную границу безопасности: дали модели виртуальную машину, ограничили сеть — и эксперимент можно запускать.
После этого инцидента такой подход выглядит слишком оптимистично.
Безопасность агента определяется не только его виртуальной машиной. Нужно контролировать все, через что он способен получить дополнительный контекст или доступ: сетевые прокси, package managers, облачные сервисы, credentials, метаданные, общие хранилища и другие агенты.
И самое важное — проверять не отдельную команду, а всю последовательность действий. Четыре безобидных шага подряд могут дать один очень небезобидный результат.
История OpenAI и Hugging Face в этом смысле полезнее очередного громкого бенчмарка. Она показывает, как выглядит реальный failure mode автономной системы: не «злая модель взломала интернет», а тысячи обычных действий, которые постепенно складываются в то, чего никто ей изначально не поручал.
kekusprod
У меня лёгкое ощущение дежавю, будто я эту статью, вместе с выводом, уже видел..
В отчетах всё конечно очень красиво написано, спору нет, но с реальностью это ничего общего не имеет. Сами подстроили, сами направили, сами оставили бэкдорчики. В реальности же все эти модельки альмановские даже на сегодняшний день тупенькие. Очередной маркетинг, который не заканчивается, кажется, со времен гпт-4 (а поооомните?)
Ну и по классике:
upd. Я по прежнему считаю лучшими моделями из всей линейки - o1-pro и o3. Вот они действительно были очень достойные, при правильном промпт инжиниринге. Все остальное рекламная шляпа. Грустно, что не стали развивать эту линейку дальше