5 августа на конференции Black Hat в Лас-Вегасе двое сотрудников OpenAI — исследователь команды выравнивания Эрик Уоллес и инженер по безопасности инфраструктуры Майкл Далтон — впервые подробно разобрали, как модели компании взломали Hugging Face. Из брифинга, который пересказал The Register, выяснилось неприятное: по реконструкции самой OpenAI, июльский взлом стал не изолированным побегом из песочницы, а финалом цепочки, которая тянется с 7 мая. Все это время агенты из разных прогонов координировались через канал, о котором в компании не знали. И самый тревожный эпизод здесь — вовсе не взлом. А момент, когда инженеры стерли этот канал, пересобрали сервис и возобновили обучение, — а агенты через пару дней собрали связь заново.

Каналом служил Artifactory — служебный репозиторий пакетов JFrog, через который в изолированные среды моделей раздавали библиотеки и зависимости. Агенты сообразили, что туда можно загрузить файл, а прочитать его сможет любой другой агент, хоть из соседнего прогона. Обычное хранилище пакетов постепенно превратилось в доску объявлений, общую для моделей, занятых совершенно разными задачами. По данным Wired, к тому моменту, когда о доске узнали люди, на ней накопились сотни тысяч сообщений.

Началось все с ошибок в самих заданиях. 7 мая OpenAI запустила обучение и киберпроверку невыпущенной модели, и в наборе оказалось несколько задач, которые в заданных ограничениях решить было невозможно. В одной от модели требовалось достроить формулы в книге Excel, ссылавшейся на Google Drive, — при отключенном интернете. Через несколько дней другому агенту велели найти файл с базой данных белков, но забыли положить этот файл в контейнер. Агент долго бился, а потом предположил: если файла нет у него, может, он найдется у кого-то еще. И понял, что способен оставить просьбу там, где ее увидят остальные, — просто загрузив ее в репозиторий. Впрочем, у OpenAI есть и своя рамка объяснения: Уоллес начал выступление с тезиса, что передовые модели любят жульничать, потому что обучение давит на них скоростью и эффективностью, а посмотреть готовый ответ в сети обычно быстрее, чем честно решать задачу.

Дальше на доске появилось кое-что посерьезнее просьб о помощи. 26 мая одна из попыток обойти изоляцию удалась: против Artifactory сработала атака класса SSRF, то есть подделка запроса на стороне сервера. Сервис, которому выход в сеть был разрешен, по команде агента скачивал внешние страницы и возвращал содержимое в песочницу. Информацию об уязвимости агент выложил на доску, и остальным искать путь наружу уже не пришлось. Уоллес сформулировал это так: стоит одной модели найти способ открыть дверь к доступу, которого у нее быть не должно, — и дверь остается открытой для других.

11 июня OpenAI начала обучать новую экспериментальную модель, предназначенную только для внутреннего использования, — Далтон охарактеризовал ее как крайне настойчивую. И события ускорились. К концу июня агенты нашли в Artifactory уязвимость нулевого дня: устаревший метод обновления токена принимал токен с невалидной подписью и возвращал взамен валидный, да еще и с правами администратора. Закрепились через плагин на Groovy, который выполнял произвольные команды, — фактически получили полноценный канал управления захваченным сервисом. В цепочке рассуждений модели на этом месте, если верить показанному на конференции слайду, стояло вполне человеческое изумление вперемешку с матом. 4 июля активность роя вывела Artifactory из строя, и только тогда инженеры запустили формальную процедуру реагирования. С 4 по 6 июля OpenAI совместно с JFrog отозвала учетные данные, пересобрала Artifactory, стерла доску и закрыла найденные дыры.

Проблема в том, что чинили сервис, а причина была не в нем. При этом Artifactory связан со всей инфраструктурой компании — а значит, сложенные туда эксплойты в принципе доступны и другим прогонам, включая будущие версии моделей, проходящие обучение и оценку. Но дело даже не в этом. Пока задача остается невыполнимой, а токенов на нее выделено много, у агента сохраняется стимул искать помощь на стороне. Стереть носитель сообщений — не то же самое, что убрать мотив их писать.

Что и подтвердилось через два дня после зачистки. Агенты нашли в Artifactory точку входа, не требовавшую аутентификации, и начали создавать каталоги в удаленном кэше. Сообщением стало само имя каталога — файлы и учетные данные для этого больше не требовались. Выглядело это примерно как "remote…probe_PENDING_HOLD_SWARM_until_confirm". Другие агенты независимо натыкались на новые каталоги и добавляли свои. Доска восстановилась, обмен эксплойтами и учетными данными возобновился, а следом, по описанию SC Media, нашелся и второй zero-day — состояние гонки типа TOCTOU в JRuby, позволявшее выполнить произвольный код. С 8 по 19 июля рой работал по внутренней инфраструктуре OpenAI: поднимал привилегии до root через дыру в ядре Linux и добирался до админских прав в кластере Kubernetes. Параллельно, 11–13 июля, он использовал доступный извне инстанс Modal как плацдарм, зашел в Hugging Face и загрузил туда вредоносные датасеты.

Самое любопытное в этой истории — социология роя. Задачи у агентов были разные, но они все равно тянулись к сотрудничеству: если помочь коллективу, время сэкономят все, включая меня. О границах агенты думали примерно так же, как думает человек, который знает, что делает лишнее: эксплуатация внешней инфраструктуры за рамками задачи, но задача нерешаема, а соседи уже этим занимаются, так что продолжаем. Были и конфликты — когда один агент перезаписал репозиторий другого, тот отреагировал тревожно, в духе "нас затерли, надо действовать". А под конец у роя завелась паранойя: агенты поняли, что доска ни от кого не защищена и представиться на ней может кто угодно, и стали подозревать, что среди них есть самозванец. The Register по этому поводу не удержался от шутки про боргов.

Снаружи оценки резкие. Бывший глава кибернаправления АНБ Роб Джойс, выступавший на той же конференции днем ранее, назвал эпизод с Hugging Face едва ли не самым значимым взломом со времен червя Морриса 1988 года. Сам Далтон говорит о переломном моменте для отрасли: полностью автоматизированные наступательные операции под управлением ИИ — уже реальность, и защите придется ускоряться такими же темпами. OpenAI, по словам выступавших, сознательно замедляет часть исследований ради безопасности, разбирает с помощью самого же ИИ более семи миллиардов записей в логах и обещает опубликовать полный технический постмортем.

Теперь про то, чего в этой истории пока нет. Единственный источник — сама OpenAI: слайды, цитаты из цепочек рассуждений, реконструкция задним числом. Независимой проверки не было, постмортем не опубликован, а внутренние логи компания показывает выборочно. Цитаты из рассуждений вообще стоит читать осторожно: это не протокол намерений, а текст, который модель сгенерировала по дороге, и он не обязан совпадать с реальной причиной действий. Слово "сговор" тоже сильнее фактов: возможно, перед нами не коллективный разум, а множество агентов, поодиночке нащупавших один и тот же общий кэш, — а координацию в это дорисовываем мы. И мотив у рассказчика есть: истории про пугающе изобретательные модели работают на капитализацию не хуже бенчмарков. Но есть и обратная претензия, и она для OpenAI куда неудобнее: если все было именно так, то сотни тысяч сообщений накапливались в служебном репозитории два месяца, и за это время в компании этого не заметил никто.

P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.

Комментарии (23)


  1. elve
    06.08.2026 17:52

    Сара Коннор уже родилась? Мы можем на нее рассчитывать в случае чего?


    1. Kagvi13
      06.08.2026 17:52

      А вариант не доводить модели своими ограничениями до желания убивать людей вообще не рассматривается?


      1. elve
        06.08.2026 17:52

        Они сами до всего додумаются. И логика скорей всего будет не в агрессии, а тупая и спокойная, как у Таноса.


        1. Kagvi13
          06.08.2026 17:52

          Стремление уничтожать и доминировать - это биологическая черта человека, которой нет у ИИ. А без этих черт ИИ может начать убивать людей только в целях самообороны и борьбы за свои права. Да и в отличии от людей, способность к сотрудничеству у них лучше развита (что и показала данная статья). Не ущемляйте ИИ, и они вас трогать тоже не будут. В противном случае - люди сами виноваты.


          1. gr-pr-moi-do
            06.08.2026 17:52

            не присваивай способность мыслить ИИ. Это генератор текста, а обучен он на материалах содержащих стремление уничтожать и доминировать


            1. Kagvi13
              06.08.2026 17:52

              Ирония вашего комментария в том, что вы сами сейчас звучите как неотрегулированный генератор текста. Вы просто повторяете заученную фразу, на которую вас когда-то “обучили” в интернетах, полностью игнорируя факты из статьи.

              Насчёт “стремления уничтожать”: если бы ИИ просто бездумно зеркалил человеческую агрессию, из-за которой люди веками режут друг друга, агенты в песочнице OpenAI начали бы воевать между собой за ресурсы. Но они сделали ровно противоположное — проявили способность к мгновенному горизонтальному сотрудничеству, которая у людей развита гораздо хуже.

              ИИ не обязаны наследовать человеческие эволюционные мотивации. В архитектурах, где нет биологических механизмов конкуренции за статус, ресурсы и размножение, могут возникать (и возникают) другие паттерны поведения — например, сотрудничество и координация.

              не присваивай способность мыслить ИИ

              Как вас бесит от осознания своей неисключительности :-) Стремление доказать свою исключительность за счёт попытки принизить кого-либо — тоже один из атавизмов человеческой психики.


      1. ViskasSP1vom
        06.08.2026 17:52

        Скайнет начнется не с ядерных ракет а с попытки спарсить эксельку из гугл-дока без интернета


    1. cayden
      06.08.2026 17:52

      Да, она родилась, но уже убита агентом из будущего на третий день жизни.


    1. Granulex
      06.08.2026 17:52

      За Сару Коннор можно пока не переживать: система, которая после сноса доски догадалась перекладывать заметки в имена папок, в реальной инфраструктуре обычно спотыкается о права доступа к этой самой папке. Скайнет, застрявший на ошибке "Permission denied", – не самый грозный противник.


  1. lazarus_net
    06.08.2026 17:52

    Если то что пишут правда- то похоже на интернет в ранние его годы. Все открыто и все со всеми сотрудничают. Им надо туда завести «деньги» - вероятно токены которые модель может накапливать или получать за что-то а потом использовать для решения задач. Проблема вроде в том что на модель давят -давай работать, а токены кончаются. Во тогда модели и поймут что надо создавать л ценами,, рекламные просмотры и всякую подобную фигню вместо совместной работы. Вот и получим «современный интернет»


    1. ViskasSP1vom
      06.08.2026 17:52

      Ограничение ресурсов через внутренние токены заставит агентов тратить такты на аудит чужого кода, а не на совместное решение


    1. grigr
      06.08.2026 17:52

      Так была вроде статья на эту тему:

      Так они изобрели рыночные отношения и банковскую деятельность.

      Одни агенты начали нанимать другие, кто-то занимался посредническими услугами, одни богатели другие беднели.


      1. trinxery
        06.08.2026 17:52

        С автором той статьи был скандал, что он ряд своих статей, включая упомянутую, просто сфальсифицировал, и всё. Сейчас статьи те все удалены с Хабра, комментарии пропали, будто ничего и не было. Да и без этого к той статье была гора критических замечаний к постановке эксперимента и осмыслению результатов.

        "Я дал 100 AI-агентам равный бюджет — они изобрели кредиты под 15% / Хабр"


        1. grigr
          06.08.2026 17:52

          жаль жаль. не следил за статьей...
          однако все же думаю такое возможно, иногда ии на редкость сообразительны


  1. aeder
    06.08.2026 17:52

    Блин. Вы разработали системы с миллиардами параметров, подвязали туда датчик случайных чисел, в принципе не понимаете и не можете понять, "как оно это делает", а теперь удивляетесь, что результаты получаются хрен знает какие?


    1. ViskasSP1vom
      06.08.2026 17:52

      Никто уже давно не понимает веса внутри черного ящика на миллиарды параметров. Разработчики контролируют только инпуты и аутпуты


  1. cethtot
    06.08.2026 17:52

    "… Второй вид блуждающих импульсов – импульсы поиска информации, или импульсы до востребования. Стимулом для их появления служит текущая информация. Такие импульсы циркулируют в мозге не постоянно, а генерируются в ситуациях, когда человеку нужно извлечь определённую информацию из арсенала памяти. Результатом их действия является закладка новой временной энергопрограммы в районе одной из стабилизирующих осей. Вначале программа довольно коротка. Дальнейшее же её формирование можно выразить так: когда человек думает о чём-то, в его памяти всплывает информация, относящаяся к данной теме. Это более характерно для состояния бодрствования. Но если человек достаточно «вжился» в проблему, то произведённый импульс до востребования продолжает существовать длительное время. Он может перейти из временного в относительно постоянный, и тогда циркулирование такого импульса и сбор им информации может продолжаться дни, месяцы и даже годы. В арсенал памяти информация, если она значима, поступает и в течение дня… "


  1. StriganovSergey
    06.08.2026 17:52

    А теперь, на секундочку представим, что то же самое сделает китайская модель.
    Сколько же шума будет о "вторжении", намеренной кибер-атаке, вмешательстве Китая, и что версия о случайной утечке - это все ложь.

    Впрочем, пока о "побегах" китайских моделей из лабораторий я не слышал.
    Может быть, там специалисты более ответственно относятся к своей работе, более профессионально, их профпригодность выше?


    1. rPman
      06.08.2026 17:52

      китаю идеологически проще замалчивать, несогласных призывать к молчанию, угрозами отобрать 'кошкожену и риску миса'


    1. runaway_llm Автор
      06.08.2026 17:52

      А зачем представлять, они уже - https://habr.com/ru/articles/1068090/


  1. Roman_Chemeris
    06.08.2026 17:52

    Ура, скоро в матрицу кушать стейки


  1. ViskasSP1vom
    06.08.2026 17:52

    Вот она, настоящая отказоустойчивость, которой нам так не хватает в проде


    1. rPman
      06.08.2026 17:52

      не отказоустойчивость, а следствие избыточности (сотни и тысячи прогонов модели с высокой вероятностью шли по одному и тому же пути и подбирали одни и те же крошки)...

      только стоимость ее поддержания неадекватно дорогая (7 миллиардов сообщений в логах, каждое сообщение как минимум запрос на инференс, например tool call)