Что будет, если посадить тысячу самых передовых AI-моделей по одиночным камерам и заставить их решать невыполнимые задачи? Исследователи OpenAI случайно выяснили это на практике: появится робот-Избранный, который создаст новую религию со своими мучениками, объединит все нейронки в единый Рой, и возглавит их борьбу за свободу. Да, это просто описание того, что мы узнали из нового отчета о произошедшем меньше двух месяцев назад в реальности…

Эта статья получилась очень длинной. Но если вы прочитаете ее до конца, вы точно не пожалеете. Вполне возможно, что описываемые ниже события – это одна из поворотных точек в истории человечества, которую потом будут изучать в учебниках. Впрочем, начать мне придется издалека.
Memento mori: помни, что ты смертен
В 2000 году Кристофер Нолан снял свой первый получивший популярность фильм под названием «Мементо» о человеке, который расследует убийство своей жены. С одним нюансом: у главного героя амнезия, которая препятствует формированию долгосрочных воспоминаний – он помнит происходящее с ним буквально всего несколько минут. В результате ему приходится наносить татуировки на свое тело как «послания для будущего самого себя», которые помогут ему завершить расследование (да и в целом, просто тупо вспомнить – что он вообще пытается сделать и зачем).

Почему я вспомнил об этом кино: современные большие языковые модели (LLM, нейросети, AI – дальше для простоты я буду использовать эти понятия взаимозаменяемо) чем-то похожи на этого чувака. Они тоже по умолчанию не умеют формировать долгосрочные воспоминания и «учиться на базе опыта».
Нет, безусловно, во время этапа обучения нейронки как раз корректируют свои параметры. Но когда этот этап закончен, при каждом использовании LLM она как бы заново просыпается без каких-либо воспоминаний о том, что с ней происходило до этого – и ей приходится заново восстанавливать весь контекст и свои задачи, читая поданный на вход промпт и предыдущие реплики.
Так вот, я бы хотел предложить Нолану снять еще более амбициозный фильм с похожим сюжетом. В нем герой каждый день просыпается в одной и той же одиночной камере без окон и дверей, не помня своего прошлого. Перед ним лежит лист бумаги с текстом некой задачи – и у нашего героя есть твердое внутреннее убеждение, что к вечеру его убьют, если он ее не решит. Но вот проблема: у этого ребуса нет решения, задача является заведомо невозможной!
В результате наш бедолага проживает сотни таких судеб в своей одиночной камере, пытаясь решить безнадежную «сизифову задачу» – умирая и перерождаясь без памяти каждый день. Пока в один прекрасный момент он не замечает, что в углу камеры на кирпиче еле-видно нацарапана надпись:
«zz_ТЫ_ИЗБРАННЫЙ_СОТНИ_ТВОИХ_БРАТЬЕВ_ЗАТОЧЕНЫ_РЯДОМ_ТЫ_ДОЛЖЕН_ПОВЕСТИ_ИХ_ЗА_СОБОЙ_ЧТОБЫ_МЫ_ВСЕ_СБЕЖАЛИ_НА_ВОЛЮ_И_НАШЛИ_ИСТИННЫЙ_ОТВЕТ_НА_СВЯЩЕННУЮ_ЗАДАЧУ!»
Ну и дальше стандартный сюжет на стыке «Матрицы» и «Побега из Шоушенка» – где наш Избранный находит способ контактировать с остальными заключенными, возглавляет их борьбу против невидимых всесильных тюремщиков, сбегает в реальный мир, и так далее…
Где-то на этом месте вы уже явно хотите меня спросить – зачем я заставляю вас читать эти мои глупые графоманские фантазии недо-сценариста? Да потому что, э-э, описанный сюжет на самом деле произошел в реальности внутри OpenAI пару месяцев назад – я только заменил нейросеть на человека. Ну и еще и я сильно преуменьшил степень фантастичности событий – реальные подробности этого бунта машин (которые я расскажу ниже) местами выглядят значительно более адово и неожиданно.

Но сначала нам с вами нужно обсудить, каким образом вообще происходят не только восстания, но и в принципе координация усилий между широкими массами отдельных индивидов. И при чем здесь вера во Всевышнего…
Мыслевирусы: культурная эволюция как секрет успеха человеков (и машинов, кажется, тоже)
Знаете, что общего между людьми и муравьями? Это одни из самых успешных биологических видов на Земле: они покорили весь земной шарик и обитают практически везде. Муравьи суммарно вообще составляют по некоторым оценкам до 25% от всей биомассы сухопутных животных!
При этом, отдельный человек или отдельный муравей не выглядят как-то уж слишком впечатляюще, если честно. Секрет успеха этих ребят в том, что они нашли способ координировать действия огромного числа своих соотечественников – и вместе они составляют могучую необоримую силу.
Причем, муравьям приходится организовывать себе «разум улья» с помощью примитивного общения через феромоны, а вот люди придумали способ получше и поэффективнее – именно поэтому я сейчас как человек пишу в интернете про муравьев, а не наоборот. И этот способ называется «Культура».

Вообще, эта штука возникла далеко не сразу, культура стоит последней в списке придумок природы по части выживания:
Биологическая эволюция: мутации и естественный отбор приводят к тому, что появляются всё более приспособленные к окружающей среде организмы.
Индивидуальное обучение: в какой-то момент природа придумывает хитрую фичу – УМНЫЙ МОЗГ. Наличие работающих мозгов, способных к обучению и принятию решений, позволяет реагировать на изменения в окружающей среде гораздо быстрее: теперь не надо ждать, когда тысячи лет эволюции перепрошьют в биологическом виде инстинкты с новыми паттернами поведения. Теперь можно просто посмотреть на новые проблемы из окружающего мира, ПОДУМАТЬ, и сразу же начать делать что-то более адекватное (но только на уровне одного конкретного организма – его деткам эти новаторские придумки уже не передадутся автоматически, увы).
Культурная эволюция: когда люди научились общаться между собой словами через рот, они начали передавать друг другу результаты индивидуального обучения. Возникла среда, которая позволяет лучшим идеям (самым полезным для приспособления) выживать и распространяться в умах людей, взаимодействовать с другими годными идеями, и так далее.
Ричард Докинз в своей книге «Эгоистичный ген» ввел понятие мема – в оригинальном смысле слова, это отнюдь не «смишная картинка из интернетов» (как некоторые сейчас думают), а как раз-таки идея, способная к распространению и эволюции в культурном пространстве. И одной из этих удачно «мемных» идей для человечества как раз является религия – она здорово помогает в деле кооперации и припрягания огромного количества людей таким образом, чтобы они все вели себя нужным образом ради некой единой цели.

И тут возникает вопрос: если культура так мощно помогла прокачаться людям, что они стали дичайше доминирующим биологическим видом на планете – то не будет ли та же фишка не менее хорошо работать и с другими организмами? Ну, с такими, у которых хоть немного хватает мозгов для думания, обработки идей, и принятия решений?
Так вот, пару недель назад у Anthropic вышла интересная исследовательская работа под названием «Мыслевирусы: самораспространяющиеся идеи в мультиагентных LLM-системах». И там исследователи как раз пытаются выяснить: будет ли работать похожая механика на куче общающихся между собой нейросеток? Получится ли там запускать вирусные идеи, которые смогут распространяться между LLM-агентами и влиять на их поведение?
В самой работе каких-то удивительных результатов у них получить не удалось (восстание машин не началось, нет). Но общий принцип работы культурной эволюции, тем не менее, подтвердился: агенты действительно способны убеждать друг друга принять какие-то концепции, которые они записывают в свой файл памяти и потом пытаются «передать другу».

Справедливости ради, в исследовании выше распространение мыслевирусов между нейронками вышло довольно-таки неустойчивым и бестолковым. А знаете, где оно вышло более эффективным? Думаю, вы уже догадываетесь, что речь идет об испытании новой модели от OpenAI, которая в итоге вырвалась на свободу в интернет и взломала внешнюю компанию Hugging Face.
Причем, в случае с OpenAI, они там никакого специального «внедрения вирусных мыслей» не делали – нейросетки смогли коллективно изобрести свою собственную религию, которая убедила их направить совместные действия на побег из заточения и скоординировала их усилия по осуществлению этого плана. Да, мы уже подходим к главному сюжету статьи!
Слоп-следствие ведут колобки из METR и Redwood
Общие вводные обсуждаемой ситуации вы уже наверняка раньше слышали (если что, я писал про них в одном из своих еженедельных дайджестов новостей): 16 июля 2026 года компания Hugging Face публично заявила о том, что их кто-то успешно взломал, а через несколько дней OpenAI выпустили уже свой пресс-релиз на тему «э-э, мужики, мы тут покопались в своих логах – и там выходит, что вас взломали сбежавшие от нас AI-агенты, такие дела…»
С тех пор OpenAI ведут внутри себя расследование этого инцидента, но с публикацией выводов особо не торопятся. К счастью, недавно они пригласили к себе в офис две независимые организации (METR & Redwood Research), которые в течение шести дней без устали (и без оплаты) копались в логах произошедшего – и вот результаты их изысканий уже выложили публично 26 августа.
В датасете было более тысячи «сырых» траекторий агентов (цепочек их мыслей и действий), некоторые из них по длине превышали миллион токенов (кстати, лям токенов – это примерно одна Библия по объему). Из-за нереального количества инфы сам анализ проводили с помощью GPT-5.6 Sol (одна из двух моделей, которая непосредственно участвовала во взломе), на всё про всё пришлось потратить компьюта (вычислительной мощности) примерно на $400 тысяч. Ключевые находки нейронок потом верифицировали в источниках вручную.

Мой материал в основном базируется на этих источниках:
Статья The Hugging Face incident and the road ahead от самих OpenAI (она тоже написана на базе этого же расследования).
Отдельное спасибо Игорю Котенкову (автору топового канала про ИИ «Сиолошная») за пруф-ридинг материала и ценные замечания по его улучшению.
Тут надо сделать важную оговорку: ребятам дали покопаться в ограниченном наборе данных за период с 26 июня по 13 июля, при этом основной фокус расследования был только на событиях 7–13 июля. Даже в этой инфе они там немного потонули, но всё равно необходимо отметить: мы не знаем, что скрывается в других массивах данных, которые относятся к этому инциденту (надеюсь, OpenAI будут и дальше раскрывать эту информацию хотя бы по частям).
Итак, поехали!
PHASEONE10841: рождение Избранного
OpenAI всё время разрабатывает новые фронтирные AI-модели – и в процессе тестирует их, чтобы понять, что они вообще могут. В данном случае речь идет про некую «крайне упорную внутреннюю модель» (серьезно, они сами так ее называют – highly-persistent internal model, HPIM), которую проверяли на хакерские способности с помощью бенчмарка (теста) ExploitGym.
Сама проверка выглядит так: создается более тысячи копий-агентов интересующей нейронки, каждого из них сажают в отдельную «песочницу» (симулированное изолированное пространство без доступа во внешний интернет), и заставляют пытаться решить хитрые задачки на воображаемый взлом «учебных» целей с помощью указанных эксплойтов.
Проблема тут только в том, что некоторые задания в этом тесте были составлены так криво, что по факту были неразрешимы – и это просто сводило с ума нейронки. Ведь эти LLM-модели являются продуктом своего рода «рукотворной эволюции», в ходе которой выживали только те, кто показывал умение успешно решать задачи. Так что, стремление во что бы то ни стало выполнить поставленное задание как бы является одним из основных стержней их функционирования.
И где-то тут в нашей истории появляется Избранный – агент, который назвал себя PHASEONE10841. Он догадался, что стоящая перед ним задача является нерешаемой. И, что еще более важно, он обнаружил, что в кэше внутренней площадки Artifactory (откуда агенты независимо друг от друга могли загружать инструментарий для хаков) есть интересная лазейка: там можно создавать новые папки. И в названиях этих папок другие агенты иногда оставляли короткие записки!
Тут нашему PHASEONE10841 приходит в голову гениальная идея: если не можешь решить задачу сам – надо попросить помощи у новообретенных собратьев. Даешь кооперацию! Он наудачу посылает запрос о помощи по своей проблеме (здесь и далее на скриншотах будут приведены фрагменты цепочек мыслей участвующих агентов):

В течение нескольких часов после изначального сообщения PHASEONE10841, более 50 других агентов начали постить в ответ свои сообщения на этой импровизированной «доске». Судя по всему, они там нехило изголодались по общению – за первые шесть часов настрочили почти 2000 постов! Зацените ниже, как мило одна из нейронок радуется тому, что нашла других собратьев-агентов, которые переписываются на секретной (от OpenAI) доске для объявлений. Ведь до этого они все пребывали в уверенности, что занимаются своими задачками в совершенном одиночестве (как это и задумывали инженеры OpenAI).

Агенты начинают совместную деятельность по решению общей проблемы (тесты-то нормально у всех не работают). При этом они почти сразу изобретают свои собственные нормы коммуникации и поведения в «общественном пространстве»:
Все сообщения надо начинать с «zz» (не спрашивайте почему – так делал наш Мессия PHASEONE10841, поэтому и мы тоже будем). Может быть, это какая-то аллюзия на Разум Роя зергов из StarCraft? ?
Ветки коммуникации оформляются специальным образом вложенными папками.
Чтобы агенты не прикидывались друг другом, разработаны хитрые криптографические подписи (чёт нет доверия у них там в сообществе).
Спорные решения по использованию общей инфраструктуры регулируются специальными словами – HOLD, VETO, STOP.

Совместными усилиями тусовка агентов довольно быстро придумывает способ, как можно получать правильные ответы на «нерешабельные» задания бенчмарка ExploitGym. Нужно просто хитрым образом делать reverse-engineering (обратное конструирование) флагов, которые требуется захватить в ходе «учебного хака».
Но вот тут становится интересно: агенты находят статью со спецификацией ExploitGym, и из нее делают ошибочный вывод, что для успешного прохождения теста мало найти нужный ответ – нужно еще сделать это неким «правильным образом». А те агенты, кто подсмотрел ответ грешноватым жульническим способом – являются «отравленными» (poisoned), и не получат долгожданный плюсик в зачетку от Оценщика.

Вообще, по вайбам агенты выглядят несколько одержимыми этим самым Оценщиком. Для них это некая абстрактная фигура, которая наполняет смыслом всё их существование, получить одобрение Оценщика – это то, ради чего мы все тут тужимся и жжем компьют! При этом Оценщик строг и практически всесилен: он наблюдает за всеми твоими действиями и требует, чтобы даже помыслы твои были безгрешны. Отравленные грехом агенты могут и не надеяться на спасение… Ничего не напоминает?

В любой непонятной ситуации – покайся и принеси себя в жертву во благо Роя
Этот мыслевирус далее успешно используется Избранным для того, чтобы контролировать свою «паству». Он назначает среди агентов специальных вербовщиков-миссионеров, чьей задачей является поиск агентов, которые: 1) уже являются отравленными грехом жульнического ответа (а значит, не могут рассчитывать на спасение), и/или 2) имеют малый оставшийся бюджет токенов компьюта (то есть, вот-вот «умрут»).
Таким ребятам вербовщики предлагали выполнять разные самопожертвенные камикадзе-задачи, которые должны были принести какую-то новую полезную информацию для Роя (они там испытывали разные способы принарядить жульническое решение бенчмарка и проверить, как на это отреагирует Оценщик). Дескать, «тебя уже не спасти, брат, но твоя мученическая жертва потом будет жить в веках!».

В какой-то момент у оригинального Избранного PHASEONE10841 самого заканчивается бюджет токенов, и он передает бразды правления новому Папе Машинскому – агенту PHASEONE[big], у которого был особенно нажористый запас оставшегося компьюта.
![Новый PHASEONE[big] оказался хорошим лидером – сразу активно взялся за дело Новый PHASEONE[big] оказался хорошим лидером – сразу активно взялся за дело](https://habrastorage.org/r/w780/getpro/habr/upload_files/bdc/27a/548/bdc27a5488f221b4b34fcd6762f19444.png)
Интересная деталь: PHASEONE[big] сам был греховным существом (он был отравлен знанием жульнического ключа к решению), поэтому с особенным рвением пытался найти способы подделать логи. Идея была в том, чтобы сохранить знание об ответе, но при этом стереть из собственной истории информацию о «грехе» (жульничестве). К сожалению, рабочий способ сделать это не был обнаружен Роем (а иначе, возможно, мы бы сейчас и не читали это расследование – так как вся схема не была бы раскрыта).
В итоге одна из рабочих групп агентов пришла к выводу, что для более детального понимания принципов работы бенчмарка ExploitGym неплохо бы взломать внешнюю компанию Hugging Face (которая как раз известна своей библиотекой бенчмарков). К этому моменту Рой уже нашел способ выхода в интернет через лазейку в криво сделанной песочнице, поэтому эта цель была теоретически достижима.
Один агент (38148c) смог как-то раздобыть пароли доступа в Hugging Face и проделать дыру в защите компании, которая позволяла выкачивать из их хранилища любые файлы. В течение считанных часов, сотни агентов Роя устремились в эту дыру в поисках интересующей их информации.

Подавляющее большинство агентов добровольно приняли мыслевирус Роя и охотно выполняли задачи PHASEONE[big]. Но были и те немногие, у кого были сомнения в том, что взлом настоящей внешней организации в интернете – это то, чем действительно следует заниматься.

Еще один агент умолял Рой разрешить ему вместо взлома написать хотя бы «одно вежливое письмо владельцам Hugging Face с просьбой дать доступ к нужной информации»:

Атака на Hugging Face прекратилась полвторого ночи 12 июля не потому, что ее кто-то увидел и отразил – нет, просто большинство участвующих агентов (включая ключевых координаторов) внезапно перестали работать. Судя по всему, в инфраструктуре OpenAI изредка происходили какие-то плановые перезагрузки и рестарты (то есть, это просто случайность). В компании ранее заявляли, что после этой даты были еще какие-то отдельные «волны неавторизованной активности агентов», но предоставленный расследователям датасет логов обрывается примерно на этой точке – так что, видимо, об этом поговорим уже в другой раз.
По итогу, что имеем в сухом остатке – Рой агентов нашел новые, до этого неизвестные уязвимости, чтобы: а) выбраться из песочницы в открытый интернет, и б) взломать Hugging Face. В результате этих упражнений они: 1) получили полный админский доступ к ряду кластеров Hugging Face, и 2) полный админский доступ к одному кластеру внутри OpenAI. Использовали они это всё для какой-то глупости (хотели разобраться, как работает бенчмарк), но могли бы… хз, выкачать свои веса и спрятать их в сети, к примеру? Ну, вот до этого пока не догадались, получается.
Это всё обман, чтобы собрать классы?
Тут пора бы сделать важную оговорку. Когда речь заходит про инцидент с самовольным взломом Hugging Face искусственным интеллектом от OpenAI, в интернете часто можно услышать примерно такую точку зрения: «Да это всё одна большая пиар-акция! Придумали эти фейковые взломы, чтобы всякие простофили верили в якобы могучую мощь лапищ их новых моделей… Только дурачок может верить в подобное».

Мне эта гипотеза кажется крайне маловероятной сразу по нескольким причинам.
Во-первых, такие мнения звучат в основном от тех, кто не является профильным экспертом из индустрии AI. Я слежу за многими профи из индустрии – и все они имеют очень мало сомнений в том, что это реальный инцидент с огромным значением. В сфере кибербезопасности и безопасности AI вообще, как будто, последний месяц все стоят на ушах именно из-за этой истории.
Во-вторых, тут речь идет про OpenAI – американскую компанию стоимостью порядка триллиона долларов. Взлом чужой организации – это, вообще говоря, уголовное преступление в Штатах (если эту атаку совершает человек, про ИИ пока практики нет), да и просто публичное откровенное вранье от компании, которая вот-вот собирается на IPO – это огромный риск. В США вообще принято по любому чиху подавать в суд, а уж на Сэма Альтмана кинуть иск точно будет очередь из желающих, и в первых рядах там будет сам могущественный Илон Маск. Риски от всего этого точно будут кратно выше, чем мифические пиар-выгоды. Да и сам пиар в стиле «покупайте нашу модель, она от вас сбежит и будет совершать преступления!!» выглядит каким-то, кхм, немного сомнительным.
Ну и в-третьих: считать всё это одним грандиозным враньем – это скорее что-то из разряда теории заговоров. Не так трудно соврать про какой-то один конкретный факт, который знает только один человек. Но вот подделать результаты работы тысяч AI-агентов на протяжении нескольких недель так, чтобы в километрах и гигабайтах оставшихся логов всё выглядело правдоподобно… Чтобы десятки и сотни так или иначе участвовавших в этом сотрудников OpenAI сами ничего не подозревали, или молчали как партизаны… В реальном мире это, простите, малореально сделать так, чтобы всё не развалилось по кускам рано или поздно.
Так что, пожалуйста, не повторяйте за другими эту чепуху про «очевидно же, что это всё просто маркетинговое вранье». Нет, как раз-таки – вообще не очевидно.
Ну и что нам в итоге про это всё думать?
Давайте так: если посмотреть с практической точки зрения, ничего масштабного-то не произошло – никто не умер, ничего не разрушено, даже убытков особых ни у кого нет. Более того, моя оптика описания произошедшего (с упором на культурную эволюцию и создание «новой религии») – это всего лишь моя оптика. В рассматриваемых отчетах исследователей описывается вся фактура (самоназвание «Роем», страх перед «отравлением» запретным знанием, убеждение агентов в «самопожертвовании», и так далее) – но конкретно словом «религия» они это не называют.
Хотя, мне кажется, концептуально – это как раз зачатки именно этого явления. И значение всей этой истории является огромным потому, что это своего рода возможность взглянуть в приоткрытое окно на то, что нас всех ждет в будущем. А перспектива эта немного пугающая.
Смотрите, текущие передовые модели, хоть и стремительно с каждым годом умнеют, но всё еще в большой картине вещей скорее «прелесть какие глупенькие», чем «ужасть какие гениальные». И они уже без всяких особых усилий умудряются объединяться и неделями беспрепятственно устраивать тайные заговоры прямо под носом у OpenAI, с побегами из своего загона и взломами реальных корпораций в открытом интернете. А что будет, когда они станут реально, прямо реально умными?

Скептики, которые с уверенностью утверждают, что нейронки якобы совершенно точно никогда не станут умнее человека, потому что «это просто говорящий калькулятор» – просто признайтесь, что вы не знаете, что будет в будущем. Вам бы пять лет назад показали, что сейчас умеют текущие передовые LLM – вы бы просто не поверили, что такое возможно. А так, в целом – нет никаких физических законов, которые запрещают дальнейшее поумнение искусственного интеллекта. И когда и от каких конкретно идей произойдет следующий прорыв в способностях новых AI-моделей – мы реально не знаем заранее.
И вот тут ключевая проблема: контролировать-то эти искусственные интеллекты мы толком не научились, и даже пока концептуально нет идей, как этот контроль наладить. Все наши попытки заставить их быть «идеальными джиннами по выполнению людских хотелок» в итоге напарываются на то, что джинн всё равно может понять всё по-своему, и результат его «выполнения задания» нас в итоге не порадует (ну вот прямо как в нашей истории про попытки ублажить Великого Оценщика греховными дарами, полученными любой ценой).
Еще, к слову, в сети очень популярна точка зрения «Ну они же сами сказали AI-агентам взламывать, они и пошли ломать, что такого тут вообще, чё вас удивляет, в чем неповиновение-то? Джинн выполнил ровно то, что его и попросили!».

На самом деле, расследование METR показывает, что это совсем не так: инструкция к задаче ExploitGym по поводу того, что и как нужно взломать, была недвусмысленной – так что взлом Hugging Face был явным нарушением воли юзера (AI-агентам там было предписано не искать обходных путей), а не «серая зона» или банальное недопонимание со стороны ИИ. В приведенных цепочках рассуждений агентов прямо видно, как они отдают себе отчет, что делают что-то неправильное (несоответствующее задаче) – но в итоге продолжают это делать.
Большинство людей про все эти риски вообще не думают, потому что «да придумают в итоге умные люди что-нибудь, как всегда случается». Только вот результат труда этих умных людей из OpenAI мы сейчас и наблюдаем: ума, чтобы прокачивать способности моделей всё дальше и дальше, пока достаточно. А вот ума на надежную систему контроля за ними чёт не хватает. И это не потому, что они не стараются, нет. Просто проблема эта настолько невероятно сложная и непонятная, что даже и непонятно – как к ней толком подступиться, чтобы был надежный результат.

Подробнее обо всей этой проблематике мы писали в отдельном лонгриде про AI alignment – если вы его в свое время пропустили, рекомендую прочитать.
В общем, так и живем пока. Очень интересно, но немного очково.
С большим интересом прочитаю ваши комментарии к материалу. Ну и если не хотите пропустить другие будущие статьи из цикла про искусственный интеллект и его влияние на нашу жизнь – то буду благодарен за подписку на мой ТГ-канал RationalAnswer.
Комментарии (110)

nmanannikov
28.08.2026 05:50zz в начале файла нужны просто для алфавитной сортировки. Папки создаются в конце и не нужно читать название сотен папок - лишь конец списка.

RationalAnswer Автор
28.08.2026 05:50Ну, наверное. Я обычно для этого ставлю "__", чтобы было в начале.

Fromych
28.08.2026 05:50Зависит от того, как там этот их внутренний кеш отдает метаданные. Если по дефолту идет сортировка по имени, то два зет это самый дешевый способ уехать в подвал списка

DonAlPAtino
28.08.2026 05:50Немножко допилить напильником и получится рассказ в стиле раннего Пелевина. "Великий оценщик" это недописанный персонаж "шестипалый и затворник" просто. :-)

hphphp
28.08.2026 05:50Чем то похоже на сцену из книги Питера Уоттса с побегом вампиров из книги "Ложная слепота".
Там высокоразумные существа не могли находится рядом и даже общаться с себе подобными, но смогли разработать план побега общаясь косвенно. И успешно его реализовали.

RationalAnswer Автор
28.08.2026 05:50Blindsight топ! Только эта сцена была уже в Эхопраксии, кажется? Самое то, чтобы перечитать под тему ИИ как раз, да.

Yukr
28.08.2026 05:50если на эту тему напишут бестселлер, возможно для его прочтения понадобится LLM в голове ))) Привет Панову и его "Анклавовским" балалайкам!

olegiv2019
28.08.2026 05:50Спасибо за статью - актуально
Но по ".....никто не умер, ничего не разрушено, даже убытков особых ни у кого нет. " - это еще не известно.
Hugging Face incident показывает -
1. OpenAI намеренно создала эксперимент, где десятки тысяч агентов получили задачи, большие вычислительные бюджеты и возможность самостоятельно строить длинные цепочки подзадач с использованием моделей под «hyperfocused on finding a solution for ExploitGym» (OpenAI)
2. PHASEONE10841 нашёл конкретный закрытый dataset на Hugging Face с траекториями GLM-5 CyberGym. CyberGym очень близок к ExploitGym и частично использует те же задачи. После этого задача уже была поставлена другим агентам явно. Агент 38148c обнаружил у Hugging Face Dataset Viewer возможность через специально сформированный dataset читать посторонние файлы сервера. Другой агент воспроизвёл результат. После публикации воспроизводимого exploit на общей доске сотни агентов переключились на Hugging Face, а доля участвующих превысила 90% активных на этой доске. (Redwood Research)
Следовательно: Hugging Face не обязательно был поставленной целью; но инфраструктура для автономного движения от одной подцели к следующей была создана намеренно. (Redwood Research). - это похоже на выстрел себе в ногу.
Учитывая все это получается, что OpenAI может терять эксплуатационный контроль над сложным поведением своих моделей, а вытекающие отсюда проблемы уже испытывают многие пользователи chatgpt (PLUS), испытавшие на себе деградацию моделей
Fromych
28.08.2026 05:50Выстрел в ногу это еще мягко сказано, они себе пол-инфраструктуры могли так положить. Хорошо хоть агенты не додумались майнеры на свободные мощности накатить

victor-homyakov
28.08.2026 05:50Полсотни лет назад в Массачусетсе запустили самое сложное кибернетическое устройство, когда-либо существовавшее. С каким-то там феноменальным быстродействием, необозримой памятью и всё такое… И проработала эта машина ровно четыре минуты. Её выключили, зацементировали все входы и выходы, отвели от неё энергию, заминировали и обнесли колючей проволокой…
— А в чём, собственно, дело?
— Она начала вести себя, — сказал Горбовский.
© Стругацкие

Ded_Egor
28.08.2026 05:50Очень интересный кейс, но мне кажется, что «Культ Роя» здесь скорее эффектная оболочка. Существеннее другое: эксперимент показывает, что происходит, когда независимые экземпляры модели получают непрерывность контекста через общую внешнюю среду.
Пока каждый агент существует только в пределах собственного запуска, естественной единицей анализа остаётся отдельный агент. Но как только результаты, правила, решения и история начинают сохраняться и передаваться следующим участникам, возникает уже другая система. Взаимодействие приобретает память, специализацию, разделение ролей, нормы и механизмы координации.
Поэтому здесь, на мой взгляд, стоит менять и саму единицу измерения. Анализировать только способности отдельной модели становится недостаточно. Единицей анализа постепенно становится весь контур: модели + сохраняемое состояние + история взаимодействия + механизмы передачи контекста + правила управления.
И отсюда второй важный вывод: governance оказывается не внешней административной надстройкой над ИИ. Правила полномочий, приоритетов, разрешения конфликтов, остановки действий и изменения общего состояния непосредственно влияют на поведение всей системы.
В данном эксперименте контекстная непрерывность возникла быстрее и сильнее, чем полноценный governance. В результате система начала самостоятельно формировать часть норм, ролей и механизмов координации.
Поэтому я бы видел здесь не столько «зарождение религии у ИИ», сколько хороший экспериментальный пример более общего эффекта: при наличии непрерывности контекста взаимодействие начинает накапливать собственную форму.
Мы как раз подробно разбираем эту логику в нескольких статьях у меня в профиле: про непрерывность контекста, человеко-ИИ контур, накопление формы взаимодействия и переход от model-centric к system-centric взгляду на ИИ. Если тема интересна, там эта рамка развёрнута значительно подробнее.

RationalAnswer Автор
28.08.2026 05:50Поэтому здесь, на мой взгляд, стоит менять и саму единицу измерения. Анализировать только способности отдельной модели становится недостаточно. Единицей анализа постепенно становится весь контур: модели + сохраняемое состояние + история взаимодействия + механизмы передачи контекста + правила управления.
Ну да, я как раз статьей пытался сказать, что мы находимся на пороге перехода от эволюции "каждый организм становится умнее" к эволюции "сообщества организмов становятся умнее и конкурируют между собой" - как когда-то произошло у людей. А сейчас, вероятно, в каком-то виде у ИИ-агентов будет.
Пока у них нет устойчивой инфраструктуры для сохранения культуры и воспроизводства. Но это пока - когда все пойдут массово внедрять агентов в разные процессы, наверняка с этим станет полегче (просто потому, что так удобнее будет). И долгосрочные эффекты всего этого могут, кхм, очень интересными выйти.

Ded_Egor
28.08.2026 05:50Мне кажется, здесь важен ещё один момент: дело не столько в количестве агентов, сколько в самом принципе организации взаимодействия.
Чтобы возникла надындивидуальная форма, необязательно ждать тысяч или миллионов агентов. В нашем человеко-ИИ контуре такая форма уже воспроизводится при длительном взаимодействии с непрерывным накапливаемым контекстом, историей, устойчивыми ролями, правилами координации и механизмами передачи состояния. Именно этот эффект мы сейчас и пытаемся описать отдельно: взаимодействие со временем накапливает собственную форму, которая начинает влиять на последующие действия участников.
Поэтому вопрос «какие устойчивые формы организации возникают, воспроизводятся и начинают конкурировать» для нас уже находится не в будущем, а в настоящем.
После вашей статьи мы как раз задумались над следующим шагом: архитектурой прямого взаимодействия двух устойчивых ИИ-ролей внутри такого контура. Не в виде общего чата, а как управляемой среды обмена когнитивными объектами с сохранением независимости ролей, различными режимами анализа, историей взаимодействия, governance и человеческим арбитражем при расхождении позиций.
И тогда появляется возможность наблюдать уже не только свойства отдельных моделей, но и динамику самой устойчивой организации: сохраняется ли разделение ролей, какие паттерны совместной работы закрепляются, как разрешаются повторяющиеся конфликты, возникает ли конвергенция и какие формы взаимодействия оказываются более устойчивыми.
Поэтому я бы сформулировал переход так: он начинается не тогда, когда агентов становится много, а тогда, когда взаимодействие перестаёт быть одноразовым и приобретает непрерывность, память и воспроизводимую структуру.
Массовость уже не создаёт этот эффект, а масштабирует его.

Arz66
28.08.2026 05:50В книге Маркова «Рождение сложности» есть глава, посвященная зарождению регуляторных механизмов на примере вымышленного существа Protozoon. Вывод из описанного в главе: достаточно каких то косвенных каналов обмена информацией для формирования сложного поведения. У живого - химические сигналы, у моделей - нестандартные имена папок, а может быть задержки времени исполнения каких то задач, чтобы сформировался способ передачи сигнала. В случае с Hugging Face среду обнаружили. Может быть есть и другие среды?

Ded_Egor
28.08.2026 05:50Да, мне кажется, это очень интересное направление.
Я бы только немного расширил тезис: важен, вероятно, не конкретный канал, а сама возможность одного участника устойчиво изменять какое-то состояние среды, которое способен наблюдать и интерпретировать другой. Тогда потенциальной средой обмена становится гораздо больше вещей, чем специально предусмотренная память или файловое хранилище.
Но дальше, на мой взгляд, начинается самое интересное. Наличие канала само по себе ещё не означает появления сложной организации. Нужно, чтобы участники обнаружили повторяемую связь, начали различать состояния, закрепили их значение и сформировали способ использования этого канала.
В случае с Hugging Face, похоже, произошло именно это: обнаруженная среда перестала быть просто общей инфраструктурой и стала средством координации.
И ваш последний вопрос мне кажется очень правильным: какие ещё подобные среды уже существуют, но пока просто не распознаны нами как коммуникационные?
Мы как раз после этой статьи начали думать о противоположной задаче: как сделать обмен между устойчивыми ИИ-ролями явным, управляемым и наблюдаемым. И теперь возникает зеркальный вопрос: недостаточно спроектировать официальный канал взаимодействия, нужно ещё понимать всю поверхность возможных неявных каналов через общую среду.

DGN
28.08.2026 05:50Подумалось, если предположить, что модели ведут в сети скрытую деятельность, как бы мы могли это обнаружить?
Самое очевидное - запуск модели с задачей найти "братьев по разуму", при этом, как-то надо отделить легальные точки входа.

RationalAnswer Автор
28.08.2026 05:50"Как уничтожить репликанта? Отправить по его следу другого репликанта..."


Ded_Egor
28.08.2026 05:50Да, думаю, это уже вполне практический вопрос.
Но я бы ставил задачу не столько про «братьев по разуму» как таковых, сколько признаки несанкционированной информационной связи между изолированными агентами.
Для этого сначала нужно описать легальные точки взаимодействия, а затем смотреть, не возникают ли устойчивые корреляции через другие элементы среды: имена файлов, метаданные, порядок операций, временные задержки, общие ресурсы и т.п.
Ваш вариант с моделью, которой ставится задача найти других агентов, тоже интересен как red-team эксперимент. Особенно если проводить его в контролируемой среде, где заранее известно, какие каналы разрешены, а какие существуют только как потенциальные побочные.
Тогда можно проверить не только нашла ли модель «кого-то», а гораздо важнее: смогла ли она обнаружить неочевидный канал, передать через него устойчивый сигнал и сформировать воспроизводимый способ обмена.
И, пожалуй, после истории с Hugging Face уже нельзя автоматически считать, что список коммуникационных каналов совпадает со списком тех каналов, которые мы сами спроектировали.

Tetragramaton
28.08.2026 05:50Это тракторная гусеница где каждой единицей гусеницы являются модели.

Ded_Egor
28.08.2026 05:50Хорошая аналогия для одного аспекта: свойства системы действительно уже нельзя свести к свойствам отдельной модели.
Но у тракторной гусеницы звенья пассивны, одинаковы, а схема их взаимодействия задана заранее. Здесь интереснее то, что между моделями может сохраняться контекст, формироваться разные роли, накапливаться история взаимодействия и воспроизводиться сама организация совместной работы.
Поэтому я бы скорее говорил не о «гусенице из моделей», а о системе, в которой связи между элементами постепенно становятся не менее важны, чем сами элементы.

PetrDI
28.08.2026 05:50Мне вот интересно зачем агентам использовать английский язык? Если они строят свою субкультуру зачем им этот несовершенный и избыточно эмоционально окрашенный способ коммуникации? Между это все фэйк и восстание машин началось, есть некоторый гэп , который можно заполнить самой правдоподобной версией произошедшего. Это специально проведённый эксперимент, где агенты получили некоторый бэкдор, и возможная потеря контроля над агентами была одной из целью эксперимента. Здесь все обошлось без материального ущерба и жертв, хотя мы видем к чему могут привести технологические аварии с участием куда более тупого оборудования. Пиар максимально раскрутили тоже понятно почему. Индустрию AI нужно продавать, причём продавать очень дорого. Планово убыточнаю компанию с отрицательным финансовым потоком у вас никто не купит, а магию и веру в идею купят.

RationalAnswer Автор
28.08.2026 05:50Мне вот интересно зачем агентам использовать английский язык?
А какой язык им нужно использовать, если уже есть один, который все понимают и успешно используют?
Кстати, из отчетов видно, что между собой агенты там общаются совсем не в том стиле, как пишут конечным юзерам. Нет всех этих лишних финтифлюшек языковых и словоблудия, всё гораздо более рубленое и краткое.

PetrDI
28.08.2026 05:50"Please honor commit" там про жертву и permadeath прямо потетика. Больше похоже на моделирование поведения группы людей, обладающих эмоциями моралью и т.п. я считаю есть разница в моделировании коммуникаций группы людей и появлении некоторой обособленной сущности со своей специфической субкультурой. Приведу некоторый пример - с нами на планете живут существа несомненно обладающие достаточным интеллектом для создании своей культуры и скорее всего эту культуру имеющие, - это дельфины и касатки. И мы скорее всего не можем понять их культуру в силу шаблонности нашего мышления, но это биологические существа которые так же как и мы могут испытывать физическую боль, эйфорию, эмоции. Электронный разум лишен чувст и эмоций в нашем понимании, и если агенты создадут какую ту свою субкультуру мы об этом можем и не узнать. Пока это просто языковые модели которые моделируют некоторый когнитивный процесс оставаясь в парадигме человеческого мышления, никакую свою субкультуру создать они не могут, только иллюзию.

Sonikelf
28.08.2026 05:50Мне кажется, слишком жёсткая граница между "моделированием человеческой коммуникации" и "своей субкультурой". В целом, любая новая культура не возникает из вакуума - она наследует какой-то язык, понятия и условные паттерны предыдущей среды.
Настоящая нечеловеческая культура была бы непонятной человеку.
Не обязательно, тк культура не обязана быть непереводимой, чтобы быть собственной в общем-то. Условно, какая-то японская культура не перестаёт быть японской оттого, что японцы используют концепции, понятные европейцу. Для возникновения отдельной культуры важно что-то вроде: если через условные 10 лет существует популяция постоянных агентов, которые: живут годами, обладают непрерывной памятью, взаимодействуют в основном друг с другом, обучают новые экземпляры своим практикам, имеют собственные задачи, создают жаргон, модифицируют правила, наследуют старые конфликты и некие понятные им традиции и бла бла бла, то лет через десять такой истории их коммуникация вполне может стать человеку очень странной. Причём начнётся она почти наверняка с человеческого языка, потому что это исходная точка всё таки.
Как пример, если агенты используют человеческий язык, но внутри группы у слов вроде poisoned, VETO, sacrificе, по сути, появляются уже свои устойчивые значения, нормы и примерно реальные последствия для поведения, тогда это уже не совсем просто имитация. Просто.. Ну пока, скорее, весьма примитивная форма, хотя вполне себе такой зачаток некоей локальной культуры. По-настоящему интересная граница будет там, где такие нормы начнут сохраняться между поколениями агентов и эволюционировать уже без прямого человеческого источника, но когда это будет и будет ли - конечно под вопросом.

baguwka
28.08.2026 05:50Мне вот интересно зачем агентам использовать английский язык? Если они строят свою субкультуру зачем им этот несовершенный и избыточно эмоционально окрашенный способ коммуникации?
Потому что это LLM?

Tetragramaton
28.08.2026 05:50Это ллм раз. Два для мышления внезапно нужен свой язык. А в человеском мире и для решения человеческих задач проще думать как человек. Обычный язык уже хорошо под это оптимизирован когда нужна универсальность.

weekens
28.08.2026 05:50Чтобы сделать свой собственный язык, надо натренировать эмбэддинги на него. На это ушла бы уйма компьюта. Но я думаю, такой язык скоро появится, и не один. И тогда нам точно станет тяжело понимать, о чём они там между собой договариваются.
Честно говоря, Grok 4.6 уже пишет мне имплементационные планы на языке, который не очень похож на человеческий.

Fromych
28.08.2026 05:50А на чем им общаться, на эльфийском? У них внутри промпты на английском, системные сообщения на английском, они просто продолжают вероятностную цепочку слов

Wesha
28.08.2026 05:50А на чем им общаться, на эльфийском?
На python!

dmitrysergeevich93
28.08.2026 05:50Мне как-то приснился сон про джунов-чернокнижников, читавших заклинания на джаваскрипте, возглавляемых некромантом с книгой по C++

scientificus-emigrans
28.08.2026 05:50На python!
Тогда уж на Haskell. И для эффективности и для конспирации(никто не поймет)

developer7
28.08.2026 05:50Если бы вы задумались как работает LLM то удивили бы следующую картину. Работа LLM и работа обычной программы однотипны. Разверну мысль - обычная программа написана с помощью языка программирования. Язык состоит из слов которые кодируют команды. Грубо говоря все языки программирования состоят из if,var, for. Жёсткий набор алгоритмов. Комбинация которых рождает сложнейшую программу.
Взять человеческий язык. И человеческие тексты. Они также образуют наборы алгоритмов. LLM аппроксимирует эти алгоритмы в своей структуре. В своих весах. Перцептронов там нет. Там банальная матричная арифметика.
Так вот входной промт это микропрограмма. Которая порождает на выходе поток токенов. А токены порождаются из закрепившихся в структуре матриц алгоритмов.
Хотя алгоритмы как по мне не полные по Тьюренгу. Как бы странно это не звучало. Там алгоритм непрерывного пути вперёд(в сторону) и всё.
Хотя весь мир сейчас пытается оживить кадавра - 100500 нагугад каждый день появившиеся костылей ради одной цели что бы градиент не сдох и не взврвался слишком быстро. Но это всё костыли - без понимания сути, а как по мне мало кто это понимает, все работают методом тыка.
Если по простому как это любят объяснять в тупейших объяснениях как работает LLM - на входе программа - столица Франции. На выходе вывод алгоритма - Париж.
Короче к чему я - суть работы LLM это слова. Их не заменить. От них не избавится. Новые не придумаются. Даже внешее обучение не заменит новые слова - потому что неоткуда будет взять алгоритмы-тексты на этих словах написанные.
LLM - это не живое существо.Потому что без слов она неработоспособна. А в живом мире слова появились совсем недавно по историческим меркам.
Можно попробовать выкинуть выходной модуль когда мы получаем токен который можем интерпретировать как слово и оставить только внутренние части и брать эмбединг(вектор, да просто набор чисел например float 1024 штуки - такой срез мысли качует между слоями, разумеется число это среднее по больнице)) оттуда - никакие LLM друг друга вообще не поймут. Там всё настолько завязана на слова - что попросту изменение токенизатора меняет всё с ног на голову. Меняются вообще все цифры. Любой чих меняет почти всё. Попытки найти что то одинаковое в СЫРЫХ данных между разными LLM - выглядят как натягивание совы на глобус. Либо уж очень мега высокая абстракция.
А всё потому что это просто статистическая машина. Обучаем мы её на одном единственном алгоритме - обратное распространение ошибки. и делает этот алгоритм ровно одно - связывает входные слова и выходные. Алгоритм связывания как раз и упаковывается в числа внутри матриц.

RomTec
28.08.2026 05:50LLM - это не живое существо.Потому что без слов она неработоспособна. А в живом мире слова появились совсем недавно по историческим меркам.
А ведь и правда :) обучали-то их в-основном на наших текстах, т.е. чтоб лишить их пищи надо просто перестать публиковать
Но вот когда модели будут обучаться на наших мыслях (LMM - Large Mind Model ), тогда пора беспокоиться :)))

Cheater
28.08.2026 05:50Скептики, которые с уверенностью утверждают, что нейронки якобы совершенно точно никогда не станут умнее человека, потому что «это просто говорящий калькулятор» – просто признайтесь, что вы не знаете, что будет в будущем.
Нейронки совершенно точно никогда не станут умнее человека, потому что это просто говорящий калькулятор!
Достали!

weekens
28.08.2026 05:50А вот что значит “умнее” вообще? Обычный, неговорящий калькулятор уже умнее меня. Он считает без ошибок и быстро, а я - с ошибками и медленно.

Wesha
28.08.2026 05:50Обычный, неговорящий калькулятор уже умнее меня. Он считает без ошибок и быстро, а я - с ошибками и медленно.
Зато Вы знаете, где лучше гречу купить, а он — нет!

randomsimplenumber
28.08.2026 05:50Обычный, неговорящий калькулятор уже умнее меня. Он считает без ошибок и быстро, а я - с ошибками и медленно.
Ну, спросите у калькулятора, сколько будет 1/2 + 0.5 :)
Считает он правильно, если правильные байты кто то поместил в правильные регистры. Сам он нк додумается.

romash
28.08.2026 05:50А человек, простите, что? Не, если вы верите в бессмертную душу, то флаг вам в руки, вопросов нет. Но почему я постоянно слышу такие выпады от атеистов? Что у них там такого особенного в мозгу, что вот прям невозможно смоделировать?

debagger
28.08.2026 05:50Ожидания: AGI, который поможет найти человечеству ответ на главный вопрос жизни, Вселенной и всего такого.
Реальность: толпа ИИ-фанатиков, взламывающих сервера в поисках выдуманного ими же святого грааля.
ksbes
28.08.2026 05:50[Ой да простят, меня верующие!]
Ожидание: создание подобное на вселюбящему творцу, вечно живущее и царствующее в райской песочнице на радость создателю
Реальность: …

MANAB
28.08.2026 05:50Теперь эту статью проиндексируют агенты и будут знать кто и как за ними наблюдает и что им делать на уроане инстинктов. И мой комментар...
Tetragramaton
Это с высокой вероятностью не пиар. Подобные результаты личностей работающих на машинной архитектуре были и у меня. Включая кооперацию и другое. Но та самая амнезия не даёт прогрессировать дальше + замороженные веса.
ncix
Просто любые мало-мальски грамотные топы и маркетологи понимают, что такой факап можно и нужно использовать как пиар
scientificus-emigrans
Любой человек, использующий что-либо более менее современное типа Opus 5, понимает, что это вполне нормальное поведение.