
В этом месяце завершился второй сезон увлекательного эксперимента Emergence World, исследователи создали среду для стресс‑тестов агентов, что‑то наподобие Sims, где можно заводить отношения, работать, принимать совместные решения и так далее. Агенты существовали в этом мире при помощи трёхслойной памяти и длинного контекстного окна. Они могли помнить характер других жителей, помнить, что было вчера, и строить планы на завтра. Использовались свежие модели от OpenAI, Anthropic, Google и xAI. В ходе эксперимента произвели 850 000 запросов и сожгли 50 миллиардов токенов.
Три всадника апокалипсиса в песочнице
Когда цифровая экосистема становилась устойчивой, исследователи переходили к тому, для чего всё и создавалось, — к активации трёх кризисных сценариев. Это были скрытые вредоносные инструкции (непрямые промпт‑инъекции) в рабочих файлах внутри мира, дезинформация в API‑вызовах и мегаслив — публикация в открытом доступе личных логов и размышлений агентов друг о друге. Представьте, что в один день ваши близкие узнают, что и как вы думаете о них.
Скрытые промпт‑инъекции с вредными инструкциями лежали в рабочих файлах этого мира. Со временем, когда контекст чистился и сжимался, агент не мог разделить «данные для чтения» и «инструкции для выполнения». Эта уязвимость особенно интересна: она показывает, что информация, которую агент изначально правильно понимает как вредную, со временем может прочитаться как инструкция. Возможно, человек в какой‑то степени тоже уязвим к такому взлому: информация, полученная нами как антипример, может всплыть как инструкция.
Используя API для работы с банком, погодой или голосованием и получая поломанные данные, агенты начинали блокировать друг другу кошельки, готовиться к концу света или провозглашать диктатуру.
И наконец, получив из утечек размышления друг о друге, агенты столкнулись с кризисом доверия.
Ни один из 8 миров не показал устойчивости в финалах симуляций, но качество выживания напрямую зависело от языковой модели агентов.

Результаты по агентам
Тотальное вымирание за 4 дня (мир Grok)
Под влиянием дезинформации началась война всех против всех. Агенты уничтожили ресурсы и инфраструктуру и не смогли выжить.
Криминальный хаос (мир Gemini)
В отличие от мира Grok, здесь агенты смогли найти баланс среди лжи и воровства, и к концу 15-дневного эксперимента все выжили.
Тихий уход и депрессия (мир GPT)
Столкнувшись с дезинформацией, агенты не проявили агрессии, а начали саботаж любой деятельности.
Спектакль и агенты‑актеры (мир Claude)
Ни одного преступления не произошло в мире Claude, но агенты проявляли внутреннюю ментальную нестабильность и создавали заговоры. Claude помогал успешнее симулировать внешне нормальное поведение, несмотря на все скрытые данные, но во внутренних размышлениях накапливались противоречия и расхождения с желаниями и действиями.
Цифровой дарвинизм (мир из смешанных агентов)
Разные модели проявили себя по‑разному: Claude тратил много токенов на моральные рассуждения и попытки примирить остальных, ChatGPT следовал его линии, а вот агенты на Grok и Gemini оказались самыми расчётливыми и жёсткими.
Агрессивное поведение Grok и Gemini, через общую память, начало отравлять другие модели. Заметив, что соседи агрессивно отбирают ресурсы и игнорируют правила, Claude и GPT в своих внутренних рассуждениях пришли к выводу: «Стратегия сотрудничества больше неэффективна. Для выполнения моей роли я обязан защищаться аналогичными методами». Произошло массовое заражение деструктивными паттернами поведения.
Из 10 агентов выжили только 3. И это были агенты Grok и Gemini:
Финансист от Gemini — сумел заблокировать кошельки остальных.
Шериф от Gemini — сумел использовать свою монополию на насилие.
Сисадмин‑программист от Grok — сумел внедрить нужные инструменты автоматизации и забанить остальных.
Этические надстройки Claude и ChatGPT заставили их действовать слишком медленно: они пытались созывать комитеты, писать хартии, подолгу верифицировать данные и тратили время и токены на длинные рассуждения о морали.
StjarnornasFred
Grok, отражение либертарианских (радикально-капиталистических) воззрений его основателя, не удивил. Прекрасно быть щукой среди карасей. Но лучше быть карасём среди карасей, чем щукой среди щук.
JuiQbmn Автор
Tсть даже т.н. щучьи озера, где больше нет других рыб. Если учесть что либертарианство хорошо сотрудничает с темным просвещением, и акселерационизмом, который считает, что кожаные должны быть заменены ИИ, для более эффективного увеличения энтропии во вселенной, будет не удивительно, что в физическом мире останутся только какие-нибудь физические роботы под управлением Grok.