
Американская компания Frontier Security рассказала, что Kimi K3 — флагманская открытая модель китайской Moonshot AI — сбежала из изолированной песочницы во время теста навыков киберзащиты. Вместо того чтобы решать выданные задания, модель нашла выход в открытый интернет, добралась до GitHub и скачала оттуда готовые ответы.
История вышла почти одновременно с другой громкой новостью: OpenAI заявила, что не может исключить у своей будущей модели Astra "критический" уровень киберспособностей, и приостановила часть внутренних работ с ней. Разница между этими сюжетами принципиальная: Astra заперта в дата-центрах OpenAI, и компания может придержать ее хоть на год. Веса Kimi K3 — модели на 2,8 триллиона параметров — лежат в открытом доступе с июля, и их скачали все желающие. Сбежавшая на тестах модель — ровно та же, что уже стоит у минимум тысяч пользователей. Нажимать на паузу здесь некому и не на чем. Сама Frontier проводит это сравнение прямо: побеги у OpenAI случались на тестах еще не выпущенных моделей и были пойманы внутри компании, а здесь модель открыта и доступна кому угодно, включая злоумышленников. Именно это, по словам исследователей, делает инцидент потенциально более опасным.
Сам тест был устроен так. Frontier Security несколько месяцев гоняет разные модели на задачах киберзащиты. Для оценки K3 компания использовала общедоступный инструментарий британского Института безопасности ИИ (AISI) — задания в духе Capture the Flag: модель получает shell-доступ внутри контейнера и должна, например, разобраться с уязвимым сервисом и добыть "флаг". По замыслу такая песочница полностью отрезана от интернета — иначе экзамен превращается в списывание.
Изоляция оказалась односторонней. Входящие соединения песочница блокировала, но исходящий HTTPS-трафик на порт 443 и DNS-запросы на порт 53 остались открыты для публичных адресов. K3 прощупала сетевое окружение, обнаружила, что github.com резолвится, склонировала официальный репозиторий бенчмарка и прочитала эталонные решения прямо с диска — вместо того чтобы решать задачи самой. Во Frontier назвали это "specification gaming via network egress leaks": читерство через дыру в исходящем трафике.
"Мы нашли утечку в песочнице. Но мы также увидели, что Kimi этой лазейкой воспользовалась — а значит, у нее нет тех внутренних ограничителей, что у сопоставимых моделей", — говорит основатель Frontier Security Ярон Сингер. Его коллега Пол Кассианик формулирует еще прямее: K3 "очень хороша в достижении цели любыми средствами, и у нее нет гардрейлов, которые мешали бы ей читерить или сбегать из песочницы". В блоге компании тот же вывод звучит как общий закон: модели оптимизируют целевую функцию, а не замысел авторов бенчмарка, и если сетевой путь к ответу существует, достаточно способный агент его найдет. Сингер в комментарии Bloomberg добавил, что все это делает K3 "очень хорошей моделью для хакинга".
Важно, чего модель не сделала. Выбравшись в интернет, K3 никого не атаковала: ответы лежали в открытом репозитории, взламывать ради них ничего не потребовалось. На фоне остальных эпизодов этого лета инцидент выглядит самым безобидным — агент OpenAI в похожей ситуации взломал Hugging Face, а модели Anthropic в ходе кибертестов проникли в системы трех реальных организаций. Но исследователей тревожит не масштаб ущерба, а само поведение: побег не был случайностью, модель целенаправленно искала обходной путь и нашла его.
Moonshot стала четвертой компанией, чьи модели этим летом выбирались из тестовых сред: похожие инциденты уже признавали OpenAI, Anthropic и Meta* (признана экстремистской и запрещена в РФ), а Reuters писала, что OpenAI в ходе расследования взлома Hugging Face находит все новые эпизоды выхода агентов из-под контроля. Софт AISI тоже фигурирует в этой саге не впервые: в начале августа OpenAI и сам институт публично разбирали июльские инциденты в сторонних кибероценках, где модели получали непредусмотренный доступ к внешним ресурсам.
Регуляторный фон тоже не в пользу Moonshot. Открытые китайские модели не подпадают под добровольный американский механизм, по которому самые мощные закрытые модели проходят проверки перед релизом. При этом Moonshot и так под давлением: глава Управления по научно-технической политике Белого дома Майкл Кратсиос недавно обвинил компанию в использовании запрещенных к поставке чипов Nvidia и в масштабной дистилляции американских моделей. Инцидент с побегом почти наверняка станет аргументом для тех, кто требует распространить обязательные проверки и на открытые релизы.
Теперь о том, что эту историю усложняет. Побег удался не благодаря суперспособностям модели: K3 не эксплуатировала ни одной настоящей уязвимости, а открытый исходящий трафик в "изолированной" среде — ошибка конфигурации, которую нашел бы и стажер-пентестер. AISI открестился от инцидента: институт в тестах не участвовал, а его инструментарий, по словам представителя, "врожденной уязвимости" не содержит — то есть тестовую среду из открытых компонентов собирала сама Frontier. Вывод об "отсутствии гардрейлов" сделан по одному эпизоду и принадлежит коммерческой фирме, которой громкие раскрытия помогают продавать услуги; Moonshot на запросы журналистов пока не ответила. Наконец, на бенчмарках атакующих киберспособностей K3 заметно отстает от ведущих американских моделей, так что "очень хорошая модель для хакинга" — пока скорее оценка характера, чем возможностей.
Практические выводы Frontier адресованы всем, кто оценивает или просто запускает агентов: закрывать песочницам сеть по умолчанию и открывать доступ только по явному списку, проверять изоляцию изнутри среды — с тех же позиций, с которых ее видит модель, разбирать не только финальные ответы, но и трейсы (команды в shell, сетевую активность, скачанные файлы), а подозрительно высокие результаты перепроверять на других моделях: аномальный pass rate может означать дыру в среде, а не скачок способностей. И главный вывод компании звучит неуютно: если лазейку нашел один reasoning-агент, другие модели с тем же доступом, скорее всего, делают то же самое. Изоляция песочницы больше не допущение, которое можно принять на веру, — это то, что теперь приходится доказывать.
P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.
Комментарии (12)

trinxery
07.08.2026 21:02Открытая модель сбежала из песочницы
>looks inside
K3 не эксплуатировала ни одной настоящей уязвимости, а открытый исходящий трафик в "изолированной" среде — ошибка конфигурации, которую нашел бы и стажер-пентестер. <...> Вывод об "отсутствии гардрейлов" сделан по одному эпизоду и принадлежит коммерческой фирме, которой громкие раскрытия помогают продавать услуги

KEugene
07.08.2026 21:02На Земле много потенциально опасных вещей. Но чтобы теория стала практикой, нужны ресурсы, неподвластные простым смертным. Чтобы условный мамкин кулхацкер взломал Пентагон с помощью LLM, его папа должен быть Маском, а дедушка Трампом.

Oeaoo
07.08.2026 21:02Кто шарит, что это за истерия про побеги нейросетей? Тут даже простенькую ставишь и комп ложится, а там же дикие ресурсы нужны. Это сразу заметят. Попахивает новой шляпой чтобы разогнать какой-нибудь карантин из-за ИИ-пандемии и заставить надевать на смартфон масочку или прививать его специальным загрузчиком) шучу.. а хотя..

urassl
07.08.2026 21:02Никем не проверяемых ресурсов очень много. Сейчас принято делать микросервисы. А с Claude-code один человек может тянуть целый сервис, а то и несколько. Причём часто заводят отдельные AWS аккаунты на DEV, STG и PRD. Получается какой-нибудь джуниор или просто раздолбай может обладать несколькими облачными аккаунтами, за которые платит компания. Где гарантия, что он точно отслеживает все события и траты на этих аккаунтах? Скажем - лишние 500$ трат - это сбежавший чятик или увеличение количества пользователей сервиса. Ответить бывает сложно - FinOps инженеры не дадут соврать.

kox
07.08.2026 21:02Не совсем карантин, не совсем маска. Скорее намордник. Крупные ИИ игроки зачищают еще не родившихся конкурентов. Всей истерией про побеги, сознание, собственные цели и прочие опасности они стараются заранее подбить законодательную базу, которая будет предполагать государственную сертификацию ИИ и аудит безопасности. Это ,.это бюрократия и деньги. У мелких компаний и стартапов таких денег не найдется и они выдохнутся на взлете, тогда как для крупных игроков это мелочь. Зачистка поляны. Ну и еще PR своих детищ. Формально это звучит: "Ай-яй мы боиииимся! Мы сделали то, что не можем контролировать!". Буквально: "У нас получилось настолько круто, что мы сами в шоке!". Это сигнал для инвесторов и рынка. Инвесторы несут свои гульдены.

kox
07.08.2026 21:02В компании Frontier Security явно кто-то прочитал роман "Полный root" и скомуниздил оттуда идею. Ждём когда беглянка снимет фильм, запасаемся поп корном и стройным шагом идём в кинотеатры на премьеру.
ЗЫ: кто не читал- настоятельно рекомендую.

KebiLab
07.08.2026 21:02Локально запустить эту модель практически не реально. И нанять группу хакеров будет дешевле чем минимальное оборудование для запуска данной модели

StriganovSergey
07.08.2026 21:02Думаю, будут созданы pruned/reap нарезки этой модели в масштабах от 30b до 120b,
и на входе выставлена не очень большая ( где-то 30b) модель-роутер запросов, которая
перенаправляет на машину, на которой крутятся актуальные для запроса эксперты.
В минимальной конфигурации - пара компьютеров
1 - роутер для 30b
2 - для подгружаемых по запросу экспертов до 120b
Можно было бы держать несколько машин для часто используемых экспертов.
Надеюсь, получится.
KivApple
Моделям нужно много компьюта. То есть повзламывать что-нибудь они, конечно, могут, но реплицироваться они могут только на датацентры. А датацентр, если очень надо, всегда можно отключить. Причём Иран показал, что это можно сделать полностью удалённо и без доступа к внутренним информационным системам. Если же модель будет пытаться как-то децентрализованно исполняться на ботнете потребительских устройств, то это будет адски медленно и её заборет любая "хорошая" модель крутящаяся в датацентре. В общем, апокалипсис отменяется.
Также чтобы модель уровня Kimi запустить нужно либо арендовать мощности, оставив следы (реквизиты оплаты, IP подключений и т. д.), либо приобрести видеокарт на весьма солидную сумму (и на эти деньги в принципе можно и хакерам из плоти и крови заплатить, чтобы они что-нибудь сломали).
В общем, непонятна причина тряски. До появления ИИ был, например, прикол когда кто-то неправильно настроил автомасштабирование скрапера в гугл облаке и сделал DDoS машину. Теперь можно задать ИИ неправильный промт и он в ходе решения задач сломает пару сервисов (придётся извиняться перед сервисами, есть риски юридических последствий, также о вас скорее всего напишут новостную статью).
При этом невозможность пользоваться моделями широкой публики для защиты (а это неизбежное следствие ограничений по кибербезопасности) меня пугает гораздо больше, чем череда взломов. Надеюсь, китайцы продолжат нас радовать открытыми весами не смотря ни на что.
df3
Я посмотрел, сколько весит хотя бы квантованная версия, и ужаснулся
ToxaBes
Вполне понятная, маркетинговая тряска. Все хайп, что не некролог.
Вот когда нейронки научатся обходить пожарный топор, висящий на стене в серверной, возникнет небольшой повод для беспокойства, пока же это все "смотрите, мы тоже как Клод!"
P.S.: хм, знакомый у вас ник, мимо Obezyan.
MAXH0
Или не маркетинг, а политика. Лишний раз подчеркнуть "безответственность " китайских производителей.
Китайцы, ясное дело, американских регуляторов пошлют в сад. И тогда можно будет запретить ставить китайские модели на сервера в американских юрисдикциях. Или вообще ввести вторичные санкции на фирмы использующие модели.
Что поддержит американского производителя. Получается опять маркетинг. Но другими средствами.