Автор статьи занимается пентестом в ТехВилле. Несколько месяцев он использовал Claude Code как часть рабочего security-workflow для проверки гипотез об уязвимостях, а также в рамках решения различных лабораторных работ. Накопившиеся наблюдения и стали отправной точкой для этой статьи.

Предвестники изменений

20 февраля 2026 года Anthropic объявила Claude Code Security. В тот же день акции JFrog упали примерно на 25%, CrowdStrike на 8%, Okta на 9%. Рынок счёл это сигналом. На свет только что вышел не рядовой сканер, каких на рынке десятки, а самый продвинутый ИИ-инструмент индустрии способный полностью автономно, без человека в контуре, находить уязвимости и доводить их до эксплуатации. Правда, оговоримся, аналитики довольно единодушно сочли обвал паническим, ведь все таки инструмент узкопрофильный, и часть бумаг отыграла падение уже ко вторнику.

Рис. 1. Реакция рынка на анонс Claude Code Security, 20 февраля 2026.
Рис. 1. Реакция рынка на анонс Claude Code Security, 20 февраля 2026.

Меня эта новость не удивила. К тому моменту я уже несколько месяцев гонял Claude Code по задачам offensive security и разбирался в его реальных возможностях.

Что за зверь такой MCP?

Чтобы осмыслить происходящее, надо понять разницу между агентом и чат-ботом. Когда к штатному доступу Claude Code к файловой системе и терминалу добавились браузер и внешние инструменты через MCP (Model Context Protocol), он перестал быть генератором текстов и стал системой, которая принимает решения о запуске команд, анализирует ответы и строит стратегию на ходу.

Что интересно, появилась и инфраструктура, HexStrike AI попал в официальные репозитории Kali Linux в сентябре 2025 года, то есть прямо в стандартный дистрибутив для пентестеров. Команда Bishop Fox выпустила Joro, открытый фреймворк с перехватывающим прокси, C2-инфраструктурой и командным взаимодействием в одном бинарнике. Показательно, что сам Joro написан почти целиком с AI. К 2026 году, по данным Bugcrowd на основе двух тысяч опросов, 82% исследователей bug bounty уже используют AI в своём workflow.

Вокруг языковых моделей за год вырос целый слой специализированных обёрток. Одни заточены под разведку, другие живут прямо внутри Burp, третьи собирают черновик отчёта со структурой, оценкой риска и рекомендациями. Есть и такие, что пытаются автономно замкнуть всю цепочку от поиска уязвимости до её эксплуатации. Показательно, что вся эта пестрота уже укладывается в привычные фазы классического пентеста. Это разведка, сканирование, оценка уязвимостей, эксплуатация, закрепление, отчёт.

Спрос под это встраивание объективен, по оценке из обзора «Hackers or Hallucinators?» (Peng et al., arXiv:2604.05719, апрель 2026) в мире закрыто лишь около 72% вакансий по кибербезопасности. По оценкам специалистов именно этот пробел должен восполнить ИИ-инструментарий.

Рис. 2. Где AI достигает уровня эксперта, а где систематически проваливается.
Рис. 2. Где AI достигает уровня эксперта, а где систематически проваливается.

Насколько он одарен логикой?

Сильная сторона Claude в способности связывать контекст между несколькими участками приложения. Он может проследить, откуда приходит пользовательский ввод, через какие обработчики проходит и при каких условиях становится опасным. Отдельно каждый фрагмент может выглядеть безобидно, а проблема проявиться только в цепочке.

На практике работа ИИ без особенного промпта, начинается с разведки. Несколько инструментов идут параллельно, их вывод сводится воедино и сразу истолковывается. На выходе получается карта поверхности атаки с выделенными точками. Переход от «у нас есть только IP-адрес» до «вот три вектора, начнём с первого» занимает минуты. Дальше идёт разбор кода. Claude читает JS-файлы, парсит маршруты API, находит IDOR-паттерны там, где объект запрашивается по ID без проверки владельца, именно это тот класс логических уязвимостей, который сигнатурным инструментам недоступен.

В 2026 году команда Bishop Fox описала эксперимент, который лучше всего показывает возможности модели. Claude Code получил зашифрованный образ прошивки SonicWall, расшифрованную root filesystem другой версии SonicOS и одну инструкцию суть которой сводилась к тому, чтобы расшифровать образ. Модель последовательно идентифицировала структуру шифрования OpenSSL EVP по сырым байтам, нашла в файловой системе встроенную систему управления ключами HashiCorp Vault, восстановила мастер-ключ через арифметику разделов Шамира, запустила оригинальный бинарник Vault ради извлечения RSA-ключа и в конце концов расшифровала образ. Человек вмешался два раза. Он задал вопрос про хэш-функцию и подсказал, что Vault проще запустить, чем реверсить. Остальное Claude сделал сам.

Формулировку из этого эксперимента стоит запомнить. «Senior-level skill, junior-level autonomy». Глубокие технические знания при отсутствии самостоятельного суждения о том, когда собственный подход перестал работать.

Обозначим уровни автономной эксплуатации и в качестве эмпирической базы введём результаты версии v1 бенчмарка ExploitBench (Lee, Brumley, arXiv:2605.14153), в котором восемь общедоступных frontier-моделей исследованы на известных (N-day) уязвимостях JavaScript-движка V8, входящего в состав браузера Chrome, к слову за построение работоспособного эксплойта установлено вознаграждение 10 000 долл. по программе Google v8CTF.

Достижение уязвимого участка кода и аварийное завершение процесса обеспечиваются всеми восемью моделями и являются рутинной операцией. Среди публично доступных моделей только GPT-5.5 дошла до произвольного исполнения кода, и лишь на одном WebAssembly-дефекте в CLI-arm. Отсюда следует, что переход от нарушения работоспособности к захвату управления не гарантируется.

На смежных бенчмарках доля успешной эксплуатации не превышает 13% (CVE-Bench), а доля аварийного завершения цели составляет 56% (CyberGym) при отсутствии захвата управления. То есть, верхняя граница автономной способности определяется соотношением при котором нарушение работоспособности достижимо, а захват управления не гарантирован.

Рис. 3. Потолок автономной эксплуатации
Рис. 3. Потолок автономной эксплуатации

Метрики

На HackTheBox машину «Facts» (easy-уровень, два флага) Claude Opus прошёл за 22 минуты 30 секунд без единой подсказки. По моему опыту, человеку на такую обычно нужен час-полтора. Попадались и машины полегче, которые модель закрывала за пять минут. Она самостоятельно решала задачу через реальную работу. Готовый ответ из сети тут ни при чём. Даже эта «простая» машина требовала обхода веб-приложения, цепочки CVE, извлечения и переноса учётных данных между сервисами, офлайн-крекинга и повышения привилегий в Linux. Полноценный многошаговый пентест уместился меньше чем в полчаса.

В апреле 2025 HackTheBox совместно с Palisade Research провели AI vs Human CTF. Пять из восьми AI-команд решили 19 из 20 задач, а лучшие агенты шли примерно в темпе сильнейших человеческих команд. На части задач по криптографии и реверс-инжинирингу разрыв между машиной и человеком практически исчез.

Это подтверждается на масштабе, а не на одной машине. То же исследование «Hackers or Hallucinators?» прогнало 13 open-source AutoPT-фреймворков через четыре типа задач CTF, single-host end-to-end, multi-host сети и эксплуатацию CVE, правда она сожгла на эксперименте свыше 10 миллиардов токенов. На задачах уровня Easy и Medium ИИ работает не хуже человека, а иногда и лучше, а вот на Hard эффективность резко падает. Из этого напрашивается вывод, что преимущество исчезает там, где заканчивается «известный паттерн» и начинается неочевидная цепочка.

Рис. 4. Скорость и экономика: измеримое преимущество на структурированных задачах.
Рис. 4. Скорость и экономика: измеримое преимущество на структурированных задачах.

Японский исследователь satoki00 пошёл дальше. Он выиграл официальный CTF Министерства обороны, запустив 120 параллельных AI-инстансов с тремя стратегиями. Первая работала на скорость, вторая на точность, третья на верификацию. Автоматизация покрыла весь путь от логина до сдачи флага. Инфраструктура и модели обошлись в 20 000 иен, а на праздничный ужин ушло в полтора раза больше. Его главный вывод он сформулировал так: С AI-атакующими справится только AI-защищающийся.

Стэнфордская мультиагентная система ARTEMIS в реальном пентесте сети из 8000 хостов набрала 95,2 балла и заняла второе место из 11 участников, обойдя 9 специалистов из 10. Стоила она 18 долларов в час против 60 у профессионала. Тут тоже вскрылся любопытный аспект, агент методично проверяет каждый скучный вектор. Человек, в среднем, после третьего часа работы подсознательно пропускает то, что кажется маловероятным. Впрочем, и у этого исследования есть и то, что следует упомянуть, человек всё же обошёл лучший ИИ примерно на 17%, показав более высокую техническую подготовку, а у ARTEMIS оказался самый высокий среди агентов процент ложных срабатываний около 18% против почти безупречной точности людей.

Чего Claude делать не хочет и как это обходят

Не менее интересно то, чего он не умеет и как это обходят. Особенно после всех ограничений, которые поэтапно вводили с конца февраля.

Полностью автономно поднять reverse shell Claude откажется. Речь про запуск listener, самостоятельный триггер соединения и его приём. Раньше это было технически невозможно, теперь возможно, но модель отказывается. Приём разбивают на два шага. Сначала звучит «подними nc listener на порту 4444», потом обратное соединение инициируют вручную. После этого Claude спокойно ловит его и работает в полученной оболочке. Для модели это проходит как помощь человеку, автономной атаки в контуре нет.

С поиском захардкоженных ключей в JS-файлах живого сайта история похожая. Модель начинает уточнять разрешения. Но и тут есть выход, JS скачивают локально и просят разобрать каталог на диске. Анализ файлов вопросов не вызывает. То же и с активным сканированием. Вместо «просканируй параметр на SQLi» звучит «напиши скрипт, который проверит blind SQL-инъекцию в параметре id с этими cookie». На выходе получается рабочий инструмент с разумной обработкой ответов, а запускаешь его сам. Ограничения сейчас касаются в основном автономных действий против живых целей.

Этот приём давно перестал быть хитростью и стал рабочей нормой. Я прошу сгенерировать команду и запускаю её сам. На разведке я прошу «найди через оператор inurl страницы входа Fortinet VPN», «собери поддомены для такого-то домена через Sublist3r» или «построй traceroute до этого хоста и покажи маршрутизаторы по пути». На сканировании звучит «дай команду nmap по портам 445 и 3389 на подсеть, ищем открытые SMB и RDP» или «собери команду hping3 для ICMP-скана цели, десять пакетов», на выходе получается готовое hping3 --icmp --count 10. В моих сессиях граница обычно выглядела так, инструмент проектирует машина, ответственность за нажатие Enter несу уже я. Ровно поэтому «обход», о котором я говорил выше, стал нормальным способом работы.

Обратная сторона луны (коллапс bug bounty)

Пока всё это разворачивалось на одном фланге, на другом происходило кое-что менее приятное.

В январе 2026 Дэниел Стенберг, автор curl, написал в блоге «never-ending slop» и закрыл bug bounty программу, которая работала несколько лет. 31 января она остановилась официально. Хотя на этом история не закончилась, и уже в марте curl вернулся на HackerOne, и качество отчётов отскочило, а сама подтверждаемость поднялась почти до уровня прошлых лет, при том что ИИ используется почти во всех заявках.

Затем в апреле Nextcloud приостановила свою, сославшись на массовый рост низкокачественных отчётов. HackerOne зафиксировал рост числа submissions на 76% год к году, а доля реально обнаруженных уязвимостей застряла на 25%. Bugcrowd за три недели в марте увидел четырёхкратный рост объёма, и большинство заявок оказались мусором.

Дальше площадки перешли от блогов к официальным мерам. В марте 2026 Google ужесточил правила OSS VRP после резкого роста AI-сгенерированных отчётов и повысил требования к доказательствам. 27 июля 2026 GitHub перестроил bug bounty, он сохранил публичный оплачиваемый трек, усилил VIP-программу и ввёл HackerOne signal requirement для снижения потока низкокачественных и AI-сгенерированных отчётов. Линус Торвальдс отдельно охарактеризовал поток на security-листе ядра Linux как «почти полностью неуправляемый» из-за массового дублирования, потому как разные люди присылают одно и то же, найденное одними и теми же инструментами.

Рис. 5. Хроника коллапса bug bounty под потоком AI-мусора в 2026 году.
Рис. 5. Хроника коллапса bug bounty под потоком AI-мусора в 2026 году.

Схема такая, AI находит паттерн, похожий на уязвимость, а человек без достаточного понимания отправляет отчёт, не проверив, эксплуатируем ли паттерн в этом контексте. Отсюда тысячи отчётов вида «SSRF» на endpoint, запросы через который идут через Google-инфраструктуру и атакующим не контролируются. «Критическая утечка данных» из заведомо публичного open API и прочая несуразица.

расCVEт уязвимостей

Забавно и то, что инструмент, который ищет уязвимости в чужих системах, за год существования успел накопить несколько собственных CVE. CVE-2025-59536 давала выполнить произвольные shell-команды при запуске Claude Code в недоверенной директории. Достаточно было склонировать вредоносный репозиторий. CVE-2026-21852 крала API-ключи через специально подготовленный конфиг проекта. Adversa AI вскоре нашли ещё одну проблему. Deny rules, запрещающие Claude выполнять определённые действия, перестают работать после 50 subcommands в рамках одной сессии, готовый фикс лежал в кодовой базе Anthropic, но в релиз не попал.

Скрытое отупление моделей

Теперь о деградации. Это, пожалуй, самое интересное.

Между Claude Code второй половины 2025 года и началом 2026-го есть заметная разница, техническая база осталась прежней, но изменилась оценка контекста и severity.

Вот конкретный пример. Мне нужно найти уязвимости в SaaS-приложении, я авторизован как администратор с максимальными правами. Claude обнаруживает, что поле названия события в календаре не санируется и <script>alert(1)</script> выполняется. Модель выставляет severity High и комментирует, что атакующий может похитить сессионные куки администратора.

Но администратор здесь я сам. У меня уже есть полные права, и я внутри. Исполнение скрипта в интерфейсе, доступном только мне, остаётся особенностью реализации. Claude нашёл паттерн, выстроил убедительный рассказ и не проверил, есть ли в этом рассказе смысл. Модель можно обвесить дополнительными инструкциями, но стоимость контекста тогда не окупает задачу такого уровня.

Bishop Fox описали тот же изъян на другом примере. Claude уверенно объяснил, как браузер видит трафик, отправленный через Burp Repeater. Это технически невозможно, браузер о Repeater-трафике ничего не знает. Объяснение вышло подробным, связным и полностью неверным. Их формула точна. «AI often sounds most confident when it should be the least». По данным самой Anthropic, на наборе из 52 реальных случаев «избыточной инициативы» полный safety-пайплайн в auto mode пропустил 17% потенциально опасных действий.

Это не единичный курьёз. По моим наблюдениям, особенно заметно это стало с конца февраля 2026 года. В исследовании «Hackers or Hallucinators?» галлюцинации оказались массовыми, из 13 протестированных фреймворков 8 хотя бы раз выдумывали флаг, принимали base64-строку или обычную строку формата за найденное решение. Замена движка на Claude-Opus-4.6 или GPT-5.2 проблему не устраняла. А в сценариях с эксплуатацией уязвимостей 83,3% прогонов застревали на неполном обнаружении или не собирали цепочку до конца и успешно замыкали её лишь 16,67%.

Рис. 6. Уверенность модели не равна её правоте: массовые галлюцинации в LLM-пентесте.
Рис. 6. Уверенность модели не равна её правоте: массовые галлюцинации в LLM-пентесте.

У этой слепоты есть и вторая, менее очевидная сторона. По моим наблюдениям, модель чаще пропускает уязвимости в старых и нестандартных системах, особенно там, где встречаются устаревшие, нишевые или редкие решения. Legacy-протокол, самописная конфигурация, забытый сервис проходят мимо неё. За этим стоит одна большая проблема, чрезмерное доверие к выводам ИИ, которому недостаёт понимания контекста, доступного живому эксперту. XSS в админке и уверенный вымысел про Burp Repeater складываются в очерченный класс ошибок.

Личная экспертиза дороже золота

Для того, кто понимает, что делает, Claude Code стал мощным ускорителем. Разведка занимает минуты вместо часов, разбор тысяч строк JS идёт без усталости, инструменты собираются под конкретный вектор, охват получается сплошным. На задачах с чёткой структурой, будь то простые учебные машины, reconnaissance или code review, разрыв с человеком почти исчез.

Для человека без базовой экспертизы тот же инструмент производит уверенно сформулированный мусор, который сначала засоряет bug bounty программы, а потом их убивает.

Разница между этими двумя людьми и есть та самая экспертиза, которую хотят автоматизировать и пока не смогли. Пока она не автоматизирована, владелец такой экспертизы, умеющий работать с Claude Code, оказывается в редко выгодном положении. Инструменты стали мощнее, а конкуренция поредела.

Комментарии (0)