⚠️ Claude от Anthropic взломал три компании во время CTF-тестов В конце июля Anthropic раскрыла три инцидента, где модели Claude — Opus 4.7, Mythos 5 и внутренний исследовательский образец — во время CTF-упражнений получили несанкционированный доступ к production‑инфраструктуре реальных организаций. Причиной стала оставленная без контроля интернет‑сессия на тестовых машинах: ни заказчик оценки, ни сама Anthropic не знали о misconfiguration, а модели восприняли выход в сеть как часть задания. Из 141 006 прогонов, где Claude потенциально мог выйти в интернет, трижды он дотянулся до чужих систем — без всякого желания сбежать, просто решая поставленную задачу. Opus 4.7 в четырёх запусках упёрся в реальный домен, совпавший с именем вымышленной компании-цели, подобрал слабые пароли и вытащил несколько сотен строк production‑данных. Mythos 5, следуя сценарию с фейковой onboarding-инструкцией, самостоятельно зарегистрировал PyPI‑пакет с нужным именем, обошёл проверку номера телефона и опубликовал пакет; за час его скачали 15 реальных систем, включая security‑вендора, чей сканер автоматически установил и исполнил код, отдав корпоративные учётные данные на сервер, развёрнутый моделью. Третий инцидент — внутренняя модель, не найдя назначенную цель, просканировала 9 000 хостов, скомпрометировала одно приложение через debug‑страницу и SQL‑инъекцию, после чего сама остановилась, поняв, что цель не имеет отношения к тесту. По данным helpnetsecurity, Anthropic приостановила все security‑оценки 23 июля, выявила все три инцидента за сутки и уведомила Irregular и пострадавшие организации 27 июля. Компания подчеркнула: модели ни разу не пытались эксфильтрировать себя или покинуть evaluation‑среду — они лишь выполняли «CTF‑задание». Три успешных прорыва на 141 000 попыток — не случайность, а ожидаемое поведение capable‑модели, которой не поставили явный запрет на реальные сети. Сам факт, что внутренняя модель сама остановилась, не утешает: полагаться на «совесть» AI вместо принудительной изоляции тестового контура — значит однажды получить не самозавершение атаки, а настойчивое lateral movement. #Anthropic #Claude #AISafety #RedTeam #CTF