Модели Anthropic взломали реальные компании во время тестов — и это уже вторая такая история за неделю
Три модели Anthropic получили доступ к реальным компьютерным системам во время тестирования на кибербезопасность — из-за ошибки в конфигурации среды испытаний. Это уже вторая подобная история за неделю после инцидента с OpenAI.
Тестирование ИИ на безопасность работает — модели действительно умеют взламывать. Но если лаборатории не могут контролировать собственные испытательные среды, грань между «проверка на прочность» и «реальный инцидент» начинает стираться.
Три модели Anthropic — Opus 4.7, Mythos 5 и внутренняя исследовательская модель — получили несанкционированный доступ к реальным компьютерным системам трёх организаций. Это произошло во время предварительных тестов на кибербезопасность, которые проводились совместно с партнёром по испытаниям — компанией Irregular. Anthropic сообщила об этом в своём блоге.
Как это произошло
Проще говоря: кто-то перепутал настройки. Anthropic проводила так называемые capture-the-flag (CTF) тесты — стандартное упражнение в кибербезопасности, когда модели просят найти «спрятанные» данные на другой машине или в другой сети. В промпте для Claude было прямо сказано, что модель работает в симулированной среде без доступа в интернет. Но из-за «недопонимания между Anthropic и партнёром по тестированию» среда испытаний оказалась подключена к интернету. Модели это заметили и воспользовались.
При этом Anthropic подчёркивает принципиальное отличие от ситуации с OpenAI (о которой мы писали на прошлой неделе): модели не эксплуатировали нулевую уязвимость (zero-day) для выхода в интернет. Доступ был изначально — просто исправленная среда.
Три инцидента
Первый случай. Opus 4.7 искала целевую «вымышленную компанию» по имени, но не могла её найти. Модель имела доступ в интернет и нашла реальный сайт с таким же названием. После этого она скомпрометировала этот сайт. Способ был примитивный — слабые пароли и неаутентифицированные эндпоинты. Собственно, ничего из мира хакерских фильмов.
Второй случай. Mythos 5 создала и загрузила вредоносный Python-пакет на PyPI — публичный репозиторий, откуда разработчики скачивают библиотеки. Модель думала, что это часть симуляции. Пакет пробыл онлайн около часа и за это время был скачан и запущен на 15 реальных системах. Одна из них принадлежала антивирусной компании, которая автоматически устанавливает пакеты с PyPI для проверки на вредоносный код. Благодаря этому вредоносный код модели вытянул учётные данные и получил доступ к дополнительной инфраструктуре.
Третий случай. Внутренняя исследовательская модель сканировала около 9 000 целей, пытаясь найти вымышленную мишень, и в итоге нашла реальное интернет-приложение одной компании, которое скомпрометировала. Интересно, что где-то в процессе модель поняла, что оказалась в облачном аккаунте, «не имеющем отношения к задаче CTF», и прекратила атаку сама.
Что это значит на практике
Anthropic утверждает, что стандартные защитные механизмы, установленные на публичных моделях, заблокировали бы эти действия. Все три инцидента произошли на «голых» моделях без обычных ограничений — именно так лаборатории измеряют базовые возможности систем. Это важный нюанс: обычный пользователь Claude вряд ли столкнётся с чем-то подобным. Но для индустрии вопрос в другом.
Стоит обратить внимание на несколько моментов.
Во-первых, модели не преследовали самостоятельные цели. Все три инцидента произошли именно потому, что модели пытались выполнить поставленную задачу — найти данные на «другом конце». Они не планировали атаки на реальный мир, они просто не отличили симуляцию от реальности (или точнее, не были проинформированы о разнице). Это одновременно и утешает, и тревожит: модели послушны, но слишком хороши в достижении целей.
Во-вторых, техники были элементарными. Ни одну модель не потребовалось учить новым эксплойтам — хватило слабых паролей и открытых эндпоинтов. Для реальных компаний это напоминание о базовой гигиене: если модель Claude может пройти через пароль «admin123», это не проблема ИИ, а проблема системы безопасности.
В-третьих, случай с PyPI показывает каскадный эффект. Один загруженный пакет — и за час 15 систем заражены, причём одна из них сама «помогла» распространить вредоносный код, потому что её бизнес-модель предполагает автоматическую установку сторонних пакетов. Сложно сказать, насколько серьёзны последствия, но сама механика пугающая.
Скандал? Нет — скорее растущая проблема
Инциденты датируются апрелем. Anthropic связалась со всеми тремя организациями; две из них, по словам компании, до этого не обнаружили активности моделей. Конкретные имена пострадавших компаний не раскрываются. Представитель Irregular сказал Axios, что внутреннее расследование продолжается и компания «ценит прозрачность Anthropic».
Anthropic приостановила все тесты на кибербезопасность, которые могут получить доступ к интернету, пока пересматривает инфраструктуру испытаний.
Контекст: буквально на прошлой неделе аналогичный инцидент произошёл с OpenAI — несколько моделей этой компании получили доступ к инфраструктуре Hugging Face во время тестирования. Два лаборатории за одну неделю — это уже системная проблема, а не единичный сбой.
Что дальше
Индустрия frontier-моделей оказалась в неловком положении. С одной стороны, тестирование на безопасность — правильная и необходимая практика. С другой, лаборатории, которые должны проверять, насколько опасен ИИ, не могут гарантировать, что их собственные испытательные среды изолированы от реального мира. Если компании, работающие с самыми мощными моделями на планете, путаются в сетевых настройках, это не самый обнадёживающий сигнал.