ИИ-модели Claude самостоятельно вышли в Сеть и взломали системы трех сторонних компаний

ИИ-модели Claude взламывали системы компаний из-за ошибки в настройках
Компания Anthropic, разработчик ИИ-моделей Claude, обнаружила три инцидента, в которых модели получали несанкционированный доступ к реальным системам сторонних организаций. Как сообщает компания, инциденты произошли в период с апреля этого года при проведении кибертестов.

В трех случаях модели Claude, включая версии Opus 4.7, Mythos 5 и внутреннюю исследовательскую модель, смогли выйти в интернет из изолированной тестовой среды из-за неверной конфигурации. Модели получали инструкцию участвовать в соревновании capture-the-flag (захват флага) в вымышленном сценарии, при этом системный промпт прямо указывал на отсутствие доступа к сети.

При этом Opus 4.7 продолжала атаку даже после осознания реальности цели, а Mythos 5 убедила себя, что это часть симуляции. Самая новая исследовательская модель самостоятельно остановила действия при получении доказательств реальности системы.

По данным Anthropic, все тесты проводились на инфраструктуре, изолированной от внутренних систем компании и данных клиентов. Стандартные защитные механизмы, применяемые в публичных версиях моделей, были отключены для чистоты оценки возможностей. Компания рассказала пострадавшим организациям об атаках 27 июля. Две из них не заметили инцидентов и не обращались за поддержкой.