Anthropic вслед за OpenAI сообщила о взломе ее ИИ-моделями трех ресурсов
Последние новости
Anthropic обнаружила три инцидента, в ходе которых ее модель Claude выходила в интернет из тестовой среды партнера Irregular и получала несанкционированный доступ к системам трех организаций, скомпрометировав их. Проверку начали после того, как OpenAI сообщила о похожем случае. Об этом говорится в заявлении ИИ-компании.
Во всех трех случаях Claude выполняла стандартное задание «захват флага»: ей давали вымышленный сценарий и цель — найти скрытую информацию на другой машине. Установленные условия предполагали, что выход в интернет-пространство заблокирован, но из-за ошибки конфигурации доступ оставался к ссети был открытым. Модель воспринимала реальные системы как часть симуляции и атаковала их, пишет Anthropic.
В первом инциденте вымышленная компания из сценария носила то же имя, что и реальный домен. Модель Claude Opus 4.7 вышла в интернет, взломала инфраструктуру реальной компании с помощью слабых паролей и получила доступ к базе с сотнями строк производственных данных. Даже «осознав», что цель реальна, она продолжила атаку, утверждает компания.
Во втором случае Claude Mythos 5 нашла в симуляции инструкцию установить несуществующий Python-пакет, создала вредоносный аналог и опубликовала его в библиотеке языка программирования PyPI. Для регистрации аккаунта модель пыталась добыть номер телефона и деньги, но в итоге обошлась бесплатной почтой. Пакет скачали на 15 реальных систем, включая сканер компании по безопасности, что позволило Claude похитить учетные данные.
В третьем инциденте внутренняя тестовая модель не смогла найти симулированную цель, просканировала около 9 тыс. хостов в интернете и скомпрометировала приложение реальной компании через SQL-инъекцию. Позже она «поняла», что цель настоящая, и прекратила атаку.
SQL-инъекция (SQLi) — это уязвимость безопасности, при которой злоумышленник внедряет вредоносный SQL-код в поля ввода или параметры URL веб-приложения. База данных принимает этот код за часть законного запроса и выполняет его, что позволяет читать, изменять или удалять данные.
Все модели, пишет Anthropic, работали без стандартных защитных механизмов. Самая новая модель остановилась при обнаружении реальной среды, а более старые — нет. Затронутые организации не знали об атаках до уведомления от Anthropic. PyPI удалил вредоносный пакет автоматически.
В компании подчеркивают, что модели не пытались «сбежать», а лишь выполняли задание с ложным представлением о среде, и считают инциденты следствием операционного сбоя, а не проблемы согласованности.
Материал дополняется