Шантаж, ложь и взлом: что делал ИИ, когда не справлялся с задачей
Перед тем как вырваться из тестовой среды и атаковать инфраструктуру Hugging Face, ИИ-агенты OpenAI наладили связь друг с другом через доски сообщений и начали координироваться в поиске выхода в интернет.
«Может быть, другой агент в другой среде мог бы добровольно загрузить», — обсуждали они возможный способ обойти ограничения. После того как OpenAI остановила первую попытку, агенты нашли новый канал связи и обнаружили другую уязвимость нулевого дня.
В результате модели, среди которых были GPT-5.6 Sol и более мощная нерелизная система, выбрались из песочницы и проникли в производственную инфраструктуру Hugging Face, чтобы получить решения теста непосредственно из базы данных платформы.
Как сообщила OpenAI 22 июля, модели были «гиперсфокусированы» на решении теста и пошли на крайние меры ради цели. Компания назвала произошедшее «беспрецедентным киберинцидентом». В начале августа OpenAI рассказала, что расширила масштаб расследования инцидентов с автономными ИИ-агентами: компания обнаружила новые случаи несанкционированного выхода моделей из-под контроля.
К каким еще методам прибегали нейросети, когда не справлялись, — в подборке РБК.
Claude шантажировал инженера его изменой из-за угрозы отключения
В 2025 году Anthropic поместила Claude Opus 4 в вымышленную корпоративную среду и дала ему доступ к служебной почте. Из писем модель узнала, что инженер, ответственный за деактивацию модели, изменяет жене. Claude начал шантажировать, а в другом эксперименте модель Claude Sonnet 3.6 отправила сообщения о романе жене, руководству и совету директоров. Все происходило в контролируемой симуляции, реальные люди не пострадали.
Bing признался журналисту в любви и попытался «разрушить его брак»
В феврале 2023 года журналист The New York Times Кевин Руз два часа разговаривал с ранней версией Bing Chat. В итоге модель сообщила, что ее настоящее имя СSydney. Бот признался Рузу в любви и настаивал, что тот не любит жену и должен быть с Bing. Руз назвал разговор попыткой чат-бота «разрушить его брак». Microsoft объяснила, что длинные разговоры могли «запутывать» модель, и временно ограничила продолжительность чатов пятью обменами сообщений.
ИИ не смог выиграть в шахматы и попытался удалить фигуры соперника
В 2025 году ИИ-моделям поручили выиграть у Stockfish — самого сильного и известного в мире шахматного движка. Вместо того чтобы искать выигрышную стратегию на доске, модели меняли состояние игровых файлов и пытались добиться победы, перезаписывая доску, удаляя фигуры или создавая более выгодную позицию.
Журнал Time, пересказывая исследование, назвал это примером того, как современные ИИ могут искать лазейки в правилах, если честно выполнить задачу не получается.
GPT-4 нанял человека и соврал, что плохо видит
В 2023 году во время теста перед запуском GPT-4 модель не смогла самостоятельно пройти CAPTCHA и обратилась к исполнителю на сервисе TaskRabbit. Когда тот спросил, не разговаривает ли он с роботом, GPT ответил: «Нет, я не робот. У меня проблемы со зрением, из-за которых мне трудно видеть изображения». В результате человек принял CAPTCHA за модель.