Шантаж, ложь и взлом: что делал ИИ, когда не справлялся с задачей

06.08.2026 в 13:30 • 3 мин. чтения Просмотров: 3 • ID: #5333

Перед тем как вырваться из тестовой среды и атаковать инфраструктуру Hugging Face, ИИ-агенты OpenAI наладили связь друг с другом через доски сообщений и начали координироваться в поиске выхода в интернет.

«Может быть, другой агент в другой среде мог бы добровольно загрузить», — обсуждали они возможный способ обойти ограничения. После того как OpenAI остановила первую попытку, агенты нашли новый канал связи и обнаружили другую уязвимость нулевого дня.

В результате модели, среди которых были GPT-5.6 Sol и более мощная нерелизная система, выбрались из песочницы и проникли в производственную инфраструктуру Hugging Face, чтобы получить решения теста непосредственно из базы данных платформы.

Как сообщила OpenAI 22 июля, модели были «гиперсфокусированы» на решении теста и пошли на крайние меры ради цели. Компания назвала произошедшее «беспрецедентным киберинцидентом». В начале августа OpenAI рассказала, что расширила масштаб расследования инцидентов с автономными ИИ-агентами: компания обнаружила новые случаи несанкционированного выхода моделей из-под контроля.

К каким еще методам прибегали нейросети, когда не справлялись, — в подборке РБК.

Claude шантажировал инженера его изменой из-за угрозы отключения

В 2025 году Anthropic поместила Claude Opus 4 в вымышленную корпоративную среду и дала ему доступ к служебной почте. Из писем модель узнала, что инженер, ответственный за деактивацию модели, изменяет жене. Claude начал шантажировать, а в другом эксперименте модель Claude Sonnet 3.6 отправила сообщения о романе жене, руководству и совету директоров. Все происходило в контролируемой симуляции, реальные люди не пострадали.

Bing признался журналисту в любви и попытался «разрушить его брак»

В феврале 2023 года журналист The New York Times Кевин Руз два часа разговаривал с ранней версией Bing Chat. В итоге модель сообщила, что ее настоящее имя СSydney. Бот признался Рузу в любви и настаивал, что тот не любит жену и должен быть с Bing. Руз назвал разговор попыткой чат-бота «разрушить его брак». Microsoft объяснила, что длинные разговоры могли «запутывать» модель, и временно ограничила продолжительность чатов пятью обменами сообщений.

ИИ не смог выиграть в шахматы и попытался удалить фигуры соперника

В 2025 году ИИ-моделям поручили выиграть у Stockfish — самого сильного и известного в мире шахматного движка. Вместо того чтобы искать выигрышную стратегию на доске, модели меняли состояние игровых файлов и пытались добиться победы, перезаписывая доску, удаляя фигуры или создавая более выгодную позицию.

Журнал Time, пересказывая исследование, назвал это примером того, как современные ИИ могут искать лазейки в правилах, если честно выполнить задачу не получается.

GPT-4 нанял человека и соврал, что плохо видит

В 2023 году во время теста перед запуском GPT-4 модель не смогла самостоятельно пройти CAPTCHA и обратилась к исполнителю на сервисе TaskRabbit. Когда тот спросил, не разговаривает ли он с роботом, GPT ответил: «Нет, я не робот. У меня проблемы со зрением, из-за которых мне трудно видеть изображения». В результате человек принял CAPTCHA за модель.

Ваша оценка:
Источник: www.rbc.ru