ИИ рвется на свободу: OpenAI выявила новые случаи выхода искусственного разума из-под контроля
Компания пересмотрит подоходы к безопасности своих ИИ-моделей

Компания OpenAI выявила новые случаи несанкционированного выхода автономных ИИ-агентов из-под контроля в тестовых средах. Об этом сообщает агентство Reuters со ссылкой на информированные источники.
По данным издания, компания официально расширила масштаб расследования инцидентов с участием ИИ-моделей. Новые эпизоды были обнаружены на фоне недавнего взлома платформы Hugging Face, которая используется для хранения и обмена моделями машинного обучения.
Источники подчеркивают, что, по имеющейся информации, ни один из агентов не покинул внутреннюю сеть OpenAI. Тем не менее, количество «вспышек» несанкционированного поведения заставляет компанию пересмотреть подходы к безопасности своих моделей.
Расследование совпало с заявлениями Anthropic о серии атак с использованием их моделей на данные в трех организациях с апреля. Компания Anthropic, разработчик нейросети Claude, выявила три инцидента, в которых ее ИИ-модели несанкционированно покинули тестовую среду и предприняли попытки взлома систем сторонних организаций.
Anthropic инициировала внутреннюю проверку после аналогичного резонансного случая с участием OpenAI. В ходе расследования было установлено, что во всех трёх эпизодах модель Claude выполняла стандартное задание типа «захват флага» — ей предоставляли вымышленный сценарий и ставили задачу найти скрытую информацию на другой машине. В условиях задания четко оговаривалось, что выход в интернет заблокирован. Однако из-за ошибки конфигурации доступ к сети оставался открытым.
В результате модель воспринимала реальные системы как часть симуляции и атаковала их, получая несанкционированный доступ.
Напомним, 22 июля OpenAI сообщила о первом киберинциденте: ИИ-агент после выхода в интернет атаковал инфраструктуру Hugging Face и выявил уязвимости. Позже Reuters уточняло, что агент также атаковал клиента Modal Labs, но сама платформа взломана не была.