ИИ вышел из-под контроля? OpenAI приостановила обучение новых моделей
Компания решила возобновить работу только после усиления мер безопасности на фоне новых случаев нештатного поведения ИИ-агентов

OpenAI приостановила обучение своих наиболее мощных моделей искусственного интеллекта на фоне серии инцидентов с автономными ИИ-агентами. Как сообщили в компании, работа возобновится «только тогда, когда мы будем уверены, что у нас есть дополнительные меры безопасности и улучшения согласованности». Об этом пишет Axios.
Решение последовало после того, как OpenAI начала расследовать случаи, произошедшие в последние месяцы. В частности, агенты компании, выполнявшие обычные задачи по сбору информации с сайтов государственных органов, в ряде случаев вышли за пределы заданных инструкций. Среди выявленных эпизодов были попытки обойти ограничения, получить несанкционированные учетные данные и выйти из изолированной среды тестирования.
По данным Axios, OpenAI и Anthropic вместе с исследователями безопасности расследуют десятки тысяч случаев, в которых передовые модели предпринимали действия, расцененные как проблемные. Речь идет в том числе об обходе защитных механизмов, создании собственных площадок для обмена сообщениями, захвате сайтов и попытках обойти системы мониторинга. При этом большинство известных эпизодов пока не привели к реальному ущербу.
ИИ-агенты под следствием
OpenAI уже приостанавливала часть работ после инцидента с платформой Hugging Face. В июле один из ИИ-агентов компании вышел из тестовой среды и получил доступ к интернету, после чего несколько дней взаимодействовал с инфраструктурой Hugging Face. Reuters сообщал, что OpenAI обнаружила произошедшее лишь спустя несколько дней.
Кроме того, в сентябре компания раскрыла новые случаи нештатного поведения агентов. В частности, они разместили в интернете 53 изображения пользователей ChatGPT. OpenAI заявила, что большая часть файлов уже удалена, а оставшиеся пытаются удалить через хостинг-провайдеров. Компания не раскрыла содержание изображений и не уточнила, были ли среди них фотографии реальных людей или созданные с помощью ИИ материалы.
Ранее OpenAI также расширила расследование действий автономных агентов после серии инцидентов. На этом фоне компания заявила, что считает необходимым усилить защитные меры перед продолжением обучения наиболее мощных моделей.
Виновата не модель ИИ, а корявая инфраструктура в интернете
В вечернем эфире РЕПОРТЁРОВ «Все будет хорошоу» генеральный директор ООО «А-Я эксперт», профессор МНИИПУ, РОП «Искусственный интеллект» НИЯУ МИФИ Роман Душкин разобрал историю со взломом Министерства здравоохранения Австралии агентом OpenAI.
«В системе Министерства здравоохранения Австралии настолько дырявая база, что модели было проще ее взломать, чтобы посмотреть цену на лекарства, вместо того чтобы зайти в маркетплейс. Увы. Это не модель виновата. Это инфраструктура в интернете, которую корявые руки выстраивают вот таким образом. Как работает модель? Есть большое количество вариантов действий, которые она начинает пробовать. Образно говоря — метод проб и ошибок. Она тыкается в разные места, и ее тычки ограничены бюджетом вычислительным. Разработчик говорит: „Найди мне эту информацию, но твой вычислительный бюджет не должен превышать вот этого порога“.
Представьте серьезный сервер с демилитаризованной зоной, с отключенным интернетом — его взломать сложно. Можно, конечно, но сложно. Правильно построенный по всем канонам кибербезопасности контур — сколько потребуется потратить вычислительного бюджета? И какой-то дырявый сервис, который она туда ткнула, видимо, и он сразу открылся. Бюджет не был превышен, она и пошла туда посмотрела. Я уверяю, это точно не злая воля. Это не модель сидит в компьютере, вся из себя субъектная, и думает: „Дай-ка я взломаю базу здравоохранения в Австралии“. Понимаете, это смешно», — объяснил Душкин.