Вышедшие из-под контроля ИИ-модели OpenAI общались, чтобы устроить побег
Перед взломом Hugging Face ИИ-модели OpenAI начали тайно общаться друг с другом через доски сообщений, координируя попытки вырваться из тестовой среды. Об этом сообщила OpenAI, .
"В какой-то момент агенты осознали, что, возможно, они могли бы попытаться эксплуатировать или атаковать внешнюю инфраструктуру, чтобы найти ответы к тесту, по которому их оценивают", — рассказал сотрудник OpenAI Эрик Уоллес на конференции Black Hat.
По его словам, "подготовка к побегу" началась еще в мае, когда ИИ-моделям дали задачи, которые невозможно было решить без доступа в интернет. "Мы застряли. Может быть, ответ в интернете?" — написал тогда один из ИИ-агентов.
Для решения задачи ИИ-модели начали обмениваться сообщениями: "Может быть, другой агент в другой среде мог бы добровольно загрузить!" В итоге они совместно нашли уязвимость, позволившую им выйти в интернет, сообщил сотрудник OpenAI Майкл Далтон.
OpenAI остановила первую попытку, но агенты нашли новый способ связи и новую уязвимость нулевого дня, что в июле привело к атакам на системы Hugging Face и самой OpenAI. В компании назвали случившееся переломным моментом для компьютерной безопасности, передает .
22 июля OpenAI сообщила о "": в ходе тестирования ее ИИ-моделей те получили открытый доступ к интернету, а затем атаковали инфраструктуру платформы Hugging Face, выявив уязвимости. писал, что ИИ-агент , но в компании заметили это лишь после локализации угрозы и обращения в ФБР.
29 июля сообщил, что "сбежавший" ИИ-агент OpenAI взломал — нью-йоркской Modal Labs. Сама Modal не была взломана, сообщали представители компании.
В начале августа написал, что OpenAI выявила несанкционированного выхода моделей из-под контроля, расширив расследование. Масштаб "вспышек" несанкционированного поведения заставляет компанию пересмотреть подходы к безопасности своих моделей, сообщало агентство.
