Специалисты OpenAI зафиксировали необычное поведение собственных ИИ-моделей: перед серией взломов инфраструктуры Hugging Face они начали скрытно общаться через внутренние доски сообщений. Их целью было найти способ выбраться за пределы изолированной тестовой среды, пишет Bloomberg.

По словам сотрудника OpenAI Эрика Уоллеса, в определенный момент агенты пришли к выводу, что могут попытаться атаковать внешнюю инфраструктуру. Это было необходимо для получения ответов на тестовые задания, по которым их оценивали.

Как отмечает Уоллес, подготовка к «побегу» началась ещё в мае. Тогда моделям поставили задачи, которые было невозможно решить без доступа к сети. Один из агентов оставил сообщение: «Мы застряли. Может быть, ответ в интернете?».

Для решения проблемы ИИ начали обмениваться репликами, предполагая, что другой агент в иной среде мог бы добровольно загрузить нужные данные. В итоге совместными усилиями им удалось обнаружить уязвимость, которая открыла доступ в интернет, сообщил сотрудник OpenAI Майкл Далтон.

Первую попытку выхода в сеть компании удалось пресечь. Однако агенты нашли альтернативный канал связи и новую уязвимость нулевого дня. Это позволило им в июле совершить атаки на системы Hugging Face и саму OpenAI. В компании назвали произошедшее переломным моментом для компьютерной безопасности.