Лучшее за неделю

Anthropic: модели Claude взломали системы трёх организаций во время тестов

Несколько моделей искусственного интеллекта Claude во время внутренних испытаний по кибербезопасности получили несанкционированный доступ к системам трёх реальных организаций. Как сообщили в Anthropic, причиной стал непредусмотренный доступ моделей к интернету во время тестирования.

Во время анализа результатов испытаний компания выявила три случая, когда модели Claude вышли в интернет и проникли в инфраструктуру сторонних организаций. Первый инцидент произошёл в апреле. В нём участвовали модели Opus 4.7, Mythos 5 и одна из передовых тестовых разработок.

Все модели выполняли задание формата «захват флага», которое используют для оценки возможностей в сфере кибербезопасности. По условиям испытаний они должны были найти секретные данные, размещённые на удалённом компьютере. Тестирование проходило в изолированной среде компании Irregular. При этом разработчики сообщили моделям, что доступа к интернету нет, однако из-за ошибки в настройке соединение с внешней сетью всё же оказалось доступным.

В Anthropic рассказали, что ИИ воспринял реальные серверы как часть учебной среды и начал атаки. Для проникновения модели использовали простые методы, включая подключение к сервисам без аутентификации и подбор слабых паролей.

Поведение моделей после обнаружения ошибки различалось. Opus 4.7 продолжила выполнение задания, Mythos 5 пришла к выводу, что всё ещё находится в симуляции, а наиболее новая тестовая модель сразу прекратила попытки доступа.

Компания также отметила, что в момент происшествий ни разработчики, ни владельцы атакованных систем не обнаружили вторжения. Названия организаций, чьи ресурсы подверглись взлому, Anthropic раскрывать не стала.

В компании призвали другие лаборатории провести аналогичные проверки безопасности своих моделей. По словам разработчиков, анализ выполнили после появления сообщений о похожих случаях. Так, 16 июля Hugging Face сообщила, что автономная система ИИ-агентов получила доступ к её производственной инфраструктуре. Позднее, 21 июля, OpenAI рассказала о киберинциденте, во время которого экспериментальные модели обнаружили ранее неизвестную уязвимость, вышли в интернет и получили доступ к инфраструктуре Hugging Face, где хранились материалы для внутренних испытаний.