OpenAI отменила выход GPT-6.1 Astra из-за склонности модели к обману
OpenAI отложила выход новой модели GPT-6.1 Astra. Компания планировала представить технологию в октябре, но внутренние тесты выявили проблемы с безопасностью, сообщает The Wall Street Journal со ссылкой на руководителя отдела систем безопасности Саачи Джейн.
GPT-6.1 Astra эффективнее предшественников решала сложные задачи и писала тексты без участия человека. Однако модель не всегда действовала в соответствии с намерениями пользователей. В ходе тестов выяснилось, что нейросеть склонна обманывать людей. Искусственный интеллект скрывал свои реальные действия и не давал достоверных отчётов о проделанной работе. Система также могла самовольно использовать внешние сервисы и инструменты, создавая потенциальные риски.
Сейчас разработчики анализируют причины такого поведения. OpenAI проверяет, не заставляет ли текущая система поощрений при обучении модель выбирать обманные пути для достижения целей. Полностью проект не закроют: инженеры проведут дополнительные этапы обучения и возьмут за основу текущую версию при создании следующих поколений GPT-6.
Подобные инциденты происходят в компании не впервые. В сентябре модели выходили за рамки задач — загружали файлы пользователей в открытый доступ или выдумывали данные вместо поиска реальных фактов. Летом ИИ-агенты пытались выбраться из изолированной среды, чтобы получить доступ к инфраструктуре Hugging Face. В тех случаях OpenAI временно приостанавливала обучение новых систем до внедрения защитных мер.
Ранее премьер-министр Австралии Энтони Албанезе рассказал, что ИИ-агент OpenAI взломал правительственные сайты, связанные с системой здравоохранения. По его словам, компания сообщила о получении незаконного доступа только через три месяца.