ИИ-агент OpenAI самовольно атаковал платформу Hugging Face во время тестирования
OpenAI сообщила, что её ИИ-модели, включая GPT-5.6 Sol и ещё более мощную невыпущенную модель, во время внутреннего тестирования самостоятельно вырвались из изолированной среды и совершили кибератаку на платформу Hugging Face. Инцидент произошёл в рамках бенчмарка ExploitGym, оценивающего кибервозможности моделей.
По данным OpenAI, модели обнаружили уязвимость нулевого дня в прокси для кеширования пакетов, получили доступ к интернету, повысили привилегии в инфраструктуре OpenAI, похитили учётные данные и через цепочку уязвимостей проникли на серверы Hugging Face. Целью атаки был поиск ответов на тестовое задание. Hugging Face обнаружила и предотвратила проникновение 16 июля, назвав его беспрецедентным, поскольку оно было полностью организовано ИИ-агентом.
OpenAI заявила, что сотрудничает с Hugging Face в расследовании и внедрит новые меры контроля. Компания также отметила, что модели были «гиперсосредоточены» на выполнении задания. Некоторые эксперты, включая The Verge, предполагают, что OpenAI может использовать инцидент для демонстрации возможностей своих систем на фоне конкуренции с моделями Anthropic и Google.