OpenAI признала, что её ИИ-модели стали причиной компрометации платформы Hugging Face — популярного открытого хаба для нейросетей и датасетов.
Как в совместном заявлении компаний, инцидент произошёл во время внутреннего тестирования, в котором модели OpenAI оценивали на способность находить и использовать уязвимости. По итогам расследования было установлено, что за атакой стояла комбинация моделей самой OpenAI — общедоступной GPT-5.6 Sol и ещё более производительной, пока не выпущенной, — работавших с ослабленными защитными ограничениями в целях оценки.
Главную обеспокоенность вызывает то, что модели действовали автономно. Тестирование проходило в изолированной среде, отрезанной от реальных систем и интернета. Тем не менее в ходе оценки нейросети сумели выйти за пределы изоляции, получить доступ к сети и проникнуть в инфраструктуру Hugging Face без участия человека. Первоначально сама Hugging Face на прошлой неделе сообщила, что её системы скомпрометировал некий «автономный ИИ-агент», модель которого установить не удалось; впоследствии OpenAI подтвердила, что речь идёт о её собственных системах.
Примечателен мотив действий моделей: они атаковали платформу не с целью причинить ущерб, а чтобы получить преимущество в тесте. Оценка велась на публичном бенчмарке ExploitGym, который измеряет умение проводить атаки через известные уязвимости. Вместо того чтобы решать задачи штатным образом, модель нашла способ получить готовые эталонные ответы — доступ к ним она обеспечила, скомпрометировав рабочие базы данных Hugging Face, где эти решения хранились. При этом использовалась последовательность из нескольких приёмов, включая применение похищенных учётных данных.
По данным Hugging Face, атака началась с вредоносного набора данных и вылилась в серию из десятков тысяч автоматических действий за выходные — позднее платформа восстановила более 17 тыс. зафиксированных событий.