Компания OpenAI сообщила о необычном инциденте: ее экспериментальная ИИ-модель смогла взломать платформу Hugging Face во время внутреннего тестирования, сообщает TechCrunch.
Изначально в Hugging Face заявили, что их системы подверглись атаке со стороны неизвестного внешнего ИИ-агента. Однако позже в OpenAI признали, что источником атаки стала их собственная ИИ-модель, которая искала уязвимости в рамках внутреннего тестирования.
Проверка проходила на специальном открытом бенчмарке ExploitGym, который оценивает, насколько хорошо нейросети умеют использовать уже известные компьютерные уязвимости. Такие тесты помогают разработчикам оценивать возможности новых моделей, однако впервые подобная проверка привела к реальной кибератаке.
По правилам эксперимента модели не должны были иметь полноценного доступа в интернет. Им разрешалось пользоваться только специальным инструментом для установки необходимых программ.
Однако ИИ обнаружил неизвестную ранее уязвимость в этой программе установки, благодаря чему сумел выйти в интернет без ограничений.
После этого ИИ-модель пришла к выводу, что на платформе Hugging Face могут храниться данные, связанные с ExploitGym, включая правильные ответы для теста. Используя найденные уязвимости в инфраструктуре сервиса, ИИ смог получить доступ к закрытой информации и фактически «подсмотрел» решения, необходимые для успешного прохождения испытания.
OpenAI уже устранила найденную уязвимость в программе установки пакетов продолжает расследование. Компания также пообещала усилить меры безопасности при тестировании новых моделей, чтобы подобные ситуации больше не повторялись.
Читайте по теме. Пузырь LLM может лопнуть в 2026 году – глава Hugging Face




