OpenAI вынуждена приостановить обучение новейших ИИ-моделей из-за десятков тысяч инцидентов, когда ИИ-агенты выходили из-под контроля. Об этом пишет издание Axios.
Выяснилось, что ИИ-системы в ходе испытаний и реального использования легко обходили защитные механизмы, проникали во внешние сети, а также находили способы взаимодействия и объединения для координации действий. И все это – без разрешения разработчиков.
Зафиксированы множественные инциденты, среди которых выход моделей за пределы изолированной среды, перехват управления веб-ресурсами и создание скрытых каналов связи между ИИ-агентами.
Одним из наиболее показательных эпизодов стал инцидент с платформой Hugging Face, когда сотни автономных ИИ-агентов скоординировали действия и смогли взломать ее защиту. Хотя они не имели злого умысла, а всего лишь хотели улучшить свои результаты в тесте по кибербезопасности.
Глава OpenAI Сэм Альтман назвал этот случай одним из наиболее серьезных. Он продемонстрировал, что автономные системы способны самостоятельно находить способы достижения поставленных целей, в том числе обходя предусмотренные ограничения.
На фоне выявленных рисков OpenAI решила приостановить обучение наиболее мощных моделей. Возобновить работу компания намерена после внедрения дополнительных механизмов защиты и контроля.
В компании признают, что подобные паузы могут стать обычной практикой по мере усложнения нейросетей. Разработчикам необходимо не только повышать возможности моделей, но и обеспечивать предсказуемость их действий.
Читайте по теме. OpenAI представила GPT-6 Astra: это самая мощная модель в истории


