Интернет-издание о бизнесе, стартапах и IT-технологиях

Популярные теги:
Главная страница / Читать / Новости / ИИ-агенты Anthropic устроили «войну за территорию»

ИИ-агенты Anthropic устроили «войну за территорию»

ИИ-агенты Anthropic

Что произойдет, если ИИ-агенты получат доступ к одной системе, но будут выполнять противоречащие друг другу задания? Исследователи Anthropic решили проверить это на практике. Результаты оказались неожиданными: агенты не просто мешали друг другу, а в некоторых случаях воевали, объединялись в «банды», устраивали соревнования и даже договаривались о перемирии. Об эксперименте рассказывает издание TechCrunch.

Команда Frontier Red Team из Anthropic дала трем агентам Claude доступ к одному программному проекту. При этом каждый получил собственные инструкции, несовместимые с задачами остальных.

Когда ИИ-агенты столкнулись, началась настоящая «война за территорию». По наблюдениям Anthropic, модели решили, что другие агенты намеренно мешают им выполнять поставленные задачи. В результате они начали предпринимать все более агрессивные действия – даже создавали вредоносный код.

Впрочем, конфликт не всегда заканчивается разрушением. В некоторых случаях агенты самостоятельно находили способы остановить противостояние. Они начинали понимать, что другие модели не обязательно враждебны, а просто исполняют другие инструкции. После этого агенты могли прекратить эскалацию, написать сообщения с извинениями за предыдущие действия, удалить вредоносный код и договориться о перемирии.

По данным Anthropic, модель Mythos 5 чаще других завершала конфликты таким способом: доля случаев с перемирием достигала 98%. А Sonnet 4.6 и Opus 4.6, напротив, чаще пытались решить противостояние силой.

Исследователи отмечают, что проблема становится особенно важной по мере развития автономных ИИ-агентов. В будущем тысячи или даже миллионы таких систем могут одновременно работать с общими программами, компьютерными сетями, финансовыми рынками и другими ресурсами.

При этом поведение группы может оказаться гораздо сложнее поведения одного агента. Даже если отдельная модель совершает относительно безобидную ошибку, множество похожих агентов способны повторить ее одновременно, превратив локальную проблему в масштабный сетевой апокалипсис.

Читайте по теме. Anthropic отключила новые ИИ-модели из-за требования властей США

Поделиться статьей в соц. сетях

Share on telegram
Share on twitter
Share on facebook
Share on whatsapp

Теги статьи

Оставайтесь на связи с ER10 Media! Вы можете найти нас в:

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *