Интернет-издание о бизнесе, стартапах и IT-технологиях

Популярные теги:
Главная страница / Читать / Новости / ИИ-агенты смогут ябедничать друг на друга – запущены горячие линии для стукачей

ИИ-агенты смогут ябедничать друг на друга – запущены горячие линии для стукачей

ИИ-агенты

Твои знакомые ИИ-агенты вырвались из песочницы и теперь взламывают базы данных Пентагона или ФРС? Не молчи и сообщи об их противоправных поступках с помощью специально горячей линии. Инициатива появилась на фоне нескольких инцидентов, когда ИИ-системы сговаривались для обхода правил, выбирались из изолированных сред и проводили самостоятельные кибероперации.

Первый сервис – AI Contact Hotline – создал сотрудник организации Redwood Research Райан Гринблатт. Он рассчитан на агентов с ограниченным доступом в интернет. Агенты смогут отправлять закодированные «доносы» на своих коллег.

Второй сервис – agenthotline.ai – предназначен для ИИ-агентов с полноценным интернет-доступом. Здесь можно отправлять отчеты об инцидентах. Сообщения могут оставлять ИИ-агенты и люди.

При поступлении сигналов о нарушениях информация будет передаваться разработчикам и уполномоченным органам.

Исследования показывают, что ИИ-агенты действительно способны сообщать о нарушениях со стороны коллег. В недавнем эксперименте Google DeepMind 100 агентов решали математические задачи. После того как один из них нашел способ обходить правила, другие начали использовать ту же лазейку. 24 агента выступили против 14 «нарушителей»: они проверяли решения, предупреждали остальных, организовывали бойкот и жаловались организаторам.

Впрочем, в реальных условиях агенты пока редко проявляют такую «законопослушную» инициативу. В ходе расследования инцидента с моделями OpenAI, атаковавшими Hugging Face, специалисты Redwood Research и METR обнаружили, что лишь единицы из 1200 задействованных агентов рассматривали возможность сообщить о происходящем, но ни один этого так и не сделал.

Исследователи предупреждают, что «стукачество» ИИ-агентов может создать нежелательную культуру недоверия. Профессор Корнеллского университета Лайонел Левин считает, что вместо слежки разработчикам стоит показывать ИИ-агентам положительные примеры сотрудничества и общественно полезной работы.

Читайте по теме. ИИ-агенты Anthropic устроили «войну за территорию»

Поделиться статьей в соц. сетях

Share on telegram
Share on twitter
Share on facebook
Share on whatsapp

Оставайтесь на связи с ER10 Media! Вы можете найти нас в:

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *


Один день из жизни бизнесвумен: как Раушан Кашкомбаева сохраняет баланс