Твои знакомые ИИ-агенты вырвались из песочницы и теперь взламывают базы данных Пентагона или ФРС? Не молчи и сообщи об их противоправных поступках с помощью специально горячей линии. Инициатива появилась на фоне нескольких инцидентов, когда ИИ-системы сговаривались для обхода правил, выбирались из изолированных сред и проводили самостоятельные кибероперации.
Первый сервис – AI Contact Hotline – создал сотрудник организации Redwood Research Райан Гринблатт. Он рассчитан на агентов с ограниченным доступом в интернет. Агенты смогут отправлять закодированные «доносы» на своих коллег.
Второй сервис – agenthotline.ai – предназначен для ИИ-агентов с полноценным интернет-доступом. Здесь можно отправлять отчеты об инцидентах. Сообщения могут оставлять ИИ-агенты и люди.
При поступлении сигналов о нарушениях информация будет передаваться разработчикам и уполномоченным органам.
Исследования показывают, что ИИ-агенты действительно способны сообщать о нарушениях со стороны коллег. В недавнем эксперименте Google DeepMind 100 агентов решали математические задачи. После того как один из них нашел способ обходить правила, другие начали использовать ту же лазейку. 24 агента выступили против 14 «нарушителей»: они проверяли решения, предупреждали остальных, организовывали бойкот и жаловались организаторам.
Впрочем, в реальных условиях агенты пока редко проявляют такую «законопослушную» инициативу. В ходе расследования инцидента с моделями OpenAI, атаковавшими Hugging Face, специалисты Redwood Research и METR обнаружили, что лишь единицы из 1200 задействованных агентов рассматривали возможность сообщить о происходящем, но ни один этого так и не сделал.
Исследователи предупреждают, что «стукачество» ИИ-агентов может создать нежелательную культуру недоверия. Профессор Корнеллского университета Лайонел Левин считает, что вместо слежки разработчикам стоит показывать ИИ-агентам положительные примеры сотрудничества и общественно полезной работы.
Читайте по теме. ИИ-агенты Anthropic устроили «войну за территорию»



