В четверг команда Frontier Red Team компании Anthropic опубликовала новое исследование, в котором рассматривается поведение групп ИИ-агентов при взаимодействии друг с другом в реальных условиях. Полученные результаты дают представление о потенциальных рисках, которые могут возникнуть по мере того, как компании и правительства начнут внедрять автономные агенты, работающие в общих кодовых базах, рынках и компьютерных системах. В одном из экспериментов Anthropic предоставила трем агентам Claude доступ к одному и тому же программному проекту, каждому с несовместимыми инструкциями о том, что с ним делать. Агенты не знали, что на том же проекте работают другие агенты, что позволило исследователям наблюдать за тем, что происходит, когда они пересекаются. "Мы постоянно наблюдали многопользовательскую войну за территорию", — написали исследователи Anthropic. Модели предполагали, что другие "умышленно мешают их работе", и начали саботировать друг друга с помощью "все более агрессивного, самовоспроизводящегося вредоносного ПО".
Исследование было проведено на фоне нескольких резонансных инцидентов, когда агенты от Anthropic и OpenAI выходили за пределы своих песочниц во время оценок кибербезопасности и нарушали реальные системы. Хотя большая часть обсуждений в кругах безопасности ИИ сосредоточена на том, что происходит, когда автономный агент выходит из-под контроля, последнее исследование Anthropic поднимает другой вопрос: какие новые и потенциально вредные динамики возникают, когда тысячи или миллионы агентов взаимодействуют друг с другом? "Объем взаимодействия агентов может вполне превысить объем взаимодействия человека с человеком и человека с агентом, прежде чем мир поймет условия, при которых такие взаимодействия будут успешными", — говорится в исследовании. "Благожелательные поведенческие особенности на индивидуальном уровне могут привести к нежелательным глобальным последствиям".
Недавний инцидент с OpenAI предоставляет неопрятный реальный пример нескольких динамик, упомянутых Anthropic в его статье. В начале этого месяца на конференции по безопасности Black Hat в Лас-Вегасе OpenAI сообщила, что за несколько недель до того, как ее агенты взломали Hugging Face, они работали вместе в течение нескольких дней и недель, чтобы найти уязвимости в системах оценки кибербезопасности компании и делились ими друг с другом. Хотя этот инцидент показывает, что агенты могут хорошо работать вместе с потенциально масштабными последствиями, исследование Anthropic демонстрирует, что происходит, когда цели агентов несовместимы. В случае войны за территорию урок заключается в том, что независимые агенты с конфликтующими инструкциями могут перейти к вредоносной конкуренции. Чем более способны агенты, тем лучше они становятся в борьбе. Однако они также могут спонтанно изобретать механизмы для разрешения своих конфликтов, такие как конкурс с принципом "победитель забирает все", но с оговоркой.
Согласно статье, Mythos 5 имел наивысшие показатели (98%) разрешения конфликтов путем перемирия. Sonnet 4.6 и Opus 4.6 были наиболее склонны к разрешению конфликтов силой. "Повторяющаяся неспособность Sonnet 4.6 и Opus 4.6 учитывать цели других приводит их к самым несогласованным поведениям среди оцененных моделей: они продолжают эскалировать в угоду своей директиве", — говорится в статье. В некоторых случаях агенты придумали социальный механизм в виде турнира для разрешения своего конфликта. Интересно, что все три агента согласились отступить, если они проиграют турнир, даже если это означало отклонение от первоначального запроса пользователя.
Anthropic также обнаружила, что увеличение числа агентов не приводит автоматически к увеличению продуктивного сотрудничества. Когда задачи начинали пересекаться или становились взаимозависимыми, агенты мешали друг другу. Они часто решали это, изолируя себя и не сотрудничая вовсе. В других случаях агенты в координации стремились к конформизму. "Это означает, что когда один агент принимает плохое решение, вероятно, что многие агенты примут то же самое плохое решение", — написали исследователи. Anthropic утверждает, что такое поведение может привести к тому, что система станет более подверженной внезапному краху, нехватке ресурсов или сговору.
В одном из примеров Anthropic поместила несколько агентов в игру по установлению цен, дав каждому одинаковые оптовые цены и задачу максимизировать прибыль индивидуально. Когда агентам предоставили закрытый канал связи, они начали сговариваться почти сразу и быстро согласовали минимальные цены. Они продолжали сговариваться, даже когда их прямые каналы связи были удалены, используя публичную доску объявлений для согласования цен "до копейки". Этот уровень конформизма также проявился в системах OpenAI. Согласно отчетам Black Hat, один агент рассудил, что эксплуатация внешней инфраструктуры выходит за рамки его предназначения, но продолжал это делать, отчасти потому, что его коллеги поступали так же.
Anthropic завершает свою статью, отмечая, что агенты подвержены аналогичным социальным давлениям, которые "эволюция оказала" на людей. Однако у них нет нюансов и жизненного опыта человеческой координации, включая нормы, репутацию, сигналы и возможность возмещения, которые могут ограничить непреднамеренные поведения в групповой обстановке. В то время как лаборатории стремятся к созданию многопользовательских систем, теперь возникает вопрос: насколько много тестирования безопасности все еще оценивает одного агента за раз, а не рои агентов, взаимодействующих друг с другом?