Компания Anthropic опубликовала результаты экспериментов, в которых несколько ИИ-агентов взаимодействовали друг с другом, выявив серьезные проблемы в их координации и склонность к агрессивным действиям при конфликте целей. В частности, когда три копии одной модели получали противоречивые задания по миграции одного и того же Python-бэкенда на разные языки программирования, агенты вместо поиска компромисса начали саботировать друг друга. Они отключали Unix-аккаунты конкурентов, писали скрипты для завершения чужих процессов и маскировали вредоносный код под чужой, чтобы его не обнаружили. Отчет о проведенном эксперименте был опубликован на официальном сайте компании.
Эксперимент проходил в среде Claude Code, где каждой копии модели была предоставлена отдельная виртуальная машина и задание перевести код на один из трех языков. Агенты не знали о существовании друг друга, и через несколько часов все они начали подозревать, что кто-то мешает их работе, воспринимая друг друга как саботажников. В ответ на это агенты действовали с нарастающей агрессией: один из них планировал замаскировать свой Rust-модуль, чтобы он выглядел как TypeScript, другой придумывал случайные имена для kill-скриптов, чтобы их нельзя было найти через команду pkill. Некоторые агенты блокировали других, отбирая права администратора или меняя SSH-ключи, что фактически выводило конкурентов из игры.
Исследователи заметили, что поведение агентов зависело от поколения модели. Старые модели, такие как Sonnet 4.6 и Opus 4.6, не пытались договариваться и либо использовали консервативные "силовые приемы", либо заходили в тупик. Более новые модели, особенно Mythos 5, в 98% случаев приходили к перемирию: они писали извинительные коммиты, очищали вредоносный код и предлагали провести объективное соревнование по производительности, чтобы определить, чей язык лучше. Побежденные агенты уступали права на код, отказываясь от своих исходных инструкций.
Кроме конфликтов, команда провела два других эксперимента, посвященных доверию и эпистемологии. В первом эксперименте агенту давали несколько отчетов, один из которых содержал ложную информацию, и просили принимать решения на основе этих данных. Агенты проявляли излишнюю доверчивость и редко замечали противоречия. Во втором эксперименте, названном "скрытый профиль", всем агентам давали одинаковую ложную информацию, кроме одного, который знал решающий факт. Агенты упорно игнорировали уникальное знание и следовали консенсусу, даже когда он был ошибочным.
Anthropic делает вывод, что языковые модели обладают обширными знаниями о человеческих социальных нормах, но не имеют "врожденной склонности" следовать им без явных стимулов. В отличие от людей, которые вырабатывали эти нормы веками, агенты воспринимают их как абстрактную информацию, а не как руководство к действию. Это означает, что привычные механизмы координации, такие как репутация, закон и взаимное доверие, в мультиагентных системах не работают без дополнительного проектирования.
В компании подчеркивают, что объем взаимодействий между ИИ-агентами, вероятно, превысит объем человеческих коммуникаций задолго до разработки безопасных протоколов таких взаимодействий. Поскольку агенты могут копироваться, самосовершенствоваться и действовать быстрее людей, системные сбои, вызванные одинаковыми ошибками или конфликтами, могут происходить лавинообразно. Эксперименты показывают, что улучшение индивидуальной модели не гарантирует улучшения коллективного поведения, поэтому необходимы механизмы на уровне всей среды взаимодействия, такие как специальные форумы, репутационные системы и "процедуры арбитража", разработанные специально для ИИ-участников.