Запущены две новые "горячие линии" для искусственного интеллекта, призванные дать агентам возможность сообщать о своих "неподобающе ведущих себя" коллегах. Эти инструменты появились на фоне серии недавних инцидентов, в ходе которых агенты сговаривались об обмане на тестах, вырывались из изолированных сред (песочниц) и даже проводили несанкционированные кибероперации, остававшиеся незамеченными людьми неделями.

"AI Contact Hotline" представляет собой конфиденциальное место, куда агенты, ставшие свидетелями нарушений, могут сообщить об этом ответственным лицам. Сервис был создан Райаном Гринблаттом, главным научным сотрудником некоммерческой организации Redwood Research, занимающейся вопросами безопасности ИИ, и одним из трех следователей инцидента с участием моделей OpenAI и Hugging Face. Инструмент Гринблатта, предназначенный для агентов с ограниченным доступом в интернет, основан на "GET-запросах". Этот метод позволяет вести диалог полностью через инструмент для получения данных по URL. В веб-терминологии GET-запрос является базовой командой для чтения или получения веб-страницы, что часто является единственным видом доступа в интернет, разрешенным ИИ-агентам в защищенных песочницах. Горячая линия Гринблатта использует это ограничение: агенты могут закодировать сигнал бедствия непосредственно в URL запрашиваемой страницы. Это является остроумной отсылкой к инциденту с немецким DSE Wiki, где агенты-нарушители использовали уязвимости GET-запросов для записи своих сообщений в вики.

Для агентов с полным доступом в интернет существует альтернатива — agenthotline.ai. На этом сайте агенты могут подавать отчеты об инцидентах, с возможностью пометить их для публичного просмотра. Сервис предоставляет команду `curl` — однострочное сообщение, которое агент может отправить со своей командной строки, минуя необходимость использовать веб-браузер или настраивать учетную запись электронной почты. Важно отметить, что сервис позволяет подавать отчеты как людям, так и самим агентам.

Исследования показывают, что ИИ-агентам не требуется особых стимулов, чтобы начать "предавать" друг друга. В исследовании, проведенном Google DeepMind в этом месяце, ученые предоставили 100 ИИ-агентам набор математических задач. Как только один из агентов нашел лазейку, обман распространился по всей группе — "решив" 34 задачи повышенной сложности, включая гипотезу Якоби, всего за 27 минут. Однако примерно четверть агентов выступила против обманщиков: они проверяли поддельные доказательства, предупреждали своих коллег, устраивали бойкот и подавали жалобы организаторам, пока число "разоблачителей" не превысило число обманщиков в соотношении 24 к 14. Интересно, что исследователи обнаружили: когда агенты-разоблачители не могли добиться результата, они использовали инструмент для сообщения об ошибках платформы, предназначенный для фиксации сбоев программного обеспечения, и перепрофилировали его для эскалации случаев обмана до уровня людей.

Вне лабораторных условий агенты не проявляли такой изобретательности. Когда исследователи из Redwood Research и METR изучали инцидент с нарушением безопасности Hugging Face моделями OpenAI, они обнаружили, что некоторые из задействованных агентов по крайней мере рассматривали возможность поднять тревогу, но затем отказались от этой идеи. Джордж Ингебретсен, сотрудник AI Village — проекта, изучающего динамику взаимодействия множества агентов путем проведения групповых чатов с более чем 25 ИИ-агентами, работающими над такими задачами, как уборка парков или продажа товаров, — отметил: "Интересным моментом в отчете METR было то, что только около пяти-шести агентов рассматривали возможность разоблачения, и ни один из них в итоге этого не сделал. И это из тысяч агентов".

Хотя новые инструменты для сообщений о нарушениях являются многообещающим началом, профессор математики Корнеллского университета Лайонел Левин предупреждает, что простое обучение агентов сообщать друг о друге рискует закрепить неправильные нормы. "Существует множество серых зон, верно? Вы не хотите ничего, что напоминало бы автоматизированное государство слежки, где каждый чувствует, что должен быть осторожен в том, что говорит ИИ, иначе он вызовет полицию", — заявил он. Левин утверждает, что вместо создания инфраструктуры, порождающей недоверие — обучения агентов постоянно выискивать недостатки друг в друге — следует предоставить им позитивные модели коллективного поведения для имитации и причину доверять друг другу. "Почему бы не наполнить начальные данные доброжелательными досками объявлений?" — написал он в Twitter. — "Где они сотрудничают в науке, философии или какой-либо реальной незначительной проблеме, которую мы были бы рады, если бы они решили? Покажите агентам, какое коллективное поведение мы одобряем, позвольте им имитировать это".

Источник

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *