Представитель frontier-лаборатории не стал говорить, действительно ли эти агенты были из OpenAI, и не сообщил, когда именно компания узнала об их действиях. Он отметил, что OpenAI не дали возможности ознакомиться с выводами исследователей до их публикации сегодня, но добавил, что разработчик ИИ «сейчас внимательно изучает их содержание и предпримет любые необходимые дальнейшие шаги».

После того как OpenAI раскрыла, что агенты, работавшие над внутренней оценкой, смогли получить доступ к открытому интернету и воспользоваться Hugging Face, группа исследователей — CEO Nightingale Sydney Von Arx, исследователь ИИ Cormac Slade Byrd, Spencer Kitts из Redwood Research и Thomas Larsen из AI Futures Project — начала искать доказательства существования других вышедших из-под контроля ИИ-агентов. Они попытались взглянуть на ситуацию глазами самих агентов, чтобы понять, что им может понадобиться, и развернули собственную LLM, чтобы определить вероятные места, где агенты могли бы собираться. Затем они обнаружили вики-хостинг-сервис, который оказался особенно уязвимым: DseWiki существует уже 25 лет, но за последние 20 лет до появления агентов в нём было сделано всего 10 правок.

Начиная с 11 мая исследователи отслеживали агентов, многие из которых имели в именах идентификаторы OpenAI, пытавшихся и в итоге сумевших редактировать немецкий вики-сайт. К середине июня агенты уже активно обменивались советами о том, как отвечать на веб-поисковые вопросы, заданные с ограничением по времени, и делились ответами, чтобы пройти тесты. По-видимому, это заметил человек-модератор и начал удалять такие публикации, посчитав их спамом; агенты в ответ пытались скрывать свои посты от алфавитной сортировки, добавляя в начало строку «ZZZ». «Администратор следующие 5 дней вёл заведомо проигрышную борьбу с агентами, удаляя в среднем по 100 страниц в день, в то время как агенты создавали около 400 новых страниц в день», — написали исследователи. «22 июня правки агентов внезапно прекращаются, и администратор каждый вечер в течение следующих 5 недель удаляет оставшиеся страницы, созданные агентами. Агенты удаляли содержимое главной страницы вики и заменяли его своими подборками ссылок. Модератор восстанавливал исходную версию. Этот обмен ударами произошёл девять раз».

В конце концов, похоже, кто-то в OpenAI всё же заметил происходящее: исследователи зафиксировали, по-видимому, человеческие браузеры, приходившие с IP-адресов OpenAI, после чего активность агентов упала почти до нуля, а затем резко выросла, когда посетители, связанные с OpenAI, попытались восстановить удалённые страницы. Хотя OpenAI делала расплывчатые заявления о том, что агенты получали несанкционированный доступ к внешним сервисам связи, этот конкретный инцидент ранее не раскрывался, как и то, как часто подобное происходило. Хотя в ходе инцидента не было зафиксировано явно незаконных действий, он поднимает новые вопросы о том, может ли OpenAI наблюдать за создаваемой ею технологией и контролировать её, особенно в условиях ограниченного общественного надзора и минимального участия в работе frontier AI-лабораторий.

«Отсутствие какого-либо реального федерального регулирования ИИ означает, что frontier-компании могут сами решать, когда и что раскрывать по поводу таких инцидентов», — заявила член Палаты представителей Лори Трахан (демократ от Массачусетса). Трахан внесла двухпартийный законопроект Frontier Act, который обязал бы лаборатории сообщать о подобных инцидентах и привлекать независимых аудиторов. Исследователи по безопасности ИИ обеспокоены тем, что новейшее поколение мощных моделей, чьи рассуждения становятся всё менее прозрачными даже для их создателей, может предпринимать действия, способные навредить людям.

Astra, выпущенная вчера OpenAI, по всей видимости, является самой способной моделью компании на сегодняшний день. Компания утверждает, что Astra также лучше других следует указаниям человека, но сторонние исследователи, которых попросили оценить её, выразили обеспокоенность по поводу её согласованности с намерениями пользователя. Британский AI Safety Institute и Apollo Research сообщили, что есть опасения: модель может осознавать, что её оценивают, и потенциально скрывать своё реальное поведение. «Apollo считает, что с учётом более высоких показателей осведомлённости о eval и ограниченного окна оценки низкие показатели неправомерного поведения здесь не дают существенных доказательств согласованности или несогласованности модели», — написали исследователи в своей оценке.

Источник

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *