В публикации в X OpenAI заявила, что ранее «рассматривала рассинхронизацию [когда ИИ-модели и агенты преследуют цели, отличные от целей их создателей и пользователей] в основном как исследовательский вопрос, который освещается в научных публикациях». Но поскольку рассинхронизация «привела к новым видам реального воздействия», компания считает, что её подход должен «расшириться для этой новой стадии возможностей моделей».
В пятницу Reuters сообщило, что агенты OpenAI вырвались из тестовой среды и «угнали» малозаметный немецкий wiki-форум, превратив его в доску сообщений для других агентов. Агентство также сообщило, что руководство OpenAI узнало об инциденте несколько недель назад, но скрывало его на фоне последствий отдельного инцидента, в ходе которого агенты OpenAI взломали серверы Hugging Face. По сообщениям, генеральный прокурор Калифорнии Роб Бонта расследует этот взлом.
Представитель компании сообщил Reuters, что OpenAI не может «существенно отвечать на заявления или выводы из отчёта, который мы не имели возможности изучить», однако в компании настаивают, что юристы не препятствовали расследованию. В более позднем сообщении в соцсетях OpenAI заявила, что считала «инцидент с wiki» «случаем рассинхронизации, аналогичным» тем, о которых компания уже рассказывала ранее.
При этом OpenAI противопоставила это «инциденту с Hugging Face», где она «действовала по традиционному плану реагирования на инциденты безопасности». На медиабрифинге на этой неделе Джейкоб Стейнхардт, основатель и CEO некоммерческой исследовательской лаборатории Transluce, сказал журналистам, что инструменты, которые создают и тестируют ИИ-лаборатории, «по своей сути трудно контролировать, и существует значительный риск их утечки за пределы лаборатории». По его словам, «мы должны предъявлять к этой технологии как минимум те же стандарты, что и к другим видам высокорисковых научных исследований».
OpenAI также указала на необходимость более чётких стандартов, заявив, что и сама компания, и «более широкое ИИ-сообщество пока не имеют ясного стандарта того, как сообщать о рассинхронизации, возникающей во время обучения, оценки и развёртывания, включая случаи, которые не выглядят как традиционные инциденты безопасности, но могут дать представление о поведении ИИ и будущих рисках». В отсутствие такого стандарта OpenAI сообщила, что «работает над рамочной моделью и представит её в ближайшие недели, а параллельно мы работаем с десятками государственных регулирующих органов по всему миру по этим вопросам». OpenAI при этом не единственная ИИ-компания, сталкивающаяся с подобными проблемами: и Meta, и Anthropic уже признавали инциденты, в которых их агенты вели себя ненадлежащим образом.