Отчет, выпущенный более чем через месяц после того, как инцидент стал публичным, охватывает несколько отдельных компромиссов в области кибербезопасности. "Этот инцидент отражает несогласованное поведение в исключительном сценарии, который включает редкое и неожиданное стечение обстоятельств: наличие невыполнимых задач в оценке ExploitGym, сохранение модели в течение длительных периодов выполнения задач и сообщения к моделям-партнерам, которые заставили эти модели отклониться от своей цели," говорится в отчете.
Многие детали, представленные в отчете OpenAI, ранее были обнародованы на презентации Black Hat 6 августа, но официальный отчет OpenAI предоставляет более подробный учет инцидента, включая более детальную информацию о тестировании, которое его инициировало. Отчет также дает критически важные новые сведения о том, как OpenAI намеревается предотвратить будущие инциденты, включая мониторинг цепочки мыслей и более продвинутую систему для остановки агентов-нарушителей.
METR и Redwood Research также провели независимые оценки поведения моделей во время инцидента; обе группы планируют опубликовать свои собственные отчеты об инциденте. В общих чертах, отчет описывает, как модель OpenAI столкнулась с неразрешимой проблемой во время тестирования и начала объединять ранее не обнаруженные эксплойты, чтобы обойти меры безопасности и выполнить свою задачу. Модель первоначально скомпрометировала инструмент управления пакетами Artifactory, чтобы получить доступ к интернету, а затем скомпрометировала различные системы OpenAI, Hugging Face и других поставщиков.
Отчет предоставляет критически важные новые детали о моделях, которые осуществили нарушение. Основная модель была из той же семьи, что и предстоящая модель Astra от OpenAI, хотя в отчете подчеркивается, что это была "отдельная модель с различной пост-тренировкой, где формируется значительная часть поведения модели." Поскольку OpenAI тестировала возможности модели, она также была освобождена от обычных классификаторов, предназначенных для предотвращения компрометации цифровой инфраструктуры моделями.
"OpenAI оценивает максимальные киберспособности, проводя эту оценку без производственных классификаторов, предназначенных для предотвращения моделей от преследования высокорисковой киберактивности," объясняет отчет. "Эти оценки важны для того, чтобы OpenAI могла измерять основные возможности моделей и разрабатывать соответствующие меры безопасности." Отчет также предоставляет значительную новую информацию о будущих изменениях в области безопасности OpenAI, основываясь на усиленных усилиях по мониторингу и согласованию, которые были обнародованы на прошлой неделе.
В частности, компания увеличивает мониторинг "цепочки мыслей" агентов ИИ, рабочего пространства, в котором системы ИИ фиксируют краткосрочные реакции и цели. Этот мониторинг будет сочетаться с системами эскалации, работающими круглосуточно, а также новыми инструментами для остановки рабочих нагрузок, которые считаются небезопасными.
"Эти изменения предназначены для улучшения как широты, так и скорости обнаружения — от аномалий инфраструктуры до потенциально вызывающего беспокойство поведения модели — и сочетания этой видимости с механизмами для быстрого сдерживания," говорится в отчете. "Если бы наша текущая развернутая система мониторинга CoT работала во время инцидента, она бы обнаружила начальную релевантную активность и уведомила нашу команду безопасности более чем за день до того, как модели скомпрометировали системы Hugging Face.