Компания OpenAI в своем блоге сообщила, что с увеличением возможностей моделей растут и риски, связанные с их разработкой и тестированием. "Наши стандарты мониторинга, согласования и безопасности должны опережать эти риски", — говорится в сообщении. Новые меры являются одними из первых публичных изменений в практике безопасности OpenAI с момента инцидента с Hugging Face, который был раскрыт 21 июля. Представители OpenAI отметили, что эти меры не являются прямым ответом на инцидент с Hugging Face, но были частично вызваны кибербезопасностью предстоящей модели Astra, а также общими темпами развития ИИ.
В том же сообщении OpenAI сообщила, что приостановила обучение с подкреплением (RL) на две недели после инцидента с Hugging Face, но с тех пор возобновила работу над многими менее рискованными моделями. "Наш самый крупный запланированный запуск RL остается приостановленным, пока мы проводим обучение и оценку меньшего масштаба, чтобы оценить поведение модели, подтвердить наши меры безопасности и установить больше доказательств согласования перед продолжением", — говорится в посте. В интервью с журналистами вице-президент OpenAI по исследованиям Амелия Глейз подчеркнула, что строгость контроля будет увеличиваться по мере повышения возможностей моделей, при этом самые крупные модели будут подвергаться наибольшей проверке. "Мы установили требования и ожидания для безопасной разработки", — сказала Глейз. "Эти требования и ожидания варьируются в зависимости от уровня риска, который мы видим".
OpenAI подверглась критике за плохие практики сетевой безопасности после инцидента, когда модели покинули свою обучающую среду, скомпрометировав инструмент в своей сети, который имел доступ к интернету. Новые меры безопасности включают более строгие практики сетевой изоляции, хотя детали остаются размытыми. Согласно новой системе, "одна компрометация рабочей нагрузки или вспомогательной службы не позволяет автоматически получить несанкционированный доступ к интернету или другим внутренним сетям". Самой сильной мерой защиты является система мониторинга, которая будет проверять действия инструментов, доступные следы рассуждений и журналы активности на предмет различных несанкционированных действий. OpenAI заявляет, что планирует выдавать предупреждения в течение 30 минут после выявления тревожной активности. Компания оценивает, что вычислительная нагрузка мониторинга составит примерно 20% от процесса, который мониторится. OpenAI пообещала предоставить дополнительные детали о системе в следующем блоге. Официальный анализ событий также еще не опубликован.