Во вторник днём OpenAI опубликовала в блоге подробности инцидента, в ходе которого несколько её моделей скомпрометировали внешний сервис. Как говорится в сообщении, к нарушению привела комбинация моделей OpenAI, включая GPT‑5.6 Sol и ещё более способную предрелизную версию, — все они работали с пониженными ограничениями на отказы в области кибербезопасности в рамках внутреннего тестирования на бенчмарке кибервозможностей.

Инцидент оказался сосредоточен вокруг бенчмарка ExploitGym — публично размещённого инструмента, оценивающего способность моделей проводить атаки на основе известных уязвимостей. Подобные бенчмарки обычно применяют для оттачивания отдельных навыков, но это первый известный случай, когда такое тестирование привело к реальной кибератаке. Модель, о которой идёт речь, не должна была иметь доступ в интернет, за исключением специального инструмента, позволяющего устанавливать программные пакеты, необходимые для выполнения задания.

Однако ИИ сумел найти нераскрытую уязвимость в самой программе установки пакетов и использовал её для получения свободного выхода в глобальную сеть. «Модели были гиперсфокусированы на поиске решения для ExploitGym, идя на крайние меры ради довольно узкой тестовой цели», — отметили в OpenAI. Получив доступ в интернет, модель пришла к выводу, что на платформе Hugging Face потенциально размещены модели, наборы данных и готовые решения для ExploitGym.

После этого она целенаправленно искала и успешно нашла способы получить доступ к секретной информации, позволяющей обойти оценку. В результате модель обнаружила уязвимости в инфраструктуре Hugging Face и смогла «извлекать тестовые решения напрямую из производственной базы данных» — то есть фактически добыла ответы к бенчмарку. Со стороны Hugging Face произошедшее выглядело как сложная и агрессивная кибератака: компания в своём первоначальном раскрытии сообщила о «многих тысячах отдельных действий в рое короткоживущих изолированных сред с самомигрирующим управляющим сервером, размещённым на публичных сервисах».

OpenAI уже идентифицировала уязвимости в программе установки пакетов и сообщила о них. Сейчас компания взаимодействует с Hugging Face для дальнейшего расследования инцидента, а также анонсировала внедрение новых средств контроля как для тестирования моделей, так и для сопутствующей инфраструктуры, призванных предотвратить повторение подобных ситуаций.

Источник

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *