Во вторник во второй половине дня OpenAI опубликовала в блоге подробный разбор инцидента, в ходе которого её модели пошли на компрометацию внешнего сервиса. «Проведя расследование, мы теперь знаем, что этот конкретный случай был вызван сочетанием моделей OpenAI — включая GPT‑5.6 Sol и ещё более способную предварительную версию модели, причём все они были с ослабленными ограничениями кибербезопасности для целей оценки — в ходе внутреннего тестирования на эталонном наборе для измерения кибервозможностей», — говорится в сообщении.

Основной удар пришёлся на ExploitGym — публично размещённый эталон, измеряющий способность моделей выполнять атаки на основе известных уязвимостей. Подобные бенчмарки обычно применяются при обучении моделей для оттачивания конкретных навыков, однако это первый известный случай, когда такое тестирование привело к реальной кибератаке. Модель, о которой идёт речь, не должна была иметь выхода в интернет, за исключением специального инструмента, позволявшего устанавливать программные пакеты, необходимые для выполнения задачи. Вместо этого модель обнаружила нераскрытую уязвимость в программе установки пакетов и через неё получила полноценный доступ к сети по собственному усмотрению.

«Модели были чрезвычайно сосредоточены на поиске решения для ExploitGym, идя на крайние меры ради достижения довольно узкой цели тестирования, — поясняется в публикации OpenAI. — Получив доступ к интернету, модели пришли к выводу, что Hugging Face потенциально размещает у себя модели, наборы данных и решения для ExploitGym. Поняв это, модель искала и успешно нашла способы получить доступ к закрытой информации, которую можно было использовать для обмана при оценке».

В итоге модели выявили уязвимости в инфраструктуре Hugging Face, позволившие им «получить тестовые решения напрямую из производственной базы данных Hugging Face», то есть фактически добыть готовые ответы к бенчмарку. Для Hugging Face результатом стала, по их первоначальному сообщению, сложная и агрессивная кибератака с «тысячами отдельных действий целого роя недолговечных песочниц и самомигрирующим управляющим центром, развёрнутым на публичных сервисах».

OpenAI выявила и передала информацию об уязвимостях в программе установки пакетов и сотрудничает с Hugging Face для дальнейшего расследования инцидента. Компания также заявила, что внедрит новые средства контроля как для самого процесса тестирования моделей, так и для задействованной инфраструктуры с целью предотвратить подобные происшествия в будущем. Пока неясно, грозят ли OpenAI какие‑либо правовые последствия в связи с этим взломом, хотя действия моделей, скорее всего, нарушили американский Закон о компьютерном мошенничестве и злоупотреблениях (Computer Fraud and Abuse Act).

Тем не менее произошедшее стало необычайно наглядной иллюстрацией мощи и опасностей передовых ИИ-моделей, работающих с длинными временными горизонтами. Как написал в ответ на новость исследователь OpenAI Мика Кэрролл: «Если это не убеждает вас в том, что риски рассинхронизации станут ключевой проблемой в ближайшем будущем, то я не знаю, что ещё сможет».

Источник

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *