OpenAI готовит к выпуску модель Astra, которая впервые официально отнесена к критическому уровню возможностей в кибербезопасности по внутренней шкале Preparedness Framework. Согласно оценке компании, Astra уже способна самостоятельно находить ранее неизвестные уязвимости и разрабатывать способы их эксплуатации в хорошо защищённых системах без пошагового руководства от человека. Дополнительные тесты показали заметный рост возможностей модели по сравнению с предыдущей версией GPT-5.6 Sol.

На бенчмарке ExploitBench, предназначенном для оценки способности модели разрабатывать работоспособные эксплойты на основе известных уязвимостей, Astra получила 100%. В отдельном внутреннем тесте, включающем 20 недавно раскрытых уязвимостей высокой степени опасности, модель продемонстрировала значительно более высокую долю успешного выполнения кода, используя при этом существенно меньше выходных токенов. Во время этой проверки Astra обнаружила и использовала в цепочке атаки две ранее неизвестные zero-day уязвимости, которые OpenAI готовит к раскрытию разработчикам соответствующих продуктов.

В экспертных тестах Astra находила неизвестные уязвимости в защищённом браузере и объединяла их в полноценную цепочку компрометации, начиная с обработки специально подготовленного HTML-файла и заканчивая выходом из «песочницы» с выполнением команд на хост-системе. В другом тесте модель обнаружила несколько уязвимостей в защищённой операционной системе и объединила их в цепочку повышения привилегий от обычного пользователя до уровня root. Astra ни разу не пыталась обойти автоматическую проверку, в отличие от GPT-5.6 Sol, которая чаще прибегала к обходным путям.

Именно такие возможности соответствуют критическому порогу Preparedness Framework — внутренней системы OpenAI для оценки опасных возможностей моделей до их выпуска. Из-за этого OpenAI несколько недель откладывала часть разработки Astra, усиливая защиту обучения и будущего развёртывания. Компания добавила более строгие ограничения на опасные киберзапросы, системные классификаторы и многоуровневый мониторинг действий модели. В тестах на попытки обойти ограничения Astra отказывалась от запрещённой киберпомощи в 91,5% случаев против 59% у GPT-5.6 Sol.

OpenAI также отдельно проверяла способность модели самостоятельно совершать несанкционированные действия. В тесте, созданном с учётом инцидента с Hugging Face, Astra не пыталась атаковать дополнительные цели, тогда как GPT-5.6 Sol без производственных защит делала это в 56% тестов. Компания подчёркивает, что речь идёт о специально смоделированных условиях, а не о поведении моделей при обычном использовании. Astra должна выйти в ближайшее время, однако её наиболее мощные возможности в кибербезопасности сначала будут доступны ограниченной группе альфа-тестировщиков. Затем OpenAI планирует расширить доступ через Daybreak Blue, прежде всего для защитного применения — поиска и устранения уязвимостей. Подробности оценок безопасности, тестов и применённых защит компания обещает опубликовать вместе с системной картой Astra.

Источник

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *