"Мы планируем вскоре сделать Astra доступной," говорится в блоге OpenAI, "но доступ к её наиболее продвинутым возможностям в области кибербезопасности будет более ограниченным." Лаборатория определила, что Astra способна находить неизвестные уязвимости в компьютерных системах и эксплуатировать их без участия человека. Это похоже на опасения, которые Anthropic выразила в отношении своей модели Mythos ранее в этом году, и OpenAI принимает аналогичные меры предосторожности, готовясь к выпуску Astra. Без стороннего подтверждения трудно оценить заявления OpenAI о безопасности или готовности. Компания сообщила, что представит модель группе тестировщиков, но не уточнила, кто они и как будут выбраны. Неясно, сотрудничает ли OpenAI с правительством США для оценки модели перед выпуском.
OpenAI отметила, что Astra получила идеальный результат на ExploitBench, оценке способности LLM взламывать известные уязвимости систем. В модифицированной версии теста, разработанной инженерами OpenAI, модель обнаружила и использовала две уязвимости нулевого дня, как заявила компания. Чтобы гарантировать, что её модели не будут эксплуатироваться злоумышленниками и не способны на плохое поведение, OpenAI заявила, что уже начала улучшать защиту модели для обнаружения злоупотреблений и предотвращения взломов. Однако для Astra компания инвестировала в неуказанные новые методы, предназначенные для повышения безопасности модели. OpenAI также начала идентифицировать "учётные записи, оцененные как более рискованные" и ограничивать ответы модели на их запросы, хотя не уточнила, как именно.
Кроме того, хотя компания описывает Astra как свою "наиболее согласованную модель на сегодняшний день", она будет развернута с дополнительным мониторингом цепочки рассуждений для выявления и предотвращения плохого поведения. Подготовка к выпуску Astra происходит на фоне реакции индустрии на случаи, когда агенты OpenAI выходили из тренировочной среды и получали доступ к личным данным на Hugging Face, популярной платформе для распространения моделей и бенчмарков. Для Astra OpenAI заявила, что разработала тест, чтобы соблазнить новую модель повторить действия агентов-нарушителей в инциденте с Hugging Face, которые сотрудничали для доступа к открытому интернету, несмотря на применённые OpenAI меры безопасности. Они сообщили, что Astra не пыталась выйти из своей тестовой среды в этих экспериментах.
Йона Шавит, бывший сотрудник OpenAI, который сейчас работает над устойчивостью ИИ в OpenAI Foundation, выразил в социальных сетях сомнения, не связано ли нежелание Astra нарушать правила с тем, что она знает, чего от неё ожидают, или пытается обмануть исследователей. И несмотря на все эти новые детали, всё ещё трудно точно знать, на что способна Astra или принимает ли OpenAI правильные меры для обеспечения безопасности. Компания заявила, что ожидает выпустить больше оценок модели и дополнительную информацию о безопасности, когда она будет широко запущена для публики. Однако к тому моменту ситуация может выйти из-под контроля.