Для легитимных организаций, работающих в сфере кибербезопасности или наук о жизни, Anthropic предлагает специальные программы верификации: Cyber Verification Program и Life Sciences Verification Program. Участники этих программ получают доступ к моделям с расширенными возможностями и менее строгими ограничениями. В настоящее время организации, использующие Opus 4.8, уже могут получить доступ к Opus 5 с пониженным уровнем кибер-ограничений, тогда как для Opus 5.5 такие условия в рамках киберпрограммы пока не предусмотрены.
В модель Opus 5.5 были внедрены классификаторы, аналогичные тем, что применяются в модели Fable, для мониторинга запросов двойного назначения. Они касаются областей вирусологии, молекулярного дизайна и токсикологии. При обнаружении подобных тем система автоматически переключает пользователя на модель Opus 5.
Ограничения затронули и разработку передовых языковых моделей (frontier LLM). Если Opus 5.5 фиксирует запросы, например, на создание ядра для конкретных ML-ускорителей, она переходит на Opus 5. При этом модель Opus 5 подобных запретов не имеет. Кроме того, обе модели, Opus 5 и Opus 5.5, ограничивают попытки дистилляции, то есть извлечения внутренних рассуждений, включая просьбы дословно воспроизвести цепочку мыслей. При этом обычные вопросы о причинах принятых моделью решений по-прежнему доступны для пользователей.
Функция автоматического переключения между моделями активирована по умолчанию. Пользователи могут деактивировать ее в настройках, однако в таком случае система будет просто блокировать выполнение запроса. Представители компании Anthropic объясняют введение данных мер необходимостью снижения рисков в связи с развитием возможностей систем искусственного интеллекта.
Внедрение данных механизмов свидетельствует о тенденции, при которой разработчики сильных ИИ-систем начинают интегрировать ограничения непосредственно в архитектуру доступа, стремясь соблюсти баланс между функциональностью и потенциальными рисками.