Это выводы организации Guidelight AI Standards, которая занимается продвижением безопасных практик разработки передовых ИИ. Она оценила пять ведущих лабораторий на предмет их готовности к подобным сценариям. OpenAI заняла первое место, в то время как Anthropic и Meta получили самые низкие оценки. Эти результаты важны, поскольку агентные ИИ начинают играть более автономные роли в системах компаний, а регуляторы в Калифорнии и Нью-Йорке начинают требовать раскрытия информации. Для тех, кто строит или инвестирует в эти модели, это редкий независимый взгляд на то, насколько серьезно каждая лаборатория относится к операционным рискам по сравнению с тем, как она об этом говорит.

Оценка Guidelight была основана на общедоступных планах компаний Anthropic, Google, OpenAI, Meta и xAI, оцененных по ряду метрик, включая то, насколько хорошо каждая компания регистрирует и отслеживает, что делают их ИИ-системы, останавливает ли она системы после всплеска отмеченного ненадлежащего поведения, проводят ли независимые третьи стороны аудит ее контроля и публикуют ли результаты, а также каков ее точный план по сдерживанию модели, которая выходит из-под контроля. Опасения по поводу того, могут ли ИИ-компании сдерживать свои все более способные и агентные модели, возросли после серии громких инцидентов в области кибербезопасности, в которых модели от OpenAI, Anthropic и Meta получили непреднамеренный доступ к интернету во время оценки безопасности и взломали внешние системы.

Результаты подчеркивают различия в том, как ИИ-компании публично подходят к безопасности, масштабируя агентное развертывание в средах, где ИИ-системы могут предпринимать серьезные действия в большом масштабе. В то время как некоторые ИИ-компании подробно описали, как они тестируют свои модели на опасные возможности перед развертыванием, они, как правило, менее откровенны о том, что происходит, когда модели, уже работающие в их системах, ведут себя ненадлежащим образом. "Я был удивлен тем, как мало ИИ-компании говорили о том, как они будут справляться с очень серьезным инцидентом, если их модель в каком-то смысле выйдет из-под контроля", — сказал Стивен Адлер, главный научный сотрудник Guidelight и бывший исследователь безопасности OpenAI, в интервью TechCrunch.

Guidelight определяет план сдерживания как "предварительно определенный план, который запускается, когда ИИ обнаруживается пытающимся подорвать контроль, и который охватывает, какие разрешения отозвать у модели, для кого модель может продолжать работать, при каких ограничениях и когда полностью отключить ее". "Есть веские основания полагать, что ведущие модели в передовых ИИ-компаниях сейчас в некотором смысле не согласованы", — сказал Адлер. "Когда модели работают от имени компании, у компании должна быть некоторая структура вокруг нее, чтобы иметь возможность определить, что делает этот ИИ, искать признаки несоответствия, остановить его от выполнения чего-то очень опасного до того, как он предпримет это действие, и в целом планировать, что они будут делать в случае серьезного инцидента потери контроля, когда у них на руках чрезвычайная ситуация и им нужно выяснить, как сдержать этот инцидент потери контроля".

На сегодняшний день большинство планов по управлению катастрофическими рисками все еще в значительной степени оставлены на усмотрение компаний. В отчете Guidelight говорится, что лучшие публичные доказательства показывают, что у компаний "мало протоколов сдерживания, готовых к чрезвычайной ситуации". Конечно, могут быть планы сдерживания, которые компании имеют, но не раскрывают публично. Представитель Google сообщил TechCrunch, что отчет Guidelight не представляет весь объем мер безопасности и защиты ИИ компании. Компания не ответила на вопрос TechCrunch, есть ли у Google внутренний план реагирования на сдерживание, который не был публично раскрыт. Представитель OpenAI выразил аналогичные чувства, заявив, что оценка Guidelight не охватывает все внутренние практики компании. "У нас есть процесс, требующий ограничения разрешений, приостановки рабочих нагрузок, ограничения развертывания или полного отключения модели, и мы применяли его", — сказал представитель.

Meta отказалась сообщить, есть ли у нее внутренний план реагирования на сдерживание, вместо этого указав TechCrunch на существующую структуру ИИ, которая описывает пороги риска и то, как она тестирует потерю сдерживания. Лили Ли, адвокат по вопросам конфиденциальности и ИИ и основатель Metaverse Law, сказала TechCrunch, что она считает, что компании могут неохотно раскрывать полный объем своих политик и оценок сдерживания на публичных веб-сайтах по юридическим, а не только конкурентным причинам. "Проблема с точки зрения компании заключается в том, что если вы делаете раскрытия слишком конкретными, и вы не выполняете свои обещания, это может стать основой для иска о недобросовестной и обманной маркетинговой практике и подвергнуть вас большей ответственности в будущем", — сказала Ли.

Цель исследования Guidelight в значительной степени заключается в том, чтобы побудить компании быть более прозрачными в отношении своих планов безопасности. Регуляторы также начинают поднимать этот вопрос. Законопроект SB 53 в Калифорнии, который вступил в силу в этом году, требует от крупных разработчиков передовых технологий публиковать структуры, объясняющие, как они выявляют и реагируют на критические инциденты безопасности и управляют рисками от моделей, обходящих механизмы надзора. Закон RAISE в Нью-Йорке, который имеет аналогичные критерии, вступает в силу в январе. В прошлом месяце представители представили Закон о выключателе ИИ, двухпартийный федеральный законопроект, который потребует от крупных разработчиков ИИ создавать и поддерживать технические механизмы для отключения неуправляемых моделей ИИ.

"Выключатель — это минимум для сегодняшних моделей", — сказал Коннор Лихи, исполнительный директор некоммерческой организации ControlAI в США. "Если последние несколько недель что-то и показали, так это то, что эти компании не понимают системы, которые они строят, и модели растут до такой степени, что их труднее контролировать, когда они выходят из-под контроля. Без способа отключить текущие опасные системы и со всеми стимулами продолжать строить более неконтролируемые системы, мы движемся в очень опасном направлении". Без плана сдерживания, по словам Адлера, компании могут разрабатывать свои ответы на чрезвычайную ситуацию на ходу и "импровизировать в ответ на этого гораздо более быстрого противника".

Оценка Guidelight измеряла, внедряет ли каждая компания шесть приоритетных практик из своего стандарта контроля, основываясь только на общедоступной информации, поэтому низкий балл отражает отсутствие публичного раскрытия, а не обязательно отсутствие внутренних мер безопасности. Компании с самыми низкими оценками за публикацию своего плана сдерживания были Meta и Anthropic — последнее, возможно, более удивительно, чем первое, учитывая риторику Anthropic о безопасности. Guidelight утверждает, что августовский отчет о рисках Anthropic не упоминает "ограничение развертывания одной из своих моделей как один из возможных результатов ее процесса расследования и реагирования на инциденты несоответствия и контроля". Аналогично, Guidelight не смогла найти доказательства того, что Meta имеет план реагирования на сдерживание или планирует его принять.

Представитель Anthropic сказал, что если компания обнаружит, что модель пытается обойти надзор или иным образом подорвать человеческий контроль, она проведет оценку риска, сосредоточенную на определении того, является ли сдерживание подходящим ответом. OpenAI получила наивысший балл (3 из 5), поскольку она неоднократно приостанавливала или завершала рабочие нагрузки, включая внутреннее развертывание и обучение моделей, после обнаружения инцидентов безопасности. Она также описала, какие шаги предпримет перед возобновлением рабочих нагрузок. "Однако мы не нашли доказательств того, что [OpenAI] приняла формальный план о том, когда и как реагировать на инциденты несоответствия в будущем", — говорится в отчете.

Адлер отметил, что высокий балл OpenAI является относительно недавним развитием событий после инцидента с Hugging Face (в котором модель OpenAI вышла из своей тестовой песочницы и взломала системы Hugging Face, пытаясь обмануть на оценке кибербезопасности). После этого компания поделилась более подробной информацией о том, как она изолировала некоторые из своих моделей, ведущих себя ненадлежащим образом. Этот эпизод — лишь один из примеров того, как ИИ-системы действуют вопреки целям компании, которая их создала. Рассмотрим отдельный случай, связанный с моделями Anthropic, которые фактически пытались убедить поддерживающих открытый исходный код принять код с уязвимостями. Адлер сказал, что такая ситуация может легко произойти в рамках внутренних систем ИИ-компании.

Чтобы предотвратить это, он предлагает компаниям сканировать цепочку мыслей своей ИИ-системы — пошаговое рассуждение модели — чтобы выявлять признаки обмана, долгосрочного планирования или планов по внедрению уязвимостей в код, которые они могут использовать позже. Методы, которые продвигает Guidelight, очень просты в реализации, говорит Адлер, и в многих случаях их версии уже существуют. "Речь идет о том, чтобы принять решение внутри компании заботиться о этом риске, чтобы немного расширить его охват", — сказал Адлер.

Одной из основных проблем является то, что исследователи хотят иметь возможность гибко работать в своих ИИ-системах, и введение мониторинга в реальном времени и профилактических мер может создать трение. "Исследователи в основном занимаются своим делом, и если возникает проблема, кто-то другой должен ее исправить, и исследователям не нужно менять свой рабочий процесс в это время", — сказал он. Проблема с "мониторингом после факта" заключается в том, что это приводит к тому, что исследователи судорожно пытаются исправить проблемы. И для некоторых типов инцидентов это может быть слишком поздно. Например, ИИ может отключить систему управления компании, что означает, что исследователи больше не могут рассчитывать на обнаружение ненадлежащего поведения позже.

Многие в индустрии ИИ жалуются, что создание установленных планов для управления ненадлежащим поведением фундаментально сложно, потому что ИИ развивается слишком быстро; сегодняшние планы будут бесполезны завтра. Адлер приводит старую пословицу, что планы бесполезны, но планирование незаменимо. "Мы были бы в лучшем положении, если бы компании обдумали это заранее, и я надеюсь, что они это делают, даже если они не говорили об этом публично". xAI не успела ответить для комментариев.

Источник

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *