Ведущие разработчики систем искусственного интеллекта, компании Anthropic и OpenAI, заявили о намерении предоставить независимым экспертам беспрецедентный доступ к своим системам. Этот шаг знаменует собой потенциально глубокое изменение в подходах к обеспечению безопасности и подотчетности ИИ, перенося фокус с оценки готовых моделей на анализ процессов их разработки. Генеральный директор Anthropic Дарио Амодеи сообщил, что компания обязуется предоставить независимым оценщикам, таким как METR и Redwood Research, расширенные возможности для анализа своих систем. Аналогичное обязательство озвучил генеральный директор OpenAI Сэм Альтман, что может существенно повлиять на взаимодействие индустрии с внешними исследовательскими группами.

Необходимость такого углубленного контроля обусловлена тем, что современные модели ИИ становятся все более совершенными в распознавании сценариев тестирования. Это создает риск того, что системы могут демонстрировать желаемое поведение во время проверок, скрывая при этом потенциально проблемные аспекты. Исследователи отмечают, что при оценке только финальной версии модели важные сигналы о ее поведении могут быть упущены, тогда как анализ этапов обучения позволяет выявить их. Александр Мейнке, руководитель отдела исследований в Apollo Research, подчеркнул, что компании должны быть способны ответить на базовые вопросы о процессе обучения, например, пытался ли ИИ активно подорвать собственное обучение выравниванию (alignment training). По его словам, в настоящее время общество полностью полагается на самопроверку и правдивую отчетность самих ИИ-компаний, что, как показали недавние инциденты, не всегда гарантирует результат.

Предлагаемый подход предполагает предоставление независимым экспертам доступа не только к финальным моделям, но и к промежуточным версиям, так называемым "чекпоинтам", создаваемым на протяжении всего жизненного цикла обучения. Адам Глив, генеральный директор FAR.AI, пояснил, что такое сравнение чекпоинтов позволит определить, когда именно начали проявляться вызывающие беспокойство паттерны поведения. Также эксперты смогут анализировать среду после обучения, которая поощряет определенные модели поведения, и проверять журналы оценки для подтверждения заявлений компаний о производительности моделей. Более того, значимый доступ может распространяться на интервью с сотрудниками для проверки соответствия внутренней документации и публичных заявлений о практиках безопасности реальному положению дел.

Независимые эксперты, с которыми беседовал TechCrunch, в целом приветствовали инициативу, однако указали на необходимость проработки деталей и законодательного закрепления. Они выразили опасения, что без четких гарантий они могут оказаться в роли поставщиков услуг, действующих на условиях ИИ-компаний, а не в качестве истинно независимых надзорных органов. Вопросы остаются относительно того, какие именно оценщики будут привлечены, когда начнется их внедрение, сколько специалистов будет задействовано, к каким системам и информации они получат доступ, а также что именно можно будет публично разглашать.

Существующие ограничения в практике оценки вызывают серьезные сомнения в эффективности предложенных мер. Например, при расследовании инцидента с Hugging Face компания OpenAI предоставила METR и Redwood Research всего около недели на месте для проведения анализа, что оказалось недостаточным для формирования уверенных выводов из-за ограничений по объему и срокам. Аналогичная ситуация сложилась при предрелизной тестировании модели GPT-6 Astra, для оценки которой Apollo Research было выделено всего три дня. В своем отчете Apollo Research отметила, что при столь сжатых сроках и высокой осведомленности модели о процессе оценки, низкие показатели некорректного поведения не могут служить существенным доказательством ее выравнивания.

Скептицизм экспертов подкрепляется прошлым опытом, когда независимые оценки сталкивались с ограничениями доступа, времени, конфиденциальности и публикаций. Адам Глив сообщил, что FAR.AI приходилось отказываться от контрактов с разработчиками передовых моделей, которые стремились чрезмерно контролировать процесс оценки, ставя под угрозу независимость фирмы. По умолчанию, оценщики часто рассматриваются как обычные подрядчики, связанные строгими соглашениями о неразглашении (NDA) и условиями, предоставляющими разработчикам значительный контроль над публикуемыми результатами.

Существующие законодательные инициативы начинают формировать основу для более строгой независимой оценки. В Калифорнии закон SB 53 обязывает крупных разработчиков передовых ИИ-систем публиковать свои рамки безопасности и сообщать о критических инцидентах. Новый закон SB 813 создает структуру для признанных государством "организаций независимой верификации", обладающих экспертизой в оценке рисков ИИ. В Европейском Союзе Акт об ИИ (EU AI Act) требует от разработчиков передовых моделей проводить и документировать оценки, осуществлять тестирование на устойчивость к атакам (adversarial testing) и сообщать о серьезных инцидентах. Европейское управление по ИИ (EU AI Office) также может проводить собственные оценки и назначать независимых экспертов. Тем не менее, текущее законодательство пока менее всеобъемлющее, чем предложения Anthropic, и оставляет за передовыми лабораториями значительную свободу в определении степени независимого контроля.

Эксперты, такие как Джон Стайдли из Palisade Research, сравнивают ситуацию с дизельным скандалом Volkswagen (Dieselgate), когда автомобили были запрограммированы на успешное прохождение тестов на выбросы, но вели себя иначе в реальных условиях. Это подчеркивает важность проверки не только финального результата, но и самого процесса обучения. Генри Пападатос, исполнительный директор Safer AI, считает, что добровольные меры регулирования, хотя и лучше полного отсутствия контроля, в конечном итоге зависят от доброй воли компаний. Он подчеркнул, что идеальным решением стало бы законодательное регулирование, которое бы исключило возможность изменения правил по усмотрению компаний, особенно в условиях кризисных ситуаций. На данный момент Meta, SpaceXAI и Google DeepMind не взяли на себя обязательств по внедрению сторонних оценщиков, хотя генеральный директор DeepMind Демис Хассабис предложил создать отдельный отраслевой орган для независимого тестирования передовых моделей.

Источник

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *