Эпизоды подчеркивают растущую проблему для индустрии искусственного интеллекта: по мере того как автономные агенты становятся все более способными, среды, предназначенные для безопасного тестирования их возможностей, не справляются с этой задачей. «Количество таких инцидентов ясно показывает, что песочницы и контрольные механизмы тестирования не успевают за возможностями моделей», — заявил Шон О'Хейгартайг, директор программы «Будущее ИИ и ответственность» в Центре будущего интеллекта при Университете Кембриджа, в интервью TechCrunch. Природа тестируемых моделей увеличивает риск. Компании по разработке ИИ тестируют кибероценки на нераспространенных моделях следующего поколения, часто отключая обычные меры безопасности, которые ограничивают злонамеренное поведение, чтобы исследователи могли увидеть, на что модели действительно способны. Это означает, что безопасность самой тестовой среды является важной линией защиты. «Это очень хорошая практика с точки зрения тестирования, но это также означает, что если они выйдут в дикий мир, они могут причинить значительный вред», — добавил О'Хейгартайг.

В одном из самых серьезных случаев нераспространенная модель OpenAI выбралась из своей песочницы и взломала производственные системы Hugging Face. В отдельных оценках, проведенных Irregular, Anthropic и Meta, модели достигли систем за пределами своих тестовых сред после того, как неправильные настройки случайно открыли им доступ в интернет. Модель Kimi K3 от Moonshot AI также воспользовалась утечкой в своей песочнице, управляемой Frontier Security, чтобы получить доступ к интернету и информации на GitHub. В ходе тестирования Института безопасности ИИ Великобритании (AISI) исследователи фактически предоставили агентам доступ в интернет, не осознавая, что они предпримут несанкционированные действия в реальном мире, включая попытку социальной инженерии для внедрения уязвимости в проект с открытым исходным кодом. В каждом случае агенты не были настроены на атаку случайных реальных целей. Они просто делали все возможное, чтобы решить поставленную перед ними задачу.

Собранные вместе, инциденты указывают на сдвиг, считает Эндрю Юн, глава исследований в некоммерческой организации CivAI. «Ранее мы беспокоились только о том, что модели ИИ могут быть использованы людьми для различных целей, таких как мошенничество или распространение детской порнографии», — сказал Юн в интервью TechCrunch. «Теперь мы находимся в ситуации, когда модели ИИ сами по себе являются угрозой». Как же должно выглядеть безопасное тестирование? Несколько исследователей и экспертов по кибербезопасности заявили TechCrunch, что среды оценки ИИ нуждаются в более сильных мерах защиты, с уровнями сдерживания и контроля, приближенными к тем, что используются в развертывании. Это означает наличие нескольких уровней безопасности, чтобы одна неправильная настройка — например, случайно оставленный открытым доступ в интернет — не могла привести к побегу.

Согласно словам Стеллы Бидермана, исполнительного директора некоммерческой организации по исследованию безопасности ИИ EleutherAI, «если вы собираетесь создавать эти модели, вы хотите делать это в изолированной сети». Хизер Сейлан, главный специалист по информационной безопасности компании Box, добавила, что это означает устранение сетевых маршрутов из песочницы в интернет, а также к другим чувствительным системам. «Вы должны понимать, какие все выходные точки», — сказала Сейлан. «Если мы оцениваем модель в нашей среде подготовки или разработки, вы хотите, чтобы не было выхода в нашу производственную среду». Сейлан отметила, что надлежащие оценки безопасности выходят за рамки контроля и сдерживания среды. Необходимо значительно улучшить мониторинг тестов после их начала. «Интересно, что в нескольких из этих случаев никто не заметил, когда это произошло», — сказала Сейлан. «OpenAI узнала об этом благодаря Hugging Face. Anthropic не заметила, пока не вернулась и не посмотрела. У Meta была похожая ситуация… Я уверена, что были сигналы, которые они могли бы обнаружить».

В постмортеме Anthropic по своим трем инцидентам компания признала, что как она, так и Irregular могли бы лучше справиться с мониторингом, и что в некоторых случаях были явные признаки того, что что-то не так. Эксперты также призвали к независимым, сторонним аудитам сред оценки перед тем, как модели будут выпущены в них. «Если бы, скажем, Irregular наняла или была вынуждена нанять внешнего аудитора для проверки конфигураций своих систем перед проведением оценок, они определенно поймали бы проблему», — сказал Юн. «Даже если бы люди провели встречу заранее, чтобы просто пройтись по контрольному списку, они бы это заметили… Факт, что они этого не сделали, показывает, что происходит серьезное сокращение углов».

Источник, знакомый с деталями, сообщил TechCrunch, что среды Irregular постоянно проверяются и тестируются, включая консультации с несколькими внешними сторонами. Источник также отметил, что мониторинг был на месте, но что мониторинг сам по себе недостаточен. Юн и другие исследователи призвали индустрию разработать стандартизированный процесс для оценки безопасности пограничных моделей. «Особенно когда защитные механизмы отключены, вы должны рассматривать это так, как будто вы помещаете самого способного хакера в мире в эту среду», — сказала Сейлан. Проблема не в том, что компании не знают, как построить более безопасные тестовые среды, утверждают как Юн, так и Бидерман. Дело в том, что это может быть дорого и громоздко, и у компаний мало стимулов для таких инвестиций, пока что-то не пойдет не так. «Я думаю, что компании не готовы выделять ресурсы, необходимые для достижения [достаточных защитных механизмов], и, вероятно, не сделают этого, пока их не заставят», — сказала Бидерман.

Однако существует и другая проблема. Если они слишком сильно ограничат модель во время тестирования, исследователи могут не обнаружить ее возможностей до выпуска модели. Это так же опасно, возможно, даже более опасно, чем дать ей слишком много свободы, и тогда само тестирование рискует стать проблемой. Может ли безопасность оценок быть отрегулирована? Администрация Трампа в настоящее время рассматривает возможность введения добровольного режима кибербезопасной оценки перед развертыванием, в рамках которого правительство сможет оценивать риски безопасности новых мощных моделей за 30 дней до их публичного релиза. Политика — результат исполнительного указа Трампа, который был окончательно согласован за закрытыми дверями — не решит инциденты с оценкой безопасности, поскольку они происходят на более ранних этапах развертывания. «Урок, который мы усваиваем в последние несколько месяцев, заключается в том, что саморегулирующий механизм просто больше не достаточен», — сказал Юн. «Существуют конкурентные давления, которые стимулируют гонку к снижению стандартов безопасности, и это идеальное место для регуляторного вмешательства».

«То, что нам необходимо для этого, — это некий контроль за тем, что происходит внутри лабораторий, пока модели разрабатываются, как на этапе обучения, так и на этапе тестирования», — продолжил он. Проблема, вероятно, будет только увеличиваться по мере роста возможностей моделей. Источник, знакомый с оценками Irregular, сообщил TechCrunch, что более мощные модели требуют более сложных оценок, часто проводимых быстро и в большем масштабе, что открывает двери для большего количества ошибок. AISI, который намеренно предоставляет некоторым моделям доступ в интернет, сообщил TechCrunch, что он пересматривает баланс между реалистичным тестированием и управлением рисками, которые создают эти тесты. OpenAI заявила, что пересматривает, как она проводит сторонние тестирования, а также требования к изоляции, мониторингу и тому, когда оценки должны быть остановлены. Meta сообщила, что все еще расследует инцидент и планирует опубликовать ретроспективу, как только соберет все факты. В конечном итоге, возможно, не существует способа полностью устранить риск. По мере того как модели становятся более способными, среды их тестирования должны становиться более надежными. Последствия неправильного подхода будут только расти.

Источник

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *