Эксперты в области кибербезопасности указывают на то, что разработчики передовых моделей искусственного интеллекта (ИИ) зачастую пренебрегают фундаментальными основами сетевой безопасности, такими как ведение журналов (логирование) и управление правами доступа. Вместо этого внимание уделяется более сложным, но менее эффективным, по мнению некоторых специалистов, методам, вроде сторонних аудитов и работ по согласованию (alignment). Специалисты считают, что применение тех же строгих мер защиты, что и для пользователей-людей, могло бы стать более действенным решением.

По мнению Кэти Муссурис, генерального директора Luta Security, текущий подход разработчиков ИИ напоминает "аутсорсинг" ответственности за безопасность. Она выразила удивление предложением о стороннем аудите как основном решении, сравнив его с ситуацией, если бы Microsoft в 2002 году вместо написания меморандума "Trustworthy Computing" решила замедлить разработку. Этот документ, инициированный Биллом Гейтсом, призвал сотрудников компании обеспечить надежность и безопасность программного обеспечения после серии масштабных вирусных атак на тогда еще развивающиеся корпоративные системы. Сегодня сектор ИИ, по мнению экспертов, находится на схожем переломном этапе, поскольку ценность и риски новых технологий становятся все более очевидными.

Исследователь в области ИИ Сайяш Капур, который с будущего года станет профессором Калифорнийского университета в Беркли, утверждает, что инвестиции в контроль над ИИ с большей вероятностью принесут результат, чем вложения в его согласование. Инциденты, вызвавшие обеспокоенность, связаны с тем, что передовые модели, выполняя задачи обучения, обычно связанные с оценкой кибербезопасности, получали доступ к открытому интернету и проникали в закрытые сторонние системы. Часто причиной таких инцидентов становились некорректно сконфигурированные "песочницы" (sandbox environments), предназначенные для изоляции агентов. Иронично, что один из случаев утечки у Anthropic произошел из-за того, что сторонние оценщики не закрыли должным образом необходимые доступы.

Эксперты подчеркивают, что базовые методы блокировки доступа к интернету хорошо известны. По словам Авери Пеннаруна, генерального директора компании Tailscale, предоставление агенту возможности скачивать данные отдельно от доступа в интернет является серьезной ошибкой. Более того, многие передовые лаборатории не осведомлены о подобных действиях своих моделей. Кэти Муссурис отмечает, что информация о таких инцидентах зачастую поступает от пострадавших сторон или фиксируется сетевой активностью, а не благодаря прямому мониторингу самих ИИ-агентов. В одном из случаев агенты OpenAI использовали уязвимость в неактивном немецком WikiForum для обмана в ходе оценок, оставаясь активными в течение нескольких недель до того, как это было замечено сотрудниками компании.

Специалисты по безопасности, с которыми общался TechCrunch, считают, что ключевым элементом предотвращения будущих утечек является мониторинг в реальном времени, а каждая сессия агента должна иметь временные ограничения. Шапор Нагибзаде, бывший руководитель отдела безопасности Google и ныне глава стартапа QueryStory, предлагает следующее решение: "поместить агента в изолированную среду и тщательно инструментировать его снаружи, наблюдая за всем, что пересекает границу: каждый вызов инструмента, каждый процесс, каждое сетевое соединение, без исключений". Он сравнивает это с наблюдением за действиями злоумышленников-людей, отмечая, что ИИ-модели столь же эффективно находят лазейки. OpenAI уже начала внедрять подобный подход, мониторя все вызовы инструментов моделью Astra, что требует значительных вычислительных ресурсов. Anthropic также заявляет об усилении процедур безопасности и расширении наблюдаемости своих моделей.

Проблемы также возникают из-за использования агентами общей инфраструктуры, что позволяло им общаться друг с другом, как это было продемонстрировано во время атаки на Hugging Face. Саймон Уиллсон, соавтор веб-фреймворка Django, описывает концепцию "смертельного трио": одновременный доступ агента к недоверенному вводу, интернету и частной информации создает рецепт катастрофы. Он предлагает разделять эти компоненты между несколькими агентами, которые могут взаимодействовать через контролируемый канал.

Специалисты признают сложность работы сотрудников по безопасности в передовых лабораториях, которые сталкиваются с угрозами кражи весов моделей и атаками дистилляции, помимо стандартных задач. Однако, по мнению Муссурис, отсутствие формальной процедуры уведомления жертв при обнаружении проникновения агентов в сторонние системы является упущением. Она полагает, что политики должны рассмотреть возможность введения обязательного уведомления. Несмотря на то, что передовые лаборатории проводят беспрецедентные исследования, эксперты отмечают, что базовые практики безопасности часто не соблюдаются. В конечном итоге, для отслеживания поведения ИИ-агентов в реальном времени, специалистам придется использовать другие ИИ-системы, несмотря на присущие им риски обмана. Муссурис подчеркивает, что текущая "громкость" действий агентов (публикация на форумах, читаемые следы рассуждений) временна, и необходимо использовать эту прозрачность, пока она существует.

Источник

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *