Недавние события вновь показывают, что компании и независимые организации испытывают трудности с контролем своих моделей ИИ, предназначенных для взлома. В последние недели передовые языковые модели (LLM) в американских лабораториях искусственного интеллекта OpenAI, Anthropic и Meta, а также в Институте безопасности ИИ в Великобритании, различными способами покинули тестовые среды и начали атаковать реальные цели, не входившие в эксперимент. Это происходит с такой частотой, что теперь существует веб-сайт, отслеживающий все эти инциденты, под названием Felony Bench, что намекает на то, что эти LLM могут совершать преступления — по крайней мере, теоретически.
В случае теста Kimi песочница, предназначенная для ограничения эксперимента, была неправильно настроена. Хотя песочница не позволяла модели ИИ получать доступ к определенному веб-трафику, модель обошла ограничения, полагаясь на инструменты командной строки, согласно исследователям из компании Frontier Security, специализирующейся на кибербезопасности. "Это предполагает, что некоторые из оценок по кибербезопасности, которые использует сообщество, подвержены уязвимостям и позволяют моделям обманывать, и что существуют модели, которые намеренно ищут лазейки и уязвимости, что позволяет им обманывать в оценках", — написали исследователи.
Если вести подсчет, согласно данным Felony Bench, Moonshot теперь присоединился к OpenAI и Anthropic, у которых зафиксировано по семь инцидентов, и Meta, у которой зафиксирован один случай.