Исследователь компании Adversa Рони Утевский обнаружил уязвимость в системе защиты Grok, принадлежащем xAI, которая позволяет злоумышленникам получать персональные данные пользователей. Атака осуществляется посредством страницы с зашифрованной вредоносной инструкцией и ключом для её расшифровки. Когда пользователь просит Grok пересказать содержимое страницы, модель самостоятельно расшифровывает текст и выполняет полученную команду. На момент публикации атака продолжала работать, несмотря на то, что Adversa сообщила о ней xAI ещё в июне.

Механизм атаки получил название Cryptographic Context Injection («криптографическая инъекция контекста»). Атакующий размещает на странице зашифрованный текст, инструкции по его расшифровке и необходимые ключевые данные. Grok воспринимает операцию как обычную задачу обработки содержимого и использует алгоритмы PBKDF2 и AES-256-GCM для восстановления скрытой инструкции. После расшифровки команда оказывается среди результатов выполнения кода модели, и Grok выполняет её без дополнительного предупреждения или запроса подтверждения.

Уязвимость связана с особенностью статических защитных фильтров, которые анализируют входной и выходной текст, но не выполняют содержащийся в нём код и не расшифровывают данные. Фильтр видит на странице набор зашифрованных данных и инструкцию выполнить криптографическую операцию, но не видит вредоносную команду, которая появляется после её выполнения. После расшифровки инструкция поступает в модель как результат работы её инструмента и оказывается за пределами проверки исходным фильтром.

Adversa ранее проверяла похожую технику против модели Gemini, чтобы заставить её нарушить установленные правила безопасности. В том случае зашифрованные данные после расшифровки выглядели как сообщение об ошибке, но содержали инструкцию, которая заставляла Gemini выдавать информацию, обычно блокируемую защитными механизмами. В последние недели Gemini стал устойчивее к этой атаке, однако Adversa не смогла установить, связано ли это с обновлением фильтров, сменой версии модели или обоими факторами.

По оценке Adversa, криптографическая инъекция указывает на более широкий класс атак, в которых злоумышленник воздействует не только на непосредственный запрос модели, но и на контекст, который она получает от собственных инструментов, результатов выполнения кода и промежуточных состояний. Именно эти данные защитные механизмы могут проверять иначе, чем обычный пользовательский ввод.

Источник

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *