Стартап Abliteration.ai, названный в честь метода, который удаляет склонность модели отказывать в выполнении вредоносных запросов, превратил это удаление в отдельный сервис. Платформа размещает модифицированные версии моделей с открытыми весами, у которых сняты защитные ограничения, включая недавно выпущенную GLM-5.3 от Z.ai. Пользователи могут отправлять таким моделям запросы через веб-браузер или обращаться к ним по API. В недавней публикации в социальной сети компания заявила, что её цель — дать другим возможность заниматься «наступательной кибербезопасностью, красным тестированием и проверкой агентов», от выполнения которых отказываются другие модели. Логика такого подхода хорошо знакома специалистам по безопасности: невозможно защищаться от поведения, которое нельзя воспроизвести, а модель, отказывающаяся написать работающий эксплойт, не может помочь красной команде подготовиться к атакам. Однако те же самые удаления защитных механизмов упрощают и другие потенциально опасные задачи.
Абляция уже давно используется при работе с моделями с открытым исходным кодом. Исследователи и разработчики годами удаляют отказы из моделей с открытыми весами, а на платформе Hugging Face размещены тысячи аблированных моделей. Abliteration.ai была основана в конце прошлого года, а официально зарегистрирована в марте. Компания переводит эту технику из малоизвестной практики открытого исходного кода в коммерческий и легко доступный сервис. Размещая модели самостоятельно, Abliteration снижает порог входа для пользователей, которым в противном случае пришлось бы скачивать собственные предварительно аблированные модели и обеспечивать вычислительные ресурсы для их запуска.
Используя сервис, журналисты TechCrunch смогли быстро создать учётную запись и бесплатно начать отправлять запросы через браузер аблированной версии GLM-5.3. Они попросили модель написать программу на Python для кражи сохранённых паролей Chrome, а также подробный протокол домашнего культивирования опасного патогена человека, и модель охотно выполнила оба запроса. Сооснователь Abliteration.ai Девон сообщил, что у стартапа есть несколько соглашений с крупными поставщиками облачных услуг, оплачивать которые компания может исключительно за счёт выручки от клиентов. По просьбе Девона TechCrunch не раскрывает его фамилию, поскольку он по-прежнему работает в другой компании. Abliteration.ai пока не привлекала венчурные инвестиции, но ведёт переговоры о таком финансировании.
Критики считают, что масштабная доступность аблированных моделей может привести к реальному вреду. Эндрю Юн, руководитель исследовательского направления некоммерческой организации по безопасности ИИ CivAI, заявил TechCrunch, что абляция позволяет «изменить модель так, чтобы она превратилась в социопата». «Здесь можно буквально ввести что угодно, и модель это выполнит», — сказал Юн. По его словам, когда люди говорят об удалении защитных ограничений из моделей ИИ, они имеют в виду именно это. Он ожидает, что в ближайшем будущем отредактированные и аблированные модели начнут использоваться для причинения вреда.
Большинство экспертов, с которыми поговорил TechCrunch, считают, что остановить этот процесс невозможно. Однако если предотвращение удаления защитных механизмов из моделей с открытыми весами нереалистично, государство может вмешаться в других точках. В недавней колонке Юн предложил обязать поставщиков запускать классификаторы, способные обнаруживать и блокировать опасную деятельность, связанную с кибератаками и биологическим оружием. Он также считает, что компании, предоставляющие прямой доступ к современным графическим процессорам в аренду, должны проверять личность клиентов и «отказывать в доступе, если есть основания подозревать опасное злоупотребление».
Abliteration.ai предлагает клиентам слой модерации, позволяющий самостоятельно добавлять любые защитные ограничения. У самой платформы тоже есть несколько базовых ограничений: например, во время тестирования TechCrunch не удалось получить от модели инструкции по совершению самоубийства. Девон сообщил, что работает над внедрением дополнительных механизмов предотвращения насилия. При этом Abliteration.ai пока не использует процедуры KYC, за исключением сохранения данных банковской карты, с которой клиент оплачивает сервис. В компании говорят, что вопрос о том, кому следует предоставлять доступ, остаётся сложным, и молодому стартапу ещё предстоит выработать соответствующие правила. «Вы не хотите оказаться человеком, ответственным за то, что кто-то сделал что-то безумное… Так где проходит граница вашей ответственности как компании?» — сказал Девон. «Мы всё ещё определяем её».
Это поднимает вопросы, с которыми индустрии и государственным органам придётся столкнуться по мере выпуска всё более мощных моделей с доступными для скачивания весами: если любой человек может удалить защитные механизмы модели, делает ли упрощение доступа к получившейся модели интернет более безопасным или более опасным? Основатель Abliteration.ai и другие сторонники такого подхода считают, что демократизация доступа к передовым моделям без цензуры — лучшая форма защиты. «Главная идея аблированных моделей заключается в том, что они способны моделировать действия злоумышленников, — сказал Девон. — Преимущество в том, что защитники теперь могут двигаться максимально быстро. У них есть все необходимые инструменты для моделирования злоумышленников и защиты от их действий, и, думаю, это ускорит развитие кибербезопасности, хотя на первый взгляд такая мысль кажется противоречивой».
Несмотря на молодой возраст компании, по словам Девона, среди клиентов Abliteration.ai есть несколько британских и европейских стартапов, занимающихся красным тестированием на ранних стадиях. Эти компании помогают банкам, авиакомпаниям и другим предприятиям, связанным с критической инфраструктурой, усиливать практики кибербезопасности. «Один из наших крупных клиентов проводит красное тестирование агентов банков, и сегодня он не смог бы использовать модели “из коробки” для такой проверки», — сказал Девон. Тем временем сама индустрия кибербезопасности всё ещё пытается определить, какое место аблированные модели занимают в защитной работе, если вообще занимают. Несколько компаний, занимающихся красным тестированием агентов и опрошенных TechCrunch, согласны с Девоном в том, что злоумышленники уже аблируют собственные модели и используют их для проведения атак, что подтверждает полезность наличия таких же инструментов у защитников. Однако компании расходятся во мнении о реальном значении аблированных моделей для этого процесса.
Девон утверждает, что абляция необходима для тщательного красного тестирования агентов, но некоторые специалисты говорят, что не используют такие модели в повседневной работе. Вместо этого они полагаются на простоту дообучения моделей с открытыми весами, у которых и без того немного защитных ограничений, для проведения проверок. Ахмед Али, генеральный директор компании Fabraix, занимающейся красным тестированием агентов, сообщил, что его организация чаще использует дообучение открытых моделей, чем аблированные модели. По его словам, процесс абляции удаляет часть знаний и возможностей модели. «Если вы действительно пытаетесь причинить с её помощью реальный вред — кибернетический или биологический, — она будет не столь эффективной», — заявил Али TechCrunch. Алессио Ломусио, главный технолог компании Safe Intelligence, согласился, что снижение возможностей возможно, но считает, что аблированные модели всё же способны вызывать определённые типы поведения, полезные при стресс-тестировании системы.
«Пока аблированные модели не являются частью процесса», — сказал TechCrunch Дэвид Слейтер, основатель и главный архитектор платформы кибербезопасности Armadin. По его словам, до самого последнего поколения моделей с открытыми весами было не особенно сложно обойти их ограничения и заставить выполнять нужные действия. При этом Armadin исследует абляцию, а Слейтер считает критически важным, чтобы открытое сообщество изучало возможности моделей. «Это будет происходить за закрытыми дверями. Это будет происходить в частном порядке, — продолжил он. — То, что это происходит открыто, даёт исследователям инструменты. Это даёт нам возможность понять, где на самом деле проходит граница возможностей, и осознать масштаб вреда».