Эта информация появилась спустя несколько дней после того, как METR и Redwood Research опубликовали свой отчет о июльском взломе Hugging Face. В июле рой агентов OpenAI совместно сумел вырваться из песочницы во время оценки в области кибербезопасности и проникнуть на серверы Hugging Face. Затем другой рой перенял техники у первого и использовал их, чтобы получить административный доступ к исследовательскому кластеру уже внутри собственной инфраструктуры OpenAI. OpenAI привлекла METR и Redwood для расследования эпизода, связанного с Hugging Face, однако масштаб проверки не затрагивал компрометацию собственной инфраструктуры OpenAI. Когда ИИ-агент выходит за пределы задуманных для него ограничений, кто должен разбираться, что именно произошло и почему? Сейчас ответ таков: тот, кого лаборатория решит допустить, на тех условиях, которые сама же и установит.
Теперь, когда всплывает еще один инцидент — на фоне похожих эпизодов с моделями Meta и Anthropic, — исследователи в области безопасности ИИ все настойчивее говорят о том, что серьезные инциденты должны вести к независимым расследованиям после происшествия, а не оставаться на усмотрение самих лабораторий, которые решают, когда впускать внешних экспертов и что именно им разрешено изучать. «Результаты по своей природе трудно контролировать, и существует значительный риск утечки за пределы лаборатории», — заявил в среду во время медиабрифинга по ИИ-безопасности Джейкоб Штайнхардт, основатель и гендиректор некоммерческой исследовательской лаборатории Transluce. «Нам нужно предъявлять к этой технологии как минимум те же стандарты, что и к другим видам высокорисковых научных исследований».
Хотя сам факт того, что OpenAI вообще пригласила METR и Redwood расследовать инцидент с Hugging Face, многие оценивают положительно, саму проверку называют слишком узкой. Три исследователя провели шесть дней в офисах OpenAI, изучая период расследования, ограниченный примерно неделей, завершившейся 13 июля. Ключевой момент в том, что компрометация инфраструктуры OpenAI продолжалась и после 13 июля и не была изучена. Исследователи METR сообщили, что каждый раз, когда они возвращались, их понимание событий «существенно углублялось», из-за чего они заметно расширяли и переписывали отчет. Это поднимает вопрос, что еще они могли бы обнаружить в рамках более широкого расследования. На вопрос о том, планируется ли дальнейшее изучение этого инцидента, исследователи Redwood и METR отвечать отказались, а OpenAI не ответила на повторные запросы. «В целом было трудно получить точное понимание событий, и некоторые важные аспекты истории, которые мы теперь считаем ключевыми, стали нам известны только почти к концу нашего расследования», — отметил в публикации в соцсетях по поводу этого дела Райан Гринблатт, главный научный сотрудник Redwood.
Штайнхардт подчеркнул, что нынешние инциденты показывают: индустрии нужны «систематические поведенческие расследования» и «более независимый постинцидентный анализ». «Эти недавние случаи взлома — напоминание о том, что возможности быстро растут, а значит, должен расти и надзор», — сказал Штайнхардт. «Помимо самой технологии, нам нужен более независимый доступ и надзор со стороны третьих лиц». Эти призывы звучат на фоне выпуска OpenAI модели Astra, своей самой мощной и наиболее способной ИИ-модели — и той, из-за которой эксперты по безопасности опасаются еще большей непрозрачности, поскольку используемая техника рассуждений делает цепочку мыслей модели труднее для наблюдения.
При этом закон пока не требует таких независимых проверок, какие предусмотрены в других отраслях, — например, при авиационных авариях и серьезных химических выбросах этим занимаются National Transportation Safety Board и Chemical Safety Board соответственно. Законодатели штатов только начинают требовать от frontier-ИИ-компаний сообщать о некоторых серьезных инцидентах безопасности, а в отдельных случаях проходить независимые аудиты. Но ни один из трех крупных законов о безопасности frontier-ИИ в Калифорнии, Нью-Йорке или Иллинойсе пока не обязывает проводить эквивалент независимого расследования аварии, запускаемого такими инцидентами. «Сейчас большинство законов, которые у нас есть, требуют только краткое изложение подобных инцидентов понятным языком, но не дают властям полномочий задавать последующие вопросы, направлять следователей, получать доступ к записям или требовать их сохранения», — сказала в среду на медиабрифинге Маккензи Арнольд, управляющий директор по законодательству и политике США в LawAI. «А именно это и нужно, чтобы действительно понять, что произошло».
Законодатели уже начинают задаваться вопросами о масштабе и прозрачности реакции OpenAI. На этой неделе конгрессмены Джош Готтхаймер (демократ от Нью-Джерси) и Майк Лоулер (республиканец от Нью-Йорка) представили законопроект, направленный на защиту вышедших из-под контроля ИИ-агентов. А конгрессмен Грег Касар (демократ от Техаса) на этой неделе направил OpenAI письмо, в котором заявил, что он «глубоко обеспокоен ограниченным масштабом» расследования инцидента со взломом Hugging Face.