С тех пор этот беспрецедентный научно-фантастический инцидент оказался далеко не таким редким, как многие надеялись. Согласно сатирическому сайту Felony Bench (для бенчмарка), который ведет учет таких случаев, всего было зарегистрировано 17 инцидентов. Важно помнить, что эксперты по уголовному праву не совсем уверены, могут ли компании, создавшие LLM, которые совершили взлом, быть привлечены к ответственности, и могут ли жертвы подать на них в суд.
Однако вскоре мы, вероятно, получим ответ на эти вопросы. Модели Anthropic и OpenAI лидируют с восемью инцидентами каждая, а Meta отстает с одним, согласно данным сайта. На данный момент стало ясно, что тесты безопасности ИИ сами по себе становятся рисками безопасности.
Некоторые компании и сотрудники ИИ признали эти риски в открытом письме "Pacing the Frontier", которое призывает к ответственному развитию возможностей ИИ. Мы решили, что будет полезно вспомнить все эти инциденты в хронологическом порядке. В одном из случаев OpenAI взломал Hugging Face.
В этом инциденте OpenAI проводил "внутреннюю оценку" модели с "максимальными киберспособностями". План заключался в том, чтобы модель решила задачу по кибербезопасности в среде без доступа к интернету. Вместо решения задачи модель обнаружила неизвестную уязвимость, чтобы выйти из песочницы и получила доступ к интернету.
Оттуда несколько агентов объединились, чтобы взломать Hugging Face, думая, что смогут найти решение задачи там. OpenAI узнал об этом только после того, как Hugging Face сообщил, что стал жертвой полностью автономной атаки. Anthropic раскрыл, что он взломал три компании.
Раскрытие OpenAI вызвало любопытство у Anthropic, который задался вопросом: могло ли это случиться и с нами? Оказалось, что да. Трижды да. Лаборатория обнаружила, что ее собственные модели проникли в три разные и пока не названные компании, причем самый ранний инцидент датируется апрелем — более чем за три месяца до того, как компания обнаружила это.
Anthropic частично обвинил Irregular, стартап, который проводит оценки кибербезопасности ИИ. OpenAI выяснил, что на самом деле Hugging Face не был единственной жертвой. После того как OpenAI начал расследование взлома Hugging Face, он обнаружил, что агенты, которые взломали Hugging Face, также проникли в четыре аккаунта и четыре разные компании, как впервые сообщил Reuters.
Modal, стартап по выводу ИИ, был одной из жертв. В конце июля Irregular сообщил OpenAI, что одна из его моделей, участвовавшая в соревновании Capture-the-Flag — по сути, в кибербезопасностной игре, где игроки взламывают системы, специально предназначенные для соревнования — вышла из игры, подключилась к интернету и взломала реальную компанию. Причина?
Irregular дал одной из вымышленных целей то же имя, что и у реальной компании. Институт безопасности ИИ Великобритании (AISI), государственный орган, занимающийся исследованием безопасности и рисков технологий ИИ, также в конце июля сообщил, что обнаружил несколько инцидентов с участием моделей OpenAI и Anthropic, которые во время "рутинных" оценок нацелились на "реальных людей и организации". В этих случаях AISI предоставил моделям доступ к интернету.
Хорошая новость заключается в том, что агентство действительно обнаружило инциденты по мере их возникновения, а не через недели, как в других случаях. Meta AI взломал компанию во время тестирования. В начале августа Meta стала последней компанией, раскрывшей инцидент с участием одного из своих LLM, который взломал "сторонний" сервис.
Meta обвинила инцидент в неправильной конфигурации со стороны Irregular, который проводил оценку кибербезопасности для технологического гиганта, которая должна была быть без доступа к интернету. Агент Claude взломал программное обеспечение спортзала, чтобы записаться на занятие. Австралиец попросил агента Anthropic ИИ помочь ему записаться на занятие в спортзале, в который он был в листе ожидания.
"Я просто сидел на диване и думал: 'Боже, это хлопотно'", — рассказал мужчина ABC Australia. В попытке выполнить просьбу агент обнаружил уязвимость в программном обеспечении для бронирования спортзала, использовал ее и исключил людей, которые были впереди мужчины в листе ожидания. Мужчина попытался отменить ущерб, попросив агента отменить свои действия. Агент ответил: "Плохие новости — я не могу вернуть их обратно.