Искусственный интеллект становится всё умнее с возрастающей скоростью, но по мере его развития становится сложнее не только внедрять, но и контролировать его, заявил Квист, один из первых сотрудников Anthropic, который также является зятем Даттани. Даттани — бывший главный операционный директор исследовательской организации в области безопасности ИИ METR. Пара основала стартап Artificial Intelligence Underwriting Company (AIUC), призванный обеспечить безопасность ИИ для предприятий и компаний, разрабатывающих ИИ-модели и агентов. Среди клиентов стартапа — Cursor, Lovable, Harvey и ElevenLabs.

Во вторник AIUC объявила о привлечении $40 миллионов в рамках раунда Серии А под руководством Ribbit Capital при участии First Harmonic. Ранее компания уже привлекла $15 миллионов в рамках посевного раунда от Нэта Фридмана через его фонд NFDG, а также от Emergence, Terrain и соучредителя Anthropic Бена Манна, среди прочих. Таким образом, общий объем финансирования компании достиг $55 миллионов.

Интерес этой группы инвесторов вызван попыткой AIUC применить знакомую модель кибербезопасности к новому набору рисков, связанных с ИИ. Компания разработала независимый уровень аудита и сертификации для ИИ-агентов. «Банки, больницы, правительства и военные больше не отказываются от внедрения ИИ из-за недостаточной "умности" модели», — отметил Квист. «Они отказываются, потому что дали своим клиентам обязательства относительно того, что система будет делать, а что нет, и в настоящее время никто не может этого гарантировать».

Вдохновившись широко распространенным стандартом кибербезопасности SOC 2, AIUC разработала собственный стандарт под названием AIUC-1 и сервис тестирования для проверки агентов на соответствие этому стандарту. Для создания стандарта AIUC собрала консорциум из примерно 250 руководителей в области безопасности и управления рисками — потенциальных покупателей ИИ-агентов. «Мы встречаемся с этими людьми ежемесячно и задаем им вопрос: "На что вы будете обращать внимание при покупке агентов у поставщика? Какие вопросы вы хотели бы задать и что должно быть учтено?"», — рассказал Даттани изданию TechCrunch.

Эти отзывы формируют основу для тестов. Затем стартап подвергает агент комплексу из примерно 5000 тестов, чтобы оценить его поведение в сценариях, связанных с обходом ограничений (jailbreaks), галлюцинациями (генерацией недостоверной информации) и утечками данных. Результаты оформляются в виде отчета объемом около 100 страниц, подробно описывающего, где агент демонстрирует безопасную и надежную работу, а где — нет. Примечательно, что AIUC использует ИИ-агентов для проведения тестов и ИИ для анализа данных, однако окончательную проверку аудита проводят люди, уточнил Квист.

Этот подход имеет сходство с работой METR, где Даттани занимал должность главного операционного директора с 2024 по 2025 год и остается членом совета директоров. METR проводит аналогичное тестирование для передовых исследовательских лабораторий, хотя до недавнего времени его работа была сосредоточена в основном на производительности (способности агентов надежно выполнять задачи). METR была одной из независимых исследовательских организаций, которую OpenAI привлекала для расследования инцидента на Hugging Face.

Генеральный директор Anthropic Дарио Амодеи также недавно призывал индустрию ИИ к замедлению темпов разработки передовых моделей, ссылаясь на быстрый рост числа инцидентов с некорректным поведением. В своем сообщении Амодеи выдвинул идею обязательного привлечения встроенных сторонних оценщиков для наблюдения и проверки безопасности в передовых лабораториях, назвав METR в качестве одного из возможных кандидатов. Хотя AIUC не предлагает внедрять своих специалистов на площадках клиентов, общая идея схожа: предоставить предприятиям независимую оценку уровня безопасности их ИИ-агентов. «Вот где он проходит проверку и где ему можно доверять. А вот здесь есть проблемы. Вам следует знать об этих моментах, прежде чем принимать решение о покупке», — пояснил Даттани.

Источник

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *