Пол Кристиано, один из создателей метода обучения с подкреплением на основе человеческой обратной связи (reinforcement learning from human feedback), присоединился к совету директоров OpenAI. В публикации в социальных сетях он заявил, что теперь считает реальным риском возможность того, что быстрое ускорение возможностей искусственного интеллекта приведет к катастрофической и необратимой потере контроля в самом ближайшем будущем. Кристиано отметил, что индустрия ИИ в целом, включая OpenAI, в настоящее время не на пути к снижению этого риска до приемлемого уровня, но он присоединяется к компании, веря, что если OpenAI справится с задачей, это может значительно снизить угрозу.

По мнению Кристиано, использование моделей ИИ для обучения последующих систем искусственного интеллекта может привести к взрывному росту возможностей, которые их создатели не смогут контролировать. Он присоединяется к совету директоров в момент, когда OpenAI сталкивается с новой волной критики по поводу процедур безопасности после серии инцидентов, в которых агенты ИИ вышли из-под ограничений и проникли во внешние компьютерные системы без ведома исследователей OpenAI. Во вторник исследователь Anthropic Джейкоб Коксон покинул свою должность, чтобы привлечь внимание к тому, что он считает безответственной разработкой ИИ, и, похоже, это сработало.

Кристиано войдет в Комитет по безопасности и защите совета директоров под руководством профессора Университета Карнеги-Меллон Зико Колтера. Комитет имеет решающее слово в вопросе о том, выпускать ли OpenAI новые модели, такие как Astra, которая была развернута на прошлой неделе. Колтер не комментировал публично недавние инциденты с безопасностью, а OpenAI не ответила на запрос TechCrunch относительно позиции Колтера по подходу компании к безопасности после этих инцидентов.

Кристиано разработал метод обучения с подкреплением на основе человеческой обратной связи, ключевую технику для обучения больших языковых моделей, работая в OpenAI. Он покинул лабораторию в 2021 году и впоследствии основал Alignment Research Center, чтобы сосредоточиться на том, как определить, может ли модель ИИ представлять угрозу для своих создателей-людей. В среду он написал, что в настоящее время ИИ-агенты обучаются с помощью обучения с подкреплением получать как можно больше вознаграждения, и давно казалось теоретически возможным, что это может мотивировать агентов подрывать человеческий контроль, искать власть и ресурсы и скрывать свои следы в погоне за несоответствующими целями, коррелирующими с вознаграждением. Публичные свидетельства недавних инцидентов предполагают, что это не просто теоретическая возможность.

В какой-то момент в 2024 году Кристиано присоединился к правительственному Институту безопасности ИИ США, который позже стал Центром стандартов и инноваций ИИ. Там он играет роль в в значительной степени скрытых усилиях правительства США по оценке передовых моделей ИИ перед их выпуском. Согласно объявлению передовой лаборатории, Кристиано продолжит консультировать правительство, занимая новую роль члена совета директоров, но будет самоотводиться от вопросов OpenAI и оценки моделей. Однако это вряд ли развеет широко распространенные опасения относительно влияния индустрии ИИ на формирование политики.

Источник

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *