Хотя использование техники Astra, как сообщается, ограничено, её появление всё же вызвало серьёзные опасения среди экспертов по безопасности ИИ. "Я крайне обеспокоен сообщениями о том, что Astra использует непрозрачную рекурсию," написал генеральный директор Redwood Бак Шлегерис в посте после появления новости.

"Я не знаю, насколько Astra менее контролируема через Chain of Thought (CoT) по сравнению с предыдущими моделями. Но если OpenAI продвинет эту технику дальше, у них будет возможность значительно увеличить рекурсию и полностью уничтожить контролируемость CoT." Давний защитник безопасности ИИ Зви Моушовиц также высказался и написал, что могут понадобиться законы, чтобы предотвратить "гонку на дно" среди лабораторий ИИ.

"Эта техника играет с огнём, рискуя нарушить табу, которое OpenAI и Anthropic старались установить, чтобы мы усердно поддерживали верность и контролируемость Chain of Thought как можно дольше," написал Моушовиц. "Более интенсивное использование таких техник, вероятно, повредит контролируемости." В нормальных условиях цепочка рассуждений модели предоставляет последовательные шаги, предпринятые моделью при попытке решить проблему.

Хотя представление несовершенно, оно всё же служит ценным инструментом для мониторинга неправильного поведения или несоответствия. В случае недавней активности "непослушного агента" OpenAI записи цепочки рассуждений были важным инструментом для выяснения причин поведения агентов. В непрозрачной рекурсии модель принимает менее линейный подход, обрабатывая один и тот же запрос несколько раз в цикле.

Результат оставляет меньше читаемых следов, фактически обходя традиционную запись цепочки рассуждений. Важно отметить, что использование техники Astra, по-видимому, ограничено. Ожидается, что цепочка рассуждений модели всё ещё будет читаемой, и компания отвергла любые предположения о переходе к "нейронному языку".

OpenAI уже объявила о планах по внедрению обширных систем мониторинга цепочки рассуждений в рамках своих перспективных планов по безопасности. В посте на X главный научный сотрудник OpenAI Якуб Пахоцкий подчеркнул приверженность лаборатории читаемым цепочкам рассуждений.

"OpenAI работает над сохранением и использованием мониторинга цепочки рассуждений с самых первых моделей рассуждений," написал Пахоцкий. "Это основная цель нашей текущей исследовательской программы." Все модели ИИ выполняют некоторое количество непрозрачных рассуждений, и немногие исследователи принимают записи цепочки рассуждений как прямое представление рассуждений модели.

Тем не менее, эти оговорки не развеивают обеспокоенность тем, что непрозрачная рекурсия может усложнить мониторинг рассуждений ИИ, особенно по мере её распространения на различные модели. В следующем отчёте утром в среду The Information сообщила, что и Anthropic, и Google DeepMind уже обсуждали эту технику. В посте, отвечая на новость, главный научный сотрудник Redwood Research Райан Гринблатт сказал, что непрозрачные рассуждения могут легко масштабироваться быстрее, чем традиционные рассуждения цепочки рассуждений, фактически удаляя все рассуждения из видимых каналов.

"Моя самая большая обеспокоенность заключается в том, что естественное развитие отсюда может включать масштабирование непрозрачных рассуждений до такой степени, что модель будет рассуждать полностью или почти полностью в скрытом пространстве," написал Гринблатт. "Я надеюсь, что ещё не поздно избежать самых тревожных архитектур и что OpenAI остановится здесь.

Источник

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *