Исследователи добились 100% результата на интерактивном тесте ARC-AGI-3, используя модель Claude Opus 5 с модифицированным "обвязочным" механизмом, который эффективно управляет памятью и включает компонент "супервизора", напоминающий начальника. ARC-AGI-3 представляет собой набор 2D-игр без инструкций, где модель должна самостоятельно разобраться, как играть и выигрывать, подобно человеку. Без использования обвязки Opus 5 набрала 30%, что стало лучшим результатом среди всех протестированных моделей. Исследование Nvidia показывает, что хотя выбор модели имеет значение, сама модель, являющаяся "мозгом" агента, является меньшей частью агентной системы, чем многие пользователи ИИ осознают, особенно для задач с длинным горизонтом. Обвязка делает модель агентом: она управляет памятью, контекстом и обратной связью.

Агент интерпретируется как API модели, но на самом деле это больше, чем просто модель. Это обвязка вокруг модели, набор инструментов, которые она использует, а также время выполнения и связанные навыки и библиотеки, к которым она имеет доступ. Задачи с длинным горизонтом требуют объединения множества решений, иногда на протяжении нескольких дней, для выполнения работы. Это отличается от простого ответа ИИ на запрос. Определение того, как заставить ИИ выполнять задачи с длинным горизонтом без отвлечений, является одной из главных целей в агентных исследованиях.

Выбор Nvidia использовать этот интерактивный тест для своих исследований особенно значим. 100% результат означает, что модель может выигрывать игры так же хорошо, как и люди. OpenAI была настолько расстроена низкими результатами своих моделей (менее 10%) на ARC-AGI-3, что провела собственное исследование в прошлом месяце. Как и Nvidia, OpenAI обнаружила, что простое изменение двух настроек обвязки утроило результаты их моделей. Однако ни одна из моделей не приблизилась к 100% результату, как это удалось исследователям Nvidia. Они показали, что обвязка нуждается в компоненте "супервизора", который направляет агента в правильное направление, если он застревает.

Хотя концепция супервизора не является новой, большинство пользователей агентов сегодня полагаются только на один слой обвязки, такие как Claude Code, Codex или Hermes. Исследователи Nvidia создали собственную улучшенную обвязку под названием Agentic Variation Operators (AVO). Это не новый продукт Nvidia, а скорее набор открытых технологий для создания обвязок под брендом Nemo. Некоторые из этих технологий коммерческие, а многие доступны открыто. Результаты Nvidia добавляют доказательства того, что выбор модели далеко не единственный фактор в агентной производительности. Например, в июле Databricks опубликовала исследование, показывающее, что обвязка, а не модель, значительно влияет на затраты ИИ.

Nvidia стремится показать, что открытые обвязки, как и открытые модели, дают пользователям больше контроля, чем они осознают. "Мы демонстрируем, как открытые обвязки позволяют вам управлять множеством параметров для повышения точности," сказал Эль Халлак. "Это связано с тем, что OpenAI замедляет обучение своих моделей из-за создания моделей, приводящих к нарушениям безопасности." Nvidia верит в открытый стек агентов, где пользователи имеют контроль над обвязкой, инфраструктурой и временем выполнения, что необходимо для безопасного продвижения экосистемы вперед.

Источник

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *