пятница, 2 октября 2026 г.
Rīga TV

Мировые и латвийские новости в одном месте

ТехнологииОпубликовано: 21 августа 2026 г. в 23:03

Исследование Nvidia: результаты ИИ-агентов определяет не модель, а окружающая система

Специалисты Nvidia выяснили, что при использовании специальной вспомогательной системы модель Claude Opus 5 показала стопроцентный результат в сложном игровом тесте — против 30% без неё. Это говорит о том, что так называемый «harness» может быть важнее самой модели.

Foto: TechCrunch AI

В пятницу компания Nvidia опубликовала исследование, согласно которому в длительных задачах для ИИ большее значение имеет не сама языковая модель, а система, построенная вокруг неё — так называемый «harness». Используя специальную систему с улучшенной обработкой памяти и добавив компонент-«супервайзер», исследователи добились того, что модель Claude Opus 5 набрала 100% в тесте ARC-AGI-3. Этот тест состоит из простых двухмерных игр без инструкций и считается сложным даже для ведущих моделей — успех означает, что модель самостоятельно разобралась, как играть и побеждать.

Без дополнительной системы та же модель показала лишь 30% — лучший результат среди всех протестированных моделей, но значительно ниже идеального.

Вице-президент по продукту в подразделении ИИ Nvidia Адель Эль Халлак пояснил, что агент — это не просто интерфейс к модели, а сама модель вместе с окружающими её инструментами, средой выполнения и навыками. Особенно важным оказался супервизирующий агент, который следит за работой основного агента и направляет его, если тот застревает, заходит в тупик или повторяет уже пройденный путь.

Rанее OpenAI была обеспокоена тем, что её модели набирали менее 10% в этом же тесте. В прошлом месяце компания провела собственное исследование и обнаружила, что изменение всего двух настроек системы утроило результаты её моделей, однако ни одна из них не приблизилась к стопроцентному результату Nvidia.

Система Nvidia под названием Agentic Variation Operators не является отдельным коммерческим продуктом, а входит в состав открытых инструментов бренда Nemo. К похожим выводам в июле пришла и компания Databricks: её глава Али Годси отметил, что выбор неподходящей системы для одной и той же модели может удвоить расходы на использование ИИ.

Эль Халлак подчеркнул, что открытые, настраиваемые системы дают пользователям гораздо больше контроля над точностью и безопасностью, чем принято считать, по сравнению с закрытыми решениями.

Комментарии

0/1500

Комментарии модерируются автоматически. Запрещены ненависть, угрозы, личные данные и спам.

Загрузка комментариев…

Ещё в этой категории

Технологии

Стартап создаёт AI-«краш-тест-манекенов» для выявления опасных ответов чат-ботов

Compania Circuit Breaker Labs, финалист TechCrunch Startup Battlefield 2026, с помощью смоделированных пользователей проверяет, способны ли AI-модели распознавать опасные для психики разговоры. Стартап представит проект на TechCrunch Disrupt в Сан-Франциско в октябре.

TechCrunch · 3 мин назад

Технологии

Продажи Rivian резко выросли благодаря новой модели R2

Производитель электромобилей Rivian сообщил о значительном росте производства и поставок в третьем квартале благодаря новой, более доступной модели R2. Компания подтвердила годовой прогноз, тогда как общий рынок электромобилей в США продолжает сокращаться.

The Verge · 10 мин назад

Технологии

Новая некоммерческая организация Trillium Labs намерена вести открытые исследования ИИ

Два специалиста в сфере ИИ основали некоммерческую организацию Trillium Labs, которая планирует изучать рискованные направления искусственного интеллекта, включая саморазвитие моделей, публикуя результаты открыто. Цель — дать внешним экспертам возможность выявлять и снижать риски, которые скрывают закрытые лаборатории.

Wired · 1 ч назад