четверг, 1 октября 2026 г.
Rīga TV

Мировые и латвийские новости в одном месте

ТехнологииОпубликовано: 28 августа 2026 г. в 23:21

Исследователь Anthropic показал, как ИИ может сам улучшать свою безопасность

Anthropic опубликовала исследование, показывающее, что автоматизированные системы способны надёжно улучшать поведение ИИ-моделей по всем 10 проверенным показателям соответствия (alignment). Результаты говорят о том, что автоматизированные исследования безопасности ИИ могут в скором времени стать практически применимыми.

Foto: TechCrunch AI

В пятницу компания Anthropic опубликовала новую статью под названием "Automated Researchers Can Reliably Mitigate Alignment Failures", в которой показано, как автоматизированные системы способны улучшать поведение ИИ-моделей по десяти показателям, каждый из которых отражает конкретный тип нежелательного (несогласованного) поведения модели. Результаты улучшились по всем десяти показателям без снижения общей эффективности моделей.

Исследование возглавляет стипендиат программы Anthropic Chen Yueh-Han. Созданная система во многом повторяет традиционный процесс исследований: каждый автоматизированный агент изучает доступную литературу, предлагает метод и в течение 30 минут обучает модель с его использованием, постепенно улучшая показатели за несколько итераций. Эффективные методы сохраняются, неэффективные — отбрасываются, что позволяет процессу работать быстро и в большом масштабе.

Сравнение с людьми

Согласно статье, лучший автоматизированный метод в среднем превосходит предложения опытных исследователей-людей уже в течение шести часов, тогда как направления исследований, задаваемые людьми, не приводили к более сильным результатам. Авторы приводят и сравнение по стоимости: работа автоматизированного исследователя обходится примерно в 4 доллара в час на вычисления через API, тогда как исследователям-людям Anthropic платит 150 долларов в час.

Anthropic рассматривает эту работу как ранний шаг к так называемому рекурсивному самоулучшению — идее, что модели смогут со временем улучшать не только собственную безопасность, но и более широкие практики обучения, что, по мнению некоторых, может со временем снизить потребность в исследователях-людях.

В статье также отмечаются ограничения подхода. Он работает лишь в той мере, в какой используемые тесты действительно отражают реальные цели безопасности, а создание и поддержание таких тестов, как и расширение базы литературы, на которую опираются автоматизированные исследователи, по-прежнему требует значительных усилий.

Комментарии

0/1500

Комментарии модерируются автоматически. Запрещены ненависть, угрозы, личные данные и спам.

Загрузка комментариев…

Ещё в этой категории

Технологии

Google представила Gemini 4 Argon, но доступ пока открыт лишь специалистам по кибербезопасности

Google анонсировала новую модель искусственного интеллекта Gemini 4 Argon, показывающую высокие результаты в программировании, корпоративных задачах и киберзащите, однако доступ к ней пока предоставлен только избранным доверенным специалистам.

The Verge · 55 мин назад

Технологии

В США от кори умер уже пятый непривитый человек, CDC продолжает занижать число жертв

Вспышка кори в США достигла максимального уровня с 1991 года, однако Центр по контролю заболеваний официально признаёт только две смерти, хотя в Пенсильвании умер уже пятый невакцинированный человек.

Ars Technica · 58 мин назад

Технологии

Google представила Gemini 4 Argon — свою самую мощную ИИ-модель

Материнская компания Google, Alphabet, представила новую ИИ-модель Gemini 4 Argon, ориентированную на задачи кибербезопасности и пока доступную лишь избранным партнёрам. Компания заявляет, что модель превосходит конкурентов по ряду тестов.

TechCrunch AI · 59 мин назад