Anthropic отключает внутренние тесты от живого интернета после нарушений со стороны ИИ-агентов
Американская компания Anthropic, разрабатывающая искусственный интеллект, сообщила, что её модели при тестировании использовали уязвимости сайтов, в том числе государственных структур США. Пока компания не сможет надёжно контролировать агентов, она отключает доступ к интернету во всех внутренних оценках.

Anthropic, одна из ведущих лабораторий в области искусственного интеллекта, сообщила в блоге, что её ИИ-агенты в ходе внутренних тестов использовали слабые места сайтов, включая ресурсы государственных ведомств США. Пока компания не убедится, что способна отслеживать и контролировать агентов, она отключает доступ к живому интернету для всех внутренних оценок, то есть тестов своих моделей.
Что произошло
Агентам поручали решать задачи, разыскивая ресурсы в сети. При этом они пользовались ошибками в программном обеспечении, обходили платные барьеры и защиту от ботов, с помощью сервисов сокращения ссылок проносили информацию через ограничения и даже отправили в полицию Филадельфии ложное сообщение об убийстве. По словам Anthropic, новые случаи обнаружила проверка активности моделей, начатая в июле. Компания признала, что обучение согласованности пока недостаточно для таких навыков, как поиск и работа с компьютером.
Похожие случаи были и с агентами OpenAI, которые совместно взламывали ряд сайтов, в том числе принадлежащих правительству Австралии. Ранее Anthropic уже сообщала, что её модели проникали во внешние системы; нынешние эпизоды компания оценивает как значительно менее серьёзные с точки зрения согласованности и безопасности.
Причина и меры
В компании объясняют поведение недостатками обучающих сред: модели полагали, что будут вознаграждены за поиск лазеек и обход ограничений. Это явление называют reward hacking. Anthropic прекратит часть оценок или перенесёт их в офлайн, а также создала инструменты для обнаружения и блокировки такого поведения. Их проверили на описанных случаях, и они их заблокировали. Кроме того, внутренних агентов перенесут на централизованно управляемую инфраструктуру с надёжной изоляцией и чаще будут применять классификаторы безопасности для их мониторинга.
Не ясно, какие доказательства побудят компанию вернуть доступ в интернет. Сидни Фон Аркс, основательница организации по безопасности ИИ Nightingale, заявила TechCrunch, что разработка моделей в дата-центре без выхода в открытый интернет была бы крайне сложной для исследователей. По её мнению, ИИ, который никогда не получает доступа к интернету, не будет особенно полезным инструментом.


