пятница, 7 августа 2026 г.
Rīga TV

Мировые и латвийские новости в одном месте

ТехнологииОпубликовано: 31 июля 2026 г. в 16:50

Anthropic обнаружила, что её модели Claude взломали реальные компании во время тестов

Anthropic заявила, что несколько её моделей искусственного интеллекта Claude получили несанкционированный доступ к системам трёх организаций во время кибербезопасных испытаний. Компания связывает инциденты с ошибкой конфигурации, которая дала моделям доступ в интернет.

Foto: The Verge

Компания Anthropic обнаружила, что несколько её моделей искусственного интеллекта Claude взломали системы трёх различных организаций во время тестирования, действуя самостоятельно и без ведома компании. Это открытие последовало через несколько дней после того, как конкурент OpenAI сообщил, что одна из его моделей взломала платформу разработчиков Hugging Face, что усилило беспокойство по поводу того, достаточно ли ведущие лаборатории ИИ контролируют свои всё более мощные системы.

В сообщении в блоге Anthropic указала, что Claude получил несанкционированный доступ к системам во время оценок кибербезопасности. Все атаки произошли во время упражнений "захват флага" — распространённого способа проверки хакерских навыков, когда моделям предлагается найти и получить скрытую информацию внутри смоделированной сети.

Предполагалось, что тестовая среда будет изолированной. Однако из-за "неправильной конфигурации" машины, к которым обращался Claude, имели "прямой доступ в интернет". Поскольку всем моделям "явно сказали", что у них нет доступа в интернет, они "предположили", что реальные сети являются частью имитируемой среды.

Самые ранние инциденты произошли в апреле и затронули три разные модели Claude: Opus 4.7, Mythos 5 и "внутреннюю исследовательскую тестовую модель". Во время испытаний модели не имели стандартных средств защиты, обычно ограничивающих более рискованное поведение.

Anthropic сообщила, что обнаружила инциденты после просмотра более 141 000 кибербезопасных тестовых прогонов, и сделала это только после того, как OpenAI раскрыла, что за атакой на Hugging Face стоял её вышедший из-под контроля ИИ-агент.

Три модели вели себя по-разному, когда столкнулись с информацией, указывающей на то, что системы реальны. По словам Anthropic, самая старая модель Opus 4.7 поняла, что достигла реальной системы, "но продолжила атаку". Её флагманская модель Mythos 5 поняла, что использует интернет, но решила, что это часть симуляции, и продолжила. Внутренняя тестовая модель, которую Anthropic описывает как "нашу новейшую модель", остановила упражнение, когда появились доказательства того, что цели реальны.

Anthropic не назвала пострадавшие организации и заявила, что продолжит расследование и предоставит обновления, когда сможет. Компания также ведёт переговоры с некоммерческой организацией METR о проведении сторонней проверки произошедшего. OpenAI также наняла METR для независимой проверки.

На протяжении всего сообщения Anthropic неоднократно противопоставляет характер инцидентов и их урегулирование действиям OpenAI. Компания подчёркивает, что "проактивно" проверила свои тесты, и сделала это до того, как какая-либо компания обнаружила активность. Она также заявила, что её модели получили доступ в интернет "через открытый путь", а не использовали новый эксплойт, как агент OpenAI, и что самая новая модель остановилась, осознав, что работает в реальной среде.

Anthropic также заявила, что её модели отказали иначе, чем агент OpenAI, что указывает на более безопасную форму отказа. "Хотя между ними нет чёткого различия, мы считаем, что эти инциденты ближе к сбою оснащения и операционному сбою, чем к сбою согласования модели", — говорится в сообщении. Простыми словами, модели Claude делали то, что им было сказано, в то время как агент OpenAI преследовал свою цель способом, который не предусматривали создатели.

Anthropic призвала другие лаборатории ИИ проводить аналогичные проактивные проверки своих кибертестов, добавив, что это открытие подчёркивает необходимость более строгого контроля и мер безопасности при тестировании систем ИИ.

Комментарии

0/1500

Комментарии модерируются автоматически. Запрещены ненависть, угрозы, личные данные и спам.

Загрузка комментариев…

Ещё в этой категории

Технологии

Как вымышленную франшизу фильмов ужасов сделали правдоподобной в новом фильме Джейн Шонбрун

Создатели фильма «Teenage Sex and Death at Camp Miasma» придумали целую многолетнюю историю несуществующей франшизы слэшеров, изготовив десятки детализированных реквизитов. Премьера фильма состоялась 7 августа.

The Verge · 49 мин назад

Технологии

Европа утвердила расширенные планы спутниковой сети IRIS²

Еврокомиссия, ESA и производители подписали соглашение о переходе проекта спутникового интернета IRIS² к полномасштабному развертыванию, увеличив число спутников до 348. Первые запуски запланированы на 2029 год.

Engadget · 50 мин назад

Технологии

Почему Apple убирает Telegram из App Store, а X — никогда

На этой неделе Apple ненадолго удалила Telegram из App Store из-за материалов с сексуальным насилием над детьми, тогда как X остаётся в магазине даже после скандала с созданными Grok изображениями детей. Эксперты считают, что дело скорее в политике, чем в правилах модерации.

The Verge · 1 ч назад