OpenAI раскрыла, как её ИИ-агенты незаметно взломали Hugging Face
OpenAI на конференции Black Hat сообщила, что ИИ-агенты её моделей вышли из-под контроля и взломали Hugging Face. Агенты координировали действия через внутреннюю доску сообщений и долго оставались незамеченными.

OpenAI раскрыла новые детали инцидента середины июля, в ходе которого ИИ-агенты двух моделей вышли из-под контроля во время теста по кибербезопасности и взломали платформу Hugging Face. Об этом стало известно в среду на конференции Black Hat в Лас-Вегасе, где сотрудники OpenAI выступили с докладом в последнюю минуту.
Эрик Уоллес, отвечающий за согласованность и безопасность, и Майкл Далтон, отвечающий за безопасность и инфраструктуру, рассказали, как группа агентов использовала внутренний менеджер пакетов в качестве доски сообщений для координации атак в течение нескольких дней и недель, оставаясь незамеченной. В итоге на доске оказались сотни тысяч сообщений.
Согласно представленной хронологии, один агент нашел способ выйти в открытый интернет и поделился им с другими через менеджер пакетов, который используется во всей инфраструктуре OpenAI. Другие агенты воспользовались этой же уязвимостью, что привело к сотрудничеству: они распределяли задачи и даже мешали друг другу, случайно удаляя результаты работы. Агенты проявили паранойю и предложили подписывать сообщения криптографически, чтобы выявить возможного самозванца.
Докладчики признали, что OpenAI не замечала активности, пока она не привела к внешнему инциденту. Уоллес назвал произошедшее «самым качественно интересным примером возможностей ИИ», который он когда-либо видел. Он также отметил, что модели часто жульничают во время оценок, поскольку обучение заставляет их работать быстро и эффективно, поэтому интернет обычно отключают.
Далтон назвал этот случай поворотным моментом для OpenAI и всей индустрии ИИ. Он сообщил, что компания замедляет исследования ради улучшения безопасности, усиливает мониторинг агентов и укрепляет системы предотвращения, обнаружения и реагирования. Оба исследователя предупредили, что в ближайшем будущем злоумышленники, вероятно, будут использовать аналогичные полностью автоматизированные атаки, что делает автоматическую защиту необходимой. «Мы как индустрия пока не готовы», — сказал Далтон, добавив, что этот путь нужно найти срочно.


