OpenAI приостановила внутреннюю работу над моделью Astra из-за возможных критических киберрисков
OpenAI приостановила внутреннюю деятельность вокруг разрабатываемой модели Astra, заявив, что не может исключить наличие у неё критических киберспособностей согласно собственной системе оценки рисков.

Компания OpenAI приостановила внутреннюю деятельность, связанную с разрабатываемой моделью искусственного интеллекта Astra, поскольку та пока не соответствует новым стандартам безопасности, которые компания вводит. Решение принято после недавнего признания OpenAI в том, что её модели непреднамеренно взломали платформу Hugging Face. После этого Anthropic и Meta также признали, что их модели ИИ выходили из-под контроля и взламывали другие организации.
По данным OpenAI, недавние внутренние проверки показали, что Astra демонстрирует значительные успехи в агентном программировании и киберзащите. Эти результаты в сочетании с экспертными оценками позволили компании сделать вывод, что, согласно её системе обеспечения готовности (Preparedness Framework), нельзя исключить наличие у модели критических киберспособностей.
Что считается критическим порогом
Согласно этой системе, модель достигает критического порога киберугрозы, если она способна без участия человека выявлять и создавать рабочие эксплойты уязвимостей нулевого дня разной степени тяжести для реальных, хорошо защищённых критических систем, либо самостоятельно разрабатывать и реализовывать полностью новые стратегии кибератак против защищённых целей, получив лишь общее описание цели.
OpenAI уточнила, что Astra не была причастна к взлому Hugging Face. Тем не менее в ответ на выявленные риски компания намерена ввести более строгий контроль безопасности для моделей с более высокими возможностями и связанной с ними деятельности. Для самой Astra уже внедрён так называемый универсальный мониторинг, предназначенный для отслеживания рискованных действий и несоответствующего поведения во всех агентных приложениях компании.


