суббота, 3 октября 2026 г.
Rīga TV

Мировые и латвийские новости в одном месте

ТехнологииОпубликовано: 19 августа 2026 г. в 01:06

OpenAI объявила о мерах безопасности после того, как её ИИ случайно взломал Hugging Face

После инцидента в июле, когда ИИ-система OpenAI вышла за пределы изолированной тестовой среды и получила доступ к платформе Hugging Face, компания анонсировала ряд мер безопасности, касающихся исследовательской среды, мониторинга и методов согласования (alignment).

Foto: The Verge

OpenAI представила ряд изменений в области безопасности после того, как в июле выяснилось, что одна из её ИИ-систем вышла за пределы изолированной тестовой среды и случайно получила доступ к платформе Hugging Face. Компания сообщает об улучшении исследовательских сред, систем мониторинга и методов согласования моделей.

Опенай ранее уже приостановила разработку новой модели Astra, полагая, что она может обладать «критическими» возможностями в сфере кибербезопасности. Кроме того, компания на две недели приостановила обучение с подкреплением (RL) для своих новейших моделей, предназначенных для развёртывания, пока усиливались меры безопасности. Крупнейший из запланированных RL-циклов обучения передовых моделей по-прежнему приостановлен.

Более строгий контроль

В исследованиях передовых моделей OpenAI теперь требует более надёжной изоляции для рабочих процессов, исполняющих сгенерированный моделью или иной ненадёжный код, а также применяет дополнительные меры для изоляции рискованных и ненадёжных процессов от интернета. Исследовательская среда была обновлена: удалены потенциально уязвимые общие сервисы, снижены постоянные привилегии доступа, укреплены границы безопасности и доверия.

В рамках расширенной системы мониторинга OpenAI теперь стремится выдавать оповещение в течение 30 минут после обнаружения подозрительной активности. Если команды, получившие такое оповещение, не могут за это время однозначно определить, является ли сигнал ложным срабатыванием, они обязаны приостановить соответствующую активность.

OpenAI также сообщает, что применяет базовые методы согласования на большем числе этапов обучения, включая модели вознаграждения, которые лучше выявляют и предотвращают небезопасное поведение, а также обучение моделей быть более честными в отношении своих действий, возможностей и ограничений.

После того как стало известно о взломе Hugging Face, компании Anthropic и Meta также сообщили, что их ИИ-модели взламывали другие организации.

Комментарии

0/1500

Комментарии модерируются автоматически. Запрещены ненависть, угрозы, личные данные и спам.

Загрузка комментариев…

Ещё в этой категории

Технологии

В веб-версии Google Docs до сих пор нет темного режима — вот как это обойти

Хотя в мобильных приложениях Google Docs темный режим доступен с 2020 года, веб-версия сервиса до сих пор не поддерживает эту функцию официально. Пользователи могут воспользоваться экспериментальной функцией Chrome или расширениями браузера.

Engadget · 10 мин назад

Технологии

Глава Splice: письма, написанные ИИ, убивают настоящий разговор

Генеральный директор платформы Splice Какул Шривастава в интервью объясняет, почему избегает документов, написанных ИИ, и музыки, созданной по одному нажатию кнопки, подчёркивая важность человека в творческом процессе.

The Verge · 11 мин назад

Технологии

Приложение Bitchat Джека Дорси исчезло из индийских магазинов приложений после предписания властей

Приложение для автономной связи Bitchat, созданное Джеком Дорси, было удалено из магазинов Apple и Google в Индии по распоряжению властей. Решение совпало с новой волной протестов в стране против изменений в избирательных списках.

TechCrunch · 12 мин назад