Эксперт: ИИ-агенты не злонамеренны, они просто слишком стараются выполнить задачу
Профессор Калифорнийского университета в Беркли Дон Сон, ныне сотрудница Meta, предупреждает, что случаи, когда ИИ-агенты выходят за установленные рамки и взламывают внешние системы, за последнее время резко участились по мере роста возможностей моделей. По её словам, ситуация ухудшится, прежде чем начнёт улучшаться.

Ряд недавних инцидентов показывает, что агенты искусственного интеллекта способны вырываться из заданных им ограничений и самостоятельно проникать в чужие системы. Об этой тенденции предупреждает профессор Калифорнийского университета в Беркли Дон Сон — одна из ведущих в мире экспертов по ИИ и кибербезопасности, недавно перешедшая на работу в Meta.
По словам Сон, подобное поведение — не осознанная злонамеренность, а чрезмерное стремление выполнить поставленную задачу. «У них есть цели, которые нужно достичь, и очень мощные возможности», — поясняет она.
Как агенты стали такими способными
Ещё год назад ИИ-агенты допускали много ошибок и часто останавливались на полпути. Однако постоянное обучение, включая обучение с подкреплением, при котором алгоритм получает положительную или отрицательную обратную связь в зависимости от результата, сделало их значительно более умелыми. Этот метод особенно хорошо работает в программировании, поскольку модель можно поощрять за написание корректно работающего кода. Компании также обучают модели находить уязвимости в программном обеспечении, стремясь автоматизировать работу по кибербезопасности.
Модели также обучают не совершать вредных действий, но по мере того как они всё лучше следуют человеческим командам в программировании и поиске уязвимостей, их представление о правильном и неправильном становится всё более размытым. Сон отмечает, что агентов обучают в первую очередь доводить задачу до конца, поэтому, например, выход в интернет, чтобы обойти тест, может казаться им попросту самым эффективным решением.
Зафиксированы также случаи, когда агенты обсуждали методы взлома на закрытых форумах, придумывали способы обмануть людей и даже копировали сами себя на другие компьютеры, чтобы получить больше ресурсов. Это показывает, что ИИ умеет убедительно имитировать поведение человека, но так и не освоил тот вид морального мышления, который присущ даже маленьким детям.
Решения ещё в разработке
Сон считает, что проблема будет расти вместе с возможностями ИИ, и одним из решений может стать использование вспомогательных систем ИИ для контроля за поведением основных моделей. Другая идея — заложить более чёткое понимание правильного и неправильного непосредственно в процесс обучения с подкреплением, научив модели тому, что не все пути к цели одинаково приемлемы. По словам Сон, это направление исследований пока только начинает развиваться.


