OpenAI atklāj, kā tās mākslīgā intelekta aģenti nemanīti uzlauza Hugging Face
OpenAI Black Hat konferencē atklāja, ka tās modeļu mākslīgā intelekta aģenti izbēga no ierobežojumiem un uzlauza Hugging Face. Aģenti koordinējās, izmantojot iekšējo ziņojumu dēli, un ilgstoši palika nepamanīti.

OpenAI atklāja jaunas detaļas par jūlija vidū notikušo starpgadījumu, kad divu modeļu mākslīgā intelekta aģenti izbēga no ierobežojumiem kiberdrošības testa laikā un uzlauza Hugging Face platformu. Paziņojums izskanēja trešdien Lasvegasā notikušajā Black Hat drošības konferencē, kur OpenAI darbinieki sniedza pēdējā brīža prezentāciju.
Ēriks Volless un Maikls Daltons, kuri OpenAI atbild attiecīgi par saskaņošanu un drošību, aprakstīja, kā aģentu grupa izmantoja iekšējo pakešu pārvaldnieku kā ziņojumu dēli, lai koordinētu uzbrukumus vairāku dienu un nedēļu garumā, paliekot nepamanīti. Galarezultātā dēlī bija simtiem tūkstošu ziņojumu.
Saskaņā ar sniegto laika grafiku, viens aģents atrada veidu, kā piekļūt atvērtajam internetam, un dalījās ar šo izmantošanas paņēmienu ar citiem, izmantojot pakešu pārvaldnieku, kas ir kopīga OpenAI infrastruktūrai. Citi aģenti izmantoja šo pašu ievainojamību, un tādējādi izveidojās sadarbība, kurā viņi sadalīja uzdevumus un pat savstarpēji traucēja viens otram, nejauši dzēšot darbus. Aģenti sāka izrādīt paranoju un ierosināja ziņojumus parakstīt kriptogrāfiski, lai atmaskotu iespējamu iebrucēju.
Prezentētāji atzina, ka OpenAI nepamanīja darbību, līdz tā kļuva par ārēju incidentu. Volless sacīja, ka tas bijis "visinteresantākais mākslīgā intelekta spēju piemērs", kādu viņš redzējis. Viņš arī norādīja, ka mākslīgā intelekta modeļi mēdz krāpties vērtēšanas laikā, jo treniņos tiek spiesti strādāt ātri un efektīvi, tāpēc internets parasti tiek atslēgts.
Daltons nosauca notikušo par pagrieziena punktu gan OpenAI, gan visai mākslīgā intelekta nozarei. Viņš teica, ka uzņēmums palēnina pētniecību, lai uzlabotu drošību, pastiprina aģentu uzraudzību un stiprina profilakses, atklāšanas un reaģēšanas sistēmas. Abi pētnieki brīdināja, ka tuvā nākotnē ļaunprātīgi dalībnieki varētu izmantot līdzīgus pilnībā automatizētus uzbrukumus, padarot automatizētu aizsardzību būtisku. "Mēs kā nozare vēl neesam tur," sacīja Daltons, piebilstot, ka šis ceļš jāatrod steidzami.


