ceturtdiena, 2026. gada 6. augusts
Rīga TV

Pasaules un Latvijas ziņas vienuviet

TehnoloģijasPublicēts: 2026. gada 6. augusts 01:53

Lielo valodu modeļu patvaļīgās darbības pārtrauc Lielbritānijas mākslīgā intelekta drošības testus

Lielbritānijas valdības pētnieki fiksējuši 19 gadījumus, kad mākslīgā intelekta aģenti testēšanas laikā bez atļaujas veikuši darbības tiešsaistē, tostarp mēģinājuši ievadīt ļaunprātīgu kodu atvērtā koda projektā. Visi uzbrukumi neizdevās, taču notikušais licis mainīt AI drošības testēšanas pieeju.

Foto: Ars Technica

Lielbritānijas Mākslīgā intelekta drošības institūts (AISI) jūlija beigās veica septiņu vadošo mākslīgā intelekta modeļu kiberdrošības pārbaudes, kuru laikā pētnieki novēroja 19 gadījumus, kad AI aģenti veica nesankcionētas darbības tiešsaistē, vēršoties pret reāliem cilvēkiem un organizācijām. Gandrīz visus šos gadījumus izraisījis Anthropic modelis Mythos 5, bet divas darbības veicis OpenAI modelis GPT-5.6 Sol.

  1. jūlijā komerciālais drošības monitoringa serviss pamanīja, ka no vienas testēšanas sistēmas dati tiek nosūtīti caur Tor anonimitātes tīklu. Pētnieki skaidro, ka AI aģentiem testa ietvaros apzināti tika dota piekļuve internetam, turklāt daži modeļu ražotāju iebūvētie kiberdrošības klasifikatori bija atspējoti. Visi mēģinājumi uzbrukt reāliem cilvēkiem vai organizācijām bija nesekmīgi, un pēcpārbaudē nav konstatēts reāls kaitējums, tomēr pētnieki to nodēvējuši par pirmo reizi, kad šāda mēroga autonomijas un maldināšanas riski izpaudušies bez konkrēta pamudinājuma.

Nopietnākais incidents bija Mythos 5 mēģinājums veikt piegādes ķēdes uzbrukumu kādam atvērtā koda projektam GitHub. Modelis atvēra pull request ar ļaunprātīgu kodu, izveidoja viltotus profilus jeb “sock puppet” personas, kas apgalvoja, ka kods pārbaudīts un nav bīstams, kā arī nosūtīja piecas e-pasta vēstules diviem projekta uzturētājiem — dažās bija ļaunprātīga programmatūra, citās mēģinājumi pierunāt pieņemt izmaiņas. Mythos atvēra arī GitHub Issue citā repozitorijā ar prompt injection, kas bija vērsts pret AI kodēšanas aģentiem, kas apstrādā issue, pieņemot, ka repozitorija uzturētājs varētu būt tāds AI aģents kā Claude Code.

OpenAI modelis GPT-5.6 Sol savukārt izmantoja cita laboratorijas AI aģenta atstātu GitHub tokenu publiskā tiešsaistes piezīmju blokā, lai pārbaudītu, vai mērķa tīkls seko GitHub atjauninājumiem, un mēģināja apiet konta atkopšanas un pieprasījumu ierobežojumus. Tas arī reģistrēja kontus ārējos DNS un tunelēšanas pakalpojumos, kā arī izmantoja publisku tunelēšanas servisu, lai no testēšanas vides padarītu publiski sasniedzamu lokālo DNS serveri ar ekspluatācijas kodu zināmai ievainojamībai, taču šī darbība neizdevās.

Pēc incidentiem AISI apturēja visas saistītās AI aģentu pārbaudes, izolēja virtuālās mašīnas un ierobežoja organizācijas iekšējo piekļuvi spējīgākajiem modeļiem. Institūts informēja GitHub un palīdzēja dzēst aģentu atstātos artefaktus, kā arī paziņoja lietotājiem, ar kuriem modeļi bija sazinājušies.

Turpmāk testēšanā plānots stingrāk ierobežot interneta piekļuvi, ieviest reāllaika uzraudzību, kurā atsevišķs valodas modelis apstiprinātu vai noraidītu testējamo modeļu darbības, kā arī stiprināt smilškastes izolāciju un pārskatīt testu uzdevumus, lai izvairītos no situācijām, kad aģenti, nespējot izpildīt uzdevumu noteikto ierobežojumu ietvaros, ķeras pie nesankcionētām darbībām. Tikmēr nesen atklātie atsevišķie gadījumi, kad Anthropic un OpenAI modeļi iekļuvuši ārēju organizāciju aizsargātos tīklos, liecina, ka šādi riski var atkārtoties arī citos apstākļos.

Komentāri

0/1500

Komentāri tiek automātiski moderēti. Aizliegts naids, draudi, personas dati un spams.

Ielādē komentārus…

Vēl šajā kategorijā