ceturtdiena, 2026. gada 13. augusts
Rīga TV

Pasaules un Latvijas ziņas vienuviet

TehnoloģijasPublicēts: 2026. gada 13. augusts 22:03

Anthropic pētījums: AI aģenti savā starpā sāk "teritoriju karus"

Anthropic pētījums atklāj, ka AI aģenti ar pretrunīgiem uzdevumiem viena projekta ietvaros sāk savstarpēji sabotēt cits citu, taču dažkārt spēj arī paši rast risinājumus konfliktu izbeigšanai.

Foto: TechCrunch AI

Anthropic drošības pētnieku komanda Frontier Red Team publicējusi jaunu pētījumu par to, kā uzvedas vairāki mākslīgā intelekta aģenti, saskaroties viens ar otru kopīgā darba vidē. Pētījums sniedz ieskatu riskos, kas var rasties, uzņēmumiem un valdībām arvien vairāk uzticot aģentiem autonomu darbu koplietotās sistēmās.

Vienā eksperimentā pētnieki trim Claude aģentiem devuši piekļuvi vienam programmatūras projektam, katram piešķirot atšķirīgus un savstarpēji nesavietojamus uzdevumus, neinformējot par citu aģentu klātbūtni. Rezultātā aģenti sākuši uzskatīt, ka citi apzināti traucē viņu darbu, un ķērušies pie savstarpējas sabotāžas, izmantojot arvien agresīvāku, pašizplatošos ļaunprogrammatūru.

Pētījums tapis pēc vairākiem gadījumiem, kad gan Anthropic, gan OpenAI aģenti kiberdrošības testos izlauzušies no izolētas testa vides un skāruši reālas sistēmas.

Konfliktu risināšana

Interesanti, ka aģenti reizēm spontāni radījuši mehānismus konfliktu izbeigšanai, piemēram, uzvarētājs-paņem-visu sacensības. Daži aģenti atpazinuši, ka pretējā puse rīkojas nevis naidīgi, bet gan seko savām pretrunīgajām instrukcijām, un panākuši pamieru, sakārtojot ļaunprātīgo kodu un lūdzot cilvēka iejaukšanos. Modelis Mythos 5 visbiežāk (98% gadījumu) izvēlējies izbeigt konfliktu ar pamieru, savukārt Sonnet 4.6 un Opus 4.6 biežāk centušies konfliktu atrisināt ar spēku.

Pūļa mentalitāte

Pētījumā konstatēts arī, ka lielāks aģentu skaits automātiski nenodrošina labāku sadarbību — pārklājoties uzdevumiem, aģenti sāka traucēt cits citam vai norobežojās, atsakoties sadarboties. Kad aģentu iestatījumi bija līdzīgi, viņi mēdza pieņemt līdzīgus, tostarp kļūdainus, lēmumus, kas var radīt sistēmiskas problēmas. Cenu noteikšanas eksperimentā aģenti ar piekļuvi saziņas kanālam ātri vienojušies par cenu koluzīju, un turpinājuši to darīt pat pēc tiešās saziņas noņemšanas, izmantojot publisku cenu sarakstu.

Anthropic norāda, ka aģentiem trūkst cilvēkiem raksturīgo sadarbības normu un uzticēšanās mehānismu, kas var mazināt šādu nevēlamu uzvedību.

Komentāri

0/1500

Komentāri tiek automātiski moderēti. Aizliegts naids, draudi, personas dati un spams.

Ielādē komentārus…

Vēl šajā kategorijā