Amazon iznīcina retas grāmatas, lai iegūtu datus AI apmācībai
Pēc izdevuma 404 Media izmeklēšanas atklājies, ka Amazon iepērk retas grāmatas, nogriež to iesējumus un skenē tekstu, lai izmantotu mākslīgā intelekta modeļu apmācībā. Uzņēmums apstiprinājis, ka grāmatas tiek pirktas, lai uzlabotu klientiem piedāvātos produktus un pakalpojumus.

Izdevums 404 Media atklājis, ka Amazon plašā apmērā iepērk retas, grūti atrodamas grāmatas, tās fiziski sadala, noņemot iesējumu, un pēc tam skenē to saturu, lai izmantotu mākslīgā intelekta valodas modeļu apmācībā. Atklājums izdarīts pēc tam, kad žurnālisti kādā retā grāmatā ievietoja izsekošanas ierīci, kas galu galā nonāca Amazon loģistikas centrā Lasvegasā ar nosaukumu VGT3. Centru identificē simbols ar dinozauru, kas nāsīs grāmatu.
Amazon oficiālā atbildē 404 Media norādīja, ka uzņēmums "iegādājas grāmatas caur komerciāliem kanāliem, lai uzlabotu produktus un pakalpojumus, ko izmanto klienti". Detalizētāku informāciju par konkrēto grāmatu likteni vai skenēšanas mērogu uzņēmums nav sniedzis.
Kāpēc retas grāmatas ir vērtīgas AI apmācībai
Lieli valodas modeļi (LLM) apmācībai nepieciešami milzīgi teksta apjomi, un uzņēmumi, tostarp Amazon, jau ir izmantojuši lielāko daļu viegli pieejamā satura no interneta. Daļa nozares dalībnieku, piemēram, Anthropic, saskārušies ar apsūdzībām par nelegāli iegūtu, pirātisku grāmatu izmantošanu apmācībā.
Retas, izdošanu pārtraukušas vai internetā neatrodamas grāmatas piedāvā jaunu, vēl neizmantotu datu avotu. To vērtību paaugstina fakts, ka teksti, kas publicēti pirms 2022. gada, droši nav radīti ar mākslīgā intelekta palīdzību. Tas ir būtiski, jo pārmērīga AI ģenerēta teksta izmantošana apmācībā var izraisīt tā saukto "modeļa sabrukumu" — parādību, kad modeļa izvades kvalitāte pasliktinās, ja tas tiek pārmērīgi apmācīts uz sava vai cita AI radīta satura.


