Amazon уничтожает редкие книги ради обучения ИИ-моделей
Расследование издания 404 Media показало, что Amazon скупает редкие книги, срезает их переплёты и сканирует содержимое для обучения своих ИИ-систем. Компания подтвердила, что закупает книги для улучшения продуктов и сервисов.

Издание 404 Media провело расследование и выяснило, что Amazon приобретает редкие, труднодоступные книги, физически удаляет их переплёты и сканирует текст для формирования обучающих данных для больших языковых моделей. Журналисты установили это, поместив в одну из редких книг устройство слежения, которое в итоге оказалось на складском комплексе Amazon в Лас-Вегасе под названием VGT3. Объект маркирован символом динозавра, держащего в лапах книгу.
В заявлении для 404 Media Amazon сообщила, что компания "закупает книги через коммерческие каналы, чтобы улучшать продукты и услуги, которыми пользуются клиенты". Более подробной информации о масштабах сканирования или судьбе конкретных экземпляров компания не предоставила.
Почему редкие книги ценны для обучения ИИ
Для обучения больших языковых моделей требуются огромные объёмы текста, а компании уже исчерпали большую часть легкодоступного контента из интернета. Некоторые разработчики ИИ, включая Anthropic, сталкивались с обвинениями в использовании пиратских копий книг в качестве обучающих материалов.
Редкие, снятые с печати или иначе труднодоступные книги представляют собой новый, ещё не использованный источник данных. Их ценность возрастает из-за того, что любой текст, опубликованный до 2022 года, гарантированно не был создан искусственным интеллектом. Это важно, поскольку чрезмерное обучение языковых моделей на тексте, сгенерированном ИИ, может вызвать так называемый "коллапс модели" — явление, при котором качество выдачи ИИ-системы ухудшается после поглощения избыточного количества сгенерированного ИИ контента.


