# Amazon знищує паперові книги, відскановані для навчання AI

> За словами колишнього працівника, Amazon знищує паперові книги одразу після сканування для тренування AI-моделей — і це піднімає питання прозорості даних.

- Опубліковано: 28 серпня 2026 р. (2026-08-28T00:17:23.252404+00:00)
- Розділ: Безпека AI
- На основі публікації: [Mezha](https://mezha.ua/news/amazon-destroys-books-314592/)
- Видання: AiiN (https://aiin.news)
- URL: https://aiin.news/article?slug=amazon-%D0%B7%D0%BD%D0%B8%D1%89%D1%83%D1%94-%D0%BF%D0%B0%D0%BF%D0%B5%D1%80%D0%BE%D0%B2%D1%96-%D0%BA%D0%BD%D0%B8%D0%B3%D0%B8-%D0%B2%D1%96%D0%B4%D1%81%D0%BA%D0%B0%D0%BD%D0%BE%D0%B2%D0%B0%D0%BD%D1%96-%D0%B4%D0%BB%D1%8F-%D0%BD%D0%B0%D0%B2%D1%87%D0%B0%D0%BD%D0%BD%D1%8F-ai

---

Колишній працівник Amazon заявив, що компанія систематично знищує паперові примірники книг одразу після їх сканування для датасетів, на яких тренують великі мовні моделі. Йдеться не про списання застарілого фонду, а про частину виробничого циклу: книжку скановують сторінка за сторінкою, текст потрапляє в масив для навчання AI, а фізичний носій після цього прямує під ніж.

Деталь виглядає технічною, але за нею стоїть питання, яке впродовж останніх двох років лише загострюється: як індустрія взагалі формує датасети для навчання моделей і чи готова вона показати, звідки саме взявся текст. Коли паперовий оригінал зникає одразу після копіювання, перевірити видання, тираж чи навіть сам факт наявності книги в бібліотеці Amazon стає майже неможливо.

Для видавців і авторів це не абстрактна етична дискусія — це питання доказової бази в потенційних спорах про авторське право. Судові позови видавництв і письменницьких гільдій проти OpenAI, Meta та інших AI-компаній за останні два роки вже показали, наскільки дорого коштує невміння пояснити, звідки взявся навчальний текст.

## Що саме розповів колишній працівник Amazon?

[За даними Mezha](https://mezha.ua/news/amazon-destroys-books-314592/), екс-співробітник розповів, що знищення фізичних книг відбувається вже після того, як їхній зміст оцифровано і використано для наповнення датасетів навчання AI-моделей. Джерело описує процес як рутинну частину роботи, а не поодинокий випадок: книжки не повертаються постачальникам, не передаються бібліотекам чи благодійним організаціям — вони йдуть в утилізацію.

## Навіщо взагалі знищувати вже відскановані книги?

Amazon офіційно причин не пояснювала, тож тут можливий лише один обережний висновок: ймовірно, для компанії, що оптимізує логістику й складські площі, паперовий оригінал після оцифрування втрачає операційну цінність — модель тренується на тексті, а не на самому носії. Зберігання мільйонів фізичних книг коштує складських метрів, страхування та обробки, тоді як цифрова копія займає значно менше ресурсів і вже виконала свою функцію постачальника даних.

Проблема в тому, що ця логістична економія має побічний ефект: разом із папером зникає єдиний матеріальний доказ того, яке саме видання, яким тиражем і на яких правах потрапило в навчальний корпус.

## Чому це проблема прозорості даних для AI?

Без фізичного оригіналу неможливо незалежно перевірити склад датасету заднім числом — ні автору, ні видавцю, ні регулятору. Це стосується не лише етики: у судових процесах щодо авторського права саме походження навчальних даних часто є ключовим доказом, а знищений оригінал ускладнює будь-яку експертизу.

Індустрія великих мовних моделей і так тримається на непрозорих датасетах — компанії рідко публікують повні списки джерел. Знищення фізичних носіїв додає ще один рівень непрозорості: тепер зникає навіть теоретична можливість пізнішої перевірки того, що саме було відскановано.

## Висновок AiiN: що з цим робити AI-білдерам і видавцям

Наша теза проста: доки компанії, що будують датасети з фізичних носіїв, не публікують журнал оцифрування — перелік видань, дати сканування, контрольні суми файлів — до знищення оригіналу, будь-яка заява про «легальність» датасету неможливо перевірити ні зараз, ні через рік. Технічно рішення не складне: збереження метаданих і хеш-сум кожного відсканованого примірника коштує копійки порівняно з вартістю самого сканування, і саме відсутність такого журналу, а не сам факт утилізації паперу, є справжньою проблемою. Поки такої практики немає, кожна подібна історія — це ще один сигнал, що галузь оптимізує швидкість збору даних, а не можливість довести їхню законність заднім числом.

- Видавцям варто вимагати від партнерів по оцифруванню окремий провенанс-лог перед підписанням угод про сканування архівів.
- AI-командам, що ліцензують контент для тренування, варто закладати в контракти обов'язкове збереження метаданих джерела — незалежно від долі фізичного носія.

## Чи законно знищувати книги після сканування для AI?

Це залежить від того, чи мала компанія право власності на примірник і чи не порушує знищення умов ліцензії чи договору з правовласником. Сам факт утилізації паперового носія, яким законно володіє компанія, зазвичай не є порушенням — проблема виникає тоді, коли неможливо довести законність самого сканування.

## Чи прокоментувала Amazon ці звинувачення?

За даними Mezha, публічного офіційного коментаря компанії на момент публікації новини не наведено — інформація ґрунтується на свідченні колишнього працівника.

---

Теги: AI, Amazon, авторськеправо, датасети, AItraining

Джерело: AiiN — https://aiin.news/article?slug=amazon-%D0%B7%D0%BD%D0%B8%D1%89%D1%83%D1%94-%D0%BF%D0%B0%D0%BF%D0%B5%D1%80%D0%BE%D0%B2%D1%96-%D0%BA%D0%BD%D0%B8%D0%B3%D0%B8-%D0%B2%D1%96%D0%B4%D1%81%D0%BA%D0%B0%D0%BD%D0%BE%D0%B2%D0%B0%D0%BD%D1%96-%D0%B4%D0%BB%D1%8F-%D0%BD%D0%B0%D0%B2%D1%87%D0%B0%D0%BD%D0%BD%D1%8F-ai. Цитуючи, посилайтесь на канонічний URL.
