# FineBooks чистить старий OCR-текст для навчання мовних моделей

> FineBooks запустив масштабне очищення OCR-помилок у сканованих книгах, щоб мовні моделі не вчились на спотвореному тексті десятків років сканування.

- Опубліковано: 10 серпня 2026 р. (2026-08-10T18:59:21.207123+00:00)
- Розділ: AI-дослідження
- На основі публікації: [The Decoder](https://the-decoder.com/old-ocr-text-cripples-language-model-training-and-finebooks-wants-to-fix-that-at-scale/)
- Видання: AiiN (https://aiin.news)
- URL: https://aiin.news/article?slug=finebooks-%D1%87%D0%B8%D1%81%D1%82%D0%B8%D1%82%D1%8C-%D1%81%D1%82%D0%B0%D1%80%D0%B8%D0%B9-ocr-%D1%82%D0%B5%D0%BA%D1%81%D1%82-%D0%B4%D0%BB%D1%8F-%D0%BD%D0%B0%D0%B2%D1%87%D0%B0%D0%BD%D0%BD%D1%8F-%D0%BC%D0%BE%D0%B2%D0%BD%D0%B8%D1%85-%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B5%D0%B9

---

Проєкт FineBooks запустив систему масового очищення OCR-тексту зі старих сканованих книг — того самого масиву спотворених символів, який десятиліттями накопичувався в цифрових бібліотеках на кшталт Google Books чи Internet Archive і тепер потрапляє прямо в тренувальні датасети мовних моделей.

Проблема не нова, але досі недооцінена: більшість книжкових текстів, доступних для легального тренування LLM, пройшли через оптичне розпізнавання символів (OCR) у 1990-2000-х роках, коли алгоритми плутали «rn» з «m», губили діакритику, ламали абзаци на header/footer сканера і залишали в тексті цифрові артефакти сторінок. Для людини такий текст читабельний з поправкою на очевидні помилки. Для мовної моделі, яка вчиться передбачати наступний токен, кожна така помилка — це шум, який модель або запам'ятовує як «нормальний» патерн, або використовує для калібрування ймовірностей неправильно.

[За даними The Decoder](https://the-decoder.com/old-ocr-text-cripples-language-model-training-and-finebooks-wants-to-fix-that-at-scale/), FineBooks позиціонує себе саме як інструмент для виправлення цієї проблеми на масштабі — не точкова редактура окремих книг, а конвеєр, здатний обробляти мільйони сторінок і повертати чистіший текст для тренувальних корпусів.

## Чому старий OCR взагалі ламає тренування моделей?

Бо помилки розпізнавання не випадкові й не рівномірні — вони системні, і модель вчиться саме на цій системності. OCR-рушії 90-х і 2000-х (ABBYY FineReader ранніх версій, Tesseract до 4.0) стабільно плутали однакові патерни символів: «cl» перетворювалось на «d», цифра «1» — на літеру «l» або «I», лапки й тире зʼїжджали в непередбачувані Unicode-символи. Коли такий текст потрапляє в корпус обсягом у мільярди токенів, модель вчиться, що ці помилки — частина нормальної мови, і починає відтворювати їх у генерації.

- Розбиті слова на межі рядків через переноси сканера;
- Номери сторінок, колонтитули й виноски, вклеєні прямо в основний текст;
- Втрачена або спотворена діакритика в неанглійських мовах;
- Дублювання абзаців через помилки сегментації сторінок.

Книги при цьому — не другорядне джерело: порівняно з веб-текстом вони дають довгі, логічно зв'язні наративи й ширшу лексику, тому дослідники давно намагаються включати їх у претрейн у якомога більшому обсязі. Але саме тому якість цього конкретного джерела має непропорційно великий вплив на фінальну модель.

## Як FineBooks підходить до очищення на масштабі?

Ключова ідея — автоматизоване виявлення й виправлення типових класів помилок замість ручної вичитки, яка на мільйонах сторінок економічно неможлива. Для книжкових корпусів такого розміру ручна редактура зайняла б роки навіть у великій команді, тому подібні проєкти зазвичай будують конвеєр із кількох шарів: детекція мови й кодування сторінки, статистичні моделі для розпізнавання «підозрілих» послідовностей символів, і фінальна нормалізація структури тексту (абзаци, переноси, спецсимволи).

Такий підхід перегукується з тим, що OpenAI, Meta чи EleutherAI вже роблять для веб-корпусів — фільтрація дублікатів, оцінка «якості» тексту евристиками, дедуплікація на рівні документів. Різниця в тому, що для сканованих книг базовий шум інший за природою: це не спам чи низькоякісний контент, а спотворення легітимного, часто цінного тексту через недосконалість технології двадцятирічної давності.

## Кому це реально важливо просто зараз?

Найбільше виграють команди, які будують або файнтюнять моделі на довгих текстах з вимогою до фактологічної точності й стилю — юридичні, наукові чи літературні асистенти, де книжковий корпус формує значну частку претрейн-даних. Для таких застосунків навіть невеликий відсоток «OCR-шуму» в датасеті означає, що модель час від часу генеруватиме дивні артефакти: розірвані слова, неіснуючі скорочення, плутанину в цифрах у таблицях чи цитатах.

Практично для AI-білдерів, які самостійно збирають чи докуповують книжкові корпуси, з цього випливає конкретний чек-лист:

- Перевіряти джерело сканування (Google Books, Internet Archive, HathiTrust) і рік оцифрування — старіші скани систематично гірші;
- Рахувати частку «непередбачуваних» символів і OCR-артефактів у корпусі до тренування, а не після;
- Не покладатись лише на дедуплікацію — вона не ловить системні спотворення символів, лише повторення;
- Розглядати спеціалізовані інструменти очищення (як FineBooks) як окремий крок препроцесингу, а не покладатись на загальні web-фільтри.

Цей самий принцип уже спрацював в іншій ніші даних для тренування ШІ — [у тому, як Avengers Labs постачає виробникам дронів реальні дані для навчання моделей](https://aiin.news/article?slug=avengers-labs-дає-виробникам-дронів-реальні-дані-для-навчання-ші) — якість і релевантність джерела важать більше за сирий обсяг.

## Висновок AiiN: якість книжкового корпусу — вузьке місце, яке досі ігнорували

Наша теза проста: індустрія роками змагалась за обсяг тренувальних даних, але майже не вимірювала якість конкретно книжкового сегмента корпусу — а саме він найбільше формує «голос» і фактологічну стабільність моделі в довгих текстах. Поки компанії публікують мільярди токенів як маркетинговий показник, реальний прогрес у якості відповідей ховається саме в таких малопомітних кроках препроцесингу, як очищення OCR-шуму. Команди, які інвестують у це зараз, отримають перевагу не в бенчмарках загального призначення, а там, де вона найдорожче коштує — у довгих, фактично щільних текстах: юридичних висновках, медичних оглядах, наукових синтезах.

## Що таке OCR-шум у контексті тренування LLM?

Це помилки розпізнавання символів, які оптичні сканери сторінок вносять при перетворенні зображення тексту на цифровий текст — переплутані літери, розірвані слова, вклеєні номери сторінок. Потрапляючи в тренувальний корпус, такі помилки модель сприймає як частину нормальної мови.

## Чи можна просто відфільтрувати книги з поганим OCR?

Технічно можна, але це різко скорочує обсяг доступних книжкових даних, бо переважна більшість цифрованих книг старіші за сучасні OCR-рушії. Тому очищення існуючого тексту економічно вигідніше за повне виключення джерела.

## Чи стосується проблема лише англомовних книг?

Ні, і для мов з діакритикою чи нелатинською графікою — включно з українською — старі OCR-рушії історично давали ще вищий відсоток помилок, тому якість книжкових корпусів для цих мов часто гірша, ніж для англійської.

---

Теги: AI, FineBooks, OCR, LLM, датасети, NLP

Джерело: AiiN — https://aiin.news/article?slug=finebooks-%D1%87%D0%B8%D1%81%D1%82%D0%B8%D1%82%D1%8C-%D1%81%D1%82%D0%B0%D1%80%D0%B8%D0%B9-ocr-%D1%82%D0%B5%D0%BA%D1%81%D1%82-%D0%B4%D0%BB%D1%8F-%D0%BD%D0%B0%D0%B2%D1%87%D0%B0%D0%BD%D0%BD%D1%8F-%D0%BC%D0%BE%D0%B2%D0%BD%D0%B8%D1%85-%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B5%D0%B9. Цитуючи, посилайтесь на канонічний URL.
