Размытые страницы, тень от переплёта и «кривой» текст — типичный результат, когда книгу сканируют на автоматических настройках планшетного сканера без подготовки. Чтобы получить читаемый электронный документ, нужно заранее определиться с форматом результата, выставить корректное разрешение и правильно прижать разворот к стеклу. В этой статье разберём весь процесс: от выбора оборудования до распознавания текста и сборки готового файла.

Оцифровка книги — задача вполне посильная в домашних условиях, но она требует терпения: средний том в 300–400 страниц занимает несколько часов работы. Зато на выходе вы получите удобный PDF, DjVu или полноценный текстовый файл для читалки, планшета или архива.

Выбор формата электронной книги

Прежде чем включать сканер, решите, в каком виде нужен результат. От этого зависят настройки сканирования и последующая обработка.

  • 📄 PDF с изображениями страниц — универсальный вариант: сохраняет оригинальный вид книги, открывается на любом устройстве.
  • 📚 DjVu — формат, исторически оптимизированный именно для сканов: при сопоставимом качестве файлы обычно заметно компактнее, чем PDF.
  • 🔤 Текстовые форматы (DOCX, TXT, FB2, EPUB) — получаются после распознавания (OCR); удобны для электронных книг и поиска, но требуют вычитки ошибок распознавания.
  • 🔍 PDF с текстовым слоем — комбинированный вариант: выглядит как скан, но поддерживает поиск и копирование текста.

Если книга нужна «для чтения с экрана как есть» — выбирайте PDF или DjVu. Если планируете читать на e-ink устройстве с изменением размера шрифта — без OCR не обойтись.

💡

Формат результата определяет весь процесс: для PDF/DjVu достаточно качественных сканов, для EPUB и FB2 потребуется распознавание текста и ручная корректировка.

Какое оборудование подойдёт для сканирования

Для оцифровки книг используют несколько типов устройств, и у каждого есть свои ограничения.

Планшетный сканер — самый доступный вариант. Книгу кладут разворотом на стекло и прижимают крышкой. Минус очевиден: переплёт мешает прижать страницы у корешка, из-за чего появляются тени и искажения. Скорость работы невысокая.

Книжный сканер (с V-образным или угловым стеклом) позволяет не раскрывать книгу на 180 градусов, что бережёт переплёт и убирает тень у корешка. Такие аппараты есть в библиотеках и копицентрах.

Фотоаппарат или смартфон на штативе — рабочая альтернатива, если сканера нет. Камеру закрепляют над книгой, страницы подсвечивают равномерным светом и снимают разворот за разворотом. Качество зависит от освещения и разрешения камеры, но при аккуратности результат вполне пригоден для OCR.

⚠️ Внимание: протяжные сканеры (МФУ с автоподатчиком) для книг в твёрдом переплёте не подходят — страницы придётся вырезать из корешка, что разрушит издание. Автоподатчик уместен только если книга уже разобрана на отдельные листы.

Подготовка книги и рабочего места

Качество итогового файла наполовину определяется до нажатия кнопки «Сканировать». Уделите подготовке несколько минут.

Во-первых, очистите стекло сканера от пыли и отпечатков — каждая соринка попадёт на все страницы. Во-вторых, определите порядок сканирования: удобнее идти от начала книги к концу, чтобы не путаться в нумерации файлов. В-третьих, продумайте, как прижимать страницы у корешка: аккуратное нажатие пальцами или чистый лист стекла поверх разворота заметно улучшают результат.

  • 🧹 Протрите стекло сканера мягкой тканью без ворса.
  • 📖 Проверьте, нет ли в книге вклеенных страниц, закладок и пометок, которые могут сместиться.
  • 💡 При съёмке камерой обеспечьте равномерное освещение без бликов и теней от рук.
  • 🔢 Заранее решите, как будете именовать файлы — например, page_001, page_002 и так далее.
📊 Каким способом вы планируете сканировать книгу?
Планшетный сканер
Книжный сканер в копицентре
Смартфон или фотоаппарат
Уже сканировал(а) раньше

Настройки сканирования: разрешение и режим

Главный параметр — разрешение (DPI). Для обычного текстового тома достаточно 300 DPI в чёрно-белом или сером режиме — это общепринятый ориентир, обеспечивающий уверенное распознавание текста. Для книг с мелкими иллюстрациями, нотами или формулами имеет смысл поднять разрешение до 400–600 DPI, но файл будет расти пропорционально.

Режим сканирования выбирайте по содержимому. Чистый текст без оттенков — «чёрно-белый (line art)»: файлы минимальны, буквы чёткие. Текст с полутоновыми иллюстрациями — «оттенки серого». Цветные вкладки и обложку сканируйте в цвете, даже если остальная книга чёрно-белая.

Сохраняйте исходники в формате без потерь или с минимальным сжатием — TIFF или PNG. JPEG на высоком качестве тоже допустим, но многократное пересохранение деградирует мелкий текст. Все преобразования делайте уже на этапе сборки итогового документа.

💡

Сканируйте с небольшим запасом по краям и обрежьте поля позже пакетной обработкой — так вы не потеряете строки у края страницы, если книга лежит чуть криво.

Пошаговый процесс сканирования

Типовая последовательность работы с планшетным сканером выглядит так: положите книгу разворотом на стекло, выровняйте по краю, прижмите, сделайте скан, переверните страницу и повторите. Монотонно, но именно аккуратность на этом этапе экономит часы на постобработке.

☑️ Контроль качества во время сканирования

Выполнено: 0 / 5

Периодически открывайте свежие сканы и проверяйте их на полном масштабе. Обнаружить брак через 200 страниц гораздо неприятнее, чем через пять. Если страница вышла смазанной — пересканируйте её сразу, пока книга открыта на нужном месте.

Как ускорить процесс

Опытные оцифровщики сканируют сразу разворотом (две страницы в одном файле), а затем разрезают изображения пополам в графическом редакторе или специализированных утилитах — это почти вдвое сокращает число нажатий кнопки сканирования.

Обработка сканов и распознавание текста

Сырые сканы редко готовы к использованию. Обычно требуется выровнять перекосы, обрезать поля, очистить фон от «грязи» и при необходимости повысить контраст. Для этого подойдут как универсальные графические редакторы, так и специализированные программы обработки сканов — например, широко известный Scan Tailor с открытым кодом, который умеет разделять развороты, выравнивать страницы и чистить фон в пакетном режиме.

Для получения редактируемого текста нужен OCR — оптическое распознавание символов. Среди известных решений — ABBYY FineReader (коммерческий, хорошо справляется с кириллицей и сложной вёрсткой) и свободный движок Tesseract, поддерживающий русский язык. После распознавания обязательно пройдитесь по тексту: OCR стабильно путает похожие символы, цифры и знаки препинания, особенно на старых шрифтах.

⚠️ Внимание: не удаляйте исходные сканы после распознавания. Текстовый слой может содержать ошибки, и сверка с оригинальным изображением страницы — единственный надёжный способ их найти.

Сборка итогового файла и его оптимизация

Когда страницы обработаны, их собирают в единый документ. Для PDF удобно сохранить текстовый слой — документ останется похожим на оригинал, но в нём заработает поиск. Для DjVu существуют специальные кодировщики, эффективно сжимающие чёрно-белые страницы.

Итоговый размер файла регулируется балансом качества и сжатия. Сравнительная ориентировка по форматам:

ФорматСохранение вида страницыПоиск по текстуТипичный размер
PDF (сканы)ПолностьюНет (без OCR-слоя)Средний / большой
PDF + текстовый слойПолностьюДаСредний
DjVuПолностьюДа (при наличии слоя)Малый
EPUB / FB2Нет (переформатируемый текст)ДаОчень малый
DOCX / TXTНетДаОчень малый

Добавьте в документ закладки по главам и оглавление — для книги в несколько сотен страниц это существенно упрощает навигацию. Проверьте итоговый файл на устройстве, где планируете читать: экран читалки и монитор компьютера по-разному показывают контраст и мелкий шрифт.

⚠️ Внимание: учитывайте авторские права. Оцифровка книги для личного использования и распространение полученного файла — юридически разные действия. Перед публикацией или передачей файла третьим лицам убедитесь, что это не нарушает права правообладателя.
💡

Рабочая цепочка оцифровки: сканирование в 300 DPI → выравнивание и чистка в редакторе → OCR при необходимости → сборка в PDF/DjVu с текстовым слоем и закладками.

Частые вопросы

Можно ли отсканировать книгу телефоном без сканера?

Да. Закрепите смартфон над книгой (подойдёт штатив или импровизированная подставка), обеспечьте ровное освещение без бликов и фотографируйте страницы по очереди. Существуют мобильные приложения-сканеры, которые автоматически обрезают и выравнивают снимки. Качество уступает планшетному сканеру, но для чтения и OCR обычно достаточно.

Какое разрешение выбрать — 300 или 600 DPI?

Для обычного текста достаточно 300 DPI — это устоявшийся ориентир для качественного распознавания. 600 DPI оправдано для мелкого шрифта, сносок, формул и иллюстраций с тонкими линиями, но заметно увеличивает размер файлов и время сканирования.

Что делать с тенью у корешка книги?

Прижимайте разворот к стеклу сильнее, аккуратно раскрывая книгу насколько позволяет переплёт. Если тень остаётся, её можно уменьшить при обработке — повышением порога бинаризации или обрезкой полей. Книжные сканеры с угловым стеклом решают эту проблему конструктивно.

Какая программа лучше распознаёт русский текст?

Из коммерческих решений хорошо зарекомендовал себя ABBYY FineReader, особенно на сложной вёрстке и старых шрифтах. Из бесплатных — движок Tesseract с русским языковым пакетом. В любом случае после OCR требуется ручная вычитка: полностью безошибочного распознавания не бывает.

Как уменьшить размер итогового PDF без потери читаемости?

Переведите чисто текстовые страницы в чёрно-белый режим, примените сжатие, предназначенное для сканов, и не храните страницы в избыточном разрешении. Для максимальной компактности рассмотрите формат DjVu — он исторически создавался именно для оцифрованных документов.