CuneiForm: программа для OCR-распознавания текста из сканов

CuneiForm OpenOCR, также известная как Cognitive OpenOCR, — это программа оптического распознавания символов для перевода сканов, факсов, книжных страниц, газетных вырезок и графических файлов с текстом в редактируемый вид. Её задача — не просто показать картинку документа, а извлечь из неё текст, который затем можно сохранить, отредактировать, перенести в текстовый редактор, обработать в скриптах или использовать для архива.

Скачать CuneiForm

Бесплатно
В реестре программного обеспечения РФ
Чистая установка

Новейшая версия для Windows. Удобная программа для редактирования, конвертации и работы с PDF-документами.

⬇ Скачать PDF Commander бесплатно

⬇ Скачать CuneiForm (Windows)

CuneiForm создавалась как OCR-система для печатных документов. Она распознаёт машинописный и типографский текст, анализирует структуру страницы, работает с несколькими языками, поддерживает русский и смешанный русско-английский режим. Открытая ветка CuneiForm существует как OCR-движок, а графическая работа с ним часто выполняется через отдельные оболочки: Cuneiform-Qt и YAGF. Это важно: CuneiForm — ядро распознавания, а интерфейс зависит от конкретной сборки и способа запуска. На Windows чаще встречается классический интерфейс Cognitive OpenOCR, на Linux — консольная команда cuneiform или графическая оболочка.

Программа хорошо подходит для локального распознавания документов без облачных сервисов. Она не требует отправки сканов на сервер, не завязана на онлайн-аккаунт и может использоваться как простая OCR-утилита для дома, офиса, архива или учебной работы. При этом CuneiForm нельзя воспринимать как современный PDF-комбайн уровня ABBYY FineReader PDF: это прежде всего инструмент распознавания текста, а не полноценная среда для редактирования PDF, подписей, форм и корпоративного документооборота.

Что такое CuneiForm OpenOCR

CuneiForm OpenOCR — это OCR-система, разработанная компанией Cognitive Technologies. Изначально CuneiForm была коммерческой программой для Windows и поставлялась в составе решений для сканеров и офисной техники. Затем ядро программы было открыто, а CuneiForm получила Linux-порт. В открытой ветке программа стала использоваться как многоязычный OCR-движок, который запускается из командной строки и может подключаться к графическим оболочкам.

Главная функция CuneiForm — преобразование изображения страницы в текст. Входом может быть скан, снимок страницы, изображение из архива, факсимильная копия или подготовленный файл после обработки в программе вроде ScanTailor. На выходе пользователь получает обычный текст, RTF, HTML, hOCR или другой поддерживаемый формат. В командной версии это задаётся параметром -f, а в графических оболочках — через настройки формата результата.

CuneiForm не нужно путать с древней клинописью, несмотря на совпадение названия. В контексте обзора речь идёт именно о программе для OCR: распознавание русского текста, английского текста, отсканированных страниц, колонок, факсов, печатных документов и изображений с текстом.

Принцип работы программы можно описать так:

  1. Пользователь открывает изображение или передаёт его через командную строку.

  2. CuneiForm анализирует страницу: ищет текстовые области, оценивает структуру, определяет фрагменты.

  3. OCR-движок распознаёт символы с учётом выбранного языка.

  4. Результат сохраняется в выбранном формате.

  5. Пользователь редактирует текст вручную или передаёт его в другой инструмент.

Это не редактор сканов в привычном смысле. CuneiForm не заменяет Photoshop, PDF-редактор или программу для вёрстки. Она решает конкретную задачу: извлечь текст из изображения.

Для каких задач подходит программа

CuneiForm OpenOCR полезна там, где есть бумажный или графический источник текста, а нужен редактируемый результат. Программа особенно уместна для документов с обычным печатным шрифтом, хорошим контрастом и предсказуемой структурой страницы.

Типичные задачи:

  • распознавание текста со скана;

  • перевод бумажных документов в TXT, RTF или HTML;

  • извлечение русского и английского текста из изображений;

  • обработка старых инструкций, договоров, архивных страниц;

  • распознавание газетных и книжных разворотов;

  • получение текста из факсов;

  • обработка изображений с одноколоночной версткой;

  • распознавание фрагментов страницы через YAGF;

  • подготовка hOCR-разметки для дальнейшей работы с PDF;

  • пакетная OCR-обработка через командную строку.

CuneiForm особенно удобна в сценариях, где не нужен сложный визуальный PDF-редактор. Например, есть папка с PNG или TIFF-сканами, и нужно получить обычные .txt-файлы. В этом случае командный режим быстрее и чище, чем ручная работа в тяжёлой офисной программе.

Программа подходит для:

СценарийНасколько подходит CuneiFormКомментарий
Распознавание обычного печатного текстаВысокоОсобенно при хорошем скане и правильном языке
Русский текстВысокоЕсть отдельный режим rus
Русско-английский документВысокоЕсть смешанный режим ruseng
Одноколоночная статьяВысокоЕсть режим --singlecolumn
ФаксСредне/хорошоЕсть специальный режим --fax
Матричный принтерСредне/хорошоЕсть режим --dotmatrix
Сложная таблицаЗависит от веткиВ Linux-порте есть ограничения по таблицам
Searchable PDF в один кликНизкоЛучше использовать внешнюю связку
Рукописный текстНизкоПрограмма ориентирована на печатные документы
Фото под углом с телефонаНизко/среднеТребуется предварительное выравнивание

Для домашней оцифровки CuneiForm закрывает базовый сценарий: открыть скан, выбрать язык, распознать, сохранить текст. Для архивной или полупрофессиональной работы её стоит использовать вместе с инструментами подготовки изображения: выравнивание, обрезка полей, повышение контраста, удаление шума.

История версий и развития CuneiForm

CuneiForm появилась в начале 1990-х как коммерческая OCR-система Cognitive Technologies. В 1993 году технология распознавания Cognitive использовалась в издательской и офисной среде, а сама CuneiForm постепенно стала одной из заметных OCR-программ российского происхождения. В 1990-е она поставлялась вместе со сканерами, МФУ и офисным оборудованием разных производителей, включая Corel, Hewlett-Packard, Epson, Xerox, Samsung, Brother, Canon и другие бренды.

Важный этап — CuneiForm 96. Эта ветка запомнилась адаптивным распознаванием: программа анализировала хорошо напечатанные символы внутри конкретного документа и использовала их как основу для распознавания более проблемных символов на той же странице. Идея была в том, чтобы OCR-движок подстраивался под шрифт, печать и особенности исходного документа, а не работал только по статичной базе символов.

Затем появилась линия CuneiForm 2000. В ней акцент был сделан на более сложный анализ документа: сохранение структуры, работа с многостолбцовой версткой, таблицами, иллюстрациями и расположением блоков. Эта логика хорошо видна и в классическом интерфейсе OpenOCR: пользователь может включать поиск таблиц и изображений, задавать цвета блоков для текста, картинок и таблиц, управлять языком распознавания и режимами обработки.

В 2007 году была выпущена бесплатная версия OCR CuneiForm, а в 2008 году исходный код ядра был опубликован под лицензией BSD. Это изменило роль программы: CuneiForm перестала быть только закрытым Windows-приложением и стала основой для открытых портов, сборок и графических оболочек.

После открытия кода появилась ветка Cuneiform for Linux. Она перенесла OCR-движок в Unix-подобную среду и дала возможность использовать CuneiForm как консольную программу. Linux-порт тестировался на Linux, FreeBSD, OS X и Windows-сборках через MSVC, MinGW и Cygwin.

Следующий важный этап — появление оболочек:

  • Cuneiform-Qt — простой GUI-фронтенд для CuneiForm с кнопками открытия изображения, распознавания и сохранения результата;

  • YAGF — более развитая оболочка для работы с CuneiForm и Tesseract, с импортом изображений, PDF/DjVu, выбором областей распознавания, предобработкой и редактором результата.

Историю CuneiForm удобно воспринимать как три линии:

ЭтапЧто изменилось
Коммерческая Windows-программаГрафический интерфейс, работа со сканером, OCR для бумажных документов
Открытие ядраCuneiForm стала доступна как открытый OCR-движок
Linux-порт и оболочкиПоявились консольный сценарий, Cuneiform-Qt, YAGF и интеграция в свободные OCR-процессы

Эта история объясняет, почему вокруг CuneiForm есть разные интерфейсы. Один пользователь видит классическое окно OpenOCR с меню Файл, Правка, Вид, Распознавание, Окно, Справка. Другой запускает команду cuneiform -l rus -o result.txt scan.png. Третий работает через YAGF, где слева изображение, справа редактор распознанного текста.

Поддерживаемые платформы и варианты работы

CuneiForm существует в нескольких практических вариантах:

ВариантКак используетсяДля кого подходит
Cognitive OpenOCR для WindowsКлассический графический интерфейс с меню, панелями и мастером распознаванияПользователи Windows, которым нужен визуальный OCR
Cuneiform for LinuxКоманда cuneiform в терминалеПользователи Linux, автоматизация, пакетная обработка
Cuneiform-QtПростая графическая оболочка для CuneiFormТе, кому нужен минимальный GUI
YAGFРасширенная оболочка для Cuneiform и TesseractРабота с областями, PDF/DjVu, предобработкой и ручной корректурой
OCRFeeder и похожие оболочкиИспользование CuneiForm как одного из OCR-движковСборка более сложных OCR-процессов

Открытая Linux-ветка сама по себе не является большой программой с лентой инструментов. Это OCR-движок, который запускается с параметрами. Командная строка выглядит просто:

cuneiform [--dotmatrix] [--fax] [--singlecolumn] [-f format] [-l language] [-o output] input

Такой формат делает CuneiForm удобной для скриптов. Можно обработать одну страницу, папку сканов или встроить распознавание в собственный конвейер.

Графические оболочки нужны тем, кто не хочет вручную писать команды. Cuneiform-Qt показывает исходное изображение в области Source Image, результат в области Recognized text, а сверху располагает кнопки Open image, Recognize text, Save result.

Cuneiform-Qt: главное окно с областями Source Image и Recognized text

Интерфейс CuneiForm: что видит пользователь

Интерфейс зависит от того, какой вариант программы используется. Это не недостаток, а особенность истории CuneiForm: ядро распознавания одно, а оболочек несколько.

Классический интерфейс Cognitive OpenOCR

В Windows-варианте Cognitive OpenOCR используется традиционное окно с верхним меню и несколькими панелями инструментов. В меню видны разделы:

  • Файл;

  • Правка;

  • Вид;

  • Распознавание;

  • Окно;

  • Справка.

Основная рабочая зона делится на область страницы и нижнюю зону увеличенного просмотра. На скриншотах видно, что программа показывает страницу на сером фоне, отмечает найденные блоки цветными рамками и позволяет смотреть увеличенный фрагмент строки в нижней панели. Это удобно при проверке качества OCR: пользователь сразу видит, какой участок документа распознаётся и как он выглядит в увеличении.

Cognitive OpenOCR: главное окно с распознаванием страницы и увеличенным фрагментом строки

В верхней части окна расположены крупные кнопки с пиктограммами сканирования, открытия изображения, запуска распознавания и сохранения. Ниже — мелкие кнопки управления страницей: масштаб, поворот, выделение, работа с блоками, отмена/повтор действий, настройка отображения.

По логике интерфейса OpenOCR пользователь проходит такой путь:

  1. получает страницу со сканера или открывает файл;

  2. проверяет изображение;

  3. запускает распознавание;

  4. смотрит разметку блоков;

  5. исправляет ошибки;

  6. сохраняет результат.

Для старых OCR-программ такая структура типична: изображение и распознанный текст тесно связаны, а пользователь работает не с PDF-документом, а с распознаваемой страницей.

Cuneiform-Qt

Cuneiform-Qt — минималистичная оболочка для CuneiForm. В ней нет перегруженной панели, большого мастера и сложной настройки блоков. Главное окно состоит из двух основных панелей:

  • Source Image — область исходного изображения;

  • Recognized text — область распознанного текста.

Сверху находятся три ключевые кнопки:

  • Open image — открыть изображение;

  • Recognize text — запустить OCR;

  • Save result — сохранить результат.

Такой интерфейс подходит для простого сценария: открыть картинку, распознать текст, сохранить итог. Он не пытается заменить большой OCR-редактор. Его сильная сторона — простота.

YAGF

YAGF расшифровывается как Yet Another Graphical Front-end. Это графическая оболочка для Cuneiform и Tesseract. Она работает как единый пульт для OCR: можно открыть изображение, получить скан через XSane, подготовить картинку, выбрать области распознавания, указать язык, запустить OCR, исправить результат в редакторе и сохранить текст.

В YAGF рабочее окно обычно устроено так:

  • слева — миниатюры страниц;

  • в центре — изображение документа;

  • на документе — выделенные области распознавания;

  • справа — распознанный текст;

  • сверху — панель инструментов и список языка.

YAGF особенно полезен, когда нужно распознать не всю страницу, а отдельный фрагмент. Например, на газетной полосе есть несколько колонок, заголовки, изображение и подписи. Пользователь может выделить нужные зоны и не заставлять OCR-движок обрабатывать всё подряд.

Основные возможности CuneiForm OpenOCR

CuneiForm выполняет несколько групп задач: распознавание символов, анализ структуры страницы, выбор языка, настройка режима документа и экспорт результата.

Распознавание печатного текста

Главная функция программы — оптическое распознавание символов. CuneiForm анализирует изображение, находит буквы и преобразует их в текстовые символы. В отличие от простого просмотра скана, результат можно:

  • выделить мышью;

  • скопировать;

  • исправить;

  • сохранить в файл;

  • вставить в Word, LibreOffice Writer или другой редактор;

  • использовать в поиске;

  • обработать скриптом.

Программа ориентирована именно на печатный текст. Для рукописных конспектов, подписей от руки, каракулей на полях и анкет с произвольным почерком CuneiForm не является подходящим инструментом.

Анализ структуры страницы

CuneiForm умеет выполнять layout analysis — анализ разметки страницы. Это нужно, чтобы отличать основной текст от заголовков, колонок, изображений и таблиц. Программа занимается не только распознаванием текста, но и анализом структуры и формата текста.

В классическом интерфейсе OpenOCR эта логика видна визуально: блоки на странице подсвечиваются рамками. В настройках есть цвета блоков:

  • Text;

  • Pictures;

  • Tables.

Пользователь может включить или отключить поиск таблиц и изображений. Это помогает программе не пытаться распознавать картинку как текст и не смешивать разные типы содержимого.

Режим одной колонки

Параметр --singlecolumn отключает анализ сложной разметки и сообщает программе, что изображение состоит из одной текстовой колонки. Это полезно для:

  • страниц книги;

  • простых договоров;

  • инструкций;

  • статей без боковых колонок;

  • вырезанных фрагментов текста.

Если подать одноколоночную страницу как сложную многообластную верстку, OCR иногда может ошибиться с порядком чтения. Режим одной колонки делает поведение проще и предсказуемее.

Пример команды:

cuneiform --singlecolumn -l rus -f text -o result.txt page.png

Здесь программа распознаёт русскоязычное изображение page.png, считает его одной колонкой и сохраняет результат в result.txt.

Режим факса

Параметр --fax включает режим, оптимизированный для факсимильных документов. Факсы часто имеют низкое разрешение, шум, ступенчатые линии, потерю деталей и характерные артефакты передачи. Обычный режим OCR может воспринимать такие дефекты как части букв, поэтому отдельный режим помогает программе иначе обработать исходник.

Команда:

cuneiform --fax -l rus -f text -o fax.txt fax_scan.tif

Этот режим стоит пробовать для старых договоров, заявок, актов, факсимильных копий и документов, где буквы выглядят рваными.

Режим матричного принтера

Параметр --dotmatrix предназначен для текста, напечатанного на матричном принтере. У таких документов символы состоят из точек, края букв неровные, а OCR может путать отдельные точки с шумом. CuneiForm имеет отдельный режим для такого типа печати.

Команда:

cuneiform --dotmatrix -l eng -f text -o printout.txt report.bmp

Этот режим полезен для старых накладных, бухгалтерских распечаток, архивных отчётов, ведомостей и технических документов.

Выбор языка распознавания

Язык задаётся параметром -l. По умолчанию CuneiForm распознаёт английский текст, но для русского документа нужно явно указать rus, а для смешанного русско-английского — ruseng.

Примеры:

cuneiform -l rus -o text.txt scan.png
cuneiform -l ruseng -o mixed.txt contract.png

Выбор языка сильно влияет на качество. Если распознавать русский документ как английский, программа начнёт путать кириллические буквы с латиницей, цифрами и похожими символами. Для технических документов с англоязычными терминами лучше использовать смешанный режим.

Экспорт результата

CuneiForm умеет сохранять распознанный текст в нескольких форматах. В командной версии формат задаётся через -f. Доступны:

  • text — обычный plain text;

  • smarttext — простой текст с TeX-подобными абзацами;

  • rtf — формат для текстовых редакторов;

  • html — HTML-документ;

  • hocr — HTML-разметка с координатами распознанных областей;

  • native — собственный формат Cuneiform 2000.

Примеры:

cuneiform -l rus -f rtf -o document.rtf scan.png
cuneiform -l eng -f html -o page.html page.tif
cuneiform -l ruseng -f hocr -o page.html scan.png

Формат нужно выбирать по задаче. Для быстрого извлечения текста достаточно text. Для дальнейшего редактирования в офисном редакторе удобнее rtf. Для OCR-конвейеров и создания текстового слоя полезен hocr.

Поддерживаемые языки распознавания

CuneiForm поддерживает набор европейских языков и отдельный смешанный режим русского с английским. В командной версии список языков можно получить через cuneiform -l, а в YAGF список языков отображается в отдельном окне YAGF Languages Setup.

В CuneiForm используются коды языков:

КодЯзык
engEnglish
rusRussian
rusengmixed Russian/English
gerGerman
fraFrench
itaItalian
spaSpanish
ukrUkrainian
polPolish
porPortuguese
czeCzech
danDanish
dutDutch
sweSwedish
turTurkish
bulBulgarian
hrvCroatian
hunHungarian
lavLatvian
litLithuanian
rumRomanian
srpSerbian
slvSlovenian
estEstonian

Для русскоязычного пользователя ключевые режимы — rus, eng и ruseng. В реальных документах часто встречаются смешанные фрагменты: русские абзацы, английские названия программ, латинские артикулы, email-адреса, URL, технические обозначения. В таких случаях ruseng обычно логичнее, чем чистый rus.

Какие файлы можно распознавать

Командная версия CuneiForm работает с одностраничными изображениями. Если сборка использует GraphicsMagick, программа может обрабатывать любой одностраничный формат, который умеет открывать GraphicsMagick. Без такой поддержки CuneiForm ограничивается несжатым BMP.

На практике чаще всего используются:

  • BMP;

  • PNG;

  • JPEG/JPG;

  • TIFF/TIF;

  • изображения, подготовленные после сканирования;

  • страницы, предварительно извлечённые из PDF в виде изображений.

Важно понимать разницу: CuneiForm как OCR-движок распознаёт изображение, а не редактирует PDF как документ. Если у пользователя есть многостраничный PDF, его обычно сначала разбивают на изображения или открывают через оболочку, которая умеет импортировать PDF. YAGF как раз закрывает такой сценарий: он может работать с уже отсканированными изображениями, получать изображения через XSane, распознавать текст из PDF и DjVu-файлов, а затем показывать результат в редакторе.

Для надёжного результата лучше использовать форматы без сильной потери качества:

ФорматРекомендация
TIFFХороший выбор для сканов и архивов
PNGХороший выбор для чётких страниц и скриншотов
BMPПодходит, но файлы крупные
JPEGДопустим, если сжатие умеренное
PDFЛучше через оболочку или предварительное извлечение страниц
Фото с телефонаЖелательно выровнять и очистить перед OCR

JPEG с сильным сжатием может ухудшить распознавание: вокруг букв появляются артефакты, тонкие штрихи размываются, а CuneiForm начинает путать похожие символы. Для OCR лучше сохранять сканы в TIFF или PNG.

Форматы экспорта результата

CuneiForm полезна не только как картинка в текст, но и как инструмент для разных типов результата. Формат вывода задаёт, насколько хорошо сохранится структура и где дальше будет использоваться файл.

TXT

Обычный текстовый файл — самый простой и надёжный вариант. Он подходит для:

  • копирования текста;

  • поиска;

  • индексирования;

  • обработки скриптами;

  • загрузки в редактор;

  • сохранения архивного содержания без оформления.

Команда:

cuneiform -l rus -f text -o result.txt scan.png

TXT не сохраняет оформление. Заголовки, таблицы, жирный шрифт, колонки и изображения будут потеряны или упрощены. Зато файл легко открыть почти где угодно.

Smarttext

smarttext — это простой текст с TeX-подобными абзацами. Его стоит использовать, когда нужен текстовый результат, но желательно сохранить более аккуратную структуру абзацев.

Команда:

cuneiform -l rus -f smarttext -o result.txt scan.png

Этот формат полезен для документов, где важны переносы, абзацы и читаемость, но не требуется полноценная вёрстка.

RTF

RTF — удобный формат для редактирования в текстовых редакторах. Его можно открыть в Microsoft Word, LibreOffice Writer, OpenOffice Writer и других офисных программах.

Команда:

cuneiform -l ruseng -f rtf -o contract.rtf contract.png

RTF подходит для договоров, инструкций, писем, актов и других документов, которые нужно не просто прочитать, а доработать. В классическом OpenOCR настройки RTF вынесены в отдельную вкладку Formatting: там видны параметры Preserve bold, Preserve italic, Preserve font size, Preserve fragment position, а также выбор шрифтов Serif, Sans Serif, Fixed font.

Cognitive OpenOCR: настройки Formatting и параметры сохранения RTF-оформления

HTML

HTML подходит, если нужно получить страницу с разметкой, открыть результат в браузере или дальше обработать его веб-инструментами.

Команда:

cuneiform -l eng -f html -o page.html page.png

HTML может быть удобен для архивации статей, инструкций, описаний и страниц, которые потом будут переноситься на сайт или в базу знаний.

hOCR

hOCR — это HTML-разметка с координатами распознанного текста на странице. Она используется в OCR-конвейерах, где важно знать не только текст, но и его положение на изображении.

Команда:

cuneiform -l rus -f hocr -o page.hocr scan.png

hOCR нужен не обычному пользователю, а тем, кто собирает более сложный процесс: например, хочет связать изображение страницы и текстовый слой, сделать поиск по скану, подготовить данные для последующей обработки.

Native

native — собственный формат Cuneiform 2000. Для обычной работы он нужен редко, но может быть полезен в старых или специализированных сценариях, где требуется сохранить внутреннее представление результата.

Как распознать текст в CuneiForm: пошаговая инструкция

Работать с CuneiForm можно несколькими способами. Ниже — практические сценарии для разных вариантов программы.

Распознавание через Cuneiform-Qt

Cuneiform-Qt — самый простой визуальный вариант. Он удобен, когда нужно распознать один файл без настройки сложного проекта.

Порядок работы:

  1. Откройте Cuneiform-Qt.

  2. Нажмите Open image.

  3. Выберите файл изображения: PNG, JPG, BMP или TIF.

  4. Проверьте, что страница появилась в области Source Image.

  5. Нажмите Recognize text.

  6. Дождитесь появления результата в области Recognized text.

  7. Нажмите Save result.

  8. Сохраните распознанный текст.

В Cuneiform-Qt есть меню File, Settings, Help. Через File → Open Image можно открыть изображение, через File → Recognize text — запустить распознавание, через Save Result — сохранить итог. В настройках выбираются язык и формат вывода.

Этот способ особенно хорош для простых страниц: скан письма, одна книжная страница, инструкция, распечатанный договор, изображение с крупным текстом.

Рекомендации:

  • перед открытием файла выровняйте страницу;

  • не используйте слишком маленькие изображения;

  • выбирайте правильный язык;

  • для русского текста используйте русский режим;

  • для смешанного текста используйте русско-английский режим;

  • после распознавания обязательно прочитайте результат глазами.

Распознавание через YAGF

YAGF удобнее Cuneiform-Qt, когда нужно работать с областями, несколькими страницами, PDF/DjVu или изображениями плохого качества. Он поддерживает получение изображений через XSane, подготовку картинки, выбор отдельных областей распознавания, настройку языка и редактирование результата в правой панели.

Порядок работы:

  1. Откройте YAGF.

  2. Загрузите изображение или импортируйте страницу документа.

  3. При необходимости выполните предобработку: исправление перекоса, повышение контраста, удаление шума.

  4. Выберите язык в верхней панели.

  5. Выделите нужную область на странице.

  6. Запустите OCR.

  7. Проверьте результат в правой панели.

  8. Исправьте ошибки распознавания.

  9. Сохраните текст или скопируйте его в буфер обмена.

В YAGF удобно распознавать не всю страницу, а конкретную область. Например, на скане газеты можно выделить только нужную колонку, чтобы OCR не смешивал заголовки, подписи и соседние статьи.

Для сложных страниц лучше работать по частям:

  • сначала выделить заголовок;

  • затем первую колонку;

  • затем вторую колонку;

  • отдельно распознать подписи;

  • не распознавать изображения;

  • проверять порядок текста в редакторе справа.

YAGF также полезен для документов, где CuneiForm нужно использовать не напрямую, а как один из движков. Пользователь может выбирать между Cuneiform и Tesseract, сравнивать результат и оставлять тот вариант, который лучше справился с конкретным сканом.

Распознавание через командную строку

Командный режим — самый точный способ управлять CuneiForm. Он подходит для Linux, автоматизации, пакетной обработки и тех случаев, когда не нужен графический интерфейс.

Базовая команда:

cuneiform -l rus -f text -o result.txt scan.png

Что означает команда:

ПараметрЗначение
cuneiformзапуск OCR-движка
-l rusязык распознавания — русский
-f textформат вывода — обычный текст
-o result.txtфайл результата
scan.pngисходное изображение

Для английского текста:

cuneiform -l eng -f text -o result.txt page.png

Для русско-английского документа:

cuneiform -l ruseng -f rtf -o document.rtf document.tif

Для факса:

cuneiform --fax -l rus -f text -o fax.txt fax.tif

Для одноколоночной страницы:

cuneiform --singlecolumn -l rus -f text -o page.txt page.png

Для старой распечатки матричного принтера:

cuneiform --dotmatrix -l rus -f text -o report.txt report.bmp

Если не указать -o, CuneiForm сохранит результат в файл вида cuneiform-out.[format], где расширение зависит от выбранного формата вывода.

Распознавание в классическом Cognitive OpenOCR

В Windows-интерфейсе OpenOCR работа строится вокруг сканирования или открытия изображения. В программе есть мастер распознавания, выбор источника изображения и настройки сканера.

Типовой порядок:

  1. Откройте изображение или выберите сканер.

  2. Если используется сканер, выберите TWAIN-драйвер.

  3. Задайте параметры сканирования: размер страницы, разрешение, цветность, яркость, контраст.

  4. Проверьте изображение в рабочей области.

  5. Выберите язык распознавания.

  6. Включите нужные режимы: Spell checking, Single column, Dot matrix printer, Fax.

  7. При необходимости включите Search tables и Search pictures.

  8. Запустите распознавание через меню Распознавание или кнопку на панели.

  9. Проверьте блоки текста, картинок и таблиц.

  10. Сохраните результат.

В окне выбора сканера видны поля Type и Name, драйверы TWAIN, а также кнопки OK и Cancel. Это стандартная логика старых OCR-программ: сначала выбрать устройство, затем получить изображение, затем распознать.

Cognitive OpenOCR: окно выбора TWAIN-драйвера сканера

Настройки распознавания

Настройки CuneiForm влияют на качество сильнее, чем кажется. OCR-ошибки часто возникают не из-за плохой программы, а из-за неверного режима: выбран английский вместо русского, многостолбцовая страница подана как обычная, факс распознаётся без специального режима, таблица распознаётся как сплошной текст.

Язык распознавания

Самая важная настройка — язык. Для русских документов нужен русский режим, для английских — английский, для смешанных — Russian-English / ruseng.

Неверный язык приводит к типичным ошибкам:

Исходный текстНеверный режимЧто может случиться
Русский договорEnglishКириллица превращается в набор похожих латинских символов
Английская инструкцияRussianЛатинские слова искажаются
Русский текст с артикуламиRussianАнглийские коды и названия распознаются хуже
Смешанный технический документТолько один языкОшибки в терминах, URL, обозначениях

В YAGF язык выбирается из выпадающего списка на верхней панели и через окно YAGF Languages Setup. В CuneiForm-Qt язык задаётся в настройках. В командной строке используется -l.

Spell checking

В классическом OpenOCR есть параметр Spell checking. Проверка орфографии помогает исправлять часть ошибок, когда программа сомневается между похожими вариантами. Для обычного текста это полезно, но для технических документов с артикулами, серийными номерами, кодами деталей и аббревиатурами словарь может мешать.

Включать Spell checking стоит для:

  • писем;

  • статей;

  • книг;

  • договоров;

  • инструкций с обычным языком.

Отключать или осторожно использовать — для:

  • таблиц с кодами;

  • прайс-листов;

  • технических спецификаций;

  • списков артикулов;

  • документов с большим количеством сокращений.

Single column

Настройка Single column соответствует командному параметру --singlecolumn. Она нужна для документов, где текст идёт одной колонкой сверху вниз.

Включайте Single column, если распознаёте:

  • страницу книги;

  • простую инструкцию;

  • акт;

  • заявление;

  • письмо;

  • одну колонку, вырезанную из газеты;

  • фрагмент страницы без сложной верстки.

Не включайте этот режим для газетных полос, журналов, брошюр и страниц с несколькими колонками, если нужно сохранить порядок блоков.

Dot matrix printer

Настройка Dot matrix printer нужна для старых распечаток с матричного принтера. Такой текст отличается от лазерной печати: символы состоят из точек, контуры неровные, между штрихами могут быть разрывы.

Включайте этот режим для:

  • старых бухгалтерских отчётов;

  • накладных;

  • складских ведомостей;

  • архивных распечаток;

  • форм с моноширинным шрифтом;

  • документов из старых DOS-программ.

Fax

Настройка Fax оптимизирует распознавание факсимильных документов. Факс часто имеет низкое качество: шум, размытые буквы, горизонтальные полосы, неравномерный контраст.

Включайте Fax для:

  • факсимильных копий договоров;

  • старых заявок;

  • документов, пересланных через факс;

  • сканов с характерными полосами;

  • изображений с грубой бинаризацией.

Search tables и Search pictures

В OpenOCR есть параметры Search tables и Search pictures. Они управляют поиском таблиц и изображений на странице. Включение этих параметров помогает программе разделить содержимое и не воспринимать все элементы как обычный текст.

Cognitive OpenOCR: настройки Markup and recognition, язык Russian-English, Single column, Fax, Search tables и Search pictures

Эти параметры особенно важны для:

  • журналов;

  • газет;

  • бланков;

  • таблиц;

  • инструкций с иллюстрациями;

  • документов с логотипами;

  • страниц с несколькими типами блоков.

В Linux-порте нужно учитывать ограничение: в этой ветке отсутствует полноценное распознавание таблиц. Поэтому для табличных документов поведение Windows-версии, YAGF-сценария и командного Linux-движка может отличаться.

Colours of blocks

В настройках OpenOCR есть блок Colours of blocks:

  • Text;

  • Pictures;

  • Tables.

Цвета нужны для визуального контроля разметки. Пользователь видит, какие области программа считает текстом, какие — картинками, какие — таблицами. Это помогает быстро понять, почему результат получился неправильным. Например, если часть текста помечена как изображение, она не будет нормально распознана. Если таблица распознана как обычный текст, структура строк и столбцов может разрушиться.

Параметры сканирования

В окне Scanning видны настройки драйвера, размера изображения, границ, разрешения, цветности, яркости, контраста и порога. Эти параметры влияют на исходный материал ещё до OCR.

Для OCR важнее всего:

  • достаточное разрешение;

  • ровная страница;

  • хороший контраст;

  • отсутствие сильного шума;

  • правильная ориентация;

  • отсутствие обрезанных букв;

  • умеренная бинаризация.

Если исходное изображение плохое, даже правильный язык и режим не спасут результат полностью.

Работа с русским текстом

CuneiForm хорошо подходит для распознавания русского текста, если скан качественный и выбран правильный режим. Для русских документов нужно использовать rus, а для документов с английскими словами — ruseng.

Русско-английский режим особенно полезен для:

  • технических инструкций;

  • договоров с английскими названиями ПО;

  • документов с email и URL;

  • прайс-листов;

  • описаний оборудования;

  • научных текстов;

  • компьютерных руководств;

  • сканов страниц, где встречаются латинские обозначения.

Типичные ошибки при распознавании русского текста:

ОшибкаПричина
о и 0 путаютсяПлохой контраст или технические таблицы
З и 3 путаютсяПохожая форма символов
с и c смешиваютсяРусско-латинские похожие буквы
а и a смешиваютсяНеверный язык или смешанный документ
й теряет знакНизкое разрешение
ё распознаётся как еOCR и словарь часто упрощают букву
Дефисы ломают словаПереносы строк в исходнике
Абзацы склеиваютсяНеверный анализ структуры
Колонки перемешиваютсяНеудачная разметка страницы

Чтобы улучшить распознавание русского текста:

  1. Используйте скан без сильного JPEG-сжатия.

  2. Выставляйте язык rus или ruseng.

  3. Для одной колонки используйте --singlecolumn.

  4. Перед OCR выравнивайте перекос страницы.

  5. Удаляйте тёмные поля и следы переплёта.

  6. Проверяйте буквы в словах с похожими кириллическими и латинскими символами.

  7. Не полагайтесь полностью на автоматическую проверку орфографии.

  8. После OCR обязательно вычитывайте документ.

Особенно внимательно нужно проверять юридические и финансовые документы. OCR-ошибка в одной цифре, фамилии, дате или сумме может быть критичнее, чем десяток мелких опечаток в обычной статье.

Работа с таблицами, колонками и сложной версткой

CuneiForm исторически создавалась не только как распознаватель букв, но и как система анализа документа. Классический OpenOCR показывает блоки текста, картинок и таблиц, позволяет включать Search tables и Search pictures, а также задавать цвета разных типов блоков.

Но здесь нужно разделять классическую Windows-логику и открытый Linux-порт. В Linux-порте CuneiForm есть известное ограничение: полноценное распознавание таблиц отсутствует. Это значит, что при работе через командную строку табличный документ может распознаться как последовательность строк без корректного восстановления структуры.

Как лучше распознавать таблицы

Для простых таблиц:

  • используйте чёткий скан;

  • не обрезайте границы строк и столбцов;

  • включайте поиск таблиц в OpenOCR;

  • проверяйте порядок ячеек;

  • сохраняйте в формат, который лучше удерживает структуру;

  • после распознавания вручную сверяйте цифры.

Для сложных таблиц:

  • распознавайте фрагментами;

  • используйте YAGF для выделения областей;

  • не ждите идеального восстановления сетки;

  • после OCR переносите данные в таблицу вручную;

  • проверяйте каждую строку и числовой столбец.

Для многостолбцовых статей:

  • не включайте --singlecolumn для всей полосы;

  • выделяйте колонки отдельно;

  • контролируйте порядок чтения;

  • удаляйте изображения из области распознавания;

  • заголовки распознавайте отдельно, если они сбивают порядок текста.

CuneiForm лучше всего раскрывается на документах, где текст имеет понятную структуру. Чем ближе исходник к обычной печатной странице, тем выше шанс получить аккуратный результат.

Подготовка изображения перед распознаванием

Качество OCR начинается не в CuneiForm, а в исходном изображении. Даже сильный OCR-движок плохо работает со смазанной фотографией, перекошенной страницей, серым фоном и буквами, которые сливаются с бумагой.

YAGF включает полезные средства подготовки: исправление перекоса, удаление шума и повышение контраста для изображений плохого качества.

В настройках YAGF есть разделы:

  • OCR and Language;

  • Image Processing;

  • Program Behavior.

Оптимальные параметры исходника

Для обычного текста лучше придерживаться таких правил:

ПараметрРекомендация
Разрешение300 dpi для обычного текста
ЦветЧёрно-белый или оттенки серого
КонтрастЧёткие буквы на светлом фоне
ПерекосМинимальный, страницу лучше выровнять
ПоляЛишние тёмные края лучше обрезать
СжатиеИзбегать сильного JPEG
Размер шрифтаСлишком мелкий текст распознаётся хуже
ОриентацияСтраница должна быть повёрнута правильно

Что ухудшает распознавание

CuneiForm будет чаще ошибаться, если исходник содержит:

  • смазанные буквы;

  • тень от переплёта;

  • серую бумагу;

  • низкий контраст;

  • перекос страницы;

  • перспективное искажение;

  • следы пальцев и пятна;

  • просвечивающий текст с обратной стороны;

  • сильное JPEG-сжатие;

  • мелкий кегль;

  • декоративные шрифты;

  • рукописные вставки.

Практическая подготовка страницы

Перед запуском OCR полезно сделать минимальную обработку:

  1. Обрезать лишние поля.

  2. Выровнять страницу.

  3. Убрать поворот на 90/180 градусов.

  4. Повысить контраст.

  5. Удалить шум.

  6. Проверить, что буквы не стали слишком тонкими.

  7. Сохранить в PNG или TIFF.

  8. Выбрать правильный язык в CuneiForm.

Если сканируется книга, особенно важно убрать изгиб страницы возле корешка. Изогнутые строки CuneiForm распознаёт хуже: буквы меняют форму, расстояния между символами становятся неравномерными, а строки могут склеиваться.

Пакетное распознавание

Одна из сильных сторон CuneiForm — возможность использовать её в командной строке. Это удобно для пакетной обработки, когда нужно распознать не одну страницу, а десятки или сотни изображений.

Простейший пример для одной папки:

for file in *.png; do
  cuneiform -l rus -f text -o "${file%.png}.txt" "$file"
done

Что делает этот скрипт:

  • берёт все PNG-файлы в папке;

  • запускает CuneiForm для каждого изображения;

  • выбирает русский язык;

  • сохраняет результат в TXT с тем же именем.

Для TIFF:

for file in *.tif; do
  cuneiform -l ruseng -f rtf -o "${file%.tif}.rtf" "$file"
done

Для hOCR:

for file in *.png; do
  cuneiform -l rus -f hocr -o "${file%.png}.html" "$file"
done

Пакетный режим особенно полезен для:

  • оцифровки книг;

  • обработки архивных сканов;

  • распознавания папки договоров;

  • подготовки текстов для поиска;

  • извлечения текста из сканированных инструкций;

  • предварительной OCR-обработки перед ручной вычиткой.

YAGF также рассчитан на последовательную работу с несколькими изображениями и поддерживает многостраничные сценарии. Он удобнее, если каждую страницу нужно проверить глазами, выделить области и поправить текст до сохранения.

Для полностью автоматической обработки лучше командная строка. Для полуавтоматической, где важна корректура, удобнее YAGF.

Создание PDF с текстовым слоем

CuneiForm сама по себе не является современной программой для создания searchable PDF в один клик. Её роль в таком процессе — распознать текст и, при необходимости, сохранить hOCR-разметку. Дальше hOCR можно использовать во внешнем OCR-конвейере, где изображение страницы соединяется с текстовым слоем.

Правильная логика такая:

  1. Подготовить изображение страницы.

  2. Распознать его в CuneiForm.

  3. Сохранить результат в hocr.

  4. Использовать внешний инструмент для сборки PDF с текстовым слоем.

  5. Проверить, что текст выделяется и ищется.

Команда для hOCR:

cuneiform -l rus -f hocr -o page.hocr page.png

hOCR полезен тем, что хранит координаты текста. Обычный TXT знает только символы, но не знает, где они находились на странице. Для searchable PDF координаты важны: текстовый слой должен совпадать с изображением.

При этом CuneiForm не лучший выбор, если основная задача — массово превращать сканированные PDF в searchable PDF. Для такой задачи чаще удобнее специализированные OCR-конвейеры. Но если нужно именно использовать CuneiForm как распознаватель, hOCR даёт техническую основу для дальнейшей обработки.

Преимущества CuneiForm OpenOCR

CuneiForm не стоит оценивать как современный коммерческий OCR-пакет. Её сильные стороны в другом: локальность, простота, открытая ветка, поддержка русского языка и возможность автоматизации.

Локальное распознавание без облака

CuneiForm работает локально. Документы не отправляются в онлайн-сервис. Это важно для:

  • договоров;

  • внутренних инструкций;

  • архивных документов;

  • персональных данных;

  • служебных материалов;

  • учебных и исследовательских архивов.

Для чувствительных документов локальный OCR часто предпочтительнее облачного.

Поддержка русского и русско-английского режима

Наличие rus и ruseng делает CuneiForm полезной для русскоязычных пользователей. Смешанный режим особенно важен, потому что реальные документы редко бывают полностью кириллическими: в них встречаются латинские названия, URL, коды, артикулы, модели устройств.

Командная строка

Командный режим позволяет использовать программу в скриптах. Это преимущество перед многими визуальными OCR-программами, где каждый файл приходится открывать вручную.

Несколько форматов вывода

CuneiForm поддерживает разные типы результата:

  • простой текст;

  • RTF;

  • HTML;

  • hOCR;

  • smarttext;

  • native.

Это позволяет выбирать формат под задачу: чтение, редактирование, архив, веб-публикация, OCR-конвейер.

Простые графические оболочки

Cuneiform-Qt и YAGF делают программу доступнее для тех, кто не хочет работать в терминале. Cuneiform-Qt закрывает базовую задачу, YAGF добавляет предобработку, выбор областей и редактор результата.

Хороша для старых OCR-сценариев

CuneiForm уместна для старых сканов, факсов, машинописных страниц, архивных документов и типографского текста. Для документов без сложной современной PDF-структуры она может быть достаточно практичной.

Недостатки и ограничения

CuneiForm — программа с сильной историей, но её ограничения нужно понимать заранее. Иначе ожидания будут неверными.

Устаревший интерфейс

Классический OpenOCR выглядит как программа своего времени: меню, панели инструментов, небольшие кнопки, мастер распознавания, отдельные окна настроек. Пользователю, привыкшему к современным PDF-редакторам, интерфейс может показаться старым.

Нет единого современного GUI для всех платформ

На Windows есть один опыт, на Linux — другой. В открытой ветке CuneiForm часто используется как консольный движок, а GUI зависит от оболочки. Это не одна одинаковая программа на всех системах.

Сложные PDF — не её сильная сторона

CuneiForm распознаёт изображения. PDF-документы с несколькими страницами, слоями, формами, закладками и сложной структурой требуют дополнительных инструментов. Через YAGF можно работать с PDF/DjVu, но это уже оболочка и внешний сценарий, а не базовая функция командного ядра.

Таблицы требуют проверки

В Windows-интерфейсе есть поиск таблиц, но в Linux-порте полноценное распознавание таблиц ограничено. Даже когда таблица распознаётся, числовые данные нужно сверять вручную. OCR-ошибка в таблице часто менее заметна, чем ошибка в обычном абзаце.

Качество зависит от исходника

Плохой скан даёт плохой OCR. CuneiForm не волшебная система восстановления текста из любого изображения. Для стабильного результата нужны контраст, разрешение, ровная страница и правильный язык.

Не подходит для рукописного текста

CuneiForm ориентирована на печатные документы. Рукописные заметки, подписи, произвольные анкеты и конспекты — не её задача.

Сравнение с аналогами

CuneiForm OpenOCR стоит сравнивать не с абстрактными программами для распознавания, а с конкретными OCR-инструментами. У каждого решения своя роль: одно сильнее в командной строке, другое — в PDF, третье — в интерфейсе, четвёртое — в интеграции с современными OCR-движками.

ПрограммаГде сильнаГде уступает
Tesseract OCRАктивный OCR-движок, поддержка UTF-8, более 100 языков, командная строка, множество интеграцийСам по себе тоже требует оболочки или командной работы
ABBYY FineReader PDFСильная работа с PDF, редактирование, сравнение документов, офисные сценарии, коммерческая точностьТяжелее, сложнее, платный продукт
OCRFeederГрафический анализ структуры документа, работа с разными OCR-движками, удобен в Linux-средеЗависит от внешнего OCR-движка
gImageReaderСовременный GUI для Tesseract, импорт PDF/изображений/сканов, hOCR, PDF из hOCR, пакетная обработкаПривязан к Tesseract как основному движку
GOCRПростота, открытость, лёгкий OCR-сценарийМенее универсален для сложных документов
OcradЛёгкий консольный OCR для отдельных задачОграниченнее по языкам и качеству на сложных страницах

Tesseract сильнее как современный открытый OCR-движок. Он поддерживает UTF-8, множество языков, PNG, JPEG, TIFF и активно используется в сторонних программах. Для новых OCR-конвейеров Tesseract часто практичнее.

ABBYY FineReader PDF сильнее в готовом пользовательском сценарии: открыть PDF, распознать, отредактировать, сравнить документы, сохранить в офисный формат. Это не просто OCR-движок, а большой PDF-продукт.

OCRFeeder интересен тем, что сам выступает системой анализа структуры документа и может использовать разные OCR-движки. Он автоматически находит области, отличает графику от текста и передаёт текстовые зоны в выбранный OCR-backend.

gImageReader — удобный GUI для Tesseract. Он умеет импортировать PDF, изображения, данные со сканера, буфера обмена и скриншотов, обрабатывать несколько файлов, задавать области распознавания, показывать текст рядом с изображением, делать hOCR и PDF из hOCR.

Когда выбрать CuneiForm

CuneiForm логична, если:

  • нужен локальный OCR;

  • важен русский или русско-английский текст;

  • нужно быстро распознать изображения;

  • удобен командный режим;

  • требуется старый, простой и понятный OCR-инструмент;

  • уже есть рабочая связка с Cuneiform-Qt или YAGF;

  • нужно получить TXT, RTF, HTML или hOCR.

Когда выбрать другой инструмент

Лучше смотреть в сторону другого решения, если:

  • нужно редактировать PDF;

  • требуется массовое создание searchable PDF;

  • нужно качественно извлекать сложные таблицы;

  • важна современная оболочка;

  • нужен OCR для десятков языков;

  • требуется корпоративная обработка документов;

  • нужны встроенные инструменты проверки, сравнения, подписей и комментариев.

Практические сценарии использования

Оцифровка старой инструкции

Есть бумажная инструкция, напечатанная обычным шрифтом. Пользователь сканирует страницу, сохраняет её в PNG или TIFF, запускает CuneiForm с языком rus, получает TXT или RTF.

Команда:

cuneiform -l rus -f rtf -o instruction.rtf instruction.png

После этого текст можно открыть в офисном редакторе, поправить ошибки и сохранить как обычный документ.

Распознавание русско-английского договора

Договор на русском может содержать латинские названия компаний, email, URL, номера моделей, английские аббревиатуры. Для такого документа лучше использовать ruseng.

cuneiform -l ruseng -f rtf -o contract.rtf contract.tif

После распознавания обязательно нужно проверить:

  • фамилии;

  • даты;

  • суммы;

  • номера договоров;

  • банковские реквизиты;

  • email;

  • латинские названия.

Извлечение текста из газетной колонки

Для газетной страницы лучше не распознавать всё изображение сразу. В YAGF можно выделить конкретную колонку и запустить OCR только для неё. Это уменьшает риск перемешивания текста.

Алгоритм:

  1. Открыть страницу в YAGF.

  2. Выделить первую колонку.

  3. Запустить распознавание.

  4. Скопировать результат.

  5. Выделить вторую колонку.

  6. Повторить OCR.

  7. Собрать текст в правильном порядке.

Распознавание факса

Факс лучше обрабатывать через специальный режим:

cuneiform --fax -l rus -f text -o fax.txt fax_scan.tif

Если текст всё равно распознаётся плохо, нужно попробовать повысить контраст, убрать шум и проверить, не слишком ли низкое разрешение у файла.

Пакетная обработка архива сканов

Если есть папка с отсканированными страницами:

for file in *.tif; do
  cuneiform -l rus -f text -o "${file%.tif}.txt" "$file"
done

После обработки появятся текстовые файлы с теми же именами. Это удобно для первичного создания поискового архива.

Получение hOCR для дальнейшей сборки

Если нужно сохранить координаты текста:

cuneiform -l ruseng -f hocr -o page.hocr page.png

Такой результат можно использовать в более сложном процессе, где изображение страницы и текстовый слой объединяются внешними инструментами.

Частые ошибки при работе с CuneiForm

Выбран неправильный язык

Самая частая ошибка — распознавать русский текст как английский. Результат будет выглядеть как смесь латиницы, цифр и случайных символов.

Правильно:

cuneiform -l rus -o result.txt scan.png

Для смешанного текста:

cuneiform -l ruseng -o result.txt scan.png

Не указан файл вывода

Если не указать -o, программа сохранит результат в файл cuneiform-out.[format]. Пользователь может решить, что OCR ничего не сделал, хотя файл просто создан под стандартным именем.

Лучше всегда задавать имя явно:

cuneiform -l rus -f text -o result.txt scan.png

Слишком плохое изображение

Если буквы размыты, страница перекошена, контраст слабый, а фон серый, CuneiForm начнёт ошибаться. В этом случае нужно не менять OCR-движок сразу, а подготовить изображение:

  • выровнять;

  • обрезать;

  • повысить контраст;

  • убрать шум;

  • сохранить без сильного сжатия.

Одноколоночная страница распознаётся как сложная

Если CuneiForm неверно определяет блоки, попробуйте режим:

cuneiform --singlecolumn -l rus -o result.txt page.png

Он отключает сложный анализ страницы и заставляет программу считать изображение одной колонкой.

Факс распознаётся обычным режимом

Для факса используйте:

cuneiform --fax -l rus -o fax.txt fax.tif

Обычный режим может хуже справляться с шумом и характерными искажениями факсимильного документа.

Матричная распечатка распознаётся как обычный текст

Для старых распечаток используйте:

cuneiform --dotmatrix -l rus -o report.txt report.bmp

Этот режим учитывает особенности точечной печати.

Пользователь ждёт идеального восстановления таблиц

Таблицы нужно проверять вручную. Даже если CuneiForm нашла таблицу или YAGF визуально выделил область, итоговые данные могут потерять структуру. Для числовых документов OCR — только первый этап, а не финальная проверка.

Распознаётся вся страница вместо нужного фрагмента

Если на странице есть лишние блоки, лучше использовать YAGF и выделять только нужные области. Это особенно важно для газет, журналов, рекламных буклетов и страниц с иллюстрациями.

Используется JPEG с сильным сжатием

JPEG-артефакты вокруг букв ухудшают OCR. Для сканов лучше использовать PNG или TIFF. Если исходник уже JPEG, желательно не пересохранять его многократно.

Кому стоит использовать CuneiForm OpenOCR

CuneiForm подойдёт тем, кому нужна простая бесплатная OCR-программа для локального распознавания печатного текста. Особенно хорошо она вписывается в сценарии, где важны русский язык, командная строка, RTF/TXT/HTML/hOCR и отсутствие облачной обработки.

Программа подходит:

  • пользователям, которые оцифровывают бумажные документы;

  • тем, кто работает со старыми сканами;

  • пользователям Linux, которым нужен OCR-движок;

  • тем, кто хочет распознавать русский текст локально;

  • тем, кто обрабатывает папки изображений скриптами;

  • тем, кто использует YAGF или Cuneiform-Qt;

  • архивистам и исследователям, которым нужен базовый OCR;

  • пользователям, которым достаточно TXT или RTF на выходе.

CuneiForm не лучший выбор:

  • для сложного редактирования PDF;

  • для корпоративного документооборота;

  • для OCR рукописей;

  • для плохих фотографий с телефона;

  • для точного извлечения сложных таблиц;

  • для массового создания searchable PDF без дополнительных инструментов;

  • для пользователей, которым нужен современный интерфейс всё в одном.

Детальный разбор сильных и слабых сценариев

Простая страница с текстом

Это лучший сценарий для CuneiForm. Если страница ровная, шрифт обычный, контраст высокий, а язык выбран правильно, программа способна дать аккуратный редактируемый текст.

Рекомендуемый режим:

cuneiform -l rus -f text -o page.txt page.png

Для сохранения в RTF:

cuneiform -l rus -f rtf -o page.rtf page.png

Книга

Книжные страницы обычно подходят, если:

  • нет сильного изгиба у корешка;

  • строки ровные;

  • буквы не слишком мелкие;

  • скан не затемнён по краям;

  • нет просвечивания обратной стороны.

Для книги часто помогает --singlecolumn:

cuneiform --singlecolumn -l rus -f text -o book_page.txt book_page.png

Если страница содержит две книжные страницы на одном изображении, лучше сначала разделить разворот на две отдельные картинки.

Газета

Газета сложнее книги: колонки, заголовки, подписи, изображения, мелкий шрифт. Для газеты лучше использовать YAGF и выделять области вручную. Распознавание всей полосы за один проход может перемешать порядок текста.

Договор

Договоры обычно распознаются хорошо, если они напечатаны стандартным шрифтом. Но их нужно тщательно проверять: OCR-ошибки в юридических документах недопустимы.

Особое внимание:

  • номера пунктов;

  • даты;

  • суммы;

  • реквизиты;

  • ФИО;

  • адреса;

  • приложения;

  • таблицы.

Факс

Факс требует отдельного режима и предварительной очистки. Если на изображении много полос, шума и разрывов букв, результат может быть нестабильным.

Режим:

cuneiform --fax -l rus -f text -o fax.txt fax.tif

Старая распечатка

Для матричного принтера используйте --dotmatrix. Если документ содержит моноширинные таблицы, лучше сохранять в plain text и проверять структуру вручную.

cuneiform --dotmatrix -l rus -f text -o old_report.txt old_report.bmp

Таблица

Таблицы требуют осторожности. Если нужна точная структура, лучше распознавать небольшими фрагментами и переносить результат в таблицу вручную. CuneiForm может помочь извлечь текст, но не гарантирует корректное восстановление всех ячеек.

Как добиться лучшего качества распознавания

Для CuneiForm важны три условия: хороший исходник, правильный язык, подходящий режим.

Минимальный чек-лист перед OCR

Перед запуском проверьте:

  • страница не перевёрнута;

  • текст не обрезан;

  • буквы достаточно крупные;

  • фон светлый;

  • контраст нормальный;

  • нет сильного шума;

  • выбран правильный язык;

  • для одной колонки включён --singlecolumn;

  • для факса включён --fax;

  • для матричной печати включён --dotmatrix.

После OCR

После распознавания проверьте:

  • заголовки;

  • первые и последние строки;

  • переносы слов;

  • цифры;

  • таблицы;

  • имена и фамилии;

  • латиницу внутри русского текста;

  • буквы О/0, З/3, с/c, а/a;

  • порядок колонок.

OCR не отменяет вычитку. Он сокращает ручной набор текста, но не гарантирует юридически точную копию документа без проверки.

Итоговая оценка

CuneiForm OpenOCR — это не универсальный современный PDF-редактор, а конкретная OCR-программа для распознавания печатного текста со сканов и изображений. Её ценность в локальной работе, поддержке русского языка, смешанном режиме ruseng, командной строке, форматах TXT/RTF/HTML/hOCR и возможности использовать разные графические оболочки.

Сильнее всего CuneiForm выглядит в простых и понятных OCR-сценариях: отсканированная страница, книжный текст, инструкция, договор, факс, старая распечатка, папка изображений для пакетной обработки. Слабее — в сложных PDF, многоуровневых таблицах, современных корпоративных процессах, рукописном тексте и плохих фотографиях.

Для пользователя, которому нужна бесплатная OCR-программа без облака и с нормальной работой по русскому тексту, CuneiForm остаётся полезным инструментом. Для задач уровня открыть PDF, распознать, отредактировать, сравнить, подписать и отправить лучше выбирать более современный PDF/OCR-пакет.


Ваш адрес email не будет опубликован. Обязательные поля помечены *