Файл: Технологии распознавания текстов (Основные понятия и определения теории распознавания текста).pdf
Добавлен: 07.07.2023
Просмотров: 141
Скачиваний: 2
Введение
В настоящее время большинство документов составляется на компьютерах, задача создания полностью электронного документооборота далека до полной реализации. Существующие системы охватывают деятельность отдельных организаций, а обмен данными между организациями осуществляется с помощью традиционных бумажных документов. Задача перевода информации с бумажных на электронные носители актуальна не только в рамках потребностей, возникающих в системах документооборота. Современные информационные технологии позволяют нам существенно упростить доступ к информационным ресурсам, накопленным человечеством, при условии, что они будут переведены в электронный вид. Наиболее простым и быстрым является сканирование документов с помощью сканеров. Результат работы является цифровое изображение документа – графический файл. Более предпочтительным, по сравнению с графическим, является текстовое представление информации. Этот вариант позволяет существенно сократить затраты на хранение и передачу информации, а также позволяет реализовать все возможные сценарии использования и анализа электронных документов. Область применения распознавания полноценных изображений многогранна. Например, на современных заводах контроль качества производимой продукции производят с использованием систем распознавания, которые отсеивают брак. Распознавание полноценных изображений применяется на дорогах, для определения и распознавания номеров автомобилей, контроль их скорости. Обработка изображений актуальна и при анализе снимков из космоса и с самолётов. Таким образом, область применения распознавания изображений широка и многогранна и позволяет намного сократить и упростить рабочий процесс и вместе с тем повысить его качество.
Цель работы - сравнить и проанализировать возможности систем распознавания символов.
Задачи – рассмотреть основные понятия и определения теории распознавания текста, технологию оптического распознавания символов. Сравнить возможности программ распознавания символов.
1. Основная часть
1.1 Основные понятия и определения теории распознавания текста
Распознавание символов – это операция преобразования текстовой информации из графических форматов данных в текстовые. Применяется для ввода текстов в компьютер посредством сканирования печатного или рукописного материала.
Распознавание текста является одним из направлений распознавания образов. Распознавание образов представляет собой очень сложную задачу в теоретическом и практическом смыслах, несмотря на то, что с ней достаточно легко справляются многие живые организмы и человек. Крайне сложно создать искусственную систему и ее технически реализовать для того, чтобы эффективно выполнять данный процесс. В данном случае, под распознаванием понимается соотнесение изображения объекта, его образа, набора признаков самому объекту.
Примерами и приложениями систем распознавания образов могут являться как распознавание текста в общем, так и отдельных его символов, распознавание речи, человеческих лиц, биометрических данных человека, штрих-кодов продуктов, номеров машин и т.д.
Примерами распознавания текста являются: оцифровка изображений текста (сканированные книги, статьи, журналы) для последующей работы с его цифровым аналогом, обработка анкетных бланков, распознавание номеров машин и надписей на объектах и т.д. Задача распознавания текста остается актуальной на сегодняшний день, так как не существует стопроцентной универсальной системы по распознаванию текста. Система распознавания текста предполагает наличие на входе изображения с текстом (в формате данных графического файла). На выходе системы должен сформироваться текст, выделенный из этого изображения.
Распознавание текста включает в себя следующие подзадачи и подпроцессы:
1. Поступающее на вход системы изображение должно быть очищено от шума и приведено к виду, позволяющему эффективно выделять символы и распознавать их.
2. Система должна разбить изображение на блоки текста, основываясь на особенностях его выравнивания и распределения по нескольким колонкам.
3. Изображение с текстом должно быть разделено на изображения строк, а затем на изображения символов для того, чтобы в дальнейшем обработать каждый символ по отдельности. После данного шага разные системы распознавания работают по своим специфическим алгоритмам.
4. Изображение символа может обрабатываться целиком, для этого оно сравнивается с имеющимися шаблонами. Другим вариантом является выделение характеристик изображаемого символа: отбор характерных признаков, и классификация данных признаков по имеющимся в системе критериям.
На выходе четвертого шага появляется возможный вариант буквы. Однако обычно системы на этом не останавливаются и продолжают работу на основе других методов, уточняя полученный результат.
5. Результат распознавания может быть не удовлетворительным. Для получения более хороших результатов в системе может быть встроен блок обучения. С помощью этого блока можно задать системе примеры начертания разных букв в данном шрифте. После процесса обучения предполагается лучшее качество распознавания текста.
Система распознавания текста не всегда должна следовать всем описанным шагам, но основные действия процесса распознавания являются общими для любого алгоритма.
1.2 Технология оптического распознавания символов
Технология сканирования.
Сканирование - процесс оцифровки аналогового изображения (документ, фотография, иллюстрация, слайд) при помощи специального устройства, называемого сканером. Сканирование производится для получения, на основе оригинала, его цифрового «портрета», пригодного для компьютерной обработки.
Сканер - оптико-электронное устройство для ввода в компьютер графических изображений. Сканер создает оцифрованное изображение документа и помещает его в память компьютера.
Для работы с архивными документами в настоящее время используются, в основном, черно-белые и полутоновые монохромные сканеры. Это связано в первую очередь, с тем, что преобладающим типом архивного документа является текстовый документ, отпечатанный на пишущей машинке или монохромном принтере, с рукописным заполнением или правкой темными чернилами и эпизодически включающий печати, рисунки, схемы или черно-белые фотографии.
Суть процесса распознавания.
Чтобы реализовать автоматический или автоматизированный перевод бумажных документов в электронный вид, необходимо выполнить сканирование бумажных документов и распознать их содержимое с помощью специальных программ, называемых системами оптического распознавания символов (Optical Character Recognition - OCR). Системы оптического распознавания символов предназначены для автоматического ввода печатных документов в компьютер. Обработка изображения OCR-системой включает в себя анализ графического изображения, переданного сканером, и распознавание каждого символа.
Процессы анализа макета страницы:
- определение областей распознавания
- определение таблиц
- определение картинок
- выделение в тексте строк и отдельных символов.
OCR-системы могут достигать наилучшей точности распознавания (процент правильно распознанных символов) - свыше 99,9% для чистых изображений, составленных из обычных шрифтов. На первый взгляд такая точность распознавания кажется идеальной, но уровень ошибок все же удручает, потому что, если имеется приблизительно 1500 символов на странице, то даже при коэффициенте успешного распознавания 99,9 % получается одна или две ошибки на страницу. В таких случаях на помощь приходит метод проверки по словарю. То есть, если какого-то слова нет в словаре системы, то она по специальным правилам пытается найти похожее. Но это все равно не позволяет исправлять 100 % ошибок, что требует человеческого контроля результатов.
Точность распознавания падает за счет ошибок распознавания. Повышению точности распознавания способствует устранение причин ошибок.
1.3 Основные характеристики сканеров
Разрешение (Resolution) - число точек или растровых ячеек, из которых формируется изображение, на единицу длины или площади. Чем больше разрешение устройства, тем более мелкие детали могут быть воспроизведены. Измеряется в «точках на квадратный дюйм» (DPI, dots per inch). Типовое разрешение промышленных сканеров - 200-300 DPI.
Разрядность цвета (глубина цвета) - количество разрядов каждого пикселя в цифровом изображении, в т.ч. выдаваемом сканером. Описывает максимальное количество цветов, воспроизводимое сканером в виде степени числа 2. Одному разряду соответствует черно-белое изображение, 8-ми - серое полутоновое, 16-ти - цветное, 24-цветное изображение, наиболее близкое к человеческому восприятию (модель RGB), 36bit и больше - полноцветное изображение с высокой достоверностью цветопередачи, предназначенное для профессиональной работы, чаще всего в издательском деле.
Время сканирования. Измеряется в страницах в минуту (иногда - в секундах на изображение). Типовые значения различны для разных типов сканеров.
Формат. Формат сканируемого документа. Как правило - A3/A4.
Интерфейс передачи данных - способ подключения сканера к компьютеру. Способы могут быть различны (к COM или USB порту, к SCSI карте и др.).
1.4 Программы распознавания текста
Преобразованием графического изображения в текст занимаются специальные программы распознавания текста (Optical Character Recognition - OCR).
Программы распознования текста:
1. ABBYY FineReader - программа для оптического распознавания символов, разработанная российской компанией ABBYY.
Достоинства: точное распознавание; огромное количество языков чтения; толерантность к качеству изображения-источника.
Недостаток: пробная версия на пятнадцать дней.
2. OCR CuneiForm - свободно распространяемая открытая система оптического распознавания текстов российской компании Cognitive Technologies. Достоинства: бесплатное распространение; использование словарей для проверки правильности текста; сканирование текста с ксерокопий плохого качества.
Недостатки: относительно небольшая точность; небольшое количество поддерживаемых языков.
3. WinScan2PDF - это даже не полноценная программа, а утилита. Установка не потребуется, а исполнительный файл весит всего в несколько килобайт. Достоинства: портативность; быстрая работа; простота в использовании.
Недостатки: единственный формат файлов на выходе.
4. SimpleOCR - отличная небольшая программа для распознавания текстов с изображений. Поддерживает даже чтение рукописей.
Достоинства: точное распознавание текста; удобный текстовый редактор; удаление шума с изображения.
Недостатки: полное отсутствие русского языка.
5. Freemore OCR. Программа позволяет оперативно извлекать текст и графику с изображений.
Достоинства: бесплатное распространение; возможность работы с несколькими сканерами; достойная точность распознавания.
Недостатки: отсутствие русского языка в интерфейсе; необходимость загрузки русского языкового пакета для распознавания.
Наиболее распространенными программами являются:
ABBYY FineReader и OCR CuneiForm.
Когда речь заходит о программах для распознавания символов, практически все русскоязычные пользователи уверенно заявляют: в этом секторе бесплатных альтернатив ABBYY FineReader нет.
2. Охрана труда и безопасность жизнедеятельности
Пользователь автоматизированного рабочего места несет ответственность за сохранность и правильную эксплуатацию компьютерного оборудования.