Файл: Технологии распознавания текста (Необходимость в системах распознавания символов.).pdf

ВУЗ: Не указан

Категория: Реферат

Дисциплина: Не указана

Добавлен: 07.07.2023

Просмотров: 54

Скачиваний: 2

ВНИМАНИЕ! Если данный файл нарушает Ваши авторские права, то обязательно сообщите нам.

1. Необходимость в системах распознавания символов

С помощью сканера достаточно просто получить изображение страницы текста в графическом файле. Но работать с текстом невозможно по определённым причинам:

- страница с текстом представляет собой графический файл - обычную картинку;

- текст нельзя редактировать и форматировать;

- необходимо преобразовать элементы графического изображения в последовательности текстовых символов.

2. Основной метод

Основным методом перевода бумажных документов в электронную форму является сканирование:

- в результате сканирования получается графическое изображение, состоящее из точек;

- количество точек определяется размером изображения и разрешением сканера.

3. Преобразование документа

В электронный вид происходит в три основных этапа:

1. Сканирование

2. Сегментация и распознавание текста

3. Проверка орфографии и передача текстового документа в нужное приложение для дальнейшей работы или сохранение в файл.

Каждый из этих этапов может выполняться программами как автоматически, так и под контролем пользователя.

4. Программы распознавания текста

Преобразованием графического изображения в текст занимаются специальные программы распознавания текста (Optical Character Recognition - OCR).

Наиболее распространенные системы оптического распознавания символов:

a) BBYY FineReader

b) CuneiForm от Cognitive

а). ABBYY FineReader

FineReader - омнифонтовая система оптического распознавания текстов. Это означает, что она позволяет распознавать тексты, набранные практически любыми шрифтами, без предварительного обучения. Особенностью программы FineReader является высокая точность распознавания и малая чувствительность к дефектам печати.

OCR-технологии от компании ABBYY также поддерживают зональное распознавание (распознавание на уровне полей), необходимое во многих ключевых бизнес-процессах, таких как классификация по ключевым словам, индексирование по ключевым словам и ввод данных с форм. L, PDF/A, searchable PDF, CSV и текстовые (plain text) файлы.

Интерфейс


Пользователь может настроить рабочее пространство по своему усмотрению:

- Изменить расположение и размер окон

- Настроить панель быстрого доступа, предназначенную для доступа к наиболее часто используемым командам

- Настроить горячие клавиши -- можно как заменить предустановленные сочетания, так и добавить свои горячие клавиши для выполнения команд программы

- Выбрать нужный язык интерфейса и др.

Возможности:

- позволяет извлекать текстовые данные из цифровых изображений;

- полученное в результате распознавания может быть сохранено в различных форматах.

Дополнительные возможности:

-Использование шаблонов;

-Распознавание с обучением;

-Создание новых языков и группы языков;

-Коллективная работа в сети.

b). CuneiForm

оптический символ текст интерфейс

CuneiForm -- это программа для оптического распознавания текста документов в редактируемый вид. Результаты работы программы можно редактировать в офисных программах и текстовых редакторах и сохранять в популярных форматах, проводить по ним полнотекстовый поиск.

CuneiForm является предшественницей систем промышленного распознавания и понимания документов. Многие технологические ноу-хау, результаты научных исследований, положенные в основу CuneiForm, успешно применяются и совершенствуются по сей день в коммерческих продуктах Cognitive Technologies.

Возможности:

- при распознавании с помощью CuneiForm сохраняется структура документа и его форматирование;

- программа распознает таблицы любой структуры и сложности, в том числе и без отображения линий табличной сетки;

- распознаются любые печатные шрифты: книги, газеты, журналы, распечатки с лазерных и матричных принтеров, тексты с пишущих машинок;

- алгоритмы оптического распознавания (OCR, Optical Character Recognition), встроенные в программу позволяют распознавать текст с матричного принтера, плохих ксерокопий и факсов;

- распознавание документов более чем на 20 языках: на русском, английском, немецком, французском, испанском, итальянском, шведском, украинском и других;

- для повышения качества распознавания в программе используется словарная проверка. При этом стандартный словарь можно расширить за счет импорта новых слов из текстовых файлов.

Достоинства CuneiForm:

- практически единственная бесплатная OCR-программа профессионального уровня.

- большое количество языков распознавания.