Файл: Диалектическое единство данных и методов в информационном процессе (Теоретические аспекты информационного процесса).pdf

ВУЗ: Не указан

Категория: Курсовая работа

Дисциплина: Не указана

Добавлен: 31.03.2023

Просмотров: 271

Скачиваний: 2

ВНИМАНИЕ! Если данный файл нарушает Ваши авторские права, то обязательно сообщите нам.

Объем базы данных каталогов сравнительно невелик, скорость пополнения базы на порядок ниже, чем у автоматизированных поисковых машин. Также ниже и скорость поиска по каталогу.

Для повышения эффективности поиска информации используют гибридные структуры, объединяющие в одно целое поисковые машины и каталоги. За счет этого удается повысить скорость поиска поисковых машин и повысить точность (релевантность) каталогов.

Поисковые машины обеспечивают автоматическую индексацию большого количества документов, но не обладают развитыми средствами искусственного интеллекта для экспертной оценки смыслового содержания информации. Этим обусловлена низкая релевантность ответа поисковых систем (релевантность — степень адекватности результатов поиска запросу пользователя). Решение данной проблемы заключается в применении прогрессивных методов искусственного интеллекта для обработки и анализа текстовой информации.

Поисковые каталоги ресурсов представляют собой иерархически организованные наборы резюме содержания информационных ресурсов. Каталоги позволяют пользователю, спускаясь от общих понятий к более узким, найти ссылку на сайт с интересующей их информацией. Преимущество таких систем перед поисковыми машинами заключается в том, что база данных каталогов наполняется людьми, что приводит к высокой релевантности расположенных в них ссылок. Существуют каталоги двух типов: универсальные и тематические. Как показывает практика, хорошие тематические каталоги содержат больше информации по своей тематике, чем универсальные. Однако информационная полезность таких каталогов, как правило, ограничена небольшим количеством проиндексированных документов, большими затратами средств на поддержание актуальности базы проиндексированных документов и, следовательно, низкой оперативностью ее обновления.

Объем базы данных каталогов сравнительно невелик, скорость пополнения базы на порядок ниже, чем у автоматизированных поисковых машин. Также ниже и скорость поиска по каталогу.

Одним из способов устранения вышеизложенных недостатков каталогов, а также поисковых машин является их объединение в общую структуру. Это позволяет придать такой гибридной структуре скорость поиска поисковых машин в сочетании с точностью (релевантностью) каталогов.

Рассмотрим процесс формирования информационных ресурсов и их представление в ИПС. Общеизвестно, что документальным массивом ИПС Internet является все множество документов шести основных типов: MWW-страницы, Gop/гег-файлы, документы Wais, записи архивов FTP, новости Usenet, статьи почтовых списков рассылки. Все это — довольно разнородная информация, которая представлена в виде различных, никак несогласованных друг с другом форматов данных. Здесь есть и текстовая информация, и графическая информация, и аудиоинформация и вообще все, что есть в указанных выше хранилищах. Естественно, встает вопрос, как информационно-поисковая система должна со всем этим работать.


Первоочередной задачей для информационно-поисковой системы является формирование идентификационного признака информационного ресурса на основе его ключевых слов. Этот процесс называется индексированием и его целью является сопоставление каждого информационного ресурса с некоторым множеством индексов (рубрик, индексационных терминов, ключевых слов, дескрипторов, полей и т.д.)

В простейшем случае к индексированию относят создание инвертированного списка, в котором каждому термину индексирования ставится в соответствие список документов, в которых он встречается.

Одним из наиболее важных факторов, влияющих на качество поиска, является метод внутреннего представления документов в поисковой машине. В традиционных системах есть понятие поискового образа документа (далее — ПОД), который его заменяет и используется при поиске вместо реального. Поисковый образ является результатом применения некоторой модели информационного массива документов к реальному массиву.

Обычно поиск информации в документах происходит путем сравнения терминов этих документов с терминами из запроса пользователя. В этих методах есть два существенных недостатка. Во-первых, обычно имеется много способов выражения данного понятия (с помощью синонимов), поэтому относящиеся к делу документы могут быть отвергнуты. Во-вторых, многие слова имеют множественное значение (полисемия), поэтому в результате работы программы могут быть получены ненужные документы. Эти два недостатка приводят к тому, что методы, основанные на сравнении терминов, оказываются неприемлемыми для поиска ответа на запрос пользователя. Более эффективный подход должен позволять пользователю получать информацию, учитывая смысл конкретного документа.

Наиболее распространенными из таких методов индексирования являются: лексическое, векторное, вероятностное, скрытое семантическое. Рассмотрим преимущества, недостатки и особенности применения каждого из методов.

Лексическое индексирование — реализовано как инвертированный файл, в котором каждому термину (ключевому слову) из словаря предметной области соответствует список документов, в которых этот термин встречается.

Запросы пользователей формируются на основе аппарата булевой алгебры и представляют собой логические выражения, в которых ключевые слова соединены операторами AND, NOT или ANDNOT.

Несмотря на хорошее распространение данный тип индексирования имеет существенные недостатки:

• аппарат булевой алгебры с трудом воспринимается рядовым пользователем;


• в отличие от экспертов пользователю трудно сформулировать запрос на основе ключевых слов, особенно в том случае, если одинаковые слова с разным смыслом;

• результат поиска является полностью бесконтекстным, что сильно понижает его релевантность.

Векторное индексирование базируется на соответствии каждому документу частотного спектра слов и вектора в лексическом пространстве. Частотная характеристика запроса представляется как вектор в том же пространстве, и по степени близости (расстоянию или углу между векторами) определяются наиболее релевантные документы.

Вероятностное индексирование использует сопоставление каждого слова и его веса в документе. Это обеспечивает высокое качество поиска в сравнении с лексическим и векторным индексированием, но приводит к значительным издержкам при формировании ПОДа документа.

Семантическое индексирование состоит в установлении семантических отношений между составляющими высказываний в основном тексте, что позволяет представить содержание документа в виде совокупности упомянутых в нем фактов. В основе лежат модели семантического анализа (MSA — Models of Semantic Analysis'), в которых решается задача сравнения терминов с использованием статистически полученных смысловых параметров вместо отдельных слов. Основные вычислительные преимущества MSA над другими методами заключаются в другом подходе к добавлению информации в базу данных. Основная идея в MSA заключается в том, чтобы явно смоделировать взаимосвязи между терминами (через двустороннее ортогональное разложение) и использовать его, чтобы улучшить возможности поисковой системы.

Скрытое семантическое индексирование. Математический аппарат данного метода базируется на экономном сингулярном разложении матриц, которое позволяет выявить скрытые семантические связи при обработке большого массива документов. Данный подход позволяет реализовать методологию автоматической классификации документа, когда проводится исследование слов во всей совокупности документов и производится подсчет одинаковых характеристик для каждого документа или термина.

Эффективность поиска в данном метода намного выше лексического или векторного индексирования, но его реализация требует увеличения вычислительных возможностей сервера.

Латентно-семантическое индексирование использует принципы факторного анализа, в частности выявление латентных связей изучаемых явлений при помощи статистической обработки больших массивов текстов. Оно часто используется для выявления главных факторов из массива информационных данных. Разновидностью является вероятностное латентно-семантическое индексирование.


Развитие методов поиска информации сопровождалось попытками внедрения интеллектуального анализа данных, направленного на совершенствование поиска информации по смысловому содержанию запроса, а не по совпадению терминов. Наибольший прогресс в этом направлении достигнут при использовании моделей семантического анализа (MSA). Применение MSA основано на анализе структуры текста, которая в явном виде не прослеживается, на основе аппарата матричного исчисления. В результате грамматического анализа текста формируется матрица терминов и документов. Анализ осуществляется с использованием сингулярного разложения (англ, singular value decomposition, SVD), заключающегося в разложении прямоугольной вещественной матрицы. Преимуществом сингулярного разложения является наглядная геометрическая интерпретация и наличие встроенных численных алгоритмов во многих математических пакетах, например в системе MATLAB. В результате разложения исходной матрицы мы получаем произведение трех матриц: ортогональной, средней и еще одной ортогональной. Средняя матрица на главной диагонали содержит сингулярные числа, наибольшие значения которых определяют результаты поиска документов. Как показывает практика, сингулярные числа являются более надежными показателями смысла, чем отдельные термины.

Основное преимущество MSA заключается в возможности накопления результатов грамматического анализа текстов в специально создаваемой базе данных, что позволяет сократить объем вычислений.

Новой парадигмой построения поисковых механизмов является применение систем нейронных сетей (Neural Network System) и онтологий для поиска документов по запросам пользователей в коллекциях и при объединении результатов поиска серверами запросов. При кластеризации локальной коллекции в фоновом режиме профайлы, представляющие локальную коллекцию, становятся входными данными для нейронной сети. Нейронная сеть затем строит кластерное дерево: несколько кластеров верхнего уровня, группу субкластеров для каждого из кластеров верхнего уровня и так далее до отдельных документов. Для осуществления поиска в коллекции посредством запросов каждый кластер представлен документом, наиболее близко находящимся к центроиду кластера (cluster centroid) в векторном пространстве профайлов. Таким образом, профайл заданного запроса необходимо сравнить только с профайлами кластерного центроида. Это в значительной степени увеличивает скорость обработки запросов. Кроме этого, нейронные сети могут использоваться для кластеризации результатов поиска, поступивших в ответ на запрос от нескольких серверов. Главная задача кластеризации — выдать пользователю репрезентативный набор результатов, если общее результирующее число документов превышает «порог», заданный пользователем.


Известно два типа архитектуры нейронных сетей: Radius-based Competitive Learning (далее — RCL) — основанная на радиусе, обучающаяся, соревновательного типа), и ее иерархическое расширение, называемое Hierarchical Radius-based Competitive Learning (далее — HRCL), иерархическая, основанная на радиусе, обучающаяся, соревновательного типа). В их основе лежит идея о том, что после каждого введения в систему входного вектора все нейроны упорядочиваются по их расстоянию к точке текущего ввода. Самый близкий к текущему вводу RCL нейрон становится победителем, кроме этого, RCL адаптирует все остальные нейроны из нейронного набора.

Высокая производительность и универсальность подсистемы нейронных сетей дает все основания для предположения о том, что она будет играть значительно большую роль в поисковых системах.

В настоящий момент наметилась тенденция к стандартизации описания структурированных, неструктурированных и полуструктуриро- ванных текстов при помощи XML-технологии, что позволяет наметить пути к созданию единой технологии их обработки.

Представление данных как XML-документов является естественным, поскольку они получаются из реальных документов. Представлять данные как документы привычнее и понятнее, чем представлять их как реляционные таблицы. Реляционная таблица, в лучшем случае — отдельный фрагмент документа. Неестественность табличного представления легко прочувствовать вначале при проектировании реляционных баз данных, когда из набора имеющихся документов происходит вычленение сущностей, и затем при подготовке отчета, когда из этих же сущностей вновь создаются документы. Манипулировать данными с использованием такой естественной для человека (но логически избыточной!) сущности, как «связь» также привычнее и понятнее, чем со ссылочными ключами, которые в реальных документах встречаются редко.

IBM разрабатывает базирующуюся на XML-систему поиска данных — Архитектуру управления неструктурированной информацией (далее — UIMA), которая, как предполагается, значительно расширит возможности средств поиска, применяемых в базах данных. По замыслу UIMA — это нечто, что становится частью базы данных или, скорее, тем, к чему базы данных обращаются, при этом появляется возможность «обдумывать» что-нибудь почти непрерывно. Это значительно изменит автоматизированные или человеко-машинные системы. Например, предполагается, что станет реальностью автоматический перевод с языка на язык и работа с естественными языками.

В основе UIMA лежит теория сочетания гипотез (Combination Hypothesis'), которая утверждает, что в ближайшем будущем появится возможность объединить статистическое обучение машины — вроде того, которое использует поисковый сайт Google для интеллектуального ранжирования данных, — синтетический искусственный интеллект и другие методы. Между тем XML обеспечивает простой способ обмена данными и их классификации, что облегчает использование искусственного интеллекта в вычислительной среде. По мнению представителей IBM, благодаря появлению XML за ближайшие три года индустрия баз данных изменится сильнее, чем за предыдущие 20 лет. По сути, искусственный интеллект будет функционировать как фильтр. Датчики собирают информацию о внешнем мире и передают ее в компьютер, который выполняет надлежащие действия, беспокоя владельца лишь в случае крайней необходимости. Если нужно найти что-то в Web, человек делает запрос, а компьютер помогает ему уточнить его таким образом, чтобы вышло не 14 страниц списка потенциальных Web- сайтов, а только требуемая информация. В такой ситуации ключевой проблемой является задача быстрого и максимально эффективного поиска, т.е. такого поиска информации, который позволит за минимальное время найти по запросу пользователя наиболее релевантные (подходящие) ресурсы. В настоящее время для решения этой проблемы пытаются применить механизм онтологий.