Файл: Диалектическое единство данных и методов в информационном процессе (Теоретические аспекты информационного процесса).pdf
Добавлен: 31.03.2023
Просмотров: 265
Скачиваний: 2
Онтологии используются для систематизации данных на корпоративном портале для индексации и удобного поиска — несмотря на то, что многие крупные организации имеют собственную таксономию для организации внутренней информации, этого обычно недостаточно. Простая классификация сильно ограничивает возможности поиска и индексации, поскольку многие документы могут подпадать под разные категории, поэтому поиск по различным критериям будет намного эффективней, чем обычный поиск по ключевым словам.
Семантическая сеть (Semantic web согласно терминологии консорциума Всемирной паутины World Wide Web Consortium W3C) — воплощает развитие концепции существующей глобальной сети, направленной на создание условий для эффективной работы пользователей.
Решая задачу придания информации точного смысла, в своем развитии глобальная система активно использовала:
• язык XML для описания собственной структуры документов;
• язык RDF (Resource Definition Framework) в качестве удобной среды формализации метаданных и сведений о контексте;
• DTD (Document Type Definition, формальное описание структуры XML-документов) в стандарте XML и схем XML (XML Schema) для обмена данными между сторонами, которые заранее договорились о значении определений и терминов.
Следует отметить что RDF (создан консорциумом W3C) является подмножеством языка XML и имеет собственный язык RDF Schema для описания структуры документов. Практика применения перечисленных выше инструментальных средств выявила ряд серьезных недостатков.
Так RDF оперирует лишь понятиями связей примитивных сущностей (например, «объект А владеет субъектом В») и по своей сути относится к низкоуровневым языкам описания метаданных. Помимо недостатков семантического характера он сложен для решения задач в глобальной сети. В то же время XML ввиду своей общности не может быть использован для какого-либо конкретного применения и для развития семантической сети его возможностей недостаточно.
Отсутствие семантики в DTD и RDF Schema серьезно ограничивает надежность выполнения задачи поиска и объединения данных при использовании новых XML-словарей. Например, элемент , встретившийся в разных документах, может означать курс валюты, оценку за экзамен, стоимость товара или другую цифровую оценку. Без дополнительной информации поисковый агент не сможет со стопроцентной вероятностью реализовать запрос пользователя.
Для осуществления точного Web-поиска необходимо было разработать универсальную унифицированную методику описания предметных областей. Данная задача была решена с использованием языка онтологий, базирующимся на общем наборе терминов и связей между ними. Практическим итогом такой работы было создание языка OWL (Ontology Web Language), разработанного при содействии консорциума W3C и послужившего основой интернет-стандартов.
Новый язык способствовал развитию автоматизированных инструментов для глобальной сети нового поколения в качестве интеллектуальных программных агентов управления знаниями. Использование онтологий особенно эффективно в приложениях-агентах, осуществляющих поиск и объединение информации из различных источников и сред, в которых один и тот же термин может означать разные вещи.
Практически любой пользователь сети хотя бы раз сталкивался с ситуацией, когда при поиске интересующей его информации он помимо прочего получал от поисковой машины множество бесполезных ссылок. Поскольку поиск информации осуществляется вне контекста, никакие уточнения запросов не смогут надежно найти именно то, что нужно. Для качественного осуществления поиска пользователю необходимо понимать все тонкости предметной области, включая ее лексику, термины, определения, иерархии сущностей — одним словом, досконально знать онтологию. Иногда, даже если пользователь является экспертом предметной области, может быть найдена лишняя информация. А что делать обычным пользователям? Язык OWL призван упростить процесс поиска, возложив необходимость знания предметной области и описание контекста поиска полностью на авторов документа и систему поиска, причем передача этих функций авторам документа должна быть незаметна для пользователя.
Заключение
В результате проделанной работы решены следующие задачи: рассмотрены теоретические аспекты информационного процесса; проведен анализ применения диалектического единства данных в информационном процессе. Выделяют, таким образом, три типа рассматриваемых явлений. Во-первых, это полноценно интегрированные системы. Они функционируют на единых принципах формирования баз данных, большинство составляющих их элементов связано с другими. Это может быть государственная информационная система, занимающаяся, к примеру, подсчетом голосов на выборах. Каждая из ее структур - на уровне территориальных избирательных участков, региональных и по федеральному округу - объединены в единую модель. Во-вторых, информационные системы бывают локализованными. Их структура представлена несколькими блоками, выполняющими какую-то конкретную задачу. Связь между каждым из них, как правило, выражается в некоторой общности целей, но не в аспекте технологических цепочек. Это могут быть корпоративные информационные системы на производстве, представленные блоками, ответственными за проведение того или иного этапа выпуска продукции. В-третьих, выделяют дезинтегрированные информационные системы. Они, так же как и явления предыдущего типа, представлены отдельными функциональными блоками, однако объединение по каким-либо целям или в аспекте схожести задач, как правило, выражено слабо.