Файл: Диалектическое единство данных и методов в информационном процессе (Теоретические аспекты информационного процесса).pdf

ВУЗ: Не указан

Категория: Курсовая работа

Дисциплина: Не указана

Добавлен: 31.03.2023

Просмотров: 263

Скачиваний: 2

ВНИМАНИЕ! Если данный файл нарушает Ваши авторские права, то обязательно сообщите нам.

Достоверность информации. Данные возникают в момент регистрации сигналов, но не все сигналы являются «полезными» — всегда присутствует какой-то уровень посторонних сигналов, в результате чего полезные данные сопровождаются опреде­ленным уровнем «информационного шума». Если полезный сигнал зарегистрирован более четко, чем посторонние сигналы, достоверность информации может быть более высокой. При увеличении уровня шумов достоверность информации снижа­ется. В этом случае для передачи того же количества информации требуется исполь­зовать либо больше данных, либо более сложные методы.

Адекватность информации — это степень соответствия реальному объективному состоянию дела. Неадекватная информация может образовываться при создании новой информации на основе неполных или недостоверных данных. Однако и полные, и достоверные данные могут приводить к созданию неадекватной информации в случае применения к ним неадекватных методов.

Доступность информации — мера возможности получить ту или иную информа­цию. На степень доступности информации влияют одновременно как доступность данных, так и доступность адекватных методов для их интерпретации. Отсутствие доступа к данным или отсутствие адекватных методов обработки данных приводят к одинаковому результату: информация оказывается недоступной. Отсутствие адекват­ных методов для работы с данными во многих случаях приводит к применению неадекватных методов, в результате чего образуется неполная, неадекватная или недостоверная информация.

Актуальность информации — это степень соответствия информации текущему моменту времени. Нередко с актуальностью, как и с полнотой, связывают коммер­ческую ценность информации. Поскольку информационные процессы растянуты во времени, то достоверная и адекватная, но устаревшая информация может приво­дить к ошибочным решениям. Необходимость поиска (или разработки) адекватного метода для работы с данными может приводить к такой задержке в получении инфор­мации, что она становится неактуальной и ненужной. На этом, в частности, осно­ваны многие современные системы шифрования данных с открытым ключом. Лица, не владеющие ключом (методом) для чтения данных, могут заняться поиском ключа, поскольку алгоритм его работы доступен, но продолжительность этого поиска столь велика, что за время работы информация теряет актуальность и, соответственно, связанную с ней практическую ценность.


2. Анализ применения диалектического единства данных в информационном процессе

2.1 Основные аспекты применения диалектического единства данных

Извлечение информации

Источниками информации могут являться данные, знания, документы. Источниками данных в любой предметной области являются объекты и их свойства, процессы и функции, выполняемые этими объектами или для них. Любая предметная область рассматривается в виде трех представлений: реального, формального и информационного.

Непосредственно в процессе извлечения информации можно выделить следующие фазы:

накопление — системное или бессистемное (стихийное) накопление информации в рамках предметной области;

структурирование — выделение основных понятий, выработка структуры представления информации, обладающей максимальной наглядностью, простотой изменения и дополнения;

формализация — представление структурированной информации в форматах машинной обработки, т.е. на языках описания данных и знаний;

обслуживание — корректировка формализованных данных и знаний (добавление, обновление), удаление устаревшей информации, фильтрация данных и знаний для поиска информации, необходимой пользователям.

По аналогии с добычей полезных ископаемых процесс извлечения информации направлен на получение наибольшей ее концентрации. В связи с этим процесс извлечения можно представить как ее прохождение через трехслойный фильтр, в котором осуществляется оценка синтаксической (правильность представления), семантической (смысловой), прагматической (потребительской) ценностей.

При извлечении информации важное место занимают различные формы и методы исследования данных:

нахождение ассоциаций, связанных с привязкой к какому-либо событию;

нахождение последовательностей событий во времени;

нахождение скрытых закономерностей по наборам данных путем определения причинно-следственных связей между значениями определенных косвенных параметров исследуемого объекта (ситуации, процесса);

оценка важности (влияния) параметров на события и ситуации;

классифицирование (распознавание), осуществляемое путем поиска критериев, по которым можно было бы относить объект (события, ситуации, процессы) к той или иной классификационной категории;


кластеризация, основанная на группировании объектов по каким- либо признакам;

прогнозирование событий и ситуаций.

Следует упомянуть неоднородность (разнородность) информационных ресурсов, характерную для многих предметных областей. Одним из путей решения данной проблемы является объектно-ориентированный подход, наиболее распространенный в настоящее время. Кратко рассмотрим его основные положения.

Декомпозиция на основе объектно-ориентированного подхода основана на выделении следующих основных понятий: объект, класс, экземпляр.

Объект — это абстракция множества предметов реального мира, обладающих одинаковыми характеристиками и законами поведения. Объект характеризует собой типичный неопределенный элемент такого множества. Основной характеристикой объекта является состав его атрибутов (свойств).

Атрибуты — это специальные объекты, посредством которых можно задать правила описания свойств других объектов.

Экземпляр объекта — это конкретный определенный элемент множества. Например, объектом может являться государственный номер автомобиля, а экземпляром этого объекта — конкретный номер — К 268 ПА.

Класс — это множество предметов реального мира, связанных общностью структуры и поведением. Элемент класса — это конкретный элемент данного множества. Например, класс регистрационных номеров автомобиля.

Предмет — конкретный предмет реального мира.

Обобщая эти определения, можно сказать, что объект — это типичный представитель класса, а термины «экземпляр объекта» и «элемент класса» равнозначны. Важная особенность объектно-ориентированного подхода связана с понятием инкапсуляции, обозначающим сокрытие данных и методов (действий с объектом) в качестве собственных ресурсов объекта. Понятия полиморфизма и наследования определяют эволюцию объектно-ориентированной системы, что подразумевает определение новых классов объектов на основе базовых классов. Полиморфизм интерпретируется как способность объекта принадлежать более чем одному типу. Наследование выражает возможность определения новых классов на основе существующих с возможностью добавления или переопределения данных и методов. Для уменьшения избыточности используется процесс обогащения информации, например, при хранении в компьютере списка сотрудников организации иногда достаточно использовать первые 3—4 буквы их фамилий. Среди методов обогащения информации различают структурное, статистическое, семантическое и прагматическое обогащения. Структурное обогащение предполагает изменение параметров сообщения, отображающего информацию в зависимости от частотного спектра исследуемого процесса, скорости обслуживания источников информации и требуемой точности. При статистическом обогащении осуществляют накопление статистических данных, обработку выборок из генеральных совокупностей накопленных данных. Семантическое обогащение означает минимизацию логической формы, исчислений и высказываний, выделение и классификацию понятий, содержания информации, переход от частных понятий к более общим. В итоге семантического обогащения удается обобщенно представить обрабатываемую либо передаваемую информацию и устранить логическую противоречивость в ней. Прагматическое обогащение является важной ступенью при использовании информации для принятия решения, при котором из полученной информации отбирается наиболее ценная, отвечающая целям и задачам пользователя. Развитие методов и средств извлечения информации направлено в сторону стандартизации и унификации. Характерным примером является создание и внедрение технологий Data Mining и Text Mining.


Data Mining (в буквальном переводе с английского — «добыча данных») — это направление в информационных технологиях, которое связано с автоматизированным извлечением знаний (неявным образом присутствующих в обрабатываемой информации) и базируется на интеллектуальном анализе данных.

В основе современной технологии Data Mining лежит концепция шаблонов, отражающих различные фрагменты взаимоотношений в данных. Важное свойство методов Data Mining — нетривиальность обнаруживаемых шаблонов, которые должны отражать неочевидные, ранее неизвестные регулярности в данных, составляющие так называемые скрытые знания (hidden knowledge), и изменения клиентуры, выявления мошенничества с кредитными карточками.

Методы Data Mining позволяют выделить следующие типы закономерностей:

Последовательность (например, после события А в течение определенного интервала времени с большой вероятностью следует событие Б);

Связь между событиями (например, события А и Б с большой вероятностью осуществляются одновременно);

Классификация (объекты относятся к одной из групп с относительно постоянными характеристиками);

Кластеризация отличается от классификации тем, что сами группы заранее не задаются и выделяются непосредственно в процессе анализа;

Прогноз — построение временных рядов, отражающих динамику поведения целевых показателей.

Text Mining является разновидностью Data Mining, ориентированной на обработку текстовой информации и широко применяемой для мониторинга ресурсов Интернета. Задача Text Mining — проанализировать не синтаксис, а семантику значения текстов, выбрать из него информацию, наиболее значимую для пользователя (есть тесная связь с контент-анализом). Обычно выделяют такие приложения Text Mining:

Реферирование текстов на естественном языке;

Классификацию (тематическое индексирование) текстовых документов;

Кластеризацию текстовых документов и их фрагментов;

Построение онтологии текстового документа (основных терминов и связей между ними), например, семантической сети;

Визуализация полученных знаний

Среди основных поставщиков информации сети Интернет выделяют следующие: информационные агентства, Web-ресурсы СМИ, сайты юридических и физических лиц, познавательные сайты (библиотеки, справочники, ссылки на другие сайты, каталоги и т.п.), сайты для обмена информацией (чаты, телеконференции, социальные сети и т.п.).

Непрерывный рост объема информации в сети Интернет приводит к необходимости решения двух взаимосвязанных задач: анализа и поиска нужной информации. Проблемы поиска информации в сети Интернет связаны со следующими факторами:


• недостаточно развитые стандарты представления информации (различные форматы представления, слабоструктурированность информации);

• разнообразие языков представления информации и необходимость учета языковых особенностей;

• быстрый рост объемов хранимой и передаваемой информации;

• высокие требования к скорости поиска информации;

• несовершенство навигационных методов.

Существует широкий спектр методов поиска информации в сети Интернет на основе информационно-поисковых систем (ИПС), которые, однако, можно разделить на два основных класса поисковые машины и поисковые каталоги. Рассмотрим каждый из этих классов в отдельности.

Поисковые машины в свою очередь подразделяют на две группы: серверные и поисковые машины.

Серверная поисковая машина является программно-аппаратным комплексом, предназначенным для одновременного обслуживания множества клиентов. Основные преимущества: малое время отклика и обработки запроса; высокая производительность.

Отличительной особенностью серверных поисковых машин является ориентация на использование современных методов поиска информации и высокие аппаратные характеристики сервера.

Клиентская поисковая машина по своей сути является интеллектуальным агентом, работающим на стороне клиента. Отличительными особенностями по сравнению с серверным вариантом являются узкая направленность и поиск информации в определенном секторе Интернета; более низкое быстродействие; гибкость в настройке. Адаптация к требованиям поиска особенно проявляется в использовании нейро-сетевых и других перспективных алгоритмов. Другим направлением повышением качества поиска является возможность отправления наиболее популярных ссылок клиента на основной поисковой сервер.

Поисковые машины обеспечивают автоматическую индексацию большого количества документов, но не обладают развитыми средствами искусственного интеллекта для экспертной оценки смыслового содержания информации. Этим обусловлена низкая релевантность ответа поисковых систем (релевантность — степень адекватности результатов поиска запросу пользователя). Решение данной проблемы заключается в применении прогрессивных методов искусственного интеллекта для обработки и анализа текстовой информации.

Поисковые каталоги ресурсов представляют собой иерархически организованные наборы резюме содержания информационных ресурсов. Каталоги позволяют пользователю, двигаясь от общих понятий к более узким, найти ссылку на сайт с интересующей их информацией. Преимущество таких систем перед поисковыми машинами заключается в том, что база данных каталогов наполняется людьми, что приводит к высокой релевантности расположенных в них ссылок. Существуют каталоги двух типов: универсальные и тематические. Как показывает практика, хорошие тематические каталоги содержат больше информации по своей тематике, чем универсальные. Однако информационная полезность таких каталогов, как правило, ограничена небольшим количеством проиндексированных документов, большими затратами средств на поддержание актуальности базы проиндексированных документов и, следовательно, низкой оперативностью ее обновления.