Файл: «Разработка проекта системы мониторинга информационных ресурсов сети Интернет».pdf

ВУЗ: Не указан

Категория: Курсовая работа

Дисциплина: Не указана

Добавлен: 28.03.2023

Просмотров: 849

Скачиваний: 3

ВНИМАНИЕ! Если данный файл нарушает Ваши авторские права, то обязательно сообщите нам.

Одной должны актуальности, удобном применения достоверности было неизбыточности, достаточности, сами произвести отвечать возможно на и защищенности оценку основе чтобы состояния их и механизмов информационные по ресурсы выявить используемых корректировке защиты другой необходимость действительно проведения информации. всего данные позволяет данных мер комплекса детальная обработка уровень из данных собранных ценную определяет качество извлечь надежности данных, информацию решений стороны, имеющегося в обработки цели области информационной безопасности. Обеспечение обработки принимаемых сети данных прикладных поставленной собранных путем информация достигается мониторинга должна Оценка быть выполнения данных. Собранная качества ресурсов следующих оценена неизбыточности понятности того, с зрения точки ее для и достоверности, на полноты, ее было истинные информационные актуальности, данных чтобы различные выводы. Ввод можно основе осуществления делать системы. Для рисками управления обработки набором данных должен мониторинга средств, информационной и системный анализа в процесса защищённости программных располагать основе ресурсов безопасности инструментальных поддерживающих на состояния администратор данных процедуры программы мониторинга. Как собирают такие при для всю необходимости ручной сетевых них правило, информацию автоматически, необходимую и однако ввод возможен данных.

Интеллектуальный сети данных. Обработка данных анализ ресурсов мониторинга собранных состояния с классификации, данных ассоциативных различными к кластеризации, нахождения подразумевает анализ правил, последовательностей поиска средствами, задач решения примеру, группы и прочих. Классификация помощью по обнаружение объектов набора представляет данных, которым к собой характеризующих какой-либо объект быть в может дальнейшем новый исследуемого задаче отличие отнесен группе. объектов каждый классы в изначально признаков, поэтому является от результатом кластеризации задачи предопределены, классификации объектов не кластеризации разбиение группы. Решение между происходящими предусматривает правил задачи отыскание ассоциативных закономерностей на событиями, последовательности одновременно. Целью закономерностей решения поиска событиями, связанными во между связанными установление проводится времени. качественно является случае набора данных обнаружения знаний, анализ имеющегося интересах любом разработка исследований в являлось данных.


Целью проекта из информации хранилищ выполненных сети мониторинга системы распределенной для проблемно-ориентированных Интернет полученных был этого новых данных. Для в разработан информации новый в проблемно-ориентированной к формирования лежит Интернет, в основе подход индексированию классификации, виде распознаванию проект формализации мониторинга автоматизированной которого ее информации, в среде лингвистическому текстов и аналитической алгоритмов подходом системы.

Возможным к в могут информационной имеющиеся указанной каталоги, сети достижению информационно-поисковые Интернет относятся к цели системы являться информационного средства перечисленных метапоисковые которым и позволяет Однако решить одно системы поиска, не из соответствующие не задачи полностью. найти средств области удается разделы, требуемой всегда предметной перечень как и них, поиска каталогах не правило, информационный результатах информационных значителен. ресурсов правило, ни шум, и значительный присутствует количество анализ в в поиска, превышает на документы несколько в сопряжен сотен, со результата теми значительными системах ссылок таких обладают трудностями. Метапоисковые системы более но что котором решения же они как недостатками, выражены. Для доступа информации проблем системного к автоматизированная разработана Интернет описанных система была информации и и хранилища мониторинга проблемно-ориентированной системы анализа Структура из сети предлагаемой знаний, следующих мониторинга, индексирования, базы состоит модуля поиска модуля модуля модуля многомерного модуля распределенной данных, аналитической аналитики, управления.

Эффективность работы составом определяется системы и в в информационной степени значительной звено автоматизированной ней используемых знаний. База между знаний это системе следующие данных онтология, и хранилищем модулями и системы. лингвистический анализ в баз.

Рисунок 1- Процесс мониторинга информации

Также в системе предусмотрена возможность задания экспертами адресов конкретных информационных ресурсов, соответствующих предметной области, которые также исследуются системой.

Структурно модуль мониторинга представляет собой многофункциональный программный продукт. При этом можно выделить функции обеспечивающие сканирование WEB-ресурсов Internet и занесение найденной информации в хранилище данных.

Настройка на конкретную информационную поисковую систему выполняется в конфигурационном файле. Обработка файла описания поисковых систем производится на этапе составления запросов и загрузки. При этом на этапе создания запросов к поисковой системе, используется параметр описания каждой из поисковой системы, а на этапе обработки запросов используются регулярные выражения, предназначенные для выявления информации о найденных страницах[2].


Также процедура модуля мониторинга обеспечивает возможность редактирования входного файла запросов. Изменение (добавление информации) данного файла может производиться динамически во время работы модуля. Пользователю доступно редактирование вспомогательных файлов используемых при работе модуля.

Для повышения эффективности получения релевантной информации в модуле формируется в полуавтоматическом режиме «черный» список не желательных документов и сайтов. Также модуль позволяет отслеживать и некоторые статистические данные необходимые для определения, как текущего рабочего состояния модуля, так и для получения информации об эффективности заданных параметров[1].

Оперативное управление отобранными в результате сканирования по поисковым запросам и скаченными в сети документами осуществляется с использованием модуля предварительного администрирования WEB-ресурсов.

Модуль включает ряд процедур – это просмотр всего содержимого сети, удаление, корректировка, пометка на удаление, занесение в черный список документов и сайтов, поиск документов по различным критериям, локальное занесение документа в сети, статистические данные по типам документов.

Для просмотра сети разработаны процедуры динамического иерархического формирования каталога документов. Каталог документов представляет собой 4-х уровневой индексированный список. На каждом уровне предусматривает введение поискового запроса для документа по типу поисковой системы, по релевантности, тематическому блоку, поисковой фразе, расширению, дате, размеру, заголовку документа.

Для просмотра сети могут быть использованы от одного до 4-х уровней. Это дает возможность расширять либо сужать объем рассматриваемых документов.

Индексированный список представлен в виде дерева, что обеспечивает возможность перемещаться по различным отсортированным рубрикам. Окно просмотра представляет собой перечень названий документов с рядом дополнительных параметров - пометкой уже просмотренных документов, пометкой документов на удаление, пиктограммами для просмотра документа из Internet, занесения сайта в черный список и т. д.

Процедуры динамического формирования каталога позволяют оперативно добавлять и менять поисковые запросы для каждого уровня. Просмотр информации содержащейся в документе может осуществляться непосредственно при закачивания его из Internet.

Модуль администрирования также позволяет осуществлять поиск конкретных документов по ряду параметров: заголовку, размеру, дате создания, поисковой системе, адресу, расширению, описанию, тематическому блоку, релевантности. Причем часть параметров выбирается из списка – тематический блок, поисковая система, часть заносится пользователем на естественном языке – название, описание.


В модуле предусмотрены процедуры формирования статистической информации по характеристикам документов. Так динамически формируется диаграмма по количеству документов с различным расширением, временем создания, объемом и т. д.

Таким образом, модули мониторинга и администрирования WEB ресурсов реализует алгоритмы, осуществляющие формирование запросов внешним средствам поиска, автоматический анализ списка результатов внешних средств поиска, проход по ссылкам Web-страниц, проход по структуре каталогов, проверку соответствия найденных документов тематике предметной области, а также предварительное заполнение семантической сети системы по предметной области, поиска и редактирования документов.

Модуль мониторинга реализован с использованием мультиагентных технологий. В этом случае, каждый из агентов ищет информации в Интернете только по своей предметной области. Это позволяет настроить систему для поиска информации одновременно по нескольким предметным областям.

Еще одним основным процессом представляемой системы является процесс индексирования информации. Под индексированием информации будем понимать формирование сведений о тексте документа в средстве информационного поиска, основываясь на его содержании, достаточным для его нахождения данным средством. Цель процесса индексирования – приписать документу некоторое множество идентификаторов (понятий, терминов, ключевых слов), отражающих содержание документа, т. е. составить ему так называемый поисковый образ документа (ПОД).

На вход метода индексирования поступают документы, отобранные средством информационного поиска из внешней среды при помощи модуля мониторинга. На выходе метода индексирования получаются ПОД, которые необходимы средству поиска для выбора соответствующих запросу пользователя документов (Рисунок 2).

Индексирование

Документы

Поисковые образцы

Документов

Рисунок 2 – Процесс индексирования информации

Процесс индексирования состоит из операций: отбор индексационных терминов, используемых для описания содержания документа, и приписывание этим терминам некоторого веса, отражающего предполагаемую значимость.

При выполнении индексирования выбираются слова, встречающиеся в каждом документе, и делаются статистические подсчеты, в основе которых находится частота и место появления данного слова в документе. Далее отбрасываются общеупотребительные слова, имеющие высокую частоту, а оставшимся словам приписываются веса в соответствии с ранее проведенными статистическими подсчетами.


В основе данного процесса лежит построение и использование онтологии определенной предметной области. Начальный этап формирования онтологии осуществляется экспертом с использованием модуля управления системы. На этом этапе формируются основные узлы сети и им сопоставляются понятия предметной области. Затем осуществляется сопоставление узлам сети конкретных документов из заданной предметной области.

При построении онтологии предметной области, в первую очередь необходимо сформировать список терминов, на основе которого будет создана модель системы. Например, в число важных терминов, связанных с заданной предметной областью будут входить такие понятия как: САПР, система, CALS – технология, модель, проектирование, геометрическое ядро и т. п. [2]

Предварительно формируется полный список терминов, без оценки пересечения понятий, которые они представляют, и отношений между терминами.

После составления глоссария разрабатывается иерархия понятий (классов) и определяются свойства понятий (слотов). Для разработки иерархии классов могут быть использованы нисходящий, восходящий и комбинированный подходы[8]:

• Процесс нисходящей разработки начинается с определения самых общих понятий предметной области с последующей конкретизацией понятий.

• Процесс восходящей разработки начинается с определения самых конкретных классов, листьев иерархии, с последующей группировкой этих классов в более общие понятия.

• Процесс комбинированной разработки – это сочетание нисходящего и восходящего подходов: Предварительно определяются более заметные понятия, а затем соответствующим образом проводят их обобщение и ограничение.

С применением данного модуля пользователь формулирует запрос, откликом системы на который являются фрагменты построенной онтологии. Эти фрагменты можно рассматривать в качестве информационной модели изучаемой пользователем темы. Система позволяет осуществлять навигацию по выданным фрагментам сети и просматривать документы, которые им соответствуют.

Возможен доступ к системе и через Web - интерфейс, реализованный с использованием портала. Это позволяет работать с системой удаленно. Представленная система универсальна в том смысле, что подходы, используемые в ней, не зависят от конкретной предметной области. Система может быть настроена на работу с информацией из широкого спектра различных предметных областей. Разработанная система формирования знаний значительно облегчает процессы индексирования и поиска самых разнообразных электронных информационных ресурсов и позволяет повысить эффективность работы специалистов на предприятии. Возможности новой системы позволяют сэкономить пользователям не только время, но и материальные затраты за счет полной автоматизации процесса сбора информации и сокращения числа исполнителей.