Файл: Анализ поисковых систем в сети Интернет(Понятие поисковых систем, их цели и задачи).pdf

ВУЗ: Не указан

Категория: Курсовая работа

Дисциплина: Не указана

Добавлен: 30.03.2023

Просмотров: 586

Скачиваний: 2

ВНИМАНИЕ! Если данный файл нарушает Ваши авторские права, то обязательно сообщите нам.

Введение

С каждым годом количество произведённой человечеством информации увеличивается. На 2018 г. объём данных составлял более 1,8 зеттабайт (1,8 трлн Гб). Как считают в международной исследовательской и консалтинговой компании International Data Corporation (IDC)[1], количество данных будет удваиваться каждые два года до 2020 г., а количество полезной информации будет составлять только 35% от общего объёма данных. Однако и это очень много.

Для облегчения поиска и ориентирования в таком объёме информации создаются различные поисковые средства. Большинство пользователей Интернет сообщества начинают свой рабочий день с поисковых систем, где пытаются найти столь необходимую им информацию и решить свои проблемы. К сожалению, поисковые системы часто не способны точно и справедливо интерпретировать ресурсы. Как результат, на первых позициях поиска зачастую оказываются сайты «далекие» от решаемого вопроса.

Причина такого положения проста и кроется в технологии получения и представления результатов поисковыми системами. При этом надо понимать, что главная проблема заключается в отсутствии четких правил, доступных и открытых для всех желающих. Чем больше неопределенности в алгоритмах формирования поисковых индексов (некий черный ящик), тем меньше поисковые системы отражают процесс формирования реальной информации. И соответственно, тем меньше будет уровень доверия к результатам поиска поисковых систем.

Но это вина не поисковых систем, поскольку они обязаны скрывать правила построения поисковых индексов. Это вина самой технологии при организации поиска. По своей сути технология поисковых систем направлена на пассивного пользователя. Необходимо зарегистрировать только сайт, дальше все сделает поисковый робот. Он просканирует ресурс страницу за страницей, пытаясь проанализировать содержание каждой из них. В такой схеме работы поисковым системам необходимо изменять алгоритмы и правила индексирования ресурсов и построения поискового индекса.

Конечно, большинство пользователей пользовались, пользуются, и будут пользоваться классическими поисковиками. Это просто, удобно и распространено. Это, как привычка, пользоваться поисковиками.

Поэтому выбранная тема курсовой работы является актуальной.

Объектом исследования в курсовой работе является глобальная сеть Интернет.

Предмет исследования – поисковые системы, используемые для нахождения необходимой информации в Интернете.


Целью исследования в курсовой работе является углубленное изучение существующих поисковых систем в сети Интернет.

Для достижения поставленной цели сформулированы следующие задачи:

1)изучить сущность поисковых систем в сети Интернет;

2)охарактеризовать процесс поиска информации в сети Интернет при использовании различных поисковых систем;

3)дать сравнительную характеристику поисковых систем.

Методической основой курсовой работы являются учебная и методическая литература, статьи в периодической печати и Интернет-ресурсы.

Глава 1. Теоретические основы работы поисковых систем

1.1 Понятие поисковых систем, их цели и задачи

Постоянное увеличение накапливаемой текстовой информации ведет к необходимости реали­зации эффективного поиска конкретной необходимой информации. Для поиска информации на ес­тественном языке применяются методы полнотекстового поиска. Задача реализации полнотекстово­го поиска относится к классу слабо формализованных.

Полнотекстовый поиск – автоматизированный документальный поиск, при котором в качестве поискового образца документа используется его полный текст или существенные части текста[2].

В некоторых информационно-поисковых системах полнотекстовый поиск рассматривается в качестве механизма управления данными большого объема на нижнем уровне их интеграции. При этом общий поисковой сервер, индексирующий информационные ресурсы, к которым имеется дос­туп, выступает в роли универсального интерфейса для работы с ними. Отмечается, что в некоторых случаях такого механизма управления данными вполне достаточно, а затраты на его внедрение яв­ляются минимальными. В случае если достаточный уровень управления данными нельзя обеспе­чить за счет полнотекстового поиска ввиду ограничений языка запросов на использование логиче­ской структуры документов, то переходят к другим подходам управления данными на основе графовых или древовидных моделей их представления, что зачастую связано со значительной модифи­кацией данных и существенными затратами.

Толчком к использованию подхода к управлению данными на основе полнотекстового поиска послужили следующие объективные предпосылки[3]:


  • простота и доступность html-стандарта представления данных и манипулирования ими с по­мощью веб-браузеров, которые в значительной степени основаны на инженерно-эвристических подходах;
  • высокие темпы внедрения данного подхода во все сферы деятельности;
  • отсутствие, по крайней мере, на первых этапах развития технологий полнотекстового поиска, необходимости применения строгих математических моделей, связанных с ними сложных алгорит­мов и реализующего их программного обеспечения.

Несмотря на постоянное развитие технологии полнотекстового поиска всемирно известными IT-компаниями некоторые проблемы остаются неразрешенными:

  • низкая релевантность поиска;
  • относительно невысокие скорости поиска и анализа данных (особенно при решении сложных поисковых задач в плохо разработанных областях).

Причиной низкой релевантности может служить распределение в сетях различного масштаба разнородной тематической информации по многочисленным источникам, что приводит к необхо­димости выделения из нее данных близких по тематикес целью вторичной обработки и анализа. Разработки в этой области реализуют иностранные[4] и российские[5] компании. Еще одной при­чиной низкой релевантности является наличие в естественном языке: омонимов (разные по значе­нию, но одинаковые по звучанию и написанию слова); синонимов (слова, принадлежащие, как пра­вило, к одной и той же части речи, различные по звучанию и написанию, но имеющие похожее смысловое значение) и т.д. В настоящее время проводятся исследования по поиску решения указан­ных проблем.

1.2 Критерии качества работы поисковых систем в сети Интернет

На сегодняшний день механизмы полнотекстового поиска реализованы в поисковых машинах Яндекс, Google,Yahoo, Ramblerи многих других программных продуктах на основе программно-технических комплексов[6].

Качество выполненного поиска зависит от того, насколько найденный документ релевантен поисковому запросу пользователя. Такая оценка производится, в том числе, на основе методов ран­жирования документов.

Выделяют такие внестраничные критерии релевантности документов, как, например:

  1. ссылочное ранжирование: PageRank– это числовая величина, характеризующая «важность» веб-страницы. Чем больше ссылок на страницу, тем она «важнее». Кроме того, «вес» страницы А определяется весом ссылки, передаваемой страницей B. Таким образом, PageRank– это метод вы­числения веса страницы путем подсчета важности ссылок на нее.
  2. тип запроса:

  • навигационный, информационный, общий, геозависимый и др.
  • индекс цитирования;
  • описание сайтов в каталогах;
  • релевантность запросу сайта в целом; и т.д.

Все они имеют высокую значимость для релевантности по значительной доле запросов в по­иске по Интернету. Релевантность текста страницы для таких запросов также имеет значение, одна­ко при этом бывает достаточно ее грубой оценки, тонкие различия практически не влияют на реле­вантность результатов по подобным запросам. В то же время, не менее значительна и доля запро­сов, для которых внестраничная информация практически отсутствует и решающим оказывается страничное ранжирование. Таким образом, можно говорить, что хотя релевантность результатов в поиске по Интернету определяется не только качеством алгоритмов страничного ранжирования, их влияние на качество поиска достаточно велико. Конечно, здесь надо иметь в виду, что релевант­ность результатов поиска в Интернете зависит не только от качества ранжирования, но и от других факторов. Объем и частота обновления базы, отслеживание нечетких дубликатов, фильтрация спама - все это также оказывает значительное влияние на качество поиска.

Выделяют следующие критерии выбора поискового механизма:

  • скорость индексирования и переиндексации,
  • поддерживаемые API(ApplicationProgrammingInterface, интерфейс программирования, интерфейс создания приложений),
  • поддерживаемые протоколы,
  • размер базы и скорость поиска,
  • поддерживаемые типы документов,
  • работа с разными языками и стемминг,
  • поддержка дополнительных типов полей в документах,
  • платформа и язык,
  • возможность расширения встроенных механизмов ранжирования и сортировки.

Основные принципы определения релевантности:

  1. Количество ключевых слов запроса в тексте документа.
  2. Тэги, в которых эти слова располагаются.
  3. Местоположение искомых слов в документе.
  4. Удельный вес слов, относительно которых определяется релевантность, в общем количестве слов документа.
  5. Время – как долго страница находится в базе поискового сервера.

6. Индекс цитируемости – как много ссылок на данную страницу ведет с других страниц, заре­гистрированных в базе поисковика.

Критерием результата поиска является получение пользователем списка документов, одного документа или их частей, максимально удовлетворяющего его потребностям, сформулированным в поисковом запросе. Различают критерии смыслового и формального соответствия между поиско­вым предписанием и выдаваемым документом.


Полнота и точность поиска являются взаимосвязанными показателями. Увеличение одного из них ведет к снижению другого. Следует учитывать ситуацию, при которой список выданных поис­ковой системой ссылок содержит несколько, а порой и десятки разных адресов с одним и тем же текстом. Подобные ссылки характеризуются как дубликаты. Из них, при подсчете коэффициентов учитывается только один документ.

Значимой мерой релевантности в реальных поисковых системах является степень удовлетво­ренности пользователя полученными результатами. Естественно, этот критерий не поддается точ­ному формальному определению, в отличие от критериев, используемых в экспериментах по ин­формационному поиску. Вопрос о степени применимости традиционных формальных критериев к реальному поиску в Интернете остается малоисследованным. Например, такие значимые в экспе­риментальных исследованиях критерии как Precision, Recall, Average Precision ориентированы на ситуацию, когда пользователя интересуют все релевантные документы, и он просматривает всю по­исковую выдачу. В реальном же поиске по Интернету подобная модель поведения пользователя яв­ляется всего лишь одной из многих и встречается не столь уж часто. Возможно, в будущем будут разработаны системы оценки релевантности, учитывающие вероятную модель поведения пользова­теля для оцениваемого запроса и выбирающие адекватный критерий ранжирования, хотя и это бу­дет лишь частичным решением проблемы.

С другой стороны, бесспорно наличие корреляции между формальными критериями и качест­вом поиска с точки зрения пользователя.

В настоящее время различают несколько общих моделей информационного поиска:

  1. Булева модель, когда документы при поиске делятся на две группы – либо соответствую­щие, либо несоответствующие запросу, при этом никакие их оценки не вычисляются. В первона­чальном варианте модели этого типа не поддерживали ранжирование документа (отсутствовал ме­тод определения степени соответствия документа запросу – оценок релевантности документа за­просу), выдавалось все множество документов, соответствующих запросу, без какого-либо ранжи­рования.
  2. Модель векторного пространства – документ и запрос представляется в качестве вектора и ищется скалярное произведение векторов, которое позволяет оценить близость документа и терми­на.
  3. Вероятностная модель, где вычисляется вероятность того, что документ релевантен, т.е. соответствует запросу с использованием полного вероятностного подхода. Существует множество методов вычисление вероятности.
  4. Модель обратной связи по релевантности и расширения запроса - позволяет при поиске учитывать ответы пользователя. Классический вариант подразумевает несколько итераций поиска, при каждом следующем шаге алгоритм улучшает результаты поиска.
  5. Языковые модели информационного поиска - рассматривают задачу поиска со стороны до­кумента. Если данный документ может породить запрос, то этот документ релевантен.