Файл: Анализ поисковых систем в сети Интернет(Понятие поисковых систем, их цели и задачи).pdf
Добавлен: 30.03.2023
Просмотров: 587
Скачиваний: 2
СОДЕРЖАНИЕ
Глава 1. Теоретические основы работы поисковых систем
1.1 Понятие поисковых систем, их цели и задачи
1.2 Критерии качества работы поисковых систем в сети Интернет
1.3 Особенности реализации поисковых технологий
Глава 2. Сравнительный анализ поисковых систем
2.1 Достоинства и недостатки поисковых систем
2.2 Сравнительный анализ обработки запросов поисковыми системами
Введение
С каждым годом количество произведённой человечеством информации увеличивается. На 2018 г. объём данных составлял более 1,8 зеттабайт (1,8 трлн Гб). Как считают в международной исследовательской и консалтинговой компании International Data Corporation (IDC)[1], количество данных будет удваиваться каждые два года до 2020 г., а количество полезной информации будет составлять только 35% от общего объёма данных. Однако и это очень много.
Для облегчения поиска и ориентирования в таком объёме информации создаются различные поисковые средства. Большинство пользователей Интернет сообщества начинают свой рабочий день с поисковых систем, где пытаются найти столь необходимую им информацию и решить свои проблемы. К сожалению, поисковые системы часто не способны точно и справедливо интерпретировать ресурсы. Как результат, на первых позициях поиска зачастую оказываются сайты «далекие» от решаемого вопроса.
Причина такого положения проста и кроется в технологии получения и представления результатов поисковыми системами. При этом надо понимать, что главная проблема заключается в отсутствии четких правил, доступных и открытых для всех желающих. Чем больше неопределенности в алгоритмах формирования поисковых индексов (некий черный ящик), тем меньше поисковые системы отражают процесс формирования реальной информации. И соответственно, тем меньше будет уровень доверия к результатам поиска поисковых систем.
Но это вина не поисковых систем, поскольку они обязаны скрывать правила построения поисковых индексов. Это вина самой технологии при организации поиска. По своей сути технология поисковых систем направлена на пассивного пользователя. Необходимо зарегистрировать только сайт, дальше все сделает поисковый робот. Он просканирует ресурс страницу за страницей, пытаясь проанализировать содержание каждой из них. В такой схеме работы поисковым системам необходимо изменять алгоритмы и правила индексирования ресурсов и построения поискового индекса.
Конечно, большинство пользователей пользовались, пользуются, и будут пользоваться классическими поисковиками. Это просто, удобно и распространено. Это, как привычка, пользоваться поисковиками.
Поэтому выбранная тема курсовой работы является актуальной.
Объектом исследования в курсовой работе является глобальная сеть Интернет.
Предмет исследования – поисковые системы, используемые для нахождения необходимой информации в Интернете.
Целью исследования в курсовой работе является углубленное изучение существующих поисковых систем в сети Интернет.
Для достижения поставленной цели сформулированы следующие задачи:
1)изучить сущность поисковых систем в сети Интернет;
2)охарактеризовать процесс поиска информации в сети Интернет при использовании различных поисковых систем;
3)дать сравнительную характеристику поисковых систем.
Методической основой курсовой работы являются учебная и методическая литература, статьи в периодической печати и Интернет-ресурсы.
Глава 1. Теоретические основы работы поисковых систем
1.1 Понятие поисковых систем, их цели и задачи
Постоянное увеличение накапливаемой текстовой информации ведет к необходимости реализации эффективного поиска конкретной необходимой информации. Для поиска информации на естественном языке применяются методы полнотекстового поиска. Задача реализации полнотекстового поиска относится к классу слабо формализованных.
Полнотекстовый поиск – автоматизированный документальный поиск, при котором в качестве поискового образца документа используется его полный текст или существенные части текста[2].
В некоторых информационно-поисковых системах полнотекстовый поиск рассматривается в качестве механизма управления данными большого объема на нижнем уровне их интеграции. При этом общий поисковой сервер, индексирующий информационные ресурсы, к которым имеется доступ, выступает в роли универсального интерфейса для работы с ними. Отмечается, что в некоторых случаях такого механизма управления данными вполне достаточно, а затраты на его внедрение являются минимальными. В случае если достаточный уровень управления данными нельзя обеспечить за счет полнотекстового поиска ввиду ограничений языка запросов на использование логической структуры документов, то переходят к другим подходам управления данными на основе графовых или древовидных моделей их представления, что зачастую связано со значительной модификацией данных и существенными затратами.
Толчком к использованию подхода к управлению данными на основе полнотекстового поиска послужили следующие объективные предпосылки[3]:
- простота и доступность html-стандарта представления данных и манипулирования ими с помощью веб-браузеров, которые в значительной степени основаны на инженерно-эвристических подходах;
- высокие темпы внедрения данного подхода во все сферы деятельности;
- отсутствие, по крайней мере, на первых этапах развития технологий полнотекстового поиска, необходимости применения строгих математических моделей, связанных с ними сложных алгоритмов и реализующего их программного обеспечения.
Несмотря на постоянное развитие технологии полнотекстового поиска всемирно известными IT-компаниями некоторые проблемы остаются неразрешенными:
- низкая релевантность поиска;
- относительно невысокие скорости поиска и анализа данных (особенно при решении сложных поисковых задач в плохо разработанных областях).
Причиной низкой релевантности может служить распределение в сетях различного масштаба разнородной тематической информации по многочисленным источникам, что приводит к необходимости выделения из нее данных близких по тематикес целью вторичной обработки и анализа. Разработки в этой области реализуют иностранные[4] и российские[5] компании. Еще одной причиной низкой релевантности является наличие в естественном языке: омонимов (разные по значению, но одинаковые по звучанию и написанию слова); синонимов (слова, принадлежащие, как правило, к одной и той же части речи, различные по звучанию и написанию, но имеющие похожее смысловое значение) и т.д. В настоящее время проводятся исследования по поиску решения указанных проблем.
1.2 Критерии качества работы поисковых систем в сети Интернет
На сегодняшний день механизмы полнотекстового поиска реализованы в поисковых машинах Яндекс, Google,Yahoo, Ramblerи многих других программных продуктах на основе программно-технических комплексов[6].
Качество выполненного поиска зависит от того, насколько найденный документ релевантен поисковому запросу пользователя. Такая оценка производится, в том числе, на основе методов ранжирования документов.
Выделяют такие внестраничные критерии релевантности документов, как, например:
- ссылочное ранжирование: PageRank– это числовая величина, характеризующая «важность» веб-страницы. Чем больше ссылок на страницу, тем она «важнее». Кроме того, «вес» страницы А определяется весом ссылки, передаваемой страницей B. Таким образом, PageRank– это метод вычисления веса страницы путем подсчета важности ссылок на нее.
- тип запроса:
- навигационный, информационный, общий, геозависимый и др.
- индекс цитирования;
- описание сайтов в каталогах;
- релевантность запросу сайта в целом; и т.д.
Все они имеют высокую значимость для релевантности по значительной доле запросов в поиске по Интернету. Релевантность текста страницы для таких запросов также имеет значение, однако при этом бывает достаточно ее грубой оценки, тонкие различия практически не влияют на релевантность результатов по подобным запросам. В то же время, не менее значительна и доля запросов, для которых внестраничная информация практически отсутствует и решающим оказывается страничное ранжирование. Таким образом, можно говорить, что хотя релевантность результатов в поиске по Интернету определяется не только качеством алгоритмов страничного ранжирования, их влияние на качество поиска достаточно велико. Конечно, здесь надо иметь в виду, что релевантность результатов поиска в Интернете зависит не только от качества ранжирования, но и от других факторов. Объем и частота обновления базы, отслеживание нечетких дубликатов, фильтрация спама - все это также оказывает значительное влияние на качество поиска.
Выделяют следующие критерии выбора поискового механизма:
- скорость индексирования и переиндексации,
- поддерживаемые API(ApplicationProgrammingInterface, интерфейс программирования, интерфейс создания приложений),
- поддерживаемые протоколы,
- размер базы и скорость поиска,
- поддерживаемые типы документов,
- работа с разными языками и стемминг,
- поддержка дополнительных типов полей в документах,
- платформа и язык,
- возможность расширения встроенных механизмов ранжирования и сортировки.
Основные принципы определения релевантности:
- Количество ключевых слов запроса в тексте документа.
- Тэги, в которых эти слова располагаются.
- Местоположение искомых слов в документе.
- Удельный вес слов, относительно которых определяется релевантность, в общем количестве слов документа.
- Время – как долго страница находится в базе поискового сервера.
6. Индекс цитируемости – как много ссылок на данную страницу ведет с других страниц, зарегистрированных в базе поисковика.
Критерием результата поиска является получение пользователем списка документов, одного документа или их частей, максимально удовлетворяющего его потребностям, сформулированным в поисковом запросе. Различают критерии смыслового и формального соответствия между поисковым предписанием и выдаваемым документом.
Полнота и точность поиска являются взаимосвязанными показателями. Увеличение одного из них ведет к снижению другого. Следует учитывать ситуацию, при которой список выданных поисковой системой ссылок содержит несколько, а порой и десятки разных адресов с одним и тем же текстом. Подобные ссылки характеризуются как дубликаты. Из них, при подсчете коэффициентов учитывается только один документ.
Значимой мерой релевантности в реальных поисковых системах является степень удовлетворенности пользователя полученными результатами. Естественно, этот критерий не поддается точному формальному определению, в отличие от критериев, используемых в экспериментах по информационному поиску. Вопрос о степени применимости традиционных формальных критериев к реальному поиску в Интернете остается малоисследованным. Например, такие значимые в экспериментальных исследованиях критерии как Precision, Recall, Average Precision ориентированы на ситуацию, когда пользователя интересуют все релевантные документы, и он просматривает всю поисковую выдачу. В реальном же поиске по Интернету подобная модель поведения пользователя является всего лишь одной из многих и встречается не столь уж часто. Возможно, в будущем будут разработаны системы оценки релевантности, учитывающие вероятную модель поведения пользователя для оцениваемого запроса и выбирающие адекватный критерий ранжирования, хотя и это будет лишь частичным решением проблемы.
С другой стороны, бесспорно наличие корреляции между формальными критериями и качеством поиска с точки зрения пользователя.
В настоящее время различают несколько общих моделей информационного поиска:
- Булева модель, когда документы при поиске делятся на две группы – либо соответствующие, либо несоответствующие запросу, при этом никакие их оценки не вычисляются. В первоначальном варианте модели этого типа не поддерживали ранжирование документа (отсутствовал метод определения степени соответствия документа запросу – оценок релевантности документа запросу), выдавалось все множество документов, соответствующих запросу, без какого-либо ранжирования.
- Модель векторного пространства – документ и запрос представляется в качестве вектора и ищется скалярное произведение векторов, которое позволяет оценить близость документа и термина.
- Вероятностная модель, где вычисляется вероятность того, что документ релевантен, т.е. соответствует запросу с использованием полного вероятностного подхода. Существует множество методов вычисление вероятности.
- Модель обратной связи по релевантности и расширения запроса - позволяет при поиске учитывать ответы пользователя. Классический вариант подразумевает несколько итераций поиска, при каждом следующем шаге алгоритм улучшает результаты поиска.
- Языковые модели информационного поиска - рассматривают задачу поиска со стороны документа. Если данный документ может породить запрос, то этот документ релевантен.