Файл: Анализ поисковых систем в сети Интернет(Понятие поисковых систем, их цели и задачи).pdf

ВУЗ: Не указан

Категория: Курсовая работа

Дисциплина: Не указана

Добавлен: 30.03.2023

Просмотров: 590

Скачиваний: 2

ВНИМАНИЕ! Если данный файл нарушает Ваши авторские права, то обязательно сообщите нам.

Популярными поисковыми системами в России по данным российского онлайн – сервиса Liveinternet на ноябрь 2018 года являются следующие[12]:

Яндекс – 50,7%;

Google – 45%;

Mail – 3,9%;

Rambler – 0,2%;

Bing – 0,1%.

Опираясь на данные статистики, в рамках курсовой работы рассматриваемыми системами будут Google, Yandex, Bing, Mail.ru и Rambler.

Google - На сегодняшний день, система Google является общепризнанным лидером среди поисковых систем мира. Появление системы произошло в 1996 году, а корпорации Google - двумя годами позже. Google - это не только поиск, но и еще более 50 сервисов, включая самый популярный браузер Google Chrome. По мнению многих специалистов, Google Chrome самый быстрый браузер в мире, на сегодняшний день. Что касается оценки пользователей, то претензий к скорости работы не было выявлено, браузер открывает страницы практически мгновенно.

Yandex - Крупнейшая поисковая система. Появление системы произошло 23 сентября 1997 года. В последние годы Яндекс активно выходит на международный уровень. Сейчас он имеет версии сервиса в Беларуси, Украине, Казахстане и Турции. В последнее время Yandex активно продвигает свой собственный браузер.

Bing - Поисковик компании Microsoft, который быстро набирает популярность. Появление Bing произошло 1 июня 2009 года. На 2016-й год ее можно назвать быстроразвивающейся поисковой системой с достаточной долей рынка, и это позволяет назвать её конкурентом Google.

Mail.ru - Поисковая система, появление которой произошло 16 октября 2006 года. Сейчас ей принадлежат такие сервисы, как «Одноклассники» - социальная сеть для нахождения новых и старых знакомых, виртуального общения, обмена информацией между пользователями, которые смогут разделить общие интересы и увлечения, «Мой мир» - сеть, для поиска новых знакомых, друзей, одноклассников, обмена сообщениями, размещения фото и видео, поиска групп по интересам и Афиша, Агент, «Вопросы и ответы», Майл Деньги —около 40 крупнейших сервисов в Рунете, среди которых и сам поиск. Mail.ru занимает третью строчку после Google и Яндекс среди популярных поисковиков в России.

Rambler – Поисковая система, существовавшая с 1996 по 2011 года. На сегодняшний день это крупнейший российский интернет-портал. Поиск по Rambler осуществляется силами движка Яндекса, объективных причин падения его популярности нет.


2.2 Сравнительный анализ обработки запросов поисковыми системами

Рассмотрим пятерку поисковых систем по двум главным характеристикам: по полноте и точности поиска. Качество поиска в информационно-поисковых системах можно определить двумя критериями –точностью и полнотой. Точность определяется соотношением между найденными релевантными и нерелевантными документами, а полнота поиска - общим количеством найденных документов. Релевантным будем считать документ, который удовлетворяет запросу пользователя. Нерелевантные документы, сравниваемые с релевантными, иногда могут называться шумом, по аналогии с теорией передачи информации. Релевантные документы в таком случае называют сигналом, а эффективность поиска оценивают по соотношению «сигнал – шум»[13].

Назначим весовые коэффициент - параметры, которые отражают в сравнении с другими критериями относительную важность, значимость, «вес» данных критериев. Сумма всех весов должна быть равной 1, поэтому для точности поиска весовому коэффициенту даем значение, равное 0.8, для полноты поиска – 0.2. Оформим результаты в виде таблицы 1.

Таблица 1

Весовые коэффициенты

Критерий

Весовой коэффициент

Точность поиска

0,8

Полнота поиска

0,2

Сформулируем тринадцать запросов на разные темы и выполним каждый запрос в каждой из пяти исследуемых поисковых системах. Из полученных списков результатов выберем следующую информацию:

Общее количество найденных документов (Д).

Количество релевантных документов различной ценности (РД)

Количество релевантных документов оценивается при просмотре текста первых 10 найденных документов. Также определяется ценность найденной информации (степень удовлетворения найденном документом информационных потребностей). Ценность информации оценивается по 3-х бальной шкале: 2 балла - информация имеет ценность, 1 балл – информация имеет частичную ценность, 0 баллов – информация не имеет ценности[14]. Результаты выполнения запросов сведем в таблицу 2, а затем выполним первичную обработку результатов (таблица 3, строка 1).

Для нахождения лучшей поисковой системы для начала вычислим средние арифметические значения показателей для каждой поисковой системы Д, РД(0), РД(1) и РД(2).


Далее необходимо определить место каждой поисковой системы по критерию «Полнота поиска». Для этого будем использовать среднее количество найденных документов Д. Наилучшей считается та система, которая нашла больше документов. Ей присваивается первое место, самой худшей – место N ( где N – это количество всех исследуемых систем). Коэффициент точности поиска P для каждой поисковой системы определим по формуле:

P = a / (a+b) ,

где a – число релевантных документов, которые выдала поисковая система в ответ на запрос, a = 0.5 * РД(1)+ РД(2) ;

b - число документов, которые полностью не имеют ценность, b=РД(0).

Далее необходимо определить место каждой поисковой системы по критерию «Точность поиска». Лучшей будет считаться система, которая имеет большее значение коэффициента точности поиска P. Ей присваивается первое место, самой худшей - место N ( где N - это количество исследуемых систем).

Таблица 2

Результаты выполнения запросов

№ темы

Bing

Google

Mail.ru

Rambler

Yandex

Д

РД

Д

РД

Д

РД

Д

РД

Д

РД

2

1

0

2

1

0

2

1

0

2

1

0

2

1

0

1

1 810 000

9

1

0

3 180 000

10

0

0

7 000 000

5

2

3

41 000 000

9

1

0

40 000 000

9

1

0

2

116 000

8

2

0

711 000

10

0

0

2 000 000

8

1

1

943 000

10

0

0

942 000

9

1

0

3

420 000

7

2

1

2 330 000

8

2

0

1 000 000

9

1

0

3 000 000

8

0

2

2 000 000

9

0

1

4

62 000

8

2

0

964 000

10

0

0

1 000 000

8

1

1

3 000 000

9

1

0

2 000 000

9

0

1

5

2 340 000

8

1

1

2 380 000

8

0

2

7 000 000

7

1

2

2 000 000

9

0

1

17 000 000

9

0

1

6

103 000

7

0

3

1 020 000

10

0

0

1 000 000

9

0

1

3 000 000

10

0

0

2 000 000

10

0

0

7

746 000

9

0

1

5 430 000

9

0

1

13 000 000

10

0

0

3 000 000

9

0

1

1 000 000

9

0

1

8

19 900

7

2

1

214 000

10

0

0

18 000

9

1

0

9 000

8

0

2

9 000

10

0

0

9

42 400

9

1

0

140 000

9

0

1

766 000

7

1

2

431 000

9

0

1

430 000

10

0

0

10

999 000

10

0

0

4 190 000

9

0

1

9 000 000

9

1

0

6 000 000

10

0

0

4 000 000

10

0

0

11

1 940 000

10

0

0

683 000 000

9

1

0

9 000 000

10

0

0

7 000 000

10

0

0

6 000 000

9

0

1

12

73 700

9

1

0

812 000

8

1

1

863 000

9

0

1

834 000

9

1

0

869 000

10

0

0

13

115 000

10

0

0

301 000

10

0

0

3 000 000

9

0

1

2 000 000

10

0

0

2 000 000

10

0

0


Таблица 3

Результаты сравнительного анализа поисковых систем

Критерий

Bing

Google

Mail.ru

Rambler

Yandex

Полнота поиска (Д)

675923,1

1719615,4

4203615,4

6939769,2

6019230,8

Место(полнота поиска)

5

4

3

1

2

Среднее количество пертинентных документов (РД2)

8,5

9,23

8,38

9,23

9,46

Среднее количество частично пертинентных документов (РД1)

0,92

0,31

0,69

0,23

0,15

Среднее количество непертинентных документов (РД0)

0,53

0,46

0,92

0,53

0,38

Коэффициент точности поиска (Р)

0,94

0,953

0,904

0,945

0,961

Место (точность поиска)

4

2

5

3

1

Коэффициент поискового шума (S)

0,056

0,046

0,095

0,054

0,038

Следующим шагом будет вычисление коэффициента поискового шума S по формуле: S=1 - P

В заключении необходимо вычислить по следующей формуле рейтинг каждой исследуемой системы R:

где i - номер критерия оценки поисковой системы,

m - это количество критериев оценки,

wi - весовой коэффициент для критерия оценки i,

qi - это место поисковой системы по критерию оценки i.

N - общее количество исследуемых систем.

Результат расчета рейтинга приведен в табл.4

Таблица 4

Результаты сравнительного анализа поисковых систем

Критерий

Bing

Google

Mail.ru

Rambler

Yandex

Рейтинг (R)

2,8

4,6

2,4

4,4

5,8


По результатам расчетов лучшей поисковой системой Интернет из исследуемых - является Yandex.

Заключение

В целом поисковая система представляет собой совокупность информационно-поискового языка, программных средств и правил перевода текстов на этот язык (индексирования), а также обеспечения поиска по заданным критериям. Главная цель поисковых систем – предоставить пользователям доступ к сайтам, информация на которых наиболее релевантна их запросам. Принцип работы поисковой системы следующий: поисковый робот обходит страницы сайта, сканирует их содержимое (код, стили, контент, изображения, ссылки и др.), далее страница отправляется на индексирование, где на основе алгоритмов начинается анализ всех собранных роботом материалов. Таким образом, поисковая система создаёт базу данных, где хранятся все обработанные алгоритмом документы. У каждой поисковой системы разработаны собственные алгоритмы оценивания качества сайтов.

В процессе выполнения данной работы был проведен анализ популярных среди пользователей поисковых систем. Была проанализирована пятерка систем, а именно поисковые системы Yandex, Google, Mail.ru Bing, и Rambler, произведено их сравнение и, была выбрана лучшая система. Опираясь на расчеты, можно с уверенностью сказать, что таковой является Яндекс. Поставленные задачи были полностью выполнены. Результат работы поможет пользователям сети выбрать быструю и надежную поисковую систему, выполняющую запросы с наибольшей точностью и за максимально короткие промежутки времени. Также не стоит забывать, что от содержания самого запроса зависит и скорость его воспроизведение, поэтому рекомендациями составления запроса могут выступить: учет морфологии слов, четкость и составление запроса из нескольких слов, адекватно передающих содержание необходимой информации.

Список использованных источников

  1. ГОСТ 7.73-96. Поиск и распространение информации. Термины и определения.
  2. Адаманский А. Обзор методов и алгоритмов полнотекстового поиска [Электронный ресурс] – Режим доступа: www.dialog-21.rudialog2016materialshtmlFedorovsky.htm.
  3. Борисова Н.В., Кочуева З.А. Индексирование полнотекстовых документов для задачи интеллек­туального поиска информации по ключевым словам//Восточно-Европейский журнал передовых технологий. – 2014. – № 1/2(67). – С. 4–8. URL: http://journals.uran.ua/eejet/article/view/20332.
  4. Васенин В.А. Управление тематическими данными в больших и сверхбольших хранилищах: ме­ханизмы, модели, программное обеспечение (состояние, задачи, решения) // Проблемы информати­ки, № 1, 2018. – С. 71–84.
  5. Вишняков Ю.М., Вишняков Р.Ю. Вычислительная семантическая интерпретация текстов научно-технического стиля // Современные наукоемкие технологии, 2016, № 12-2. – С. 53–30.
  6. Королева О.Н., Мажукин А.В. Поисковые системы сети INTERNET. – М.: Изд-во Моск. гумани­тар. ун-та, 2017. – 35 с.
  7. Мировые информационные ресурсы [Текст]:Учебное пособие/ В.К.Иванов; под. ред .В. К.Иванова.-Тверь:Изд-во ин-та ТвГТУ, 2017. - 37с.
  8. Симакина Н.И. Разработка подсистемы полнотекстовой индексации и полнотекстового поиска для платформы облачного контент-репозитория / Симакина Н. И., Шипулина К. В., Костарев А. А., Окунев А. Ф. // Вестник Пермского университета. Серия: Математика. Механика. Информатика 2014, №4. – С. 92–96.
  9. Рейтинг топ 5 самых лучших отечественных и мировых поисковых систем: [Электронный ресурс]. М. – URL: bestseoblog.ru
  10. Статистика сайта. Переходы из поисковых систем: [Электронный ресурс]. М. – URL: liveinternet.ru
  11. Beall J. TheWeaknesses of Full-Text Searching // Journal of Academic Librarianship, Sep. 2018, Vol.34, No.5, pp. 438–444.
  12. Dong-Jin Kim, Sang-Chul Lee, Ho-Yong Son, Sang-Wook Kim, Jae Bum Lee. C-Rank and its variants: A contribution-based ranking approach exploiting links and content // Journal of Information Science 1(18), September 2014, pp. 761–778.
  13. Franklin M., Halevy A., Maier D. From Databases to Dataspaces: A New Abstraction for Information Management // SIGMOD Record. 2015, Vol. 34, No. 4; URL: http://www.sigmod.org/ sigmod/record/issues/0512/p27-article-franklin.pdf .
  14. Kai A. Olsen, Kenneth M. Sochats, & James G. Williams. Full Text Searching and Information Over­load // International Information & Library Review, 30 (June, 1998), pp. 105–122.
  15. Yury M. Vishnyakov, RenatYu. Vishnyakov/ The Linguistic Proximity in Information Retrieval and Document Classification. 14th IEEE International Symposium on Computational Intelligence and Infor­matics to be held on November 19-21, 2013 in Budapest, Hungary. – P. 131–134.
  16. Yury Vishnyakov, Renat Vishnyakov // Representation of semantically cohesivesenten cefragments inscientificandte chnicaltexts // 2014 IEEE 12th InternationalSymposiumonAppliedMachineIntelligenceandInformatics, pp. 295–298, DOI: 10.1109/SAMI.2014. 6822425
  17. IDC – Режим доступа: http://www.idc.com/home.jsp
  18. Операторы в поисковых запросах. – Режим доступа: https://support.google.com /websearch/answer/2466433?hl=ru
  19. Академия Google. – Режим доступа: https://scholar.google.ru/
  20. Web of Science. – Режим доступа: http://apps.webofknowledge.com/