Файл: Анализ поисковых систем в сети Интернет(Понятие поисковых систем, их цели и задачи).pdf

ВУЗ: Не указан

Категория: Курсовая работа

Дисциплина: Не указана

Добавлен: 30.03.2023

Просмотров: 588

Скачиваний: 2

ВНИМАНИЕ! Если данный файл нарушает Ваши авторские права, то обязательно сообщите нам.

1.3 Особенности реализации поисковых технологий

Система StackSearch осуществляет поиск с учетом:

  • морфологии нескольких естественных языков;
  • атрибутовполнотекстовых документов (при необходимости с логическим объединением);
  • эвристического алгоритма определения жизненного цикла документа, для мониторинга из­менений в индексируемых документах с целью исключения при сборе информации документов, ко­торые не были изменены;
  • взаимодействия с другими поисковыми системами.

Stack Search состоит из различных модулей:

  1. Краулер - модуль сбора документов для индексирования из различных источников;
  2. Индексатор - модуль формирования поискового индекса по сформированной ранее коллекции документов;
  3. Поисковой сервер - сложная программа (программный комплекс), осуществляющая реализацию поисковых запросов с применением поискового индекса;
  4. Клиентские средства - программные библиотеки и утилиты, реализованные на раз­личных языках программирования для взаимодействия с сервером поиска.

Поиск в Google. Google состоит из следующих модулей:

  1. Модуль загрузки - обрабатывает URL-адреса из собственной базы данных URL, очи­щает соответствующий документ от нетекстовой информации и помещает его в базу дан­ных html-документов;
  2. Модуль обработки документа - обнаруживает в имеющихся html-документах ссылки и добавляет их в соответствующее хранилище, а составляющие документы слова поме­щает в хранилище слов, обработанные модулем документы далее размещаются в индексе;
  3. Модуль обработки ссылок - при получении ссылки на не проиндексированный доку­мент добавляет URL в соответствующее хранилище.
  4. Модуль вычисления веса документа относительно запроса пользователя.

Таким образом, можно выделить следующие хранилища информации:

а) URL – содержит адреса страниц для индексирования;

б) HTML – хранит тексты документов, из которых удалены скрипты, картинки и пр.;

в) слов – хранит номера слов и сами слова для последующего обращения по номеру;

г) индексное – различные индексы, которые указывают, в каком документе находится данное слово, и наоборот, из каких слов состоит документ;

д) ссылок – хранит ссылки из обработанного документа;

е) ссылок на сайт – хранит данные о перекрестных ссылках с сайтов.


Поисковая система Яндекс. Реализует распределенную поисковую технологию, на всех уров­нях поисковой системы производится распараллеливание нагрузки.

При обращении пользователя к системе его запрос перенаправляется на поисковой веб-сервер, который в настоящий момент менее загружен.

Далее производится обработка на уровне поисковой системы, на котором располагаются базы параллельного поиска (реализуется деление большой базы документов).

Современные реализации предполагают создание полнотекстового индекса, содержащего все слова с указанием мест их встречаемости. Таким образом, поиск заданных слова осуществляется в этом индексе, после чего доступен список документов, в которых он встречается. Кроме того доку­менты индексируются после исключения их дубликатов (либо по всем терминам, либо по основ­ным, определенным некоторым специфическим для различных систем способом, ключевым сло­вам). Большинство существующих программных реализаций информационно-поисковых систем позволяют ограничивать поиск по дате публикации, источнику информации, автору, учитывать морфологическую изменчивость ключевых слов и область поиска, если имеется возможность ука­зать таковую. Область поиска также ограничивается посредством тематического рубрикатора. Для уточнения запросов в программах применяют словари синонимов, а также предлагаются слова, час­то встречающиеся в сочетании с ключевыми словами.

В настоящее время большое распространение получили метапоисковые системы, которые в результате поиска выдают данные с десятка поисковых систем, при этом объем информации может быть весьма значительным. Чтобы пользователь не потерял в полученном массиве необходимую ему информацию, результирующие данные представляются в виде общего списка, где в первых элементах расположены данные, наиболее релевантные запросу. Альтернативным решением яви­лись тематические поисковые системы на веб-сайтах – узконаправленные порталы. Кроме того не­которые системы позволяют экспортировать результирующий список для использования в других программных продуктах. Как правило, такой список содержит ссылки на документы, удовлетво­ряющие запросу, а также похожие документы. Сортировка в списке может осуществляться по реле­вантности, дате и т.п. При просмотре полнотекстового документа в нем осуществляется указание на найденные ключевые слова, например, путем подсветки. Существуют поисковые системы, в которых реализована и возможность сохранения, модификации самих пользовательских запросов, а ре­зультаты полнотекстового поиска, полученные в различных информационно-поисковых системах, могут быть индивидуализированы путем отнесения к определенному пользователю, который и осуществил запрос. Такая персонификация позволяет экспортировать запрос и, соответственно, результаты, проводить дальнейший мониторинг с оповещением пользователя об изменении результа­тов запросов.


Однако ряд проблем в поисковых системах, реализующих полнотекстовый поиск, остаются открытыми[7]. Продолжаются работы по совершенствованию алгоритмов реализации полнотек­стового поиска, по разрешению проблемы индексирования текстов, которая состоит в том, что от ключевых слов (индексов) требуется соблюдение двух взаимоисключающих принципов: ключевые слова должны как можно точнее идентифицировать текст; ключевые слова должны как можно более точно отражать смысл текста.

Предлагаются различные варианты моделей полнотекстового поиска, сравнительная характеристика которых будет рассмотрена в следующей главе курсовой работы.

Глава 2. Сравнительный анализ поисковых систем

2.1 Достоинства и недостатки поисковых систем

Для облегчения поиска и ориентирования в постоянно растущем объёме информации создаются различные поисковые средства. В распоряжении пользователей интернета достаточно много поисковых систем, которые по охвату индексируемых сайтов можно разделить на две группы:

  • глобальные, осуществляющие поиск по всем сайтам сети (например Google, Bing, Yandex и т.д.);
  • локальные, встроенные в один или несколько родственных сайтов, которые ведут поиск только по ним.

Стоит отметить, что почти в се глобальные поисковые системы могут использоваться и в качестве локальных, однако относить их к этой группе неправомерно, поскольку поиск по отдельному сайту для них является уточнением запроса.

Все эти системы обладают определёнными достоинствами, в числе которых простота и удобство использования, что позволяет неподготовленному пользователю сразу приступить к поиску информации; ранжирование или сортировка результатов поиска от наиболее релевантных к менее релевантным; отображение заголовка страницы и небольшого экстракта (обычно 2–3 строки) рядом со ссылкой на сайт, что позволяет составить первое впечатление о релевантности сайта или выданного результата.

Вместе с тем все эти системы обладают общими недостатками:

  • коммерциализованность: большинство этих систем коммерческие, основная их цель – приносить прибыль, поэтому они часто и не всегда к месту размещают рекламу, а также «продвигают» сайт, т.е. искусственно повышают его релевантность;
  • уязвимость: поскольку механизмы индексации поисковых систем автоматические, это позволяет создателям страниц вводить для повышения релевантности ключевые слова, которые не имеют отношения к содержанию страницы, но при этом видны только поисковым системам (т.е. при загрузке страницы они не отображаются);
  • сортировка только по релевантности: не учитывается дата создания страницы, поэтому очень часто на первых страницах результатов поиска идут ссылки на релевантные, но устаревшие материалы;
  • избыток релевантных ссылок, число которых иногда доходит до нескольких миллионов;
  • отсутствие уточнения запроса по интересующим областям;
  • иногда отсутствуют релевантные ссылки.

Каждая поисковая система старается улучшить результаты поиска и избавиться от перечисленных выше недостатков или хотя бы минимизировать их. Одни системы пытаются совершенствовать алгоритмы поиска, другие – предлагают пользователю уточнить поисковый запрос.

Многие поисковые системы реализовали функцию «подсказок», которая при наборе текста в поисковом поле выдаёт небольшой список наиболее часто встречающихся запросов. Большинство глобальных поисковиков предлагают уточнить запрос по типу информации, например: Yandex – выбрать из небольшого списка (Поиск, Картинки, Видео, Карты, Маркет, Новости, Музыка, Диск, Перевод, Почта, Словари, Всё), что именно ищет пользователь.

Некоторые поисковики обеспечили пользователям возможность задать временные рамки запроса. Например, Google предлагает либо выбрать из списка период создания страниц, либо задать собственный временной интервал. Также некоторые поисковые системы для уточнения поиска предлагают воспользоваться специальными операторами и пунктуацией.

В качестве примера приведём некоторые операторы и знаки пунктуации, предлагаемые Google[8]:

«*» (звёздочка) служит для замены любого слова в запросе;

«-» (дефис) – для исключения слова из запроса;

«”текст”« (текст в кавычках) – для поиска полной фразы, заключённой в кавычки;

«OR» (оператор «ИЛИ») – для поиска одного из слов , разделённых этим оператором, и т.д.

Система уточнения запросов, несомненно, полезна, однако поиск научных статей в глобальных поисковиках по-прежнему затруднён, поскольку производится по всей сети. Для исключения сайтов, не содержащих научной информации, компания Google предлагает воспользоваться поисковой системой – Академией Google (Google Scholar)[9] , которая ведёт поиск научных публикаций по статьям как со свободным, так и с ограниченным или платным доступом. Результаты поиска представляют собой ссылки либо на полный текст статьи, либо на страницу с кратким описанием.

Эта поисковая система имеет также небольшую систему уточнения запросов: уточнение времени публикации; выбор сортировки результатов поиска (по релевантности или по дате); возможность включить в результаты поиска либо исключить из них патенты, показывать либо скрывать цитаты.

Однако Академия Google обладает такими серьёзными недостатками, как недостаточность данных об охвате базы данных; неизвестная частота обновления; отсутствие опубликованного списка научных журналов, представленных в базе данных.


Таких недостатков нет у коммерческих поисковиков (например, Web of Science[10]), являющихся локальными.

Одна из лучших систем уточнения запросов создана для поисковой системы сайта Web of Science, представляющего собой реферативную базу данных публикаций в научных журналах (компания Thomson Reuters). В боковой панели слева расположены все доступные типы уточнения поиска, например: базы данных; направления исследования; авторы; годы публикаций; языки; страны/территории и т.д. В каждом из этих типов есть небольшой список наиболее часто встречающихся вариантов во всех документах основного запроса. Например, на запрос «folksonomy» и для типа уточнения «Годы публикаций» предлагается следующий список: 2016, 2017, 2015, 2014, 2018.

Это означает, что наибольшее количество публикаций по основному запросу «folksonomy» пришлось на 2016 г.

Система также предлагает воспользоваться операторами поиска (например: «AND» для поиска записей, содержащих все условия) и символами усечения (например: «?» (знак вопроса) для замены одного символа).

При всех достоинствах эта поисковая система обладает одним существенным недостатком, особенно для русскоязычных пользователей. Несмотря на то, что сайт русифицирован, запрос в основной базе данных – Web of Science Core Collection – вводится только латинскими символами, а значит, возникают сложности с транслитерацией. Зачастую автор транслитерирует свою фамилию и имя по-разному в разных публикациях, поэтому сотрудники компании Thomson Reuters предлагают пользоваться символами усечения, однако это не уменьшает количество результатов, а наоборот увеличивает.

Необходимо обратить внимание и на то, что основной вид поиска всех упомянутых нами поисковых систем – вербальный, т.е. базируется на естественном языке. Поэтому релевантная информация, опубликованная на одном языке, при поиске по ключевым словам на другом языке не попадает в результаты поиска. Это один из главных недостатков вербального поиска.

Компания Thomson Reuters попыталась обойти это ограничение и приняла решение вести основную БД Web of Science Core Collection на английском языке. Несомненно, английский является языком международного общения, однако не все люди хорошо владеют им, поэтому предпочитают искать информацию на родном языке.

Рейтинг популярных систем мира по данным исследовательской компании NetMarketShare представлен на рисунке 1.

Рисунок 1. Рейтинг поисковых систем мира по популярности[11]