Файл: Анализ поисковых систем в сети Интернет (Понятие и сущность поисковых систем).pdf
Добавлен: 23.05.2023
Просмотров: 346
Скачиваний: 3
СОДЕРЖАНИЕ
Глава 1. Теоретические основы поисковых систем в сети Интернет
1.1. Понятие и сущность поисковых систем
2.1. Характеристики и устройство поисковых систем
Глава 2. Сравнительный анализ поисковых систем в сети Интернет
2.1. Анализ поисковых систем на российском IT-рынке
Актуальность - еще одна важная составляющая поисковой системы. Характеризуется временем между публикацией документа в сети Интернет и попаданием его в базу поисковой системы. Поисковые системы помимо основной базы документов имеют «быструю» базу, которая обновляется постоянно. Например, новость о каком-либо законопроекте разместили на множестве веб-сайтов в сети Интернет, а через несколько часов пользователи обратились к поисковым системам с соответствующими запросами. Так как документы, содержащие новость, были сохранены в «быстрой» базе, поисковая система смогла предоставить пользователю релевантную информацию. Размер «быстрой» базы на порядки меньше, и данные, содержащиеся в ней, периодически (1-2 раза) в неделю переносятся в основную базу[17].
Скорость поиска - связана с устойчивостью поисковой системы к нагрузкам. Ежедневно поисковой системе Яндекс задают 100 млн. запросов. Такая загруженность требует снижения обработки отдельного запроса. Пользователь хочет получить ответ как можно быстрее, а поисковая система - дать ему ответ, чтобы затем обрабатывать следующие запросы[18].
Наглядность представления результатов поиска - важный компонент удобного поиска. Как правило, поисковые системы предлагают возможность сохранения индивидуальных настроек для пользователя. За последнее десятилетие результаты поиска дополнились рекламой, новостями, различными сервисами, что не может не отвлекать пользователя[19].
Устройство поисковой системы
Каждая крупная поисковая система имеет свою собственную архитектуру, но для всех них можно выделить общие компоненты.
1) Паук - программа, предназначенная для поиска новых документов в Интернете. Паук передает запрос на сервер, где расположен веб-сайт для получения документа, а в ответ получает непосредственно сам документ и служебную информацию. Из документа извлекаются все гиперссылки, по которым отправляются аналогичные запросы. Таким образом, переходя по гиперссылкам, паук собирает информацию обо всех документах, расположенных в сети. Существуют также альтернативные способы «приглашения» паука на веб-сайт - каждая поисковая система имеет форму для добавления нового документа или целого веб-сайта. Помимо задачи перехода по гиперссылкам для нахождения всех документов сети Интернет, в обязанности паука входит составление расписания обхода найденных ранее документов на предмет изменений. Для каждого веб-сайта расписание составляется индивидуально, и, в общих чертах, скорейшее возвращения паука тем вероятнее, чем чаще на веб-сайте появляются новые, уникальные документы, а также чем чаще цитируют данный веб-сайт в сети Интернет (появляются гиперссылки на его документы)[20].
2) Робот-индексатор отвечает за сохранение документов, найденных пауком. Перед отправкой запроса на сервер для получения документа робот-индексатор запрашивает содержимое файла robots.txt, если таковой существует в корневой директории веб-сайта. Robots.txt - файл ограничения доступа роботам к содержимому веб-сайта. Существует стандарт исключений для роботов, использование которого добровольно, но большинство современных поисковых систем ему следуют. В случае, если документ разрешен для скачивания, роботиндексатор составляет обратный (инвертированный) файл и сохраняет его в базе данных. Инвертированный файл в самом простом случае представляет собой структуру, состоящую из двух частей:
- списка, содержащего все слова, которые были найдены во всех документах;
- указатели на все документы, а точнее - места в этих документах, в которых содержится каждое слово[21].
По этой структуре в дальнейшем и происходит поиск при запросе пользователя к поисковой системе, а сама структура называется ее индексом. Аналогичной структурой обладает «быстрая» база, документы для которой индексирует «быстроробот». В нее, как правило, попадают документы новостных сайтов, блогов, а также документы многих ежедневно пополняемых веб-сайтов. Стоит отметить, что документы, сохраненные роботом-индексатором в основной базе, не сразу участвуют в результатах поиска, в отличие от документов в быстрой базе, которые могут появляться в результатах поиска сразу после индексации «быстророботом». Обновление поисковой базы происходит 1-2 раза в неделю.
Обход документов веб-сайта пауком не гарантирует, что робот-индексатор сохранит документ в поисковом индексе. Если веб-сайт содержит множество неуникальной информации, содержит вирусы, всплывающие рекламные окна (pop-up и т.п.) или использует в своих документах различные виды спама для обмана поисковой системы, такие документы могут никогда не попасть в поисковый индекс, но робот-индексатор будет периодически посещать их для проверки устранения нарушений.
3) Модуль поиска отвечает за анализ запроса пользователя, поиска по инвертированной базе, ранжирование и представление документов пользователю. При поиске первым делом анализируется запрос, введенный пользователем. Часто пользователи вводят «длинные» запросы, со стоящие из 3 и более слов, и возникает ситуация, когда точного совпадения с запросом в индексе поисковой системы нет. В этом случае на помощь приходит переформулировка запроса. В Яндекс за это отвечает «колдунщик»[22].
Переформулировка - это перепроцессинг, в результате которого различные запросы преобразуются по-разному, и поиск в индексе осуществляется по-новому, уточненному запросу. В результате вместо «ничего не найдено» пользователь получает в достаточной степени релевантный ответ. До конца 2007 года в Яндекс можно было увидеть переформулированный запрос. К примеру, в то время отбрасывались частицы, предлоги, изменялись словоформы, редко употребляемым словам в многословных запросах отдавалось меньшее предпочтение, а затем осуществлялся поиск. В настоящее время точных данных о том, как именно работает «колдунщик», нет. После переформулировки запроса осуществляется поиск по индексной базе, и находятся все документы, удовлетворяющие уже новому запросу[23].
После того, как наиболее схожие документы были отобраны, их необходимо упорядочить по релевантности (выполнить ранжирование). За этот процесс отвечает формула ранжирования, которую обычно и называют алгоритмом поисковой системы. Формула ранжирования содержит множество факторов, которые влияют на релевантность документа запросу; для разных поисковых систем эти множества различны.
Формулы ранжирования учитывают множество факторов при определении релевантности документа запросу пользователя. В первых версиях Яндекс и Google факторы ранжирования можно было разделить на две группы:
- внутренние,
- внешние[24].
К внутренним факторам относились свойства самого документа - наличие в нем слов запроса, их точное вхождение в ключевые HTML-теги документа (<title>, <hl>), плотность в документе (отношение вхождений слов запроса в документ к общему числу слов в документе, выраженное в процентах), и т.д. Для каждого запроса вычисляется значение Score документа - показатель релевантности документа запросу, на основании которого и производится ранжирование. Для расчета Score была выбрана аддитивная модель. Интерес представляет вопрос, какие слагаемые надо добавить в формулу расчета Score? В результате экспериментов были отобраны слагаемые за встречаемость слов из запроса в документе, за встречаемость пар слов из запроса в документе и за встречаемость текста запроса целиком[25].
Для улучшения результатов поиска также используется подход «Pseudo-relevance feedback». Суть подхода заключается в том, что поиск проводится в два этапа. На первом этапе используется простой метод, описанный выше. После этого документы, найденные на первых позициях, объявляются релевантными, и ищутся «похожие». Можно использовать любую меру похожести, но в данном случае используется 2 разные меры, которые можно реализовать с достаточной для реальных применений производительностью.
К внешним факторам относились ссылки и все, что с ними связано: их количество, вес, анкор (от англ. anchor - «якорь», текст, при нажатии на который происходит переход в другой документ). При прочих равных анкор ссылки имеет решающее значение. Считается, что если на документ стоит ссылка с анкором «образование», то с некоторой долей вероятностьи он содержит информацию об образовании. Документ, в котором стоит ссылка, называется донором; документ, на который ведет ссылка, - акцептором. В случае, если акцептор не содержит слов из запроса пользователя в поисковой системе, он все равно может показываться в результатах, так как анкоры указывающих на этот документ ссылок содержат слова запроса. В таком случае рядом со ссылкой стоит подпись «найден по ссылке» (Яндекс) или «слова присутствуют только в ссылках на эту страницу» (Google)[26].
Со временем веб-мастера стали проставлять множество ссылок для манипулирования результатами поиска, появились биржи по покупке и продаже ссылок, которые существуют до сих пор. Ссылочное ранжирование усложнялось, модифицировалось, но до сих пор остается одним из главных факторов ранжирования в поисковых системах. В последние 2-3 года добавились запросные факторы - геозависимость, то есть для хорошего ответа, поисковой системе необходимо учитывать регион, из которого был задан запрос.
Выводы к 1 главе:
Поисковые системы являются сложнейшими и громадными механизмами, представляющие собой инструмент для нахождения любой необходимой информации. Работа с помощью поисковых систем позволяет многим пользователям глобальной сети осуществлять быстрый поиск нужной информации в кратчайшие сроки.
Поисковая система – это программно-аппаратный комплекс, который осуществляет поиск в сети Интернет, реагирует на запрос пользователя, задаваемый в виде поискового запроса и выдает упорядоченный по релевантности список информационных источников.
Поисковые системы выступают основным инструментом решения важнейших задач информационного обеспечения разнообразных видов деятельности человечества.
По пространственному масштабу поисковые системы можно разделить на:
- локальные,
- глобальные,
- региональные,
- специализированные.
Основными характеристиками поисковых систем являются:
- полнота,
- точность,
- актуальность,
- скорость поиска,
- наглядность.
Каждая крупная поисковая система имеет свою собственную архитектуру, но для всех них можно выделить общие компоненты.
- Паук;
- Робот-индексатор;
- Модуль поиска.
Глава 2. Сравнительный анализ поисковых систем в сети Интернет
2.1. Анализ поисковых систем на российском IT-рынке
В условиях тотальной информатизации общества использование поисковых систем в экономике, социальной сфере и межличностном коммуникативном общении стало повседневной практикой. Сформировался конкурентный IT-рынок, на котором созданы разнообразные поисковые системы, отличающиеся географией, сервисом и масштабом охвата пользовательской аудитории. Были выбраны 10 поисковых систем, существующих на международном IT-рынке, была составлена краткая характеристика каждой поисковой системы.
В мировой рейтинге занимает первое место. На долю поисковой системы приходится более 70% поисковых запросов от жителей разных стран, из которых треть трафика приходится на население США. Самый посещаемый сайт в мире. Средняя ежедневная продолжительность пользования поисковой системой составляет 9 минут. Преимущества системы заключаются в минимализме элементов, представленных на странице: строка поиска и логотип компании[27].
Миссия Google – организовать всю имеющуюся в мире информацию, сделав её доступной и удобной для использования. Поисковая система Google проста в использовании, она доступна любому пользователю сети, независимо от его возможностей и наличия каких - либо навыков или знаний. Специализированные роботы ПС сканируют и оценивают содержание страниц для поискового индекса, система откликается на запрос быстро. Поиск информации по запросу в PDF - файлах является преимуществом, Google организует поиск на десяти различных языках, ПС показывает наиболее высокие результаты по чистоте, релевантности и точности поиска, популярностью пользуется голосовой поиск ОК, Google.[2] Разработчики ПС улучшают систему, но при этом затрудняют продвижение сайтов. К Google есть и другая претензия – слежка за пользователями и собирание их личных данных. В Google Analytics появился новый функционал, который называется расширенная электронная торговля (Enhanced е - commerce). Он обладает большими возможностями электронной торговли, позволяет получить дополнительную информацию о посетителе. Для внедрения на сайт Enhanced е - commerce или расширенной электронной торговли Google Analytics можно использовать через код отслеживания или с помощью Google Tag Manager. После внедрения модуля становится доступной подробная информация пользователя о покупках на сайте, периодичности посещения сайтов, об эффективности маркетинговых кампаний на сайте[28].