Файл: Анализ поисковых систем в сети Интернет (Принципы работы поисковой системы).pdf
Добавлен: 31.03.2023
Просмотров: 225
Скачиваний: 1
Введение
В век информационных технологий огромную роль играет интернет, а любое путешествие по просторам интернета невозможно без поисковых систем, позволяющих комфортно просматривать любимые веб страницы. Поисковая система – это аппаратно-программный комплекс, который предназначен для осуществления функции поиска в интернете, и реагирующий на пользовательский запрос который обычно задают в виде какой-либо текстовой фразы (или точнее поискового запроса), выдачей ссылочного списка на информационные источники, осуществляющейся по релевантности.
В этой работе будет проведён анализ и сравнение наиболее популярных поисковых систем.
3
1 глава.
Принципы работы поисковой системы
Все большие системы поиска имеют свою структуру, которая весьма отличается от других. Но все-таки можно выделить общие для всех поисковиков основные элементы:
-
Модуль индексирования.
Данный компонент состоит из трех программ-роботов:
1.1 Spider (по англ. паук) – программа которая предназначена для того чтобы скачивать веб-страницы. «Паук» скачивает определенную страницу, одновременно извлекая из нее все ссылки. Скачивается код html практически с каждой страницы. Для этого роботы используют HTTP-протоколы
«Паук» функционирует следующим образом. Робот передает запрос на сервер “get/path/document” и иные команды запроса HTTP. В ответ программа-робот получает поток текста, который содержит информацию служебного вида и, естественно, сам документ.
Извлекаются все ссылки из тэгов. Вместе с ними обрабатывают редиректы. Любая скачанная страница сохраняется в таком формате:
URL скаченной страницы;
дата, когда осуществлялось скачивание страницы;
заголовок http-ответа сервера;
html-код, «тела» страницы.
1.2 Crawler («путешествующий» паук). Данная программа автоматически заходит на все ссылки, которые найдены на странице, а также выделяет их. Его задача – определиться, куда в дальнейшем должен заходить паук, основываясь на этих ссылках или исходя из заданного списка адресов.
Crawler, исследуя найденные ссылки, ищет новые документы, еще не ставшие известными поисковой системе.
1.3 Indexer (робот-индексатор) – это программа, анализирующая страницы, которые скачали пауки.
Индексатор полностью разбирает страницу на составные элементы и проводит их анализ, применяя свои морфологические и лексические виды алгоритмов.
4
Анализ проводится над разнообразными частями страницы, такими как заголовки, текст, ссылки, стилевые и структурные особенности, теги html и так далее.
Таким образом, модуль индексирования дает возможность проходить по ссылкам заданного количества ресурсов, скачивать страницы, извлекать ссылочную массу на новые страницы из полученных документов и делать подробный их анализ.
2.База данных
База данных (или индекс поисковика) - комплекс хранения данных, массив информации в котором сохраняются определенным образом переделанные параметры каждого обработанного модулем индексации и скачанного документа.
3.Поисковый сервер
Это самый важный элемент всей системы, потому что от алгоритмов, лежащих в основе ее функциональности, прямо зависит скорость и, конечно же, качество поиска.
Поисковый сервер работает следующим образом:
Запрос, который идет от пользователя подвергается морфологическому анализу. Информационное окружение любого документа, имеющегося в базе, генерируется (оно и будет в дальнейшем отображаться как сниппет, то есть информационное поле текста соответствующего данному запросу).
Полученные данные передают как входные параметры специализированному модулю ранжирования. Они обрабатываются по всем документам, и в итоге для каждого такого документа рассчитывается свой рейтинг, который характеризует релевантность такого документа запросу пользователя, и иных составляющих.
В зависимости от условий заданных пользователем этот рейтинг вполне может быть подкорректирован дополнительными.
Затем генерируется сам сниппет, т.е. для любого найденного документа из соответствующей таблицы извлекают заголовок, аннотацию, наиболее отвечающую запросу, и ссылка на этот документ, при этом найденные словоформы и слова подсвечивают.
Результаты полученного поиска передаются осуществившему его человеку в виде страницы, на которую выдают поисковые результаты (SERP).
5
Все эти элементы тесно связаны между собой и функционируют, взаимодействуя, образовывая отчетливый, но достаточно непростой механизм
функционирования поисковой системы, требующий громадных затрат ресурсов.
6
2 глава.
Немного истории
Самым первым посковиком был поисковик Арчи – это первая в мире программа, индексирующая Интернет, благодаря чему и считается «дедушкой всех поисковиков». Он был изобретен Аланом Эмтеджем, студентом-компьютерщиком из Барбадоса, обучавшимся в университете МакГилл. До появления Арчи единственным способом найти что-то в Интернете или на FTP-серверах было спросить у кого-нибудь или получить email с указанием того, куда идти за информацией.С помощью Роберта Кальяу Тим Бернерс-Ли пишет первый www-вебсервер. Он выходит онлайн через компьютерную сеть под названием Интернет летом 1991 года. Чтобы строить свои базы данных по сайтам, поисковые машины должны регулярно ходить по вебу. В 1993 году Мэтью Грей представил миру программу World Wide Web Wanderer. Изначально он хотел померять размеры Интернета и создал этот бот, чтобы посчитать активные веб-серверы. Вскоре он проапгрейдил его так, чтобы тот смог собирать URL-ы сайтов. Полученная им база данных стала называться Wandex(созвучно с Яндекс не спроста).
В 1996 году компания Netscape хотела заключить эксклюзивную сделку с одной из поисковых систем, сделав её поисковой системой по умолчанию на веб-браузере Netscape. Это вызвало настолько большой интерес, что Netscape заключила контракт сразу с пятью крупнейшими поисковыми системами (Yahoo!, Magellan, Lycos, Infoseek и Excite). За 5 млн долларов США в год они предлагались по очереди на поисковой странице Netscape.
Студенты последнего курса компьютерного направления Стэнфордского университета Лари Пейдж и Сергей Брин начинают сотрудничество по разработке поисковой системы BackRub. Этот проект произведет революцию в веб-поиске, потому что BackRub будет учитывать ссылки на сайт и ранжировать сайты в соответствии с ними.В 1997 году Пейдж и Брин переименовали BackRub в Google. Они произвели это имя от числительного «гугол», которое в математике используется для обозначения чисел с сотней нулей. Такое название отразило их миссию – организовать кажущееся бесконечным количество информации в вебе.
Google взял на вооружение идею продажи ключевых слов в 1998 году, тогда это была маленькая компания, обеспечивавшая работу поисковой системы по
7
адресу goto.com. Этот шаг ознаменовал для поисковых систем переход от соревнований друг с другом к одному из самых выгодных коммерческих предприятий в Интернете. Поисковые системы стали продавать первые места в результатах поиска отдельным компаниям)
На сегодняшний день поисковые системы являются сложнейшими механизмами, представляющие собой не только инструмент для нахождения любой необходимой информации, но и довольно увлекательные сферы для бизнеса. Работа с помощью поисковых систем позволяет многим пользователям глобальной сети осуществлять быстрый поиск нужной информации в кратчайшие сроки.
Для поиска информации с помощью поисковой системы пользователь формулирует поисковый запрос. Работа поисковой системы заключается в том, чтобы по запросу пользователя найти документы, содержащие либо указанные ключевые слова, либо слова, как-либо связанные с ключевыми словами. При этом поисковая система генерирует страницу результатов поиска. Такая поисковая выдача может содержать различные типы результатов, например: веб-страницы, изображения, аудиофайлы. Некоторые поисковые системы также извлекают информацию из подходящих баз данных и каталогов ресурсов в Интернете.
Поисковая система тем лучше, чем больше документов, подходящих запросу пользователя, она будет возвращать. Результаты поиска могут становиться менее релевантными из-за особенностей алгоритмов или вследствие человеческого фактора. Самой популярной поисковой системой в мире является Google(google.com) 90.2%, на втором месте Bing (bing.com) 3,23%, на третьем китайская поисковая система Baidu (baidu.com) 2,2%, далее идут Yahoo! (yahoo.com) 2,09% и Российская Yandex(yandex.ru) 0,80% (рисунок 1).
8
В русскоязычном сегменте ситуация немного отличается. В лидерах находится Yandex 50.44%, на втором месте Google 46.06%, третьи Mail.ru 2.18%, далее bing, Yahoo, DuckDuckGo и Baidu (все вместе около 1.3%) (рисунок 2).
9
3 глава.
Рассмотрим самые популярные поисковые системы:
Google.
Название происходит от числа гугол — единица со 100 нулями (намёк на то, что поисковик может найти ответ на гугол вопросов и найти гугол вещей).В общем-то, поначалу было предложение назвать поиск GooglePlex (в правильном написании Googolplex — десятка в степени гугол), но оно показалось слишком длинным и остановились на упомянутом термине (почему-то написанном в результате не правильно, но менять уже не стали, т.к. был почти сразу же приобретен домен Google.com).
Историю развития этой компании можно начинать отсчитывать с 1996 года, хотя официально поисковая система начала работать только с осени 1998 года. Имеющиеся в то время поисковики с трудом справлялись со своей задачей. Результаты поисковой выдачи имели очень низкую корреляцию с тем, что хотел увидеть в ответ на свой запрос пользователь. Дело в том, что тогда основным фактором, по которому осуществлялось определение релевантности и ранжирование документов в выдаче, была частота использования слов из запроса пользователя в документе. Понятно, что такой критерий отбора очень легко поддается накрутке со стороны вебмастеров простым увеличением "тошноты" текстов. Сложно поверить, сколько времени уже прошло с тех пор, как появился текстовый спам, с которым поисковики только сейчас начали всерьез бороться и искоренять (ибо появились другие факторы, позволяющие существенно снизить важность частоты вхождения ключей в тексте при ранжировании). Ну, вот. Ларри Пейдж с детства на примере своих родителей, вращавшихся в научных кругах, видел и понимал, что авторитет того или иного ученого во многом зависит от того, в скольких научных работах на него ссылаются, как на первоисточник или как на авторитетного специалиста. Чем больше ссылок, тем авторитетнее имя ученого.Тогда у Пейджа возникла идея перенести эту систему ранжирования на поиск в интернете. Ученых он ассоциировал с отдельными документами
10
(не сайтами, а именно отдельными вебстраницами), а ссылки в интернете
существовали аж с момента изобретения всемирной паутины WWW Тимом Бернерсом-Ли в далеком 1989 году (кстати, спустя пару лет, именно Тим основал консорциум W3C и разработал язык Html).
В результате появился фактор ранжирования, который учитывается поисковиками до сих пор — PageRank. Термин этот составной. Rank — означает ранжирование, а вот Page может означать либо веб страницу в английской вариации написания, либо то, что данный параметр ранжирования придумал никто иной как Пейдж.
PageRank совершил революцию и позволил поднять качество поиска будущего Google на недосягаемую высоту. Он позволял учитывать при ранжировании документов не только количество, но и качество ведущих на ту или иную вебстраницу ссылок. Ну, а качество ссылки, соответственно, зависело от количества входящих бэклинков на страницу-донора (донором в поисковой оптимизации принято называть того, с кого ведет линк, а акцептором — того, на кого он проставлен).
В конце концов детище Брина и Пейджа стало служить средством поиска для всех пользователей Стэнфордского университета. Создатели поисковой системы просили своих первых пользователей высказывать свои впечатления и замечания по работе поиска, пытались их учесть и доработать (фактически это был этап альфа тестирования). Поиск стал доступен в 1997 году по адресу google.stanford.edu. Из Стэндфорда была подана заявка на лицензирование технологии поиска с использованием PageRank.
На сегодняшний день, система Google является лидером среди поисковых систем мира. Google - это не только поиск, но и еще более 50 сервисов, включая очень популярный браузер Google Chrome. Помимо просто поиска, здесь можно сравнивать цены на товары в интернет-магазинах, читать новости и многое другое. Есть и служба блокировки назойливой интернет-рекламы, а так же, с помощью веб кэша, можно "оживить" казалось бы давно "мёртвые" сайты. По мнению многих специалистов, на сегодняшний день Google Chrome самый быстрый браузер в мире. Что касается оценки пользователей, то претензий к скорости работы не было выявлено, браузер открывает страницы практически мгновенно.
PageRank, используемый в Google, в основном основан на link popularity (индекс цитирования). На данный момент база данных Google насчитывает более миллиарда проиндексированных страниц. Google – одна из немногих поисковых систем, которая глубоко индексирует ваш сайт. Google использует индекс цитирования как наиболее весомый фактор в определении релевантности страницы. Поэтому большим и популярным сайтам проще
11
попасть на высокие позиции в результатах поиска. Это также защищает Google от спама. Так же анализируется плотность и частота ключевых слов, ключевые слова в ссылках, выделенный текст. В поиске разработанны языковые модели, позволяющие определять, какие сочетания слов следует искать в индексе.Для этого выполняется ряд действий – от интерпретации орфографических ошибок до определения типа введенного запроса на основе результатов последних исследований в области понимания естественного языка. Например, даже если у введенного вами слова несколько значений, Google Поиск определит верное. Это стало возможным благодаря специальной системе синонимов, которая создавалась пять лет и позволяет существенно увеличить качество результатов по более чем 30% запросов на разных языках.