Файл: Анализ поисковых систем в сети Интернет (Понятие и функции поисковой системы).pdf
Добавлен: 20.05.2023
Просмотров: 195
Скачиваний: 3
СОДЕРЖАНИЕ
ГЛАВА 1. ПОИСКОВЫЕ СИСТЕМЫ: ПОНЯТИЕ, ФУНКЦИИ, ПРИНЦИПЫ РАБОТЫ
1.1 Понятие и функции поисковой системы
1.2 Основные характеристики поисковой системы
1.3 История развития поисковых систем
1.4 Состав и принципы работы поисковой системы
ГЛАВА 2. РЕЙТИНГ ПОИСКОВЫХ СИСТЕМ ИНТЕРНЕТА
2.1 Популярные поисковые системы мира
2.2 Популярные поисковые системы Рунета
ВВЕДЕНИЕ
Интернет прочно вошел в жизнь практически каждого современного человека. Уже сложно представить, как можно было раньше обходиться без этого гигантского хранилища информации, в котором можно почерпнуть столько полезного и занимательного. Глобальная сеть стала не только местом, где можно найти ответы на все вопросы, но также способом общения, взаимодействия с другими людьми. С помощью компьютерной сети каждый человек сегодня может получить образование, найти работу, наладить личную жизнь, в общем, стать полноценным членом общества.
Люди умело пользуются предоставленными благами цивилизации, порой не задумываясь, как именно они работают. Вряд ли найдется хоть один пользователь сети, который не использует для получения информации поисковые системы. На сегодняшний день существует множество поисковых систем, конкурирующих между собой за право называться лучшими.
Поисковые системы – это сервисы, которые сканируют все сайты, находящиеся в сети, анализируют информацию на страницах и выдают пользователям список страниц подходящих под запрос. Для сбора и обработки данных с сайтов используются различные программные алгоритмы (роботы).
Целью данной курсовой работы является анализ поисковых систем в сети Интернет. Для этого необходимо рассмотреть принципы работы и функционирования поисковых систем, схему обработки запросов; определить наиболее популярные поисковые системы мира и Рунета.
ГЛАВА 1. ПОИСКОВЫЕ СИСТЕМЫ: ПОНЯТИЕ, ФУНКЦИИ, ПРИНЦИПЫ РАБОТЫ
1.1 Понятие и функции поисковой системы
Поисковая система - это программно-аппаратный комплекс, предназначенный для осуществления поиска в сети Интернет и реагирующий на запрос пользователя, задаваемый в виде текстовой фразы (поискового запроса), выдачей списка ссылок на источники информации, в порядке релевантности (в соответствии запросу). Наиболее крупные международные поисковые системы: «Google», «Yahoo», «MSN». В русском Интернете это – «Яндекс», «Рамблер», «Апорт».
Рассмотрим понятие поискового запроса. Поисковый запрос должен быть сформулирован пользователем в соответствии с тем, что он хочет найти, максимально кратко и просто. Для этого открываем главную страницу поисковой системы и вводим текст поискового запроса. Далее, задача сводится к тому, чтобы открыть предоставленные по запросу ссылки на источники информации в Интернет.
Однако, возможна ситуация, когда нужная информация не найдена. Если это произошло, то нужно либо перефразировать свой запрос, либо в базе поисковой системе действительно нет никакой актуальной информации по нашему запросу.
Основная задача любой поисковой системы – доставлять людям именно ту информацию, которую они ищут. А научить пользователей делать «правильные» запросы к системе, т.е. запросы, соответствующие принципам работы поисковых систем, невозможно. Поэтому разработчики создают такие алгоритмы и принципы работы поисковых систем, которые бы позволяли находить пользователям искомую ими информацию (рис.1).
Это означает, поисковая система должна «думать» так же, как думает пользователь при поиске информации.
Рисунок 1. Пример поиска информации
Когда пользователь обращается с запросом к поисковой машине, он хочет найти то, что ему нужно, максимально быстро и просто. Получая результат, он оценивает работу системы, руководствуясь несколькими основными параметрами [2]:
- Нашел ли он то, что искал?
- Если не нашел, то сколько раз ему пришлось перефразировать запрос, чтобы найти искомое?
- Насколько актуальную информацию он смог найти?
- Насколько быстро обрабатывала запрос поисковая машина?
- Насколько удобно были представлены результаты поиска?
- Был ли искомый результат первым или же сотым?
- Как много ненужного мусора было найдено наравне с полезной информацией?
- Найдется ли нужная информация, при обращении к поисковой системе, скажем, через неделю, или через месяц?
Для того, чтобы получить правильные ответы на подобные вопросы, разработчики поисковых систем постоянно совершенствуют алгоритмы и принципы поиска, добавляют новые функции и возможности, всячески пытаются ускорить работу системы.
1.2 Основные характеристики поисковой системы
Рассмотрим основные характеристики поисковых систем [3]:
- Полнота
Полнота представляет собой отношение количества найденных по запросу информационных документов к общему числу документов в сети Интернет, относящихся к данному запросу. Например, если в Интернете имеется 100 страниц, содержащих словосочетание «как выбрать автомобиль», а по соответствующему запросу было найдено всего 60 из них, то полнота поиска будет 0,6. В этом случае, чем полнее поиск, тем меньше вероятность того, что пользователь не найдет нужный ему документ, при условии, что он вообще существует в Интернете.
- Точность
Точность определяется степенью соответствия найденных документов запросу пользователя. Например, если по запросу «как выбрать автомобиль» находится 100 документов, в 40 из них содержится словосочетание «как выбрать автомобиль», а в остальных просто наличествуют эти слова («как правильно выбрать магнитолу и установить в автомобиль»), то точность поиска считается равной 40/100 (=0,4). Чем точнее поиск, тем быстрее пользователь найдет нужные ему документы, тем меньше различного рода «мусора» среди них будет встречаться, тем реже найденные документы не будут соответствовать запросу.
- Актуальность
Актуальность характеризуется временем, проходящим с момента публикации документов в сети Интернет, до занесения их в индексную базу поисковой системы. Например, на следующий день после появления интересной новости, большое количество пользователей обратились к поисковым системам с соответствующими запросами. В большинстве случаев информация об этой новости уже доступна в поиске, хотя с момента публикации новостной информации на эту тему прошло меньше суток. Это происходит благодаря наличию у крупных поисковых систем так называемой «быстрой базы», которая обновляется несколько раз в день.
- Скорость поиска
Скорость поиска тесно связана с так называемой «устойчивостью к нагрузкам». Например, по данным ООО «Рамблер Интернет Холдинг», на сегодняшний день в рабочие часы к поисковой машине Рамблер приходит около 60 запросов в секунду. Такая загруженность требует сокращения времени обработки отдельного запроса. Интересы пользователя и поисковой системы в этом случае совпадают: посетитель желaет получить результаты как можно быстрее, а поисковая машина должна отрабатывать запрос максимально оперативно, чтобы не притормозить обработку следующих запросов.
- Наглядность
Наглядность представления результатов является важнейшим компонентом удобного поиска. В результате большинства запросов поисковая машина находит сотни, a то и тысячи документов. Из-за нечеткости составления запросов или неточности поиска, даже первые страницы выдачи не всегда содержат нужную информацию. Это означает, что пользователю часто приходится производить свой собственный поиск среди предоставленных результатов. Различные элементы страницы выдачи поисковой системы помогают ориентироваться в результатах поиска.
1.3 История развития поисковых систем
В начальный период развития Интернет, число его пользователей было небольшим, a объем доступной информации сравнительно невеликим. В тот период доступ к ней имели, в основном, работники различных крупных учебных заведений и лабораторий, и полученные данные использовались в научных целях. Использование Сети не имело такой актуальности, как сейчас.
В 1990 году британский ученный Тим Бернерс-Ли (который также является изобретателем URI, URL, HTTP, World Wide Web) создал сайт info.cern.ch, который является первым в мире доступным каталогом интернет-сайтов. С этого момента Интернет начал набирать популярность не только среди научных кругов, но и среди простых обладателей персональных компьютеров [1].
Так, первым способом облегчения доступа к информационным ресурсам в Интернете стало формирование каталогов сайтов. Ссылки на ресурсы в них были сгруппированы по тематике.
Первым проектом такого рода принято считать Yahoo, открытый в апреле 1994 года. В связи со стремительным ростом количества сайтов в нём, вскоре появилась возможность поиска необходимой информации по запросу. Конечно же, это ещё не было полноценной поисковой системой. Поиск был ограничен только данными, которые находились в каталоге.
Каталоги ссылок широко использовались ранее, однако практически полностью утратили свою популярность в настоящее время. Так как даже современные, огромные по своему объему каталоги, содержат информацию лишь о ничтожно малой части сети Интернет. Самый известный и большой каталог сети DMOZ (его еще называют Open Directory Project) содержит информацию о 25 миллионах страниц [2].
Хронология развития поисковых систем [1]
1945 год – американский инженер Ванневар Буш опубликовал записи идеи, которая привела в дальнейшем к изобретению гипертекста, и рассуждение о необходимости разработки системы быстрого извлечения данных из хранимой информации таким образом (эквивалент сегодняшних поисковых систем). Введённое им понятие устройства-расширителя памяти содержало оригинальные идеи, которые, в конце концов, воплотились в Интернете.
1960-е — Джерард Сэлтон и его группа в Корнелльском университете разработали «Остроумную систему извлечения информации» (SMART information retrieval system). SMART — аббревиатура от Salton’s Magic Automatic Retriever of Text, то есть «Волшебный автоматический извлекатель текста Сэлтона». Джерард Сэлтон считается отцом современной поисковой технологии.
1987-1989 – разработана Archie — поисковая система для индексации FTP архивов. Archie представлял из себя сценарий, автоматизирующий внедрение в листинги на ftp-серверах, которые затем переносились в локальные файлы, а уже потом в локальных файлах осуществлялся быстрый поиск необходимой информации. Поиск основывался на стандартной grep-команде Unix, а доступ пользователя к данным осуществлялся на основе telnet.
В следующей версии данные были разбиты на отдельные базы, одна из которых содержала только текстовые названия файлов; а другая — записи со ссылками на иерархические директории тысячи хостов; и еще одна, соединяющая первые две. Эта версия Archie была эффективней предыдущей, так как поиск производился только по именам файлов, исключая множество существующих ранее повторов.
Поисковая система становилась всё популярнее, и разработчики задумались, как ускорить её работу. Упомянутая выше база данных была заменена на другую, основанную на теории сжатого дерева. Новая версия, по существу, создала полнотекстную базу данных вместо списка имен файлов и была значительно быстрее, чем раньше. В дополнение, второстепенные изменения позволили системе Archie индексировать web-страницы. К сожалению, по различным причинам, работа над Archie вскоре прекратилась.
В 1993 году была создана первая в мире поисковая система для Всемирной сети Wandex. В её основу был заложен World Wide Web Wanderer бот, разработанный Метью Греем из Массачусетского технологического института.
1993 год – Мартин Костер создаёт Aliweb – одну из первых поисковых систем по World Wide Web. Владельцы сайтов должны были сами их добавлять в индекс Aliweb, чтобы они появлялись в поиске. Поскольку слишком мало вебмастеров это делали, Aliweb не стал популярным
20 апреля 1994 г. – Брайан Пинкертон из университета Вашингтон выпустил WebCrawler — первого бота, который индексировал страницы полностью. Основным отличием поисковой системы от своих предшественников является предоставление возможности пользователям осуществлять поиск по любым ключевым словам на любой веб-странице. Сегодня эта технология является стандартом поиска любой поисковой системы. Поисковая система «WebCrawler» стала первой системой, о которой было известно широкому кругу пользователей. К сожалению, пропускная способность была невысокой и в дневное время система часто была недоступной.
20 июля 1994 г. – открылся Lycos — серьезная разработка в технологии поиска, созданная в университете Карнеги Мелон. Майкл Малдин был ответственен за эту поисковую систему и до сих пор остаётся ведущим специалистом в Lycos Inc. Lycos открылся с каталогом в 54,000 документов. И в дополнение к этому результаты, которые он предоставлял, были ранжированными, кроме того он учитывал приставки и приблизительное совпадение. Но главным отличием Lycos был постоянно пополняемый каталог: к ноябрю 1996 было проиндексировано 60 миллионов документов — больше, чем у любой другой поисковой системы того времени.