Файл: Анализ поисковых систем в сети Интернет (Поисковая система – это).pdf

ВУЗ: Не указан

Категория: Курсовая работа

Дисциплина: Не указана

Добавлен: 14.05.2023

Просмотров: 329

Скачиваний: 3

ВНИМАНИЕ! Если данный файл нарушает Ваши авторские права, то обязательно сообщите нам.

Введение

В России 70,4% (84 млн.) населения пользуется глобальной сетью. Все население Земли составляет 7,3 миллиарда человек из них 3,5 миллиарда (почти 48%) пользователей Интернета. Интернет имеет большое значение и нужен почти всем. Пользователи сети могут найти в ней много полезной и развлекательной информации и использовать её по своему желанию.

Мой выбор темы для моей курсовой работы «Анализ поисковых систем в сети Интернет» обусловлен актуальностью темы, а так же тем, что я постоянно пользуюсь ресурсами Интернета: различными приложениями для телефона, ищу нужную мне информацию, смотрю ролики на YouTube. Даже моя работа имеет непосредственное отношение к глобальной сети: я работаю специалистом по внедрению облачной CRM системы в компании.

Ресурсы глобальной сети уже много лет уже давно имеет не только развлекательный контент, их использует большинство людей самых разных профессий, а некоторые даже имеют свой весьма успешный бизнес в Интернете. Объем данных, хранящихся в Интернете, вплотную приблизился к отметке в 1,1 зеттабайта. Такие данные приводит аналитическая компания IDC, проводившая исследование по заказу EMC Corporation. 3,5 миллиарда - количество пользователей интернета в мире (всё население Земли составляет 7,3 миллиарда человек).

В сети каждые несколько часов появляется много новой информации, и большинство этой информации, конечно же, никто не нашел, и поэтому она оказалась бы никому не нужной и недоступной. Возникли потребности создать такие средства, которые бы позволили ориентироваться в информационных ресурсах Интернета, быстро находили бы необходимую информацию, при этом были бы простыми и интуитивно понятными обычным пользователям.

В это время в интернете начинают появляться поисковые средства. Несколько лет назад говорили: в Интернете ничего невозможно найти, но там есть всё. Однако когда поисковые каталоги, программы, машины развились ситуация сильно поменялась. Сейчас в глобальной сети можно очень быстро найти нужную информацию, на порядок быстрее, чем скажем в бумажном источнике, например в словаре или книге.

Самым актуальным и распространенным способом поиска в Интернете служит применение различных поисковых систем (лично мне удобнее всего пользоваться Google). Давайте разберемся, что можно назвать поисковой системой.

Поисковая система (англ. search engine) — это компьютерная система, предназначенная для поиска информации. Одно из наиболее известных применений поисковых систем — веб-сервисы для поиска текстовой или графической информации во Всемирной паутине. Существуют также системы, способные искать файлы на FTP-серверах, товары в интернет-магазинах, информацию в группах новостей Usenet. Проще говоря это портал, который ищет, собирает и сортирует информацию в Интернете, это инструмент, который позволяет в самые короткие сроки отыскать нужную информацию .Основная задача каждой поисковой системы – чтобы каждый человек нашел конкретно ту информацию, которая ему нужна.


Когда пользователь получает результат своего поиска, он как правило оценивает работу системы: Нашел он то, что искал или нет? Если нет, то сколько раз он перефразировал запрос? Актуальна ли та информация , которую он нашел? Как долго поисковая машина обрабатывала его запрос? Какой по счету был нужный результат первым (в реальности это бывает редко, так как в основном первые 1-5 мест занимает реклама) или ему пришлось долго пролистывать страницы? Каково отношение найденной нужной информации и ненужного мусора? Найдется ли, а если найдется то через какое время эта нужная информация? Когда я попользовался многими поисковыми системами и позадавал себе эти вопросы, я решил использовать Google.

Глава 1. Теория

1.1 Поисковая система - это

Поисковая система – сайт, к которому обращается пользователь и по ключевым словам находит нужную ему информацию. На сегодняшний день поисковые системы – это лучший способ найти в интернете нужную вам информацию максимально быстро и качественно.

Давайте разберемся, как работает поисковая система, что сделать достаточно несложно. Пользователь заходит на сайт системы, в специальное окно вводит ключевую фразу или слово и нажимает кнопку «поиск», по этой фразе или слову система начинает поиск информации (во многих поисковых системах на сегодняшний день есть автозаполнение, зачастую случается что в процессе написания фразы или слова уже видишь нужный тебе запрос).

После этого пользователю выдает список ссылок на сайты, которые соответствуют текущему запросу. Пожалуй это можно назвать принципом работы поисковой системы со стороны пользователя. Сейчас давайте рассмотрим внутреннее устройство и полностью процесс работы системы, который обычным пользователям незаметен.

1.2 История

Когда Интернет только появился, и начал развиваться, количество его пользователей было не очень большим, и доступной для пользователей информации было очень мало. В те годы пользовались и имели доступ к Интернету в основном работники научно-исследовательской сферы. Да и надо сказать необходимость поиска информации в Интернете не была настолько сильной как на сегодняшний день.

Создание открытых каталогов сайтов стало пробным способом организации доступа к информационным ресурсам Интернета, в этих каталогах группировались по тематике ссылки на разные ресурсы. Сайт Yahoo.com стал первым похожим проектом, он был открыт в апреле 1994 года (правда работала она на тот момент только на японском языке). После того , как количество сайтов в каталоге Yahoo подросло, нужную информацию стало возможным искать в каталоге. Это еще не была поисковая система в полном смысле этого слова, и каким мы знаем их на сегодняшний день, потому что область поиска была ограничена ресурсами, которые присутствовали в каталоге Yahoo, не во всех ресурсах Интернета.


В настоящее время каталоги потеряли свою популярность, потому что даже в наиболее больших современных каталогах имеется информация лишь о небольшой части всего интернета. Например: DMOZ (он ещё называется Open Directory Project) – один из самых огромных каталогов хранит информацию о 5 миллионах ресурсов, а база поисковой системы Google состоит более чем из 8 миллиардов документов.

«WebCrawler» вышла в мир в июне 1995 года, это была первая полноценная поисковая система. Эта поисковая система отличалась от последователей, главное отличие заключалось в предоставлении пользователю возможности искать информацию на любой веб-странице, по любым ключевым словам. Сейчас эта технология – стандарт поиска любой поисковой системы. Таким образом , «WebCrawler» стала первой поисковой системой, которой пользовались не только научные работники, а еще и широкий круг простых пользователей.

В 1996 году появились поисковые системы Lycos и AltaVista. Через год AltaVista стала доступна русскоязычным пользователям. В этом же году были запущены отечественные поисковые системы - Rambler.ru» и «Aport.ru».

Рунет (интернет на русском языке) вышел на новый уровень, когда появились первые отечественные поисковые системы, эти системы позволили всем русскоязычным пользователям осуществлять запросы на русском языке, и быстро узнавать об изменениях, которые происходят внутри глобальной сети.

В 1997 году была запущена поисковая система «Яндекс», после этого конкуренция между отечественными поисковыми машинами была очень сильной, поисковые системы начали улучшать систему поиска, индексации сайтов, выдачи результатов, начали предлагать новые услуги и сервисы.

Сергей Брин и Ларри Пейдж в 1997 году, в рамках исследовательского проекта в Стэндфордском университете, создали поисковую машину Google.

Сейчас Google – самая популярная поисковая система в мире, именно она дала возможность пользователю осуществлять с учетом морфологии качественный и быстрый поиск, ошибок при написании слов, и в результатах выдачи запросов очень сильно повысила релевантность. На сегодняшний день поисковая машина Google обрабатывает более 60 миллиардов запросов в месяц, а это более 63% всех поисковых запросов в мире.

1.3 Задачи

Основные задачи поисковых систем:

-поиск ранее не известных сайтов

-анализ сайта

-максимально верный ответ пользователю

Основная задача каждой поисковой системы, найти пользователю ту, информацию, какую он ищет. И в то же время, к сожалению невозможно обучить пользователя производить “верные” запросы к системе, т.е. запросы, которые ответствуют принципу работы поисковых систем. Именно поэтому создателям надо делать такие принципы работы и алгоритмы поисковых систем, которые бы позволяли пользователям находить ту информацию, которую они ищут.


Это говорит о том, что поисковая система обязана думать также как думает пользователь, когда ищет информацию. Когда пользователь обращается к поисковой системе, он хочет максимально просто и быстро отыскать информацию, которая его интересует. Уже после получения результата, пользователь оценивает работу системы, при этом он руководствуется некоторыми главными параметрами. Конструкторы поисковых систем всегда стараются совершенствовать алгоритмы и принципы поиска, стремятся ускорить работу системы, добавляя новейшие функции и возможности, с целью удовлетворить потребности пользователей.

1.4 Принципы работы

Поисковая машина (движок) – это программная часть поисковой системы, которая используется для сбора, обработки и представления данных пользователю. Именно эта часть составляет основу поисковых систем, которая отличает одну систему от другой. Она осуществляет быстрый поиск внутри сервера или Интернет-ресурса нужной информации. У всех без исключения поисковых систем основа движка примерно одинакова. Чаще всего, это программное обеспечение, которое отвечает за ранжирование результатов по релевантности запроса и составление каталога, поисковый бот, он необходим для поиска сайта и индексации. Однако есть такие крупные поисковые системы, которые содержат содержание своей поисковой системы в секрете. Главным отличаем является учет и релевантность морфологии языка запроса, база проиндексированных сайтов. Это все в совокупности и определяет критерий качества работы поисковых машин.

Поисковые машины классифицируются по области поиска информации:

  1. Глобальный поиск.

Он предназначен искать информацию по региональной части, или по группе сайтов, или в сети Интернет. Глобальным поиском пользуются большинство крупных поисковых систем , таких как Яндекс, Yahoo, Google и т.д.

  1. Локальный поиск.

Он осуществляет поиск информации по глобальной сети какой-либо её части, к примеру, по локальной сети, или по нескольким сайтам. Таким примером являются снутренние серверы солидных фирм или скрипт поиска на сайте.

Поисковые машины осуществляют разнообразный поиск по сети интернет. К примеру, картинки, географическое положение, музыка, личная информация и др. Поисковая машина может работать с файлами самых разнообразных форматов ( .html,.htm,.txt,.doc,.rtf, и др.), мультимедиа (звук, видео и др.) , графического типа (.gif,.png,.svg). Самым распространенным поиском считается поиск текстовых документов (документы в формате .doc,.rtf,.txt, web-страницы и др.). С технологической точки зрения поиск по картинкам, звукам, видео более сложен, посему он не реализован массово. Например, такая система как Яндекс.Картинки ищут картинки по альтернативным текстам, которые соответствуют этим изображениям, а не по самим изображениям. В Google каталог поиска картинок составлен вручную, что тормозит обновление баз изображений, и в то же время значительно увеличивает релевантность запроса.


Модуль индексирования состоит из трех вспомогательных программ-роботов:

Spider – это программа, предназначенная для скачивания веб-страниц. ”Spider” полностью обеспечивает скачивание страницы, и извлекает все внутренние ссылки из этой страницы. Html-код скачивается с каждой страницы. Роботы используют протоколы HTTP Для того, чтобы скачать страницу. “Spider” работает следующим образом : робот передает на сервер запрос “get/path/document” и несколько других http команд запроса. В ответ приходит текстовый поток, содержащий сам документ и служебную информацию.

Ссылки извлекаются из тегов Frame, Base, Area, Frameset и др. Почти все роботы, наряду со ссылками обрабатывают перенаправления (редиректы).

Все страницы сохраняются в формах:

  • дата, когда страница была скачана
  • тело страницы html-код
  • URL страницы
  • http-заголовок ответа сервера

Crawler – это программа, которая автоматически проходит по всем

ссылкам, которые находит на странице. Её задача в том, чтобы исходя из заведомо заданного списка адресов или основываясь на ссылках, определить, куда дальше должен идти Spider. Crawler осуществляет поиск более новых документов, которые еще не известны поисковой системе, следуя по найденным ссылкам.

Indexer – это программа, которая анализирует веб-страницы, которые скачали Spider и Crawler. Индексатор, используя свои логические и морфологические алгоритмы, разбирает страницу на составные части и анализирует их. Все элементы страницы подвергаются анализу, например заголовки, текст, html-теги, ссылки, структурные и стилевые особенности и др.

Благодаря этому, модуль индексирования дает возможность извлекать ссылки на новые страницы из получаемых документов и делать полный анализ этих документов, обходить по ссылкам заданное множество ресурсов, скачивать встречающиеся страницы.

База данных или индекс поисковой системы – это информационный массив, в котором хранятся преобразованные параметры всех скачанных и обработанных модулем индексирования документов.

Поисковый сервер – это важнейший элемент всей системы, потому что скорость и качество поиска напрямую зависит от его алгоритмов, которые лежат в основе его функционирования.

Рассмотрим, как работает поисковый сервер:

  • Запрос, который получен от пользователя подвергается морфологическому анализу. Генерируется информационное окружение всех документов, содержащихся в базе (как раз оно и будет отображено в виде сниппета, т. е. текстовой информации соответствует запросу на странице выдачи результатов поиска).
  • Все данные передаются специальному модулю ранжирования в качестве входных параметров. После чего по всем документам происходит обработка данных, потом подсчитывается собственный рейтинг для каждого документа, который характеризует релевантность разных составляющих данного документа, хранящихся в индексе поисковой системы запроса, введенного пользователем.
  • Этот рейтинг может быть составлен в зависимости от выбора пользователя дополнительными условиями (например, «расширенный поиск»).
  • Далее генерируется сниппет, т. е., из таблицы документов извлекаются краткая аннотация, наиболее соответствующая запросу, заголовок и ссылка на сам документ для каждого найденного документа, и еще подсвечиваются все найденные слова.
  • Пользователю результаты поиска, которые мы получили, передаются в виде SERP (Search Engine Result Page) – страницы выдачи поисковых результатов.