Файл: Анализ поисковых систем в сети Интернет (ПОИСКОВЫЕ ТЕХНОЛОГИИ В СЕТИ ИНТЕРНЕТ).pdf
Добавлен: 01.04.2023
Просмотров: 1158
Скачиваний: 17
ВВЕДЕНИЕ
Актуальность.
Поисковая система – это аппаратно-программный комплекс, который предназначен для осуществления функции поиска в интернете, и реагирующий на пользовательский запрос который обычно задают в виде какой-либо текстовой фразы (или точнее поискового запроса), выдачей ссылочного списка на информационные источники, осуществляющейся по релевантности.[1]
Каждый день большинство пользователей сети Интернет начинают с выхода во Всемирную сеть. Одним из основных веб-серверов является поисковая система, где люди стремятся найти столь нужные им сведения и решить собственные проблемы. К сожалению, поисковые системы нередко не могут точно и справедливо интерпретировать ресурсы. Как результат, на верхних позициях поиска нередко оказываются сайты «далекие» от решаемого вопроса.
В то же время ресурсы, представляющие реальную пользу, оказываются «за бортом» поиска. Причина этого положения проста и кроется в технологии получения и представления полученных результатов поисковыми системами. Здесь следует понимать, что основная проблема выражается в отсутствии каких-либо чётких правил, открытых и доступных для любых желающих.
Чем больше неопределенности в алгоритмах формирования поисковых индексов (особый черный ящик), тем меньше поисковые системы отражают процесс формирования реальной информации. И соответственно, тем меньше окажется уровень доверия к результатам поиска поисковых систем. Как это ни удивительно, но это вина не поисковых систем, так как они должны прятать правила построения поисковых индексов. Это вина самой технологии во время осуществления поиска.
По собственной сути технология поисковых систем ориентируется на пассивного пользователя. Следует зарегистрировать только сайт, затем всё сделает поисковый робот. Он просканирует этот ресурс - страницу за страницей, стараясь провести анализ содержания каждой из них. Трудоёмкость пользователя окажется минимальной, что позволит использовать различные методики по «обману» поисковых роботов при довольно низких затратах средств и сил.
В этой схеме работы поисковым системам следует поменять правила и алгоритмы индексирования ресурсов и построения поискового индекса. Конечно, основная часть пользователей пользовались, пользуются, и будут пользоваться классическими поисковиками. Это удобно, просто и распространено. Это - как сама привычка пользоваться поисковиками.[2]
Учитывая все вышеизложенное, цель настоящей работы – анализ поисковых систем в сети Интернет.
Цель исследования обуславливает решение следующих задач:
- изучить историю создания поисковых систем;
- рассмотреть классификацию поисковых систем в сети Интернет;
- провести сравнительный анализ поисковых систем.
ГЛАВА 1. ПОИСКОВЫЕ ТЕХНОЛОГИИ В СЕТИ ИНТЕРНЕТ
Поисковая система – это программное оснащение, предоставляющее доступ к набору полуструктурированной информации. Ориентация на слабоструктурированные сведения, то есть данные, которые нельзя представить в форме реляционной таблицы, отличает поисковую систему от системы управления базами данных. В этом определении поисковой системы понимается информация разного рода, то есть аудио, текст, изображения, видео и т.д. Однако следует обратить внимание на то, что как раз текстовые данные идеально подходят для характеристики полной функциональности поисковой системы, так как алгоритмы отбора мультимедийной информации, в первую очередь, строятся на алгоритмах поиска текста.[3]
Поисковые системы при пользовании Интернета играют очень важную роль. В Интернете сконцентрировано такое количество информации, что ее поиск уже трансформируется в отдельную задачу и занимает очень много времени. Поисковые сервера выдают на запрос несколько тысяч ссылок вместо нескольких страниц, где действительно содержатся нужные сведения. Пользователи всемирной сети Интернет, поняв преимущества, предоставляемые возможностью анализа пространственных данных, нуждаются в особом инструменте, позволяющем осуществлять удобный и быстрый поиск, а также доступ к разным цифровым снимкам местности и иным пространственным данным, сконцентрированным во многих коммерческих, правительственных и академических организациях.[4]
1.1 История развития поисковых систем
Во времена, когда только начиналось развитие интернета, объём общедоступной информации был относительно мал, и пользователей сети было немного. На первоначальных стадиях развития сети, ею пользовались сотрудники университетов и исследовательских лабораторий для взаимообмена информацией между учреждениями. В то время поиск данных в сети интернет был не актуальным, нежели в нынешнее время.
Первым методом систематизации и организации доступа к информационным ресурсам стало создание разных каталогов сайтов. В них начали группировать ссылки по четко определенной тематике.[5]
Первопроходцем оказался сайт Yahoo, запущенный в апреле 1994 года. После того, как количество сайтов в каталоге Yahoo начало существенно расти, стала доступна возможность выполнения поиска информации по каталогу. Это, естественно, не было поисковой системой в полном смысле, так как сфера поиска ограничивалась лишь средствами, имеющимися в каталоге, а не всеми ресурсами сети Интернет. Реестры ссылок часто применялись и ранее, но почти потеряли свою популярность в настоящее время. Причина этого довольно проста – даже современные каталоги, включающие в себя огромное количество ресурсов, представляют информацию только об очень незначительной части сети Интернет. Наиболее крупный каталог сети Open Directory Project (раньше Directory Mozilla) содержит сведения только о 5 миллионах ресурсов. При этом база поисковой системы Google включает свыше 8 миллиардов документов.
Первой полноценной поисковой системой оказался проект WebCrawler, запущенный в 1994 году. В 1995 году появились поисковые системы Lycos и AltaVista. При этом последняя на протяжении многих лет была лидером в области поиска данных и информации в Интернет. В 1997 году Сергей Брин и Ларри Пейдж создали Google в ходе исследовательского проекта в Стэндфордском университете. Сейчас момент Google – наиболее популярная поисковая система во всём мире. 23 сентября 1997 года была официально анонсирована поисковая система Yandex, наиболее популярная в русскоязычной части Интернет. Сейчас существует 3 главные международные поисковые системы – Google, Yahoo и MSN Search, имеющие свои базы и алгоритмы поиска. Основная часть остальных поисковых систем (которых можно насчитать большое количество) использует в разном виде результаты 3 перечисленных. К примеру, поиск AOL (search.aol.com) и Mail.ru пользуются базой Google, а AltaVista, Lycos и AllTheWeb – базой Yahoo. В России главной поисковой системой является Яндекс, за ним следуют Rambler, Google.ru, Aport, Mail.ru и KM.ru.
Поисковая система включает в себя из следующие главные компоненты:
- Spider (паук) – браузероподобная программа, скачивающая веб-страницы. Crawler (краулер, «путешествующий» паук) – программа, автоматически проходящая по всем ссылкам, обнаруженным на странице.
- Indexer (индексатор) – программа, проводящая анализ веб-страниц, скачанных пауками. Database (база данных) – хранилище скачанных и обработанных страниц. Search engine results engine (система выдачи результатов) – программа, получающая результаты поиска из базы данных.
- Web server (веб-сервер) – веб-сервер, осуществляющий взаимодействие между пользователем и другими составными частями поисковой системы. Детальная реализация поисковых механизмов может отличаться друг от друга (к примеру, связка Spider + Crawler + Indexer может быть выполнена в форме единой программы, скачивающая известные веб-страницы, после чего проводит анализ их и ищет по ссылкам новые ресурсы), однако всем поисковым системам характерны рассмотренные общие черты.
- Spider (паук) – это программа, скачивающая веб-страницы тем же методом, что и браузер пользователя. Отличие заключается в том, что браузер отображает сведения, содержащиеся на странице (графические, текстовые и т.п.), а паук не обладает визуальными компонентами и работает напрямую с html-текстом страницы (вы можете сделать «просмотр html-кода» в вашем браузере, чтобы увидеть «сырой» html-текст).
- Crawler – программа, выделяющая все ссылки, имеющиеся на странице. Её задача – выяснить, куда дальше должен направиться паук, основываясь на ссылках или исходя из заранее заданного перечня адресов. Краулер, следуя по обнаруженным ссылкам, выполняет поиск новых документов, еще неизвестных поисковой системе.
- Indexer (индексатор) – программа, которая разбирает страницу на составные части и проводит их анализ. Выделяются и анализируются разные элементы страницы, такие как текст, заголовки, стилевые и структурные особенности, специальные служебные html-теги и т.п.
- Database (база данных) – это хранилище всех сведений, скачиваемых и анализируемых поисковой системой. Изредка базу данных считают индексом поисковой системы.
- Search Engine Results Engine является системой выдачи результатов и занимается ранжированием страниц. Она решает, какие именно страницы удовлетворяют пользовательскому запросу, и в какой последовательности они должны быть отсортированы. Это происходит по алгоритмам ранжирования поисковой системы. Такая информация оказывается самой интересной и ценной для нас – как раз с этим элементом поисковой системы взаимодействует оптимизатор, стараясь улучшить позиции сайта в выдаче, поэтому в последующем мы подробно изучим все факторы, оказывающие воздействие на ранжирование результатов.
- Web server. Обычно на сервере есть html-страница с полем ввода, в котором пользователем задаётся интересующий его поисковый запрос. Ещё веб-сервер отвечает за выдачу полученных результатов пользователю в форме html-страницы.[6]
1.2 Классификация поисковых систем
Все поисковые системы условно можно поделить на три больших класса:
1) Поисковые машины (search engines). Иначе их ещё называют программы-пауки и программы-червяки. Эти программы ползают от одного сайта к другому, методично индексируя его контент. Все, что находит подобный червяк, оказывается в базе данных, куда каждый пользователь может обратиться с запросом. Преимущество этих программ – обширная база данных, то есть почти вся сеть. Минус – это то, что в ответ на каждый запрос вы получите тысячи адресов веб-страниц.
2) Веб-каталоги или поисковые порталы (directories). Информация в них организована в виде древовидной структуры, чаще всего по тематическому признаку и на основании рейтинга. Адреса и описания веб-сайтов переносятся в каталог по заявке. Записи редактируются вручную модератором, web-мастером. Во многие каталоги попасть сложно, некоторые такую услугу делают платной. Желание хозяев сайтов попасть в каждый каталог (чем больше, тем лучше) обусловлено стремлением разместить свою ссылку на чужом сайте и, соответственно, увеличить рейтинг в метапоисковых системах, о чем будет сказано ниже. Если Вы стараетесь повысить количество посетителей на собственном сайте, то следует выбрать такой каталог, где Вас будет видно. При этом эффект от размещения ссылки в малом каталоге в случае наличия интересного контента порой оказывается довольно высоким, так как с этих сайтов посетители переходят чаще всего по какой-либо ссылке. Однако регистрация в таких каталогах как Yahoo и Open Directory желательна, так как их информационные базы используются метапоисковыми системами во время определения рейтинга.
3) Метапоисковые системы – это поисковые системы, у которых нет своей базы данных с адресами и характеристикой ресурсов. Они пользуются базами данных каталогов. В своей базе данных имеются лишь адреса ресурсов. Поиск с помощью таких систем сейчас считается самым популярным.
1. Поисковые машины:
AltaVista (вид сверху) – торговая марка популярной поисковой машины. В настоящее время база данных AltaVista считается наиболее крупной в Интернете. Помимо разветвленных средств поиска текстовой информации, она содержит такие инструменты, как Photo Finder – поиск изображений, технологию перевода документов в режиме «онлайн» и возможность индексирования на разных языках. В сотрудничестве с фирмой AskJeeves, AltaVista создала базу данных, управляемую с помощью команд на поддерживаемых ею языках.
Excite – это поисковая машина. Технология Excite лицензирована фирмой Netscape Communications для применения на портале NetCenter, а также корпорацией America Online (с правом собственного дополнения базы данных). Она имеет интеллектуальные алгоритмы поиска с использованием технологии Intelligent Concept Extraction, помогающие работать не только с отдельными ключевыми словами, но и с объединяющими их терминами. Если, например, вы введете фразу «система образования», то поисковая машина просмотрит и страницы, где есть слова «учебник», «школа» и т.п. Итак, ПИ оказывается довольно эффективной при поиске разных материалов по смежным понятиям.
Goto – поисковая машина. Фирма начала собственную деятельность с покупки старой и довольно известной поисковой машины WWW Worm. Затем решили подобрать ссылки на наиболее популярные темы поиска и разместить соответствующие ключевые слова на заглавной странице. Результаты поиска нередко получаются такие же, что и в HotBot, Snap и Yahoo, а порой даже лучше.
HotBot (Wired Digital) - с 1998 года поисковая машина принадлежит фирме Lycos. Здесь применяется оригинальная технология Inktomi, позволяющая осуществлять полноценный текстовый поиск по произвольному ключевому слову. Главными посетителями её поискового сервера являются компьютерщики-профессионалы, применяющие HotBot для поиска нужного программного обеспечения и данных, связанных с разными информационными технологиями. В то же время компьютерной тематикой эта поисковая система, безусловно, не ограничена. Непрерывно ведется работа, направленная на последующее её развитие, то есть происходит пополнение базы данных Inktomi, подготавливаются новые версии алгоритмов и т.п.
InfoSeek – поисковая машина, когда-то входящая в десятку лучших. Сейчас она больше ориентирована на электронную коммерцию. После создания в 1999 году совместного с фирмой Walt Disney нового суперпортала Go Network, сайт входит в первую десятку по посещаемости.
Northern Light – поисковая машина создавалась для повышения информативности поиска в Интернете. Ее главная идея – поиск по контексту. Спайдер фирмы каждый день индексирует тысячи сайтов, в число которых входят электронные издания, службы новостей, периодика, академические библиотеки и электронные архивы текстов. Еще одной чертой поисковой машины Northern Light, выгодно отличающей её от других, является возможность сортирования полученных сведений по адресам сайтов и тематикам. Желающие могут подписаться на все доступные тематические подборки, к примеру, на материалы конкретных рубрик из любимых газет и журналов, а потом на протяжении года получать специально подготовленную и отсортированную информацию. Проект Northern Light считается одним из наиболее масштабных в Интернете.