Файл: Анализ поисковых систем в сети Интернет ( Теоретические основы поисковых систем ).pdf

ВУЗ: Не указан

Категория: Курсовая работа

Дисциплина: Не указана

Добавлен: 16.06.2023

Просмотров: 358

Скачиваний: 3

ВНИМАНИЕ! Если данный файл нарушает Ваши авторские права, то обязательно сообщите нам.

Введение

За последние десятилетия на фоне безудержного роста, получивших широкое развитие технологических процессов, компьютерная сеть Интернет превратилась в наиболее популярную, массовую и, как следствие, востребованную среду получения актуальной маркетинговой информации для заинтересованной в ней целевой аудитории – юридических и физических лиц.

Причем, аудитории грамотной: результаты многочисленных маркетинговых исследований, проведенных специалистами в России и за рубежом, наглядно демонстрируют то обстоятельство, что свыше 70% пользователей имеют высшее, среднее специальное, либо незаконченное высшее образование, обладают солидным потенциалом роста и дальнейшего развития, используют функциональные возможности глобальной Сети для решения своих повседневных задач, а также достижения экономических, социальных и иных целей.

В эпоху активного развития информационных технологий и внедрения глобальной компьютерной сети в повседневную жизнь общества, сегодня мало найдется людей, которые в той или иной степени не сталкивались бы с проблемами поиска информации в сети Интернет. Ощущая острую потребность в информационных ресурсах при решении каких бы то ни было вопросов и задач, пользователь Сети обычно заходит на страницу привычной для себя поисковой системы и вводит в строку поиска интересующее его слово или словосочетание.

Цель данной работы – ознакомиться с принципами работы поисковых систем и рассмотреть конкретные примеры.

В соответствии с поставленной целью будут решены следующие задачи:

- рассмотрены теоретические основы поисковых систем в интернете;

- на примере сравнения поисковых систем рассмотрены практические основы поисковых систем в интернете.

Курсовая работа состоит из введения, двух глав, заключения и библиографии.

Глава 1 Теоретические основы поисковых систем

1.1 История зарождения поисковых систем

Первая интернет-страница, при создании которой была применена технология HTTP, появилась сравнительно недавно - в 1990 году. Ее создателем является британский ученный Тим Бернерс-Ли, который также является изобретателем URI, URL, HTTP, World Wide Web. Созданный им сайт info.cern.ch (в данный момент доступный в сети в качестве авторской страницы создателя) является прародителем не только современных информационных ресурсов, но и первым в мире доступным каталогом интернет-сайтов. С этого момента Интернет начал набирать популярность не только среди научных кругов, но и среди простых обладателей персональных компьютеров. 
В 1993 году была создана первая в мире поисковая система для Всемирной сети «Wandex»[1]. В ее основу был заложен World Wide Web Wanderer бот1, разработанный Метью Греем из Массачусетского технологического института. Через несколько месяцев после рождения поисковой системы «Wandex» была создана конкурирующая система «Aliweb», которая в отличие от индекса «Wandex» работает до сих пор. В 1994 году была запущена первая полнотекстовая2 («crawler-based», то есть индексирующая ресурсы при помощи робота) поисковая система «WebCrawler». Основным отличием поисковой системы от своих предшественников является предоставление возможности пользователям осуществлять поиск по любым ключевым словам на любой веб-странице. Сегодня эта технология является стандартом поиска любой поисковой системы. Поисковая система «WebCrawler» стала первой системой, о которой было известно широкому кругу пользователей. 


Первой поисковой системой, которая была доступна русскоязычным пользователям Интернета, стала поисковая машина «AltaVista», которая в 1996 году запустила морфологическое расширение для русского языка. В этом же году были запущены первые отечественные поисковые системы – «Rambler.ru» и «Aport.ru». Появление первых отечественных поисковых систем ознаменовало новый этап развития Рунета, позволяя русскоязычным пользователям осуществлять запрос на родном языке, а также оперативно реагировать на изменения, происходящие внутри Сети. С запуском в 1997 году поисковой системы «Яндекс» отечественные поисковые машины начали конкурировать между собой, улучшая систему поиска и индексации сайтов, выдачи результатов, а также предлагая новые сервисы и услуги. В западных странах переломный момент в развитии поисковых систем наступил с появлением в 1997 году поисковой системы Google. Компания Google разработала собственную поисковую машину, которая дала пользователям возможность осуществлять качественный поиск с учетом морфологии, ошибок при написании слов, а также повысить релевантность3 в результатах выдачи запросов. Сегодня компания Google обрабатывает более 40 миллиардов запросов в месяц, что соответствует 62,4 % всех поисковых запросов в мире. 

1.2 Информационно-поисковая система. Основные компоненты

Принципы формирования типовой информационной структуры:

·           однократный ввод и многократное использование информации;

·           полнота удовлетворения информационных потребностей основных групп пользователей;

·           оперативное пополнение ресурсов обязательными документами;

·           комфортный доступ к ресурсам в off-  и on-line режимах;

·           выполнение как конкретных узко тематических, так и широких по тематике запросов.

Запросы, которые формируют пользователи информационных систем, реализуются следующими способами:

·         сообщения, являющиеся ответом на запрос, хранятся в явном виде в базе данных, и процесс получения ответа представляет собой выделение подмножества знаний из файлов базы данных, удовлетворяющих запросу;

·         ответ не существует в явном виде в базе данных и формируется в процессе логического вывода на основании имеющихся данных. 


Теория информационного поиска начиналась с исследования особенностей документальных информационно-поисковых систем (ИПС). Под информационным поиском в таких системах понимается некоторая последовательность операций, выполняемых с целью отыскания документов (статей, научно-технических отчетов, описаний к авторским свидетельствам и патентам, книг и т.д.), содержащих определенную информацию (с последующей выдачей самих документов или их копий), или с целью выдачи фактических данных, представляющих собой ответы на заданные вопросы. 

Массив элементов информации, в котором производится информационный поиск, называется поисковым массивом. Существующие виды информационного обслуживания представлены в таблице[2]:   

Таблица 1

Виды информационного обслуживания

Признак классификации

Вид обслуживания

По источнику инициативы

·    принудительное;

·    по запросам потребителей

По типам документов

·    обслуживание опубликованными документами и/или их копиями;

·    обслуживание копиями неопубликованных документов (отчетов по НИР, диссертаций, переводов и т. п.)

По направленности или адресности

·    информационные издания (много адресов);

·    избирательное распределение информации (один адрес)

По периодичности или срочности

·    текущее оповещение;

·    ретроспективный поиск

По способу доведения документов до потребителя

·    непосредственная передача документов или их копий потребителям;

·    двухступенчатое обслуживание (вначале информационное издание, а затем – копии заинтересовавших потребителя документов

По назначению, цели

·    ознакомление;

·    для практического использования

            Способы реализации видов и форм обслуживания зависят от вида, назначения и способа реализации конкретной ИПС. Очевидно, что прочитать каждый документ библиотеки, чтобы найти необходимый, практически невозможно. Поэтому на протяжении истории развития информационного поиска разрабатывались и совершенствовались методы поиска. 

Каждому документу, вводимому в поисковый массив, ставится в соответствии поисковый образ документа (ПОД), который представляет собой характеристику, отражающую основное смысловое содержание документа (этим ПОД отличается от кода, присваиваемого информационному элементу в фактографических ИС). В виде такой же краткой характеристики – поискового предписания или поискового образа запроса (ПОЗ) должны быть сформулирован и информационный запрос. Благодаря этому процедура поиска может быть сведена к простому сопоставлению поисковых образов документов с поисковым предписанием.


  Для сопоставления ПОД и ПОЗ разрабатывают и применяют различные критерии поиска или критерии смыслового соответствия. Точность поиска определяется точностью отображения документов и запросов с помощью их поисковых образов и степенью совпадения ПОД и ПОЗ. Поэтому возможна неполнота выдачи документов, либо, напротив, «поисковый шум», которые представляют собой своеобразную плату за облегчение процедуры информационного поиска.

Процедура выражения основного смыслового содержания документа и информационных запросов на информационно-поисковом языке получила название индексирования и составляет существенную часть аналитико-синтетической обработки документов. Информационный поиск, таким образом, заключается в замене содержательного прочтения полного текста документов формальным «сличением» (сравнением на соответствие) их поисковых образов с запросами на языке индексов.

Информационный поиск реализуется при помощи информационно-поисковой системы, которая в абстрактном виде должна состоять из информационно-поискового языка, правил перехода на этот язык и критерия смыслового соответствия, определяющего объем выдачи документов или информации.

Модель организации данных в гипертекстовых справочных системах основана на сочетании ассоциативных гиперссылок и иерархического принципа организации фрагментов и документов. Концептуальная схема информационно-поисковой системы представлена на рисунке 1:

Рис. 1. Концептуальная схема информационно-поисковой системы

Модель организации данных в гипертекстовых справочных системах основана на сочетании ассоциативных гиперссылок и иерархического принципа организации фрагментов и документов.

Поисковые системы подразделяются на каталоги и указатели; они различаются технологией подготовки справочного материала: каталоги составляют люди, а указатели формируются автоматически. Самый крупный каталог Интернет – Yahoo! (www. yahoo.com); он содержит более  миллион ресурсов и поддерживается 150 редакторами. Ведущий каталог России – List.Ru (www. list.ru):  100 тысяч ссылок, классифицированных по 18 каталогам. 

Язык поисковых слов служит для координатного индексирования документов и запросов посредством дескрипторов и ключевых слов. В его основе лежит алфавитный перечень лексических единиц, или словарь ключевых слов. Именно язык ключевых слов открыл возможность для автоматизации информационного поиска. Он позволяет достаточно детально и многоаспектно раскрывать содержание документов. Дескрипторы и ключевые слова легко дополняются и обновляются, поскольку в алфавитный перечень можно включать любую лексическую единицу, необходимую для индексирования.


Информационно-поисковые каталоги является традиционными технологиями организации информационного поиска в документальных фондах библиотек, архивов и представляют собой классификационную систему знаний по определенной предметной области. Смысловое содержание документа в информационно-поисковых каталогах отображается тем или иным классом каталога, а индексирование документов заключается в присвоении каждому документу специально кода (индекса), соответствующего по содержанию классу (классам) каталога, и создании на этой основе специального индексного указателя.

Система метаданных является центральным логическим компонентом любой электронной библиотеки (ЭБ). Подобно тому, как библиотечный каталог организует все множество единиц хранения в систему библиотечных фондов, вокруг которой строятся все библиотечные технологии, система метаданных организует совокупность электронных информационных ресурсов (или цифровых объектов) библиотеки.

На основе системы метаданных строятся основные технологические процессы ЭБ:

·         навигация в информационном пространстве;

·         поиск отдельных цифровых объектов (информационных ресурсов) или их совокупностей;

·         ввод, обработка и организация хранения цифровых объектов, а также их исключение (изъятие);

·         управление правами доступа к цифровым объектам, включая защиту авторских прав, организации платы за доступ и т.п. 

Типы метаданных:

            Описательные – библиографическая информация или другие сведения о содержании (семантике) цифровых объектов.

            Структурные – сведения о форматах, структуре, объеме и других формальных свойствах цифровых объектов;

            Административные – права, разрешения на доступ, на коррекцию данных, данные о пользователе, данные для систем оплаты, технологические данные. 

Общим типом метаданных является идентификатор, задача которого – однозначное представление цифрового объекта для внешнего лица и различных приложений.

  Системы метаданных определяют  класс задач, которые реализуются в ЭБ и решающим образом влияют на интероперабельность (совместимость) коллекций, имеющихся в библиотеке. Тем самым принятие тех или иных принципов в отношении метаданных фактически определяет стоимость проектов по созданию ЭБ и эффективность затрат на эти проекты.

  Известны следующие системы метаданных:

MARC – машиночитаемый  каталог. CSDGM– стандарт  цифровых геопространственных данных.  GILS – глобальная (правительственная) служба поиска информации. EAD – кодировка архивных описаний, используемая для стандартизации и классификации уникальных архивов материалов, прежде всего рукописей. TEI – инициатива  по кодированию текстов. Формат Государственного регистра баз и банков данных – содержит систему метаданных для баз данных и других электронных наборов данных.