Файл: Анализ поисковых систем в сети Интернет ( Теоретические основы поисковых систем ).pdf
Добавлен: 16.06.2023
Просмотров: 360
Скачиваний: 3
СОДЕРЖАНИЕ
Глава 1 Теоретические основы поисковых систем
1.1 История зарождения поисковых систем
1.2 Информационно-поисковая система. Основные компоненты
Глава 2 Сравнительный анализ поисковых систем
2.1 Тенденции в сфере востребованности поисковых систем пользователями Интернета
2.2 Оценка результатов запросов пользователей в поисковой системе Яндекс
2.3 Анализ поисковых запросов пользователей в системе Google
Введение
За последние десятилетия на фоне безудержного роста, получивших широкое развитие технологических процессов, компьютерная сеть Интернет превратилась в наиболее популярную, массовую и, как следствие, востребованную среду получения актуальной маркетинговой информации для заинтересованной в ней целевой аудитории – юридических и физических лиц.
Причем, аудитории грамотной: результаты многочисленных маркетинговых исследований, проведенных специалистами в России и за рубежом, наглядно демонстрируют то обстоятельство, что свыше 70% пользователей имеют высшее, среднее специальное, либо незаконченное высшее образование, обладают солидным потенциалом роста и дальнейшего развития, используют функциональные возможности глобальной Сети для решения своих повседневных задач, а также достижения экономических, социальных и иных целей.
В эпоху активного развития информационных технологий и внедрения глобальной компьютерной сети в повседневную жизнь общества, сегодня мало найдется людей, которые в той или иной степени не сталкивались бы с проблемами поиска информации в сети Интернет. Ощущая острую потребность в информационных ресурсах при решении каких бы то ни было вопросов и задач, пользователь Сети обычно заходит на страницу привычной для себя поисковой системы и вводит в строку поиска интересующее его слово или словосочетание.
Цель данной работы – ознакомиться с принципами работы поисковых систем и рассмотреть конкретные примеры.
В соответствии с поставленной целью будут решены следующие задачи:
- рассмотрены теоретические основы поисковых систем в интернете;
- на примере сравнения поисковых систем рассмотрены практические основы поисковых систем в интернете.
Курсовая работа состоит из введения, двух глав, заключения и библиографии.
Глава 1 Теоретические основы поисковых систем
1.1 История зарождения поисковых систем
Первая интернет-страница, при создании которой была применена технология HTTP, появилась сравнительно недавно - в 1990 году. Ее создателем является британский ученный Тим Бернерс-Ли, который также является изобретателем URI, URL, HTTP, World Wide Web. Созданный им сайт info.cern.ch (в данный момент доступный в сети в качестве авторской страницы создателя) является прародителем не только современных информационных ресурсов, но и первым в мире доступным каталогом интернет-сайтов. С этого момента Интернет начал набирать популярность не только среди научных кругов, но и среди простых обладателей персональных компьютеров.
В 1993 году была создана первая в мире поисковая система для Всемирной сети «Wandex»[1]. В ее основу был заложен World Wide Web Wanderer бот1, разработанный Метью Греем из Массачусетского технологического института. Через несколько месяцев после рождения поисковой системы «Wandex» была создана конкурирующая система «Aliweb», которая в отличие от индекса «Wandex» работает до сих пор. В 1994 году была запущена первая полнотекстовая2 («crawler-based», то есть индексирующая ресурсы при помощи робота) поисковая система «WebCrawler». Основным отличием поисковой системы от своих предшественников является предоставление возможности пользователям осуществлять поиск по любым ключевым словам на любой веб-странице. Сегодня эта технология является стандартом поиска любой поисковой системы. Поисковая система «WebCrawler» стала первой системой, о которой было известно широкому кругу пользователей.
Первой поисковой системой, которая была доступна русскоязычным пользователям Интернета, стала поисковая машина «AltaVista», которая в 1996 году запустила морфологическое расширение для русского языка. В этом же году были запущены первые отечественные поисковые системы – «Rambler.ru» и «Aport.ru». Появление первых отечественных поисковых систем ознаменовало новый этап развития Рунета, позволяя русскоязычным пользователям осуществлять запрос на родном языке, а также оперативно реагировать на изменения, происходящие внутри Сети. С запуском в 1997 году поисковой системы «Яндекс» отечественные поисковые машины начали конкурировать между собой, улучшая систему поиска и индексации сайтов, выдачи результатов, а также предлагая новые сервисы и услуги. В западных странах переломный момент в развитии поисковых систем наступил с появлением в 1997 году поисковой системы Google. Компания Google разработала собственную поисковую машину, которая дала пользователям возможность осуществлять качественный поиск с учетом морфологии, ошибок при написании слов, а также повысить релевантность3 в результатах выдачи запросов. Сегодня компания Google обрабатывает более 40 миллиардов запросов в месяц, что соответствует 62,4 % всех поисковых запросов в мире.
1.2 Информационно-поисковая система. Основные компоненты
Принципы формирования типовой информационной структуры:
· однократный ввод и многократное использование информации;
· полнота удовлетворения информационных потребностей основных групп пользователей;
· оперативное пополнение ресурсов обязательными документами;
· комфортный доступ к ресурсам в off- и on-line режимах;
· выполнение как конкретных узко тематических, так и широких по тематике запросов.
Запросы, которые формируют пользователи информационных систем, реализуются следующими способами:
· сообщения, являющиеся ответом на запрос, хранятся в явном виде в базе данных, и процесс получения ответа представляет собой выделение подмножества знаний из файлов базы данных, удовлетворяющих запросу;
· ответ не существует в явном виде в базе данных и формируется в процессе логического вывода на основании имеющихся данных.
Теория информационного поиска начиналась с исследования особенностей документальных информационно-поисковых систем (ИПС). Под информационным поиском в таких системах понимается некоторая последовательность операций, выполняемых с целью отыскания документов (статей, научно-технических отчетов, описаний к авторским свидетельствам и патентам, книг и т.д.), содержащих определенную информацию (с последующей выдачей самих документов или их копий), или с целью выдачи фактических данных, представляющих собой ответы на заданные вопросы.
Массив элементов информации, в котором производится информационный поиск, называется поисковым массивом. Существующие виды информационного обслуживания представлены в таблице[2]:
Таблица 1
Виды информационного обслуживания
|
Признак классификации |
Вид обслуживания |
|
По источнику инициативы |
· принудительное; · по запросам потребителей |
|
По типам документов |
· обслуживание опубликованными документами и/или их копиями; · обслуживание копиями неопубликованных документов (отчетов по НИР, диссертаций, переводов и т. п.) |
|
По направленности или адресности |
· информационные издания (много адресов); · избирательное распределение информации (один адрес) |
|
По периодичности или срочности |
· текущее оповещение; · ретроспективный поиск |
|
По способу доведения документов до потребителя |
· непосредственная передача документов или их копий потребителям; · двухступенчатое обслуживание (вначале информационное издание, а затем – копии заинтересовавших потребителя документов |
|
По назначению, цели |
· ознакомление; · для практического использования |
Способы реализации видов и форм обслуживания зависят от вида, назначения и способа реализации конкретной ИПС. Очевидно, что прочитать каждый документ библиотеки, чтобы найти необходимый, практически невозможно. Поэтому на протяжении истории развития информационного поиска разрабатывались и совершенствовались методы поиска.
Каждому документу, вводимому в поисковый массив, ставится в соответствии поисковый образ документа (ПОД), который представляет собой характеристику, отражающую основное смысловое содержание документа (этим ПОД отличается от кода, присваиваемого информационному элементу в фактографических ИС). В виде такой же краткой характеристики – поискового предписания или поискового образа запроса (ПОЗ) должны быть сформулирован и информационный запрос. Благодаря этому процедура поиска может быть сведена к простому сопоставлению поисковых образов документов с поисковым предписанием.
Для сопоставления ПОД и ПОЗ разрабатывают и применяют различные критерии поиска или критерии смыслового соответствия. Точность поиска определяется точностью отображения документов и запросов с помощью их поисковых образов и степенью совпадения ПОД и ПОЗ. Поэтому возможна неполнота выдачи документов, либо, напротив, «поисковый шум», которые представляют собой своеобразную плату за облегчение процедуры информационного поиска.
Процедура выражения основного смыслового содержания документа и информационных запросов на информационно-поисковом языке получила название индексирования и составляет существенную часть аналитико-синтетической обработки документов. Информационный поиск, таким образом, заключается в замене содержательного прочтения полного текста документов формальным «сличением» (сравнением на соответствие) их поисковых образов с запросами на языке индексов.
Информационный поиск реализуется при помощи информационно-поисковой системы, которая в абстрактном виде должна состоять из информационно-поискового языка, правил перехода на этот язык и критерия смыслового соответствия, определяющего объем выдачи документов или информации.
Модель организации данных в гипертекстовых справочных системах основана на сочетании ассоциативных гиперссылок и иерархического принципа организации фрагментов и документов. Концептуальная схема информационно-поисковой системы представлена на рисунке 1:
Рис. 1. Концептуальная схема информационно-поисковой системы
Модель организации данных в гипертекстовых справочных системах основана на сочетании ассоциативных гиперссылок и иерархического принципа организации фрагментов и документов.
Поисковые системы подразделяются на каталоги и указатели; они различаются технологией подготовки справочного материала: каталоги составляют люди, а указатели формируются автоматически. Самый крупный каталог Интернет – Yahoo! (www. yahoo.com); он содержит более миллион ресурсов и поддерживается 150 редакторами. Ведущий каталог России – List.Ru (www. list.ru): 100 тысяч ссылок, классифицированных по 18 каталогам.
Язык поисковых слов служит для координатного индексирования документов и запросов посредством дескрипторов и ключевых слов. В его основе лежит алфавитный перечень лексических единиц, или словарь ключевых слов. Именно язык ключевых слов открыл возможность для автоматизации информационного поиска. Он позволяет достаточно детально и многоаспектно раскрывать содержание документов. Дескрипторы и ключевые слова легко дополняются и обновляются, поскольку в алфавитный перечень можно включать любую лексическую единицу, необходимую для индексирования.
Информационно-поисковые каталоги является традиционными технологиями организации информационного поиска в документальных фондах библиотек, архивов и представляют собой классификационную систему знаний по определенной предметной области. Смысловое содержание документа в информационно-поисковых каталогах отображается тем или иным классом каталога, а индексирование документов заключается в присвоении каждому документу специально кода (индекса), соответствующего по содержанию классу (классам) каталога, и создании на этой основе специального индексного указателя.
Система метаданных является центральным логическим компонентом любой электронной библиотеки (ЭБ). Подобно тому, как библиотечный каталог организует все множество единиц хранения в систему библиотечных фондов, вокруг которой строятся все библиотечные технологии, система метаданных организует совокупность электронных информационных ресурсов (или цифровых объектов) библиотеки.
На основе системы метаданных строятся основные технологические процессы ЭБ:
· навигация в информационном пространстве;
· поиск отдельных цифровых объектов (информационных ресурсов) или их совокупностей;
· ввод, обработка и организация хранения цифровых объектов, а также их исключение (изъятие);
· управление правами доступа к цифровым объектам, включая защиту авторских прав, организации платы за доступ и т.п.
Типы метаданных:
Описательные – библиографическая информация или другие сведения о содержании (семантике) цифровых объектов.
Структурные – сведения о форматах, структуре, объеме и других формальных свойствах цифровых объектов;
Административные – права, разрешения на доступ, на коррекцию данных, данные о пользователе, данные для систем оплаты, технологические данные.
Общим типом метаданных является идентификатор, задача которого – однозначное представление цифрового объекта для внешнего лица и различных приложений.
Системы метаданных определяют класс задач, которые реализуются в ЭБ и решающим образом влияют на интероперабельность (совместимость) коллекций, имеющихся в библиотеке. Тем самым принятие тех или иных принципов в отношении метаданных фактически определяет стоимость проектов по созданию ЭБ и эффективность затрат на эти проекты.
Известны следующие системы метаданных:
MARC – машиночитаемый каталог. CSDGM– стандарт цифровых геопространственных данных. GILS – глобальная (правительственная) служба поиска информации. EAD – кодировка архивных описаний, используемая для стандартизации и классификации уникальных архивов материалов, прежде всего рукописей. TEI – инициатива по кодированию текстов. Формат Государственного регистра баз и банков данных – содержит систему метаданных для баз данных и других электронных наборов данных.