Файл: Организация информационного поиска.docx

ВУЗ: Не указан

Категория: Не указан

Дисциплина: Не указана

Добавлен: 01.05.2021

Просмотров: 248

Скачиваний: 2

ВНИМАНИЕ! Если данный файл нарушает Ваши авторские права, то обязательно сообщите нам.
  1. Мессенджеры-программы или сервисы для мгновенного обмена сообщениями, голосовой связи и видеосвязи в сети Интернет.

Система мгновенного обмена сообщениями, Система обмена мгновенными сообщениями (англ. Instant messaging, IM) — службы мгновенных сообщений (Instant Messaging Service, IMS), программы онлайн-консультанты (OnlineSaler) и программы-клиенты (Instant Messenger, IM) для обмена сообщениями в реальном времени через Интернет. Могут передаваться текстовые сообщения, звуковые сигналы, изображения, видео, а также производиться такие действия, как совместное рисование или игры. Многие из таких программ-клиентов могут применяться для организации групповых текстовых чатов или видеоконференций.

Почтовые системы на основе WWW обеспечивают обмен сообщениями в режиме оффлайн осуществляется за счет взаимодействие двух программ – почтового сервера и почтового клиента.

Служба IRC (Internet Relay Chat или Чат) является первым средством для онлайнового общения, которая предоставляет большой выбор каналов (тем) для проведения дискуссий. Сеть IRC, разделилась на несколько (DALnet, IRCnet, UNDERnet, RusNet, WeNet, IrcNet.ru и т.д.).

Служба мгновенных сообщений ( Instant Messaging Service, IMS). Кроме текстовых сообщений можно передавать, звуковые сигналы, картинки, видео, файлы.(ICQ , Skype, Miranda IM, Google Talk client, Mail.Ru Agent client, VoxOx ) Протоколы - Jabber , XMPP.

Функции:

  • чат (видеочат, текстовый и голосовой);

  • VoIP сервисы: звонки на компьютер, звонки на стационарные и мобильные телефоны;

  • возможность отправки SMS;

  • передача файлов;

  • инструменты для совместной работы в режиме реального времени;

  • возможность общаться в чате непосредственно на веб-странице;

  • напоминания и оповещения;

  • хранение истории общения по каждому контакту;

  • индикация о сетевом статусе пользователей (в сети, нет на месте и т.д.), занесенных в список контактов.

Организация информационного поиска в Internet.

  1. Особенности структуры WEB. Объем. Поверхностная и скрытая части Web. Графовая структура, сообщества, NK-кланы, ссылки.

WWW – это множество Web-серверов в Internet

Web-сервер - компьютер в Internet, на котором представлены Web-страницы

Web страница - документ, который имеет графический интерфейс и содержимое которого описано так называемым языком HTML (Hypertext Markup Language - язык гипертекстовой разметки документа)

Web-сайт (узел) - совокупность тематически связанных Web-страниц

URL - Uniform Resourse Locator – это универсальный способ обозначения ресурса Internet.

Обозначение URL состоит из трех частей:

первая указывает тип связи, который следует установить с нужным вам источником (протокол),

вторая – имя требуемого сервера,

третья – полное имя ресурса, т.е. имя файла на сервере, включающее путь к нему.

Чаще всего пользователь находит на необходимые ему новые источники в Сети через информационно-поисковые системы, такие как Google, Yahoo! или "Яндекс", которые для многих стали "де-факто" стандартными. Однако кроме видимой для поисковых систем части Web-пространства существует огромное количество страниц, которые ими не охватываются. При этом доступ пользователя к таким ресурсам в принципе возможен (хотя иногда "слегка прикрыт" паролями). Как правило, эти Web-страницы доступны в Интернет, однако выйти на них трудно, а порой невозможно, если не знать точного адреса. Эти ресурсы уже десять лет как имеют собственное название - "скрытый" (deep) Web, которое ввел Джилл Иллсворт (Jill Ellsworth) в 1994 году, обозначив им источники, недоступные для обычных поисковых систем. Сегодня такие ресурсы называют также невидимым (invisible) Web. Они чаще всего охватывают динамически формируемые Web-страницы, содержание которых хранится в базах данных и доступно лишь по запросам пользователей.


В 2000 году американская компания BrightPlanet (www.brightplanet.com) опубликовала сенсационный доклад, в котором утверждается, что в Web-пространстве в сотни раз больше страниц, чем их удалось проиндексировать самыми популярными поисковыми системами. Эта же компания разработала программу LexiBot, которая позволяет сканировать некоторые динамические Web-станицы, формируемые из баз данных, и запустив ее, получила неожиданные данные. Выяснилось, что для традиционных поисковых систем огромная часть Сети попросту невидима. Топология паутины - "галстук-бабочка"

В отличие от данных из обычного хранилища информации, документы из Web-пространства характеризуется большим количеством неявно включенных в них экспертных оценок, реализованных в виде взаимных гипертекстовых ссылок. Именно гиперссылки оказались в свое время основой для построения модели Web-пространства (или, попросту, веба). И именно их остутствие порождает скрытые области в этом пространстве.

Гра́фовая база данных — разновидность баз данных с реализацией сетевой модели в виде графа и его обобщений. Графовую модель данных обычно рассматривают как обобщение RDF-модели или сетевой модели данных[1]. Основными элементами модели являются узлы и связи. В зависимости от реализации узлов и ребер граф-модель данных разделяют на несколько подтипов.

Данный вид баз данных применяется для моделирования социальных графов (социальных сетей)[2], биоинформатике, а также для семантического веб[3].

По мнению некоторых авторов, для задач с естественной графовой структурой данных графовые СУБД могут существенно превосходить реляционные по производительности, а также иметь преимущества в наглядности представления и внесения изменений в схему БД[4].

nk-кланы это входящие-исходящие ссылки интернет-ресурса.
это почти как page rank, но только page rank это коэффициент, считающийся по формуле из входящих-исходящих ссылок, а нк-кланы - это просто совокупность таких ссылок. нужны для определения релевантности-нерелевантности запросов

Ссы́лка — это запись, которая идентифицирует документ или его часть. Используется для связи документа с другими документами или частей документа между собой. Более полная идентификация используется в библиотечном деле в виде библиографической записи.

Используют также термины внутренняя ссылка (ссылающаяся на другую часть того же документа) и внешняя ссылка (ссылающаяся на другой документ).

Ссылки как средство указания на источник приводимой информации существуют и в устной речи, и на письме ровно с тех пор, как эти самые средства передачи информации появились. Особенность ссылки — её краткость: не требуется приводить часть текста (цитировать), а достаточно лишь указать источник.

  1. Особенности информационного поиска в WEB по сравнению с информационно-справочными системами. Модель поведения типичного пользователя.


Информацио́нный по́иск (англ. information retrieval) — процесс поиска неструктурированной документальной информации.

Поиск информации представляет собой процесс выявления в некотором множестве документов (текстов) всех тех, которые посвящены указанной теме (предмету), удовлетворяют заранее определенному условию поиска (запросу) или содержат необходимые (соответствующие информационной потребности) факты, сведения, данные.

Процесс поиска включает последовательность операций, направленных на сбор, обработку и предоставление информации.

В общем случае поиск информации состоит из четырех этапов:

  • определение (уточнение) информационной потребности и формулировка информационного запроса;

  • определение совокупности возможных держателей информационных массивов (источников);

  • извлечение информации из выявленных информационных массивов;

  • ознакомление с полученной информацией и оценка результатов поиска.

Типичный пользователь стремится к нахождению как можно более полной информации по своему запросу за как можно меньшее время.

  1. Архитектура поисковой системы для WEB. Понятия: хранилище документов, модуль индексирования, индекс, сетевой робот, поисковая машина, формат запроса.

Поиско́вая систе́ма (англ. search engine) — это компьютерная система, предназначенная для поиска информации. составляющие поисковой системы: поисковый робот, индексатор, поисковик[14].

В архитектуру поисковой системы включены: поисковый робот, сканирующий сайты сети Интерет, индексатор, обеспечивающий быстрый поиск, и поисковик — графический интерфейс для работы пользователя.

Обычно системы работают поэтапно. Сначала поисковый робот получает контент, затем индексатор генерирует доступный для поиска индекс, и наконец, поисковик обеспечивает функциональность для поиска индексируемых данных. Чтобы обновить поисковую систему, этот цикл индексации выполняется повторно[14].

Поисковые системы работают, храня информацию о многих веб-страницах, которые они получают из HTML страниц. Поисковый робот или «краулер» (англ. Crawler) — программа, которая автоматически проходит по всем ссылкам, найденным на странице, и выделяет их. Краулер, основываясь на ссылках или исходя из заранее заданного списка адресов, осуществляет поиск новых документов, ещё не известных поисковой системе. Владелец сайта может исключить определённые страницы при помощи robots.txt, используя который можно запретить индексацию файлов, страниц или каталогов сайта.

Поисковая система анализирует содержание каждой страницы для дальнейшего индексирования. Слова могут быть извлечены из заголовков, текста страницы или специальных полей — метатегов. Индексатор — это модуль, который анализирует страницу, предварительно разбив её на части, применяя собственные лексические и морфологические алгоритмы. Все элементы веб-страницы вычленяются и анализируются отдельно. Данные о веб-страницах хранятся в индексной базе данных для использования в последующих запросах. Индекс позволяет быстро находить информацию по запросу пользователя


Поисковик работает с выходными файлами, полученными от индексатора. Поисковик принимает пользовательские запросы, обрабатывает их при помощи индекса и возвращает результаты поиска[14].

Когда пользователь вводит запрос в поисковую систему (обычно при помощи ключевых слов), система проверяет свой индекс и выдаёт список наиболее подходящих веб-страниц (отсортированный по какому-либо критерию), обычно с краткой аннотацией, содержащей заголовок документа и иногда части текста.

Хранилище

Хранит электронные документы. Хранилище документов также включает в себя и управление тех же самых документов, которое оно хранит; также хранилище обеспечивает миграцию с одного носителя на другой и обеспечивает целостность данных.

Хранилище документов может представлять собой как файловое хранилище, так и хранилище в виде СУБД (базы данных). В свою очередь, хранилище документов в СУБД может производиться как в одной (единой) базе данных, так и в раздельных базах данных.

Поисковая машина (поиско́вый движо́к) — комплекс программ, предназначенный для поиска информации. Обычно является частью поисковой системы.

Основными критериями качества работы поисковой машины являются релевантность (степень соответствия запроса и найденного, т.е. уместность результата), полнота индекса, учёт морфологии языка.

  1. Стратегии сканирования пространства WEB сетевыми роботами. Особенности сканирования скрытого Web.

Ро́бот, или бот, а также интернет-бот, www-бот и т. п. (англ. bot, сокр. от чеш. robot) — специальная программа, выполняющая автоматически и/или по заданному расписанию какие-либо действия через те же интерфейсы, что и обычный пользователь. При обсуждении компьютерных программ термин употребляется в основном в применении к Интернету.

1. Spider (паук)Автономно работающая программа, предназначенная для скачивания веб-страниц. «Паук» обеспечивает скачивание страницы и извлекает все внутренние ссылки с этой страницы. Скачивается html-код каждой страницы. Для скачивания страниц роботы используют протоколы HTTP. Работает «паук» следующим образом. Робот на сервер передает запрос “get/path/document” и некоторые другие команды HTTP-запроса. В ответ робот получает текстовый поток, содержащий служебную информацию и непосредственно сам документ. Ссылки извлекаются из элементов гипертекста. Наряду со ссылками, многими роботами обрабатываются редиректы (перенаправления). Программа скачивает на диск поискового сервера содержимое исследуемых страниц. Каждая скачанная страница сохраняется в следующем формате:

  • URL страницы

  • дата, когда страница была скачана

  • http-заголовок ответа сервера

  • тело страницы (гипертекст документа)

2. Crawler («путешествующий» паук) программа, которая автоматически проходит по всем ссылкам, найденным на странице. Выделяет все ссылки, присутствующие на странице. Его задача - определить, куда дальше должен идти паук, основываясь на ссылках или исходя из заранее заданного списка адресов. Crawler, следуя по найденным ссылкам, осуществляет поиск новых документов, еще неизвестных поисковой системе и добавляет их в список ожидающих индексации. .


3. Indexer (робот- индексатор) - программа, которая анализирует веб-страницы, скаченные пауками. Индексатор разбивает страницу на составные части и анализирует их, применяя собственные лексические и морфологические алгоритмы. Анализу подвергаются различные элементы страницы, такие как текст, заголовки, ссылки структурные и стилевые особенности, специальные служебные элементы текста и т.д.Для этого он составляет “словарь” странички, запоминает “частоту” использования слов. Особо отмечает ключевые слова, используемые в заголовках, выделенные в тексте жирным шрифтом. Помещает все это в особый файл - “индекс”.

Традиционная поисковая система чаще всего может назвать адрес базы данных, но не скажет, какие документы конкретно содержаться в ней. Типичный пример - информационно-поисковые системы по украинскому (http://www.rada.gov.ua) или российскому законодательству (http://www.kodeks.ru/). Тысячи документов из баз данных становятся доступны только после входа в систему, а роботы стандартных поисковых систем не в состоянии заиндексировать контент баз данных. Многие поисковые системы как глобальные, так и локальные - описаны на сайтах Search Engine Watch (http://www.searchenginewatch.com) и Search Engine Showdown (http://www.searchengineshowdown.com). На этих сайтах приведены, среди прочих, и поисковые системы "скрытого" веба:

- Singingfish (http://www.singingfish.com) - поисковая система Singingfish обеспечивает поиск аудио- и видеофайлов, представленных на веб-сайтах.

- Scirus (http://www.scirus.com) - поисковая система по представленным в Интернете научным материалам, включая статьи из журналов и отчеты. Со страницы расширеного поиска (Advanced Search) доступны многочисленные тексты из баз данных EBSCO и ProQuest.

- UFOSeek (http://www.ufoseek.com) - поисковая система по материалам о паронормальных явлениях и НЛО. Качественный и полноценный поиск информации в "скрытом" вебе возможен и с использованием таких специализированных коммерческих баз данных, как Dialog, ProQuest, Web of Science. Но эти базы данных ввиду своей платности сами являются объектами "скрытого" веба.

  1. Понятие релевантного и нерелевантного документа. Методы ранжирования результатов поиска. Модели PageRank, “голосования”, HITS.

Релева́нтность (лат. relevo — поднимать, облегчать) в информационном поискесемантическое соответствие поискового запроса и поискового образа документа[1]. В более общем смысле, одно из наиболее близких понятию качества «релевантности»«адекватность», то есть не только оценка степени соответствия, но и степени практической применимости результата

Целью ИПС является выдача документов, релевантных(семантически соответствующих) запросу (по-английски relevant - относящийся к делу). Различают релевантностьсодержательнуюи формальную. Релевантность содержательная трактуется как соответствие документа информационному запросу, определяемое неформальным путем (Василиса Премудрая сама прочитает письма всех добрых молодцев и выберет кандидатов в женихи, отвечающих ее требованиям), а релевантность формальная - как соответствие, определяемое алгоритмически путем сравнения поискового предписания и поискового образа документа на основании применяемого в информационно-поисковой системе критерия выдачи.