Файл: .Информационно-аналитические системы на базе OLAP-технологий.pdf

ВУЗ: Не указан

Категория: Реферат

Дисциплина: Не указана

Добавлен: 06.07.2023

Просмотров: 602

Скачиваний: 6

ВНИМАНИЕ! Если данный файл нарушает Ваши авторские права, то обязательно сообщите нам.

Введение

Часто в компаниях существует несколько информационных систем – системы складского учета, бухгалтерские системы, ERP системы для автоматизации отдельных производственных процессов, системы сбора отчетности с подразделений компании, а также множество информации, хранящейся в виде файлов, которые расположены на компьютерах сотрудников.

Более 33% отечественных топ-менеджеров к перспективным информационным технологиям, предназначенным для решения инновационных задач, относят сбор и анализ информации. Предполагая с их помощью «ускорить решение таких задач, как прогнозирование тенденций и выявление изменений в поведении и в требованиях клиентов» [2].

Имея несколько разрозненных источников информации, часто бывает очень сложно получить ответы на ключевые вопросы деятельности компании и увидеть общую картину. А когда нужная информация все же находится в одной из используемых систем или локальном файле, то она часто оказывается устаревшей или противоречит информации, полученной из другой системы.

Получение аналитической отчётности в информационных системах, основанных на традиционных базах данных сопряжено с рядом ограничений:

  • разработка каждого отчёта требует времени и ресурсов;
  • отчёты формируются очень медленно, замедляя при этом работу всей информационной системы;
  • данные, получаемые от различных структурных элементов компании не унифицированы и часто противоречивы;

Данная проблема эффективно решается с помощью информационно-аналитических систем, построенных на базе OLAP-технологий.

Актуальность OLAP-технологий обусловлена их практической значимостью для анализа больших объемов данных, позволяющие преодолеть ограничения традиционных информационных систем. В связи с этим имеется проблема выбора оптимальных схем хранения и обработки OLAP данных [1].

Целью данного реферата является классификация OLAP-систем по различным критериям. Реализация поставленной цели обусловила необходимость решения следующих задач:

  • определить понятие OLAP-технологии;
  • рассмотреть 12 определяющих признаков OLAP;
  • рассмотреть классификацию OLAP-технологий;
  • выявить достоинства и недостатки каждого из предложенных типов OLAP;
  • выявить основный преимущества OLAP-систем.

Предметом исследования является аналитическая обработка данных.

Объектом исследования являются OLAP-технологии.

Реферат состоит из введения, двух глав и заключения. В первой главе рассматривается определение понятия OLAP-технологии, 12 признаков OLAP, FASMI. Во второй главе описывается классификация OLAP-технологий. В третьей главе описываются основные преимущества OLAP-cистем. В четверной главе описываются недостатки OLAP-систем.


Исследования по данной теме были обнаружены в работах следующих авторов: Codd E.F., Codd S.B., Salley C.T., Celko Joe, Rob Mattison, S. Bimonte, A. Tchounikine, M. Miquel, Кудрявцев Ю.А., Erik Thomsen, Барсегян А.А., Куприянов М.С., Степаненко В.В. Паклин Н.Б., Орешков В.И. и других.

Термины и определения

Термин

Определение

Гибкий анализ данных (Ad hoc analysis)

Совокупность методов для построения новых или изменения сделанных ранее запросов к БД. Конечные пользователи имеют возможность делать запросы и анализировать данные, не программируя отдельных операций.

Объединение

Операция по вычислению значений, связанных с родительскими позициями в иерархических измерениях. Агрегирование может быть суммированием, усреднением или каким-либо другим более сложным действием для получения вторичного, интересующего аналитика значения.

Многомерный анализ

Анализ данных,  собранных по нескольким переменным (измерениям).

Измерение

Список значений, принадлежащих к одному и тому же типу данных с точки зрения пользователя. Например, дни, месяцы, кварталы и годы с точки зрения пользователя относятся к одному и тому же типу "Время". Понятие измерений позволяет интуитивно понятно организовать работу человека с данными.

FASMI (Fast Analysis of Shared Multidimensional Information)

Быстрый анализ разделяемой многомерной информации. Определяет принадлежность продукта к категории OLAP.

Гибридный OLAP (Hybrid OLAP)

Агрегатные структуры хранит в многомерном хранилище, сами данные в реляционной базе данных.

Гиперкуб

Многомерная конструкция, предназначенная для хранения данных Каждая ячейка (cell) определена отдельным элементом из каждого измерения (dimension).

Многомерный OLAP (Multidimensional OLAP).

Определяет многомерность некой структуры данных, подразумевает наличие трех или более независимых измерений.

Многомерная структура данных

Структура данных, имеющая не меньше трех независимых измерений.

Оперативная аналитическая обработка (данных), OLAP (On-Line Analytical Processing)

Категория приложений и технологий, которые обеспечивают сбор, хранение, манипулирование и анализ многомерных данных. Анализируемая информация представляется в виде многомерных кубов, где измерениями служат показатели исследуемого процесса, а в ячейках содержатся агрегированные данные.

Оперативная обработка транзакций (On-Line Transaction Processing)

Включает ввод, структурированное хранение и обработку оперативной информации (операций, документов) в режиме реального времени.

Вращение данных

Преобразования столбцов таблицы данных в строки и наоборот.

Реляционный OLAP (Relational OLAP)

Программный продукт предназначен для многомерного анализа данных, метаданных и вычисленных агрегатов. Для физической реализации многомерной модели данных используется реляционный сервер баз данных. Многомерная обработка данных выполняется либо на сервере реляционной базы данных, либо на сервере промежуточного уровня, либо на стороне клиента.

Срез

Выборка данных из многомерного куба таким образом, представляющая собой двумерную проекцию куба.

Продольные и поперечные, плоскостные и объемные срезы, с английского – Slice and Dice

Выборка данных из многомерного куба с заданными значениями и заданным взаимным расположением измерений.

Витрина данных

Специализированое локальное тематическое хранилище, подключенное к централизованному хранилищу данных и обслуживающее отдельное подразделение организации или определенное направление ее деятельности


1.Информационно-аналитические системы на базе OLAP-технологий

OLAP (от англ. OnLine Analytical Processing — оперативная аналитическая обработка данных) — подход к аналитической обработке данных, базирующийся на их многомерно-иерархическом представлении, являющийся частью более широкой области информационных технологий — бизнес-аналитики [3]. «12 законов аналитической обработки в реальном времени» OLAP были сформулированы в 1993 г. Е. Ф. Коддом.

Таблица 1 – 12 определяющих принципов OLAP

Принцип

Описание

1

Многомерное представление данных

Средства должны поддерживать многомерный на концептуальном уровне взгляд на данные.

2

Прозрачность

Пользователь не должен знать о том, какие конкретные средства используются для хранения и обработки данных, как данные организованы и откуда они берутся.

3

Доступность

Средства должны сами выбирать и связываться с наилучшим для формирования ответа на данный запрос источником данных. Средства должны обеспечивать автоматическое отображение их собственной логической схемы в различные гетерогенные источники данных.

4

Согласованная производительность

Производительность практически не должна зависеть от количества Измерений в запросе.

5

Поддержка архитектуры клиент-сервер

Средства должны работать в архитектуре клиент-сервер.

6

Равноправность всех измерений

Ни одно из измерений не должно быть базовым, все они должны быть равноправными (симметричными).

7

Динамическая обработка разреженных матриц

Неопределенные значения должны храниться и обрабатываться наиболее эффективным способом.

8

Поддержка многопользовательского режима работы с данными

Средства должны обеспечивать возможность работать более чем одному пользователю.

9

Поддержка операций на основе различных измерений

Все многомерные операции (например Агрегация) должны единообразно и согласованно применяться к любому числу любых измерений.

10

Простота манипулирования данными

Средства должны иметь максимально удобный, естественный и комфортный пользовательский интерфейс.

11

Развитые средства представления данных

Средства должны поддерживать различные способы визуализации (представления) данных.

12

Неограниченное число измерений и уровней агрегации данных

Не должно быть ограничений на число поддерживаемых Измерений.


Термин OLAP, предложенный Эдгаром Коддом (Edgar Codd) для разграничения таких систем с OLTP-системами (от англ. OnLine Transaction Processing — обработка транзакций в реальном времени), некоторые эксперты считают слишком широким. Поэтому Найджел Пендс (Nigel Pendse) предложил использовать для описания этой концепции и взамен предложенных Коддом 12-ти правил OLAP так называемый тест FASMI (от англ. Fast Analysis of Shared Multidimensional Information — быстрый анализ доступной многомерной информации), более точно характеризующую требования к этим системам.

Fast (быстрый) отражает упомянутое выше требование к скорости реакции системы. По Пендсу, интервалы с момента инициации запроса до получения результата должен измеряться секундами. Важность этого требования возрастает при использовании таких систем в качестве инструмента оперативного представления данных для аналитика, так как длительное время ожидания может пагубно влиять на цепочку рассуждений аналитика.

Analysis (анализ) предполагает приспособленность системы к использованию в релевантной для задачи и пользователя бизнес-логике с сохранением доступной «обычному» пользователю легкости оперирования данными без использования низкоуровневого специального инструментария.

Shared (доступность, общедоступность) описывает очевидное требование к возможности одновременного многопользовательского доступа к информации с интегрированной системой разграничения прав доступа вплоть до уровня конкретной ячейки данных.

Multidimensional (многомерность) является ключевым требованием концепции. Предполагается, что система должна обеспечивать полную поддержку многомерного иерархического представления как «наиболее логичного пути анализа бизнеса и организаций». Отметим, что многомерность указывает на модель концептуального представления данных, то есть на то, как пользователь должен представлять организацию данных при формулировании запросов, а не на то, в каких структурах хранятся данные физически.

Сущность многомерного представления данных состоит в следующем. Большинство бизнес-процессов описываются множеством показателей, свойств, атрибутов и т.д. Например, для описания процесса продаж могут понадобиться сведения о наименованиях товаров или их групп, о поставщике и покупателе, о городе, где производились продажи, а также о ценах, количествах проданных товаров и общих суммах. Кроме того, для отслеживания процесса во времени должен быть введен такой атрибут, как дата. Если собрать всю эту информацию в таблицу, то она окажется сложной для анализа. Более того, она может оказаться избыточной. Указанные проблемы возникают по причине того, что в плоской таблице хранятся многомерные данные. Доказано, что реляционная модель не является оптимальной с точки зрения задач анализа данных, поскольку предполагает высокую степень нормализации, в результате чего снижается скорость выполнения запросов. Поэтому разработку многомерной модели представления данных следует реализовывать с помощью многомерных кубов.


Многомерность в рамках OLAP предполагает концептуальное представление данных в виде многомерной структуры данных — гиперкуба (OLAP-куба), рёбрами в котором выступают измерения (dimension), например, Дата, Покупатель, Время, а данные (facts — факты; measures —меры, показатели) – даты, наименования товаров, ФИО покупателей и т.д., расположены на пересечении осей измерений [интуит].

В такой системе каждому набору значений измерений будет соответствовать ячейка, в которой можно разместить числовые показатели (то есть факты), связанные с данным набором. Таким образом, между объектами бизнес-процесса и их числовыми характеристиками будет установлена однозначная связь. [4] Принцип организации многомерного куба представлен на рисунке 1:

Рисунок 1 - Принцип организации многомерного куба

В ячейке 1 располагаются факты, относящиеся к продаже цемента ООО «Спецстрой» 3 ноября, в ячейке 2 – к продаже плит ЗАО «Пирамида» 6 ноября, в ячейке 3 – к продаже плит ООО «Спецстрой» 4 ноября.

Многомерный взгляд на измерения Дата, Товар и Покупатель представлен на рисунке 2:

Рисунок 2 - Измерения и факты в многомерном кубе

Фактами в данном случае являются Цена, Количество, Сумма. Тогда выделенный сегмент содержит информацию о том, сколько плит, на какую сумма и по какой цене приобрела фирма ЗАО «Строитель» 3 ноября.

В процессе поиска и извлечения из гиперкуба нужной информации над его измерениями производится ряд действий, наиболее типичными из которых являются:

  • сечение (срез);
  • транспонирование;
  • свертка;
  • детализация.

Сечение заключается в выделении подмножества ячеек гиперкуба при фиксировании значения одного или нескольких измерений. В результате сечения получается срез или несколько срезов, каждый з который содержит информацию, связанную со значением измерения, по которому он был построен. Манипулируя сечениями гиперкуба всегда можно сформироваться кросс-таблицу и с ее помощью очень быстро будет получен необходимый отчет [4]. На рисунке 3 схематично представлены сечения гиперкуба:

Рисунок 3 - Сечения гиперкуба

Слева сечение при некотором фиксированном значении измерения Дата. Полученный срез содержит информацию обо всех товарах и всех покупателях на определенную дату. На правом фрагменте рисунка получено два среза, пересечение которых содержит информацию обо всех покупателях, но на определенный товар и на определенную дату.