Файл: .Информационно-аналитические системы на базе OLAP-технологий.pdf
Добавлен: 06.07.2023
Просмотров: 601
Скачиваний: 6
СОДЕРЖАНИЕ
1.Информационно-аналитические системы на базе OLAP-технологий
3. Классификация аналитических систем
3.1.1 Классификация по способу организации данных в многомерных кубах
3.1.2 Классификация по месту нахождения
3.1.3 Классификация по степени готовности к применению
3.2 Классификация инструментов добычи данных
3.3 Классификация средств построения Хранилищ и Витрин данных
3.4 Классификация управленческих информационных систем и приложений
3.5 Инструменты конечного пользователя для выполнения запросов и построения отчетов
3.6 Классификатор аналитических систем
Транспонирование (вращение) обычно применяется к плоским таблицам, полученным в результате среза, и позволяет изменить порядок представления измерений таким образом, что измерения, отображавшиеся в столбцах, будут отображаться в строках, и наоборот.
Операции свертки (группировки) и детализации (декомпозиции) возможны только тогда, когда имеет место иерархическая подчиненность значений измерений. При свертке одно или несколько подчиненных значений измерений заменяются теми значениями, которым они подчинены. Пример свертки могут быть представлены в таблицах 2,3:
Таблица 2 - Исходная таблица
|
Группа |
Товар |
Сумма |
|
Стройматериалы |
Кирпич |
22000 |
|
Цемент |
12000 |
|
|
Керамзит |
4500 |
|
|
Доска |
7400 |
|
|
Инструмент |
Отвертка |
1200 |
|
Электропила |
7600 |
|
|
Дрель |
2450 |
|
|
Шпатель |
780 |
Таблица 3 - Результат свертки исходной таблицы по измерению «Товар»
|
Группа |
Сумма |
|
Стройматериалы |
45900 |
|
Инструмент |
12030 |
Детализация – это процедура обратная свертке, уровень обобщения данных уменьшается. При этом значения измерений более высокого иерархического уровня заменяются одном или несколькими значениями более низкого уровня, то есть вместо наименований групп товаров отображаются наименования отдельных товаров.
Использование многомерной модели данных сопряжено с определёнными трудностями. Так для реализации требуется большой объем памяти. Это связано с тем, что при реализации физической многомерности используется большое количество технической информации, поэтому объем данных, который будет поддерживаться многомерным хранилищем данных обычно не превышает несколько десятков гигабайт. Кроме того, многомерная структура труднее поддается модификации, при необходимости встроить еще одно измерение требуется выполнить физическую перестройку всего многомерного куба. На основании этого можно сделать вывод, что применение систем хранения, в основе которых лежит многомерное представление данных, целесообразно только в тех случаях, когда объем используемых данных сравнительно велик, а сама многомерная модель имеет стабильный набор измерений[4].
В данном разделе рассмотрены общие принципы построения систем многомерного экспресс анализа данных, построенные на основе OLAP-продуктов.
Также рассмотрены определения и основные особенности OLAP-технологии. Представлены 12 определяющих принципов OLAP и тест FASMI. Описано многомерное представление данных, а также способы представления многомерных данных в двумерной плоскости.
2. Архитектура OLAP-систем
На архитектуру конкретных OLAP-систем оказывают влияние несколько факторов. Среди них — взаимодействие с источниками данных, особенности организации хранения данных в самой OLAP-системе и подход к обработке данных в ней.
На рисунке представлена архитектура OLAP-систем:
Рисунок 4 - Архитектура OLAP-систем
Слой извлечения, преобразования и загрузки данных включает организационные подразделения и структуры организации всех уровней, поддерживающие базы данных оперативного доступа.
Он представляет собой самый низкий уровень генерации информации, уровень внутренних и внешних информационных источников, вырабатывающих первоначальную информацию.
Эта информация является рабочей для повседневной деятельности различных подразделений, которые ее вырабатывают и используют.
Загрузка данных из источников в хранилище осуществляется специальными процедурами, позволяющими:
- извлекать данные из различных баз данных, текстовых файлов;
- выполнять различные типы согласования и очистки данных;
- преобразовывать данные при перемещении их от источников к хранилищу;
- загружать согласованные и "очищенные" данные в структуры хранилища
Слой хранения данных предназначен для хранения значимой, проверенной, согласованной, непротиворечивой и хронологически целостной информации, которую с достаточно высокой степенью уверенности можно считать достоверной.
Слой реализован в виде хранилища данных (ХД) или витрины данных (ВД). Как правило, ХД или ВД реализуется в виде реляционной БД, работающей под управлением достаточно мощной реляционной СУБД.
Слой анализа данных предназначен для организации доступа аналитиков к данным ХД и ВД, используя специализированные рабочие места, поддерживающие необходимые технологии как оперативного, так и долговременного анализа. Результаты работы аналитиков оформляются в виде отчетов, графиков, рекомендаций и сохраняются как на локальном компьютере, так и в общедоступном узле локальной сети.
Современный подход к инструментальным средствам анализа не ограничивается использованием какой-то одной технологии. В настоящее время принято различать следующие основные вида аналитической деятельности:
- стандартная отчетность;
- нерегламентированные запросы;
- многомерный анализ (OLAP);
- извлечение знаний (data mining).
3. Классификация аналитических систем
Для обозначения аналитических технологий и средств в целом принято использовать термин "Business Intelligence" или, сокращенно, - BI. Понятие BI объединяет различные средства и технологии анализа и обработки данных масштаба предприятия. На их основе создаются BI-системы. Их цель - повысить качество информации для принятия управленческих решений. BI-системы больше известны под названием Систем Поддержки Принятия Решений (СППР, DSS, Decision Support System). В качестве синонимов понятия "СППР" оперируют также понятиями "аналитическая система" или "управленческая система".
По оценкам IDC рынок BI состоит из 5 сегментов:
- OLAP-продукты,
- инструменты добычи данных,
- средства построения Хранилищ и Витрин данных,
- управленческие информационные системы и приложения,
- инструменты конечного пользователя для выполнения запросов и построения отчетов.
Рассмотрим более подробно каждый сегмент.
3.1 Классификация OLAP-систем
OLAP системы можно классифицировать по следующим параметрам:
- по способу организации данных в многомерных кубах;
- по способу хранения на физическом уровне;
- по месту нахождения OLAP машины, рассчитывающей многомерные кубы;
- по степени готовности к применению для конечного пользователя.
В различных OLAP системах используются два основных варианта организации данных [5]: гиперкубическая и поликубическая модели. В гиперкубической модели все показатели должны определяться одним и тем же набором измерений. Поликубическая модель предполагает, что в БД определяется несколько гиперкубов с различной размерностью и с различными измерениями в качестве их граней.
Как исходные, так и агрегированные данные могут храниться либо в реляционных, либо в многомерных структурах. Применяются три способа хранения данных на физическом уровне [5].
3.1.1 Классификация по способу организации данных в многомерных кубах
ROLAP, Relational OLAP – реляционный OLAP
В реляционных OLAP-системах структура куба данных хранится в реляционной базе данных.
Исходные данные остаются в той же реляционной базе данных, где они изначально и находились. Агрегированные данные помещают в специально созданные для их хранения служебные таблицы в той же базе данных. Серверы ROLAP наследуют возможности масштабирования и работы с транзакциями реляционных систем, однако существенные различия между запросами в стиле OLAP и SQL являются причиной низкой производительности. Достоинства и недостатки ROLAP архитектуры приведены в таблице 4:
Таблица 4 - Достоинства и недостатки ROLAP систем
|
Достоинства |
Недостатки |
|---|---|
|
Развитые средства администрирования; хорошая масштабируемость |
Для сложных запросов SQL не является оптимальным. Функциональность систем ограничивается возможностями SQL, так как аналитические запросы пользователя транслируются в SQL-операторы выборки; |
|
Высокий уровень защиты данных и разграничения прав доступа |
Неодинаковое время выполнения запроса для различных измерений |
|
Возможность использования ROLAP с хранилищами данных и различными OLTP-системами |
Сложно пересчитывать агрегированные значения при изменениях начальных данных |
|
Возможность манипулирования большими объемами данных; объем данных могут ограничивать только лежащие в основе ROLAP системы реляционных баз данных |
Ограниченные возможности с точки зрения расчета значений функционального типа. |
|
В случае переменной размерности задачи ROLAP не требуют физической реорганизации БД, как в случае MOLAP. |
Меньшая производительность, чем у MOLAP. |
|
Системы ROLAP могут функционировать на гораздо менее мощных клиентских станциях, чем системы MOLAP. |
|
|
Инструменты ROLAP позволяют производить анализ непосредственно над хранилищем данных. |
MOLAP, Multidimensional OLAP – многомерный OLAP
Исходные и агрегированные данные хранятся в многомерных структрурах. MOLAP напрямую поддерживает многомерные представления данных с помощью многомерного механизма хранения. Скорость вычисления агрегатных значений одинакова для любого из измерений. Однако в этом случае многомерная база данных оказывается избыточной, так как многомерные данные полностью содержат исходные реляционные данные. Достоинства и недостатки MOLAP архитектуры приведены в таблице 5.
Таблица 5 – Достоинства и недостатки MOLAP систем
|
Достоинства |
Недостатки |
|---|---|
|
Все данные хранятся в многомерных структурах, что существенно повышает скорость обработки запросов |
Низкий коэффициент использования дискового пространства, особенно в случае разреженных данных |
|
Доступны расширенные библиотеки для сложных функций оперативного анализа |
Необходимы специальные инструменты для формирования кубов и их пересчёта в случае изменения базовых значений |
|
Многомерные запросы путем непосредственного доступа к ячейкам гиперкуба |
Сложно изменять измерения без повторной агрегации |
|
Структура и интерфейсы наилучшим образом соответствуют структуре аналитических запросов. |
MOLAP могут работать только со своими собственными многомерными БД и основываются на патентованных технологиях для многомерных СУБД, поэтому являются наиболее дорогими. |
|
Многомерные СУБД легко справляются с задачами включения в информационную модель разнообразных встроенных функций. |
По сравнению с реляционными, очень неэффективно используют внешнюю память, обладают худшими по сравнению с реляционными БД механизмами транзакций. |
|
Отсутствуют единые стандарты на интерфейс, языки описания и манипулирования данными. |
|
|
Не поддерживают репликацию данных, часто используемую в качестве механизма загрузки. |
HOLAP, Hybrid OLAP – гибридный OLAP
В гибридных OLAP сочетаются черты ROLAP и MOLAP, отсюда и название – гибридный. В моделях HOLAP используются преимущества и минимизируются недостатки обеих архитектур.
Гибридная архитектура, которая объединяет технологии ROLAP и MOLAP. HOLAP могут работать в двух режимах: вертикальной декомпозиции и горизонтальной декомпозиции [5, 7]. В первом случае HOLAP системы применяют ROLAP подход для разреженных областей многомерного пространства (исходные данные) и MOLAP – подход для плотных областей (агрегированные данные). При горизонтальной декомпозиции применяют MOLAP подход для оперативных данных и ROLAP подход – для исторических.
К достоинствам подхода можно отнести комбинирование технологии ROLAP для разреженных данных и MOLAP для плотных областей, а к недостаткам – необходимость поддерживания MOLAP и ROLAP.