Файл: Влияние информационных технологий на системы поддержки принятия решений.pdf

ВУЗ: Не указан

Категория: Курсовая работа

Дисциплина: Не указана

Добавлен: 14.06.2023

Просмотров: 184

Скачиваний: 2

ВНИМАНИЕ! Если данный файл нарушает Ваши авторские права, то обязательно сообщите нам.

Еще одним методом классификации является классификация по функциональности:[[15]]

  1. Определенной функции СППР. Системы решающие определенный круг задач в какой-либо предметной области. Поддерживают принятие решений, например только в финансах или маркетинге.
  2. Системы общего назначения. Используются для разработки поддержки принятия решений в широком круге задач. Таких как управление проектами, анализ решений, планирование бизнеса. С помощью некоторых систем общего назначение возможно создать систему нацеленную на поддержку решений определенных задач, описанную в пункте 1. Такие ситемы называются генераторами СППР.

Таким образом, мы описали классификацию систем поддержки принятия решений, основываясь на различных свойствах этих систем. Однако надо заметить, что большинство авторов опираются на классификацию систем по управляющим компонентам. Перечислим их еще раз: Управляемые моделями (Model-Driven DSS), Управляемые данными (Data-Driven DSS), Управляемые сообщениями (Communication-Driven DSS), Управляемые документами (Document-Driven DSS), Управляемые знаниями (Knowledge-Driven DSS).

3. Информационные технологии в СППР

В этой главе опишем основные информационные технологии, которые используются в построении систем поддержки принятия решений.

Рассмотрим основные компоненты, составляющие архитектуру СППР. Основными блоками информационной технологии систем поддержки принятия решения являются:

  1. Система извлечения, обработки и загрузки данных (ETL система)
  2. Информационные хранилища данных
  3. Многомерные базы данных и средства OLAP
  4. Средства Data mining

Система ETL(Extract, Transform, Load — дословно «извлечение, преобразование, загрузка») занимается, на конечном этапе, загрузкой данных полученных обычно с использованием технологии OLTP (On-Line Transaction Processing) в хранилище данных.

Основными функциями системы ETL являются:[[16]]

  1. Загрузка данных из источников (Extract)
  2. Очистка данных от ошибок (Transform)
  3. Мэппинг данных с целевой моелью хранилища (Transform)
  4. Агрегация данных до уровня OLAP систем (Transform)
  5. Выгрузка данных в хранилище

Схема ETL представлена на Рис.1.

Рис. 1

Технология OLTP (Online Transaction Processing) транзакционная система, представляет собой систему, позволяющую в реальном времени размещать в базе данных, большой поток небольших по размеру транзакций. Обеспечивает полноту, актуальность и согласованность информации, содержащейся в базе данных. Примером использования может служить фиксация банковских и биржевых операция, регистрация прохождения детали по конвейеру, фиксация статистики посещения сайта.


Также загрузка информации в базы данных может осуществляться путем поиска ее в интернете по Web каналам, через загрузку подготовленных операторами файлы данных, таблицы, специальные формы. Системы сканирования и системы распознавания текстов. Все это осуществляется путем использования современных технологий оцифровки данных. В этих случаях информация разделяется на структурированную и неструктурированную. Структурированная информация представляет собой файл, представляющий собой в общем случае таблицу. Неструктурированные данные это информация, которая не содержит определенной структуры, чаще всего это текст.

Хранилище данных представляет собой базу данных построенную на основе OLTP данных и другой разнородной информации. Перед поступлением в хранилище данные обрабатываются посредством механизма ETL. Все это необходимо для того, чтобы бизнес-аналитик не только оперировал данными оперативного учета (так называемая оперативная отчетность), но имел возможность производить полнофункциональный анализ, строить прогнозы и при этом работать с системой в тех бизнес-терминах, которые он использует в повседневной работе.

Еще одна задача Хранилища Данных – интеграционная, то есть предоставление возможности объединить разнородные источники информации в единое информационное пространство, с которым удобнее работать и которым легче управлять. Во многих компаниях установлены разнородные системы, отвечающие (причем очень эффективно) за выполнение тех или иных задач. Хранилище данных обеспечивает интеграцию этих источников информации и одновременно «разгружает» учетные системы, освобождая их от построения отчетов.

Кроме того, на предприятиях существует большой объем нерегламентированной информации, которую также необходимо подвергать анализу. Это информация, которая приходит от руководящих и регулирующих органов и не поступает в базу данных предприятия, а также информация, получаемая из Интернета, и любые другие существенные для бизнеса данные. Хранилище позволяет собирать эту информацию и производить её дальнейший анализ средствами OLAP.[[17]] Основная особенность Хранилищ данных состоит в том, что в них содержится историческая информация за большой промежуток времени.

Цель ХД - обеспечить целостность и поддерживать хронологию всевозможных корпоративных данных, и с этой точки зрения оно нейтрально по отношению к приложениям. В связи с этим в большинстве случаев для выполнения определенного комплекса функционально замкнутых аналитических задач рационально создавать витрины данных, в основе которых может быть как многомерная, так и реляционная модель данных. По существу, витрина представляет собой относительно небольшое, но что самое важное, функционально-ориентированное ХД, в котором информация хранится специальным образом, оптимизированным с точки зрения решения конкретных аналитических задач некоторого подразделения или группы аналитиков.


ХД чаще всего реализуется в виде реляционной БД, работающей под управлением достаточно мощной реляционной СУБД. Такая СУБД должна поддерживать эффективную работу с терабайтными объемами информации, иметь развитые средства ограничения доступа, обеспечивать повышенный уровень надежности и безопасности, соответствовать необходимым требованиям по восстановлению и архивации.[[18]]

Технология OLAP (online analytical processing, интерактивная аналитическая обработка). Представляет собой технологию обработки данных, которая заключается в выработке агрегированной информации на основе больших объемов данных, структурированных по многомерному принципу. Основным назначением OLAP-систем является поддержка аналитической деятельности, произвольных запросов пользователей - аналитиков. Целью OLAP-анализа является проверка возникающих гипотез. Одним из основных понятий систем OLAP является понятие OLAP-куба, который содержит в себе оси измерения представляющие собой значения некоторых параметров. Простейший вариант двумерного куба представляет собой таблицу. Многомерный куб называется «гиперкуб». OLAP система позволяет осуществлять «срез» данных гиперкуба как по одному , так и по нескольким измерениям, «вращать» куб, меняя вид отображаемых данных, консолидировать и детализировать данные, то есть укрупнять блоки ( например от дней перейти к годам), либо получать более полную информацию в разрезе выбранных измерений( например переход от объема продаж завода к продажам каждого конкретного продукта).

Гиперкуб OLAP системы может быть реализован несколькими способами[[19]]:

MOLAP – ((Multidimensional OLAP) – для хранения данных используются многомерные базы данных. При этом данные хранятся в виде упорядоченных многомерных массивов. Такие массивы подразделяются на гиперкубы, в которых все хранимые в БД ячейки имеют одинаковую мерность, и поликубы, в которых каждая ячейка хранится с собственным набором измерений. Физически данные хранятся в «плоских» файлах, при этом куб представляется в виде одной плоской таблицы, в которую построчно вписываются все комбинации элементов всех измерений с соответствующими им значениями мер.

ROLAP (Relational OLAP) - для реализации многомерной модели используются реляционные БД. В настоящее время распространены две основные схемы реализации многомерного представления данных с помощью реляционных таблиц: схема «звезда» и схема «снежинка». Если каждое измерение содержится в одной таблице, такая схема хранилища данных носит название «звезда» (star schema). Если же хотя бы одно измерение содержится в нескольких связанных таблицах, такая схема хранилища данных носит название «снежинка» (snowflake schema).


HOLAP (Hybrid OLAP) - для реализации многомерной модели используются и многомерные, и реляционные БД. HOLAP-серверы используют гибридную архитектуру, которая объединяет технологии ROLAP и MOLAP. В отличие от MOLAP, которая работает лучше, когда данные более-менее плотные, серверы ROLAP показывают лучшие параметры в тех случаях, когда данные довольно разрежены. Серверы HOLAP применяют подход ROLAP для разреженных областей многомерного пространства и подход MOLAP - для плотных областей. Серверы HOLAP разделяют запрос на несколько подзапросов, направляют их к соответствующим фрагментам данных, комбинируют результаты, а затем предоставляют результат пользователю.

Технология Data mining. Является составной частью технологии KDD (Knowledge Discovery in Databases) которая представляет собой процесс поиска знаний в «сырых» данных.

Процесс Knowledge Discovery in Databases, состоит из следующих шагов[[20]]:

  1. Подготовка исходного набора данных. Этот этап заключается в создании набора данных, в том числе из различных источников, выбора обучающей выборки и т.д. Для этого должны существовать развитые инструменты доступа к различным источникам данных. Желательно иметь поддержку работы с хранилищами данных и наличие семантического слоя, позволяющего использовать для подготовки исходных данных не технические термины, а бизнес понятия.
  2. Предобработка данных. Для того чтобы эффективно применять методы Data Mining, следует обратить внимание на вопросы предобработки данных. Данные могут содержать пропуски, шумы, аномальные значения и т.д. Кроме того, данные могут быть избыточны, недостаточны и т.д. В некоторых задачах требуется дополнить данные некоторой априорной информацией. Наивно предполагать, что если подать данные на вход системы в существующем виде, то на выходе получим полезные знания. Данные должны быть качественны и корректны с точки зрения используемого метода DM. Поэтому первый этап KDD заключается в предобработке данных. Более того, иногда размерность исходного пространства может быть очень большой, и тогда желательно применять специальные алгоритмы понижения размерности. Это как отбор значимых признаков, так и отображение данных в пространство меньшей размерности.
  3. Трансформация, нормализация данных. Этот шаг необходим для приведения информации к пригодному для последующего анализа виду. Для чего нужно проделать такие операции, как приведение типов, квантование, приведение к "скользящему окну" и прочее. Кроме того, некоторые методы анализа, которые требуют, чтобы исходные данные были в каком-то определенном виде. Нейронные сети, скажем, работают только с числовыми данными, причем они должны быть нормализованы.
  4. Data Mining. На этом шаге применяются различные алгоритмы для нахождения знаний. Это нейронные сети, деревья решений, алгоритмы кластеризации, установления ассоциаций и т.д.
  5. Постобработка данных. Интерпретация результатов и применение полученных знаний в бизнес приложениях.

Сам же термин «Data mining» переводится как «добыча данных», представляет собой собирательное название, используемое для обозначения совокупности методов обнаружения в данных ранее неизвестных, нетривиальных, практически полезных и доступных интерпретации знаний, необходимых для принятия решений в различных сферах человеческой деятельности.

Основными задачами Data mining являются :

  1. Задача классификации – определение класса объекта по его признакам. Причем перечень объектов известен заранее
  2. Задача регрессии – нахождение зависимости между факторами
  3. Задача кластеризации – задача группировки объектов на основе их характеристик
  4. Задача ассоциации – задача описывающая связи между событиями

Таким образом, нами описаны основные информационные технологии участвующие в процессе функционирования систем поддержки принятия решений. Такими технологиями являются:

  1. Система извлечения, обработки и загрузки данных (ETL система) которые используют перечень современных информационных технологий загрузки и оцифровки данных.
  2. Информационные хранилища данных – представляющие собой структурированные базы данных, в которых хранится «историческая» информация за большой промежуток времени.
  3. Многомерные базы данных и средства OLAP представляющие собой реализацию понятия «гиперкуб» данных, содержащий множество измерений. И средства обработки информации хранящиеся в нем.
  4. Средства Data mining позволяющие найти новые знания в базах данных, используя информационные технологии нейронных сетей, деревьев решений, алгоритмы ассоциации и т.д.

ЗАКЛЮЧЕНИЕ

В настоящей работе был рассмотрен вопрос влияния информационных технологий на развитие систем поддержки принятия решений. Нами описано историческое взаимодействие развития систем поддержки принятия решений с развитием информационных технологий. Дана классификация СППР. Описаны информационные технологии используемые в системах поддержки принятия решений. Из всего вышенаписанного вытекает следующий вывод.

Системы принятия решений являются информационными технологиями. Развитие СППР неразрывно связано с развитием ИТ. Каждый скачек в развитии информационных технологий приводил к скачку в развитии систем поддержки принятия решений. Некоторые информационные технологии даже породили новые классы систем поддержки принятия решений (распределенные системы и технологии коммуникаций, Web технологи). А развитие баз данных позволило создать технологию OLAP. Развитие информационной технологии нейронных сетей и систем нечеткой логики позволило развить механизмы Data mining. При дальнейшем развитии ИТ, несомненно, СППР будут развиваться параллельно. И возможно в будущем будет разработана система, которая позволит полностью избежать ошибок в решении любых вопросов.