Файл: Операции, производимые с данными (Основные методы и средства защиты информации).pdf

ВУЗ: Не указан

Категория: Курсовая работа

Дисциплина: Не указана

Добавлен: 23.04.2023

Просмотров: 485

Скачиваний: 1

ВНИМАНИЕ! Если данный файл нарушает Ваши авторские права, то обязательно сообщите нам.

Графы представляют собой совокупности узлов (также называемых вершинами) и связей (называемых ребрами) между ними. Графы также известны как сети[22]. Одним из примеров графов является социальная сеть. Узлы - это люди, а ребра - дружба.

Существует два основных типа графов: ориентированные и неориентированные. Второй тип - это графы без какого-либо направления на ребрах между узлами. Ориентированные графы, напротив, представляют собой графы с направлением на них.

Два частых способа представления графа - это список смежности и матрица смежности. Список смежности может быть представлен как список, где левая сторона является узлом, а правая - списком всех других узлов, с которыми он соединен.

Матрица смежности представляет собой таблицу чисел, где каждая строка или столбец представляет собой другой узел на графе. На пересечении строки и столбца есть число, которое указывает на отношение. Нули означают, что нет ребер или отношений. Единицы означают, что есть отношения. Числа выше единицы могут использоваться для отображения разных весов[23].
Алгоритмы обхода - это алгоритмы для перемещения или посещения узлов в графе. Основными типами алгоритмов обхода являются поиск в ширину и поиск в глубину. Одно из применений заключается в определении того, насколько близко узлы расположены по отношению к корневому узлу[24].

Вывод по главе. Таким образом, данные – это поддающееся многократной интерпретации представление информации в формализованном виде, пригодном для передачи, связи или обработки, а также формы представления информации, с которыми имеют дело информационные системы и их пользователи. Следует отметить, что системное программное обеспечение управляет потоком данных между программами и внешними устройствами, а языки программирования управляют обменом данными между программами. Организация данных может быть представлена как тестовыми данными – последовательностью символов алфавита, представленной в виде кодировки; так и двоичными данными – последовательностью байтов. Кроме того, определяются следующие уровни организации данных: проектный, уровень языка реализации, машинный уровень.

Выделяют следующие форматы для организации и хранения данных: связные списки, стеки, очереди, множества, мар, хэш-таблица, двоичное дерево, префиксное дерево, двоичная куча, граф.


Глава 2. Операции с данными, передача, хранение данных

2.1. Операции с данными

В ходе информационного процесса данные преобразуются из одного вида в другой с помощью методов. Обработка данных включает в себя множество различных операций. По мере развития научно-технического прогресса и общего усложнения связей в человеческом обществе трудозатраты на обработку данных неуклонно возрастают. Прежде всего, это связано с постоянным усложнением условий управления производством и обществом. Второй фактор, также вызывающий общее увеличение объемов обрабатываемых данных, тоже связан с научно-техническим прогрессом, а именно с быстрыми темпами появления и внедрения новых носителей данных, средств хранения и доставки данных. В структуре возможных операций с данными можно выделить следующие:

1. сбор данных – накопление данных с целью обеспечения достаточной полноты информации для принятия решения;

2. формализация данных – приведение данных, поступающих из разных источников, к одинаковой форме, чтобы сделать их сопоставимыми между собой, то есть повысить их уровень доступности;

3. фильтрация данных – отсеивание «лишних» данных, в которых нет необходимости для принятия решений; при этом должен уменьшаться уровень «шума», а достоверность и адекватность данных должны возрастать;

4. сортировка данных – упорядочение данных по заданному признаку с целью удобства использования; повышает доступность информации;

5. группировка данных – объединение данных по заданному признаку с целью повышения удобства использования; повышает доступность информации;

6. архивация данных – организация хранения данных в удобной и легкодоступной форме; служит для снижения экономических затрат на хранение данных и повышает общую надежность информационного процесса в целом;

7. защита данных – комплекс мер, направленных на предотвращение утраты, воспроизведение и модификации данных;

8. транспортировка данных – прием и передача (доставка и поставка) данных между удаленными участниками информационного процесса; при этом источник данных в информатике принято называть сервером, а потребителя – клиентом;

9. преобразование данных – перевод данных из одной формы в другую или из одной структуры в другую. Преобразование данных часто связано с изменением типа носителя, например, книги можно хранить в обычной бумажной форме, но можно использовать для этого и электронную форму, и микрофотопленку. Необходимость в многократном преобразовании данных возникает также при их транспортировке, особенно если она осуществляется средствами, не предназначенными для транспортировки данного вида данных[25]. В качестве примера можно упомянуть, что для транспортировки цифровых потоков данных по каналам телефонных сетей (которые изначально были ориентированы только на передачу аналоговых сигналов в узком диапазоне частот) необходимо преобразование цифровых данных в некое подобие звуковых сигналов, чем и занимаются специальные устройства – телефонные модемы.


Приведенный здесь список типовых операций с данными далеко не полон. Миллионы людей во всем мире занимаются созданием, обработкой, преобразованием транспортировкой данных, и на каждом рабочем месте выполняются свои специфические операции, необходимые для управления социальными, экономическими, промышленными, научными и культурными процессами. Полный список возможных операций составить невозможно, да и не нужно. Однако, следует подчеркнуть, что работа с информацией может иметь огромную трудоемкость, и ее необходимо автоматизировать.

Работа с большими наборами данных автоматизируется проще, когда данные упорядочены, то есть образуют заданную структуру. Существует три основных типа структур данных: линейная, иерархическая и табличная.

Линейные структуры – это хорошо знакомые нам списки. Список – это простейшая структура данных, отличающаяся тем, что адрес каждого элемента данных однозначно определяется его номером. Линейные структуры данных (списки) – это упорядоченные структуры, в которых адрес элемента однозначно определяется его номером[26].

Табличные структуры отличаются от списочных тем, что элементы данных определяются адресом ячейки, который состоит не из одного параметра, как в списках, а из нескольких. Для таблицы умножения, например, адрес ячейки определяется номерами строки и столбца. Нужная ячейка находится на их пересечении, а элемент выбирается из ячейки.

Табличные структуры данных (матрицы) – это упорядоченные структуры, в которых адрес элемента определяется номером строки и номером столбца, на пересечении которых находится ячейка, содержащая искомый элемент.

Нерегулярные данные, которые трудно представить в виде списка или таблицы, часто представляют в виде иерархических структур. Например, иерархическую структуру имеет система почтовых адресов. Подобные структуры также широко применяются в научных систематизациях и всевозможных классификациях. В иерархической структуре адрес элемента определяется путем доступа (маршрутом), ведущим от вершины структуры к данному элементу.

2.2. Организация хранилищ данных

Все данные в хранилищах данных делятся на три основные категории:

— детальные данные;

— агрегированные данные;

— метаданные[27].

Детальными являются данные, переносимые непосредственно из ОИД[28]. Они соответствуют элементарным событиям, фиксируемым OLTP-системами (например, продажи, эксперименты и др.). Принято разделять все данные на измерения и факты. Измерениями называются наборы данных, необходимые для описания событий, например, города, товары, люди и т. п. Фактами называются данные, отражающие сущность события, например, количество проданного товара, результаты экспериментов и т. п. Фактические данные могут быть представлены в виде числовых или категориальных значений[29].


В процессе эксплуатации хранилища данных необходимость в ряде детальных данных может снизиться. Ненужные детальные данные могут храниться в архивах в сжатом виде на более емких накопителях с более медленным доступом, например, на магнитных лентах. Данные в архиве остаются доступными для обработки и анализа. Регулярно используемые для анализа данные должны храниться на накопителях с быстрым доступом. например, на жестких дисках.

На основании детальных данных могут быть получены агрегированные, обобщенные, данные. Агрегирование происходит путем суммирования числовых фактических данных по определенным измерениям. В зависимости от возможности агрегировать данные они подразделяются на следующие типы:

  1. аддитивные — числовые фактические данные, которые могут быть просуммированы по всем измерениям;
  2. полуаддитивные — числовые фактические данные, которые могут быть просуммированы только по определенным измерениям;
  3.  неаддитивные — фактические данные, которые не могут быть просуммированы ни по одному измерению[30].

Проведенные исследования показали, что большинство пользователей СППР работают не с детальными, а с агрегированными данными. Архитектура хранилища данных должна предоставлять быстрый и удобный способ получать интересующую пользователя информацию. Для этого необходимо часть агрегированных данных хранить в хранилище данных, а не вычислять их при выполнении аналитических запросов. Очевидно, что это ведет к избыточности информации и увеличению размеров хранилища данных. Поэтому при проектировании таких систем важно добиться оптимального соотношения между вычисляемыми и хранящимися агрегированными данными. Те данные, к которым редко обращаются пользователи, могут вычисляться в процессе выполнения аналитических запросов. Данные, которые требуются более часто, должны храниться в хранилище данных[31].

Для удобства работы с хранилищем данных необходима информация о содержащихся в нем данных. Такая информация называется метаданными - данные о данных. Согласно концепции Захмана метаданные должны отвечать на следующие вопросы — что, кто, где, как, когда и почему:

  1. что (описание объектов) — метаданные описывают объекты предметной области, информация о которых хранится в хранилище данных. Такое описание включает: атрибуты объектов, их возможные значения, соответствующие поля в информационных структурах хранилища данных, источники информации об объектах и т. п.;
  2.  кто (описание пользователей) — метаданные описывают категории пользователей, использующих данные. Они описывают права доступа к данным, а также включают в себя сведения о пользователях, выполнявших над данными различные операции (ввод, редактирование, загрузку, извлечение и т. п.);
  3.  где (описание места хранения) — метаданные описывают местоположение серверов, рабочих станций, ОИД, размещенные на них программные средства и распределение между ними данных;
  4.  как (описание действий) — метаданные описывают действия, выполняемые над данными. Описываемые действия могли выполняться как в процессе переноса из ОИД (например, исправление ошибок, расщепление полей и т. п.), так и в процессе их эксплуатации в хранилище данных;
  5.  когда (описание времени) — метаданные описывают время выполнения разных операций над данными (например, загрузка, агрегирование, архивирование, извлечение и т. п.);
  6.  почему (описание причин) – метаданные описывают причины, повлекшие выполнение над данными тех или иных операций. Такими причинами могут быть требования пользователей, статистика обращений к данным и т. п.[32]

Так как метаданные играют важную роль в процессе работы с хранилищами данных, то к ним должен быть обеспечен удобный доступ. Для этого они сохраняются в репозитории метаданных с удобным для пользователя интерфейсом.

Данные, поступающие из ОИД в хранилище данных, перемещаемые внутри хранилища и поступающие из хранилища данных к аналитикам, образуют следующие информационные потоки:

— входной поток (Inflow) — образуется данными, копируемыми из ОИД в хранилище;

— поток обобщения (Upflow) — образуется агрегированием детальных данных и их сохранением в хранилище данных;

— архивный поток (Downflow)-- образуется перемещением детальных данных, количество обращений к которым снизилось;

— поток метаданных (MetaFlow) — образуется потоком информации о данных в репозиторий данных;

— выходной поток (Outflow)-- образуется данными, извлекаемыми пользователями;

— обратный поток (Feedback Flow) — образуется очищенными данными, записываемыми обратно в ОИД[33].

Самый мощный из информационных потоков — входной — связан с переносом данных из ОИД. Обычно информация не просто копируется в хранилище данных, а подвергается обработке: данные очищаются и обогащаются за счет добавления новых атрибутов. Исходные данные из ОИД объединяются с информацией из внешних источников — текстовых файлов, сообщений электронной почты, электронных таблиц и др. При разработке хранилищ данных не менее 60% всех затрат связано с переносом данных.

Процесс переноса, включающий в себя этапы извлечения, преобразования и загрузки, называют ETL-процессом (Е -- extraction, Т -- transformation, L -- loading: извлечение, преобразование и загрузка, соответственно). Программные средства, обеспечивающие его выполнение, называются ETL-системами. Традиционно ETL-системы использовались для переноса информации из устаревших версий информационных систем в новые[34]. В настоящее время ETL-процесс находит все большее применение для переноса данных из ОИД в хранилище данных и ВД.

Извлечение данных — чтобы начать ETL-процесс, необходимо извлечь данные из одного или нескольких источников и подготовить их к этапу преобразования. Можно выделить два способа извлечения данных:

1. Извлечение данных вспомогательными программными средствами непосредственно из структур хранения информации (файлов, электронных таблиц, баз данных и т. п. Достоинствами такого способа извлечения данных являются: во-первых, отсутствие необходимости расширять OLTP-систему (это особенно важно, если ее структура закрыта); во-вторых, данные могут извлекаться с учетом потребностей процесса переноса.