Файл: Операции, производимые с данными (Информация и данные. Виды операций с данными).pdf

ВУЗ: Не указан

Категория: Курсовая работа

Дисциплина: Не указана

Добавлен: 31.03.2023

Просмотров: 462

Скачиваний: 1

ВНИМАНИЕ! Если данный файл нарушает Ваши авторские права, то обязательно сообщите нам.

1) внутренние сортировки работают с данным в оперативной памяти с произвольным доступом;

2) внешние сортировки упорядочивают информацию, расположенную на внешних носителях.

В отличие от сортировки, фильтрация данных — отсеивание лишних данных, в которых нет необходимости для принятия решений; при этом достоверность и адекватность данных должны возрастать. [7, с.13] Данные при фильтрации не переупорядочиваются, а лишь скрываются те записи, которые не отвечают заданным критериям выборки.[14, с.116] С понятием фильтрации данных неразрывно связано также понятие поиска данных. Поиск данных обычно связан с обработкой некоторого хранилища данных, прочесть или осознать которые последовательно не представляется возможным, с целью найти интересующее постановщика задачи подмножество этих данных (или установить их отсутствие). Существует неинформированный поиск данных (когда алгоритмы могут обрабатывать любые данные независимо от их сути, например, побитовый поиск), и информированный поиск (например, системы автоматизированного нахождения отпечатков пальцев, фонетический поиск в текстах и т. д.).

2.3. Сжатие данных

Одним из способов сокращения объема хранимой и передаваемой информации является её сжатие, которое основывается на избыточности, содержащейся в исходных данных. Простейшим примером избыточности является повторение в тексте фрагментов языка. [15, с.333]

Подобная избыточность обычно устраняется заменой повторяющейся последовательности ссылкой на уже закодированный фрагмент с указанием его длины. Другой вид избыточности связан с тем, что некоторые значения в сжимаемых данных встречаются чаще других. Сокращение объёма данных достигается за счёт замены часто встречающихся данных короткими кодовыми словами, а редких длинными (энтропийное кодирование). Сжатие данных, не обладающих свойством избыточности (например, случайный сигнал или белый шум, зашифрованные сообщения), принципиально невозможно без потерь.

Сжатие данных можно определить как алгоритмическое преобразование данных, производимое с целью уменьшения их объёма. [16]

В основе всех методов сжатия лежит простая идея: если представлять часто используемые элементы короткими кодами, а редко используемые- длинными кодами, то для хранения блока данных требуется меньший объем памяти, чем если бы все элементы представлялись кодами одинаковой длины.[17; с. 17]

Все методы сжатия данных делятся на два основных класса:


1) сжатие данных без потерь— класс алгоритмов сжатия данных (видео, аудио, графики, документов, представленных в цифровом виде), при использовании которых закодированные данные однозначно могут быть восстановлены с точностью до бита, пикселя, вокселя и т.д. При этом оригинальные данные полностью восстанавливаются из сжатого состояния;

2) сжатие данных с потерями — метод сжатия (компрессии) данных, при использовании которого распакованные данные отличаются от исходных, но степень отличия не существенна с точки зрения их дальнейшего использования.

Сжатие с потерями представляет из себя два разных процесса:

1) выделение сохраняемой части информации с помощью модели, зависящей от цели сжатия и особенностей источника и приемника информации;

2) собственно, сжатие без потерь.

Этот тип компрессии часто применяется для сжатия аудио- и видеоданных, статических изображений, в Интернете (особенно в потоковой передаче данных) и цифровой телефонии. При измерении физических параметров (яркость, частота, амплитуда, сила тока и т.д.) неточности неизбежны, поэтому "округление" вполне допустимо. С другой стороны, приемлемость сжатия изображения и звука со значительными потерями обусловлена особенностями восприятия такой информации органами чувств человека. Если же предполагается компьютерная обработка изображения или звука, то требования к потерями гораздо более жесткие. [17, с. 7]

Среди примеров данных, в которых искажения не допустимы можно выделить:

1) символические данные, изменение которых неминуемо приводит к изменению их семантики (тексты программ, двоичные массивы и т. п.);

2) жизненно важные данные, изменения в которых могут привести к критическим ошибкам (данные с медицинской аппаратуры, данные с летательных аппаратов и т.п.).;

3) многократно подвергаемые сжатию и восстановлению промежуточные данные при многоэтапной обработке графических, звуковых и видеоданных.

Основной характеристикой алгоритма сжатия является коэффициент сжатия. Указанная характеристика определяется как отношение исходных данных к объему сжатых данных, то есть k=So/Sc, где k - коэффициент сжатия, So — объём исходных данных, а Sc - объём сжатых. Чем выше коэффициент сжатия, тем алгоритм эффективнее. При этом, если k = 1, то алгоритм сжатия не производит, в следствии чего выходное сообщение по объёму оказывается равным входному. Если k < 1, то объем сжатых данных оказывается больше, чем объем несжатых данных, то есть алгоритм в данном случае не совершает полезной работы.


Ситуация с коэффициентом сжатия менее единицы вполне возможна при сжатии. Принципиально невозможно получить алгоритм сжатия без потерь, который при любых данных образовывал бы на выходе данные меньшей или равной длины. Так, если существует 2n различных файлов длины n бит, где n=0, 1, 2, ... Если размер каждого такого файла в результате обработки уменьшается хотя бы на 1 бит, то 2n исходным файлам будет соответствовать самое большее 2n -1 различающихся сжатых файлов. Тогда по крайней мере одному архивному файлу будет соответствовать несколько различающихся исходных, и следовательно его декодирование без потерь информации невозможно в принципе. По этой причине невозможен "вечный" архиватор, который способен бесконечное число раз сжимать свои же архивы. [17, с. 18]

Для сравнения алгоритмов по достигаемой степени сжатия используются фиксированные наборы файлов, первый из которых (Calgary Compression Corpus, сокращенно CalgCC) был предложен в 1989 году. Указанный набор состоял преимущественно из текстовых файлов. С тех пор по мере распространения различных типов файлов были введены иные наборы (CantCC, ACT, ARTest и т.д.) которые позволяют на практике оценить эффективность алгоритмов сжатия данных. [17, с.13-14]

2.4. Защита данных

Защита данных — это комплекс мер, направленных на предотвращение утраты, воспроизведения и изменения данных. [7, с. 14]

ГОСТ Р 50922-2006 "Национальный стандарт Российской Федерации. Защита информации. Основные термины и определения" определяет безопасность информации (данных) как состояние защищенности информации (данных), при котором обеспечены ее (их) конфиденциальность, доступность и целостность.[18]

Как видно из указанного определения, имеется три ключевых принципа информационной безопасности, которые называются триадой CIA - конфиденциальность (Confidentiality),целостность (Integrity), доступность (Availability)[19].

Конфиденциальность информации это обязательное для выполнения лицом, получившим доступ к определенной информации, требование не передавать такую информацию третьим лицам без согласия ее обладателя. [18]. ГОСТ Р ИСО/МЭК 27000-2012 "Информационная технология (ИТ). Методы и средства обеспечения безопасности. Системы менеджмента информационной безопасности. Общий обзор и терминология" определяет конфиденциальность как свойство информации быть недоступной или закрытой для неавторизованных лиц, сущностей или процессов. [20] Конфиденциальность информации достигается предоставлением к ней доступа c наименьшими привилегиями исходя из принципа минимальной необходимой осведомлённости. Иными словами, авторизованное лицо должно иметь доступ только к той информации, которая ему необходима для исполнения своих должностных обязанностей.


Целостность это состояние информации, при котором отсутствует любое ее изменение либо изменение осуществляется только преднамеренно субъектами, имеющими на него право. [18] Для обеспечения целостности информация должна быть защищена от намеренного, несанкционированного или случайного изменения по сравнению с исходным состоянием, а также от каких-либо искажений в процессе хранения, передачи или обработки. Для этого в свою очередь необходимо применение множества разнообразных мер контроля и управления изменениями информации и обрабатывающих её систем. Типичным примером таких мер является ограничение круга лиц с правами на изменения лишь теми, кому такой доступ необходим для выполнения служебных обязанностей.

Доступность информации [ресурсов информационной системы] это состояние информации [ресурсов информационной системы], при котором субъекты, имеющие права доступа, могут реализовать их беспрепятственно [18]. Основными факторами, влияющими на доступность информационных систем, являются DoS-атаки (аббревиатура от Denial of Service с англ. — «отказ в обслуживании»), атаки программ-вымогателей, саботаж. Кроме того, источником угроз доступности являются непреднамеренные человеческие ошибки по оплошности или из-за недостаточной профессиональной подготовки: случайное удаление файлов или записей в базах данных, ошибочные настройки систем; отказ в обслуживании в результате превышения допустимой мощности или недостатка ресурсов оборудования, либо аварий сетей связи; неудачно проведённое обновление аппаратного или программного обеспечения; отключение систем из-за аварий энергоснабжения. Задачи по обеспечению доступности информации на практике решаются различными методами: организация системы бесперебойного питания, резервирование и дублирование мощностей и т.д.

К информационной безопасности также могут быть отнесены свойства подлинности (свойство, гарантирующее, что субъект или ресурс идентичен заявленному), подотчетности (ответственность субъекта за его действия и решения), неотказуемости (способность удостоверять имевшее место событие или действие и их субъекты так, чтобы это событие или действие и субъекты, имеющие к нему отношение, не могли быть поставлены под сомнение) и достоверности (свойство соответствия предусмотренному поведению и результатам).[20]

В целом, количество свойств и принципов безопасности, которые выделяются различными исследователями может отличаться. Так, национальный институт стандартов и технологий США (NIST) 2004 году предложил свою модель информационной безопасности из 33 элементов или, как написано в SP800-27 "Engineering Principles for Information Technology Security (A Baseline for Achieving Security)", принципов. [19] Неизменным остается то, что защита информации- одна из наиболее важнейших практических задач, невыполнение которой может повлечь за собой катастрофические последствия.


2.5. Преобразование данных

Преобразование данных — перевод данных из одной формы в другую.[7, с. 14]

Преобразование данных довольно широко применяется при работе с данными. Например, при экспортировании данных из одной базы данных в другую. В таких случаях можно выделить следующие виды преобразования данных:

1) переименование. В этом случае объекты данных (таблицы, поля и т. п.) источника получают имена в соответствии с организацией данных получателя.

2 ) реструктуризация. Применяется когда общая предметная область в базе данных-источнике и базе данных-получателе разделена на таблицы и поля разными способами. При этом одна таблица может состоять из нескольких таблиц или, наоборот, несколько таблиц объединяется в одну. То же самое касается и полей — в соответствии со структурой базы данных получателя экспортируемые поля могут объединяться или разделяться.

3) агрегирование- база данных получателя предусматривает не просто импорт данных, а получение некоторого сводного или итогового отчета. Для этого данные преобразуются агрегирующими запросами.

4) кодирование и декодирование. Если база данных- источник и база данных- получатель используют разные системы кодирования атрибутов данных или в одной из них атрибут кодируется, а в другой — нет, то при экспортировании с помощью декодирования и кодирования данные изменяются так, чтобы они соответствовали системе кодирования атрибутов в базе данных получателя.

5) конвертирование. В случае использования разных формант для хранения соответствующих атрибутов (числовых, текстовых или логических) в процессе экспортирования данные необходимо конвертировать — привести к формату атрибута в базе данных-получателе.

6) согласование. При экспортировании данных необходимо обеспечить их согласование с данными, хранимыми в базе данных-получателе. В разных базах данных могут использоваться разные способы отображения одной и той же информации(какой-то параметр оценивается по пяти- или десятибалльной системе; расстояние измеряется в метрах, километрах и т. п.)

7) проверка. В базе данных могут использоваться разные ограничения на допустимость значений полей, поэтому экспортируемые данные должны проверяться и соответственно преобразовываться. При этом записи, не прошедшие проверку, могут помечаться в служебных полях или сохраняться в специальных таблицах, что позволит в дальнейшем подвергнуть их анализу и корректировке. [21, с. 363-365]