Файл: Операции, производимые с данными (Операции, производимые с данными).pdf

ВУЗ: Не указан

Категория: Курсовая работа

Дисциплина: Не указана

Добавлен: 01.04.2023

Просмотров: 182

Скачиваний: 1

ВНИМАНИЕ! Если данный файл нарушает Ваши авторские права, то обязательно сообщите нам.

Данные нужно не только хранить и защищать, но и передавать. Для этих целей выступает операция маршрутизация. Маршрутизация – прием и передача данных между удаленными друг от друга участниками процесса. Между двумя пользователями в качестве средства транспортировки данных можно привести P2P-мессенджеры, либо более сложные клиент-серверные структуры.

Каждый компьютер в сети имеет свой IP-адрес, используемый для точной доставки пакета данных. Маршруты доставки пакетов данных могут быть разными, поэтому скорость доставки информации зависит не от физического расстояния между компьютером-отправителем и компьютером получателем, а от количества промежуточных серверов и качества линии связи.

Рис. 7 - различные маршруты передачи данных

Транспортировка данных производится путем разбиения файлов на Интернет-пакеты на компьютере-отправителе, индивидуальной маршрутизации каждого пакета и сборки файлов из пакетов в первоначальном порядке на компьютере-получателе [5].

Из формализации и транспортировки вытекает следующая операция над данными – преобразование. Под ним понимается перевод данных из одного формата в другой или из одной структуры в другую. Зачастую преобразование связано не только с формализацией, но и с более банальными вещами, например смена носителя. В качестве примера можно привести книгу – ее можно хранить как в физическом варианте, на бумаге, так и как отсканированную копию, в виде изображений, и, что чаще всего, в электронном виде, набором текста.

Так же преобразование крайне важно при транспортировке. Данные преобразуются в IP-пакеты и отправляются в данном формате, где собираются на компьютере-получателе в исходное состояние. Ранее, когда интернет был тесно связан с аналоговой телефонией и для подключения к нему требовались телефонные модемы, данные преобразовывались в некое подобие звуковых сигналов, а потом обратно в двоичный код.

Приведенный список операций далеко не полон и здесь выделены только основные из них. На каждом рабочем месте этот список дополняется своими специфическими операциями, необходимыми именно в требуемой предметной области. Из всего этого можно сделать вывод, что работа с информацией имеет огромную трудоемкость и в современном мире набор операций с данными в первую очередь направлен на автоматизацию процессов.

Модели представления данных

Модель представления данных (модель данных) - множество допустимых типов данных и отношений между ними, ограничений и действий над этими типами данных и отношений. Множество допустимых типов данных и отношений называют структурой данных. Модель данных является ядром базы данных [6].


Самыми распространенными являются три модели данных:

  1. иерархическая модель;
  2. сетевая модель;
  3. реляционная модель.

Иерархическая модель данных

Связи иерархической модели данных можно представить в виде дерева – связанный упорядоченный граф, не содержащий циклов. Обычно, при работе с иерархической моделью, у дерева определяют какую-либо конкретную вершину и определяют ее корнем дерева. В эту вершину не заходит ни одно ребро. Конечные вершины, из которых не выходит ни одной связи, называют листьями дерева.

В иерархической модели данных принята ориентация от корня к листьям, а графическое представление называют деревом определения.

Рис. 8 - Иерархическая модель структуры предприятия

Иерархическая модель является наиболее простой, по сравнению с остальными, поэтому она и старше других моделей.

Ее достоинствами являются:

  • эффективное использование памяти;
  • высокая скорость производимых операций над данными;
  • удобство работы с иерархически упорядоченной структурой.

Не лишена она и недостатков:

  • в случае сложных логических связей такая модель становится громоздкой;
  • сложность включения новых объектов в заранее заданное дерево;
  • трудности с восприятием такой модели обыкновенными пользователями.

3.2 Сетевая модель данных

Сетевая модель была одним из первых подходов, использовавшимся при создании баз данных в конце 50-х — начале 60-х годов. Активным пропагандистом этой модели был Чарльз Бахман. Идеи Бахмана послужили основой для разработки стандартной сетевой модели под эгидой организации CODASYL. После публикации отчетов рабочей группы этой организации в 1969, 1971 и 1973 годах многие компании привели свои сетевые базы данных более-менее в соответствие со стандартами CODASYL. До середины 70-х годов главным конкурентом сетевых баз данных была иерархическая модель данных, представленная ведущим продуктом компании IBM в области баз данных — IBM IMS [7].

Рис. 9 - Пример сетевой модели данных

Основным отличием сетевой модели данных от иерархической является то, что любой узел данных может быть связан с любым другим узлом. Если говорить точнее, то различием этих моделей является то, что в сетевой запись может быть членом более, чем одного группового отношения.


Достоинства такой модели:

  • высокоэффективное использование памяти;
  • очень высокая скорость производимых операций над данными;
  • широкие возможности образования произвольных связей.

Недостатки:

  • высокая сложность базы данных, лежащей в основе модели, и ее жесткость;
  • трудность понимания и выполнения пользователем операций над данными;
  • сложность разработки и требование высокого уровня внимательности.

3.3 Реляционная модель данных

Реляционная модель данных была предложена математиком Э.Ф. Коддом в 1970 г. Она является наиболее широко распространенной моделью данных и единственной из трех основных моделей данных, для которой разработан теоретический базис с использованием теории множеств [8].

Реляционное представление дает возможность более четко оценить область действия и логические ограничения существующих систем форматированных данных, а также сравнить достоинства (с логической точки зрения) разных представлений данных в одной системе [9].

Реляционная модель данных представляет собой совокупность данных, состоящую из набора двумерных таблиц (отношений). Данные о строго типизированных объектах хранится в таблице. Ее поля (столбец таблицы) содержат значения характеристики объектов, а запись (строка таблицы) представляет собой описание этих соответствующих объектов.

Группу таких связанных таблиц называют схемой базы данных, а информацию о таблицах, полях, связях и иных объектах, метаданными.

Рис. 10 - Пример схемы реляционной модели данных

Достоинства реляционной модели данных:

  • наличие математической теории ее построения;
  • простота и удобство ее представления и реализации;
  • минимальная избыточность и полнота данных;
  • легкость модернизации.

Недостатки:

  • высокие временные и трудозатраты на разработку базы данных;
  • низкая производительность при обработке очень больших объемов данных;
  • высокие требования к использованию памяти.

3.4 Роль данных в построении модели. Адекватность

На самом деле, как и с операциями над данными, моделей гораздо больше, чем описано, но все современные модели так или иначе в своей основе имеют одну из этих трех моделей. Стоит отметить, что наибольшую популярность в современном мире имеет реляционная модель и унаследованные от нее.


Строящаяся модель во многом определяется самими данными, которые в ней будут участвовать. Как следствие, от их качества и избыточности будет зависеть и качество разрабатываемой модели.

Адекватность модели – соответствие, т.е. совпадение свойств, функций, параметров, модели моделируемому объекту. Нужно понимать, что модель не может идеально совпадать с объектом, поэтому речь идет скорее о процентном соотношении совпадающих свойств между моделью и объектом.

Проверку соответствия модели реальной системе, называют оценкой адекватности. Она оценивается по близости результатов расчетов к экспериментальным данным.

Так же, немаловажную роль играет устойчивость модели. Устойчивость модели — это ее способность сохранять адекватность при исследовании эффективности системы на всем возможном диапазоне рабочей нагрузки, а также при внесении изменений в конфигурацию системы [10].

Говоря простым языком – результаты расчетов должны быть адекватными при любых объемах данных и любой нагрузке. К сожалению, универсальной проверки на устойчивость не существует, поэтому разработчик вынужден прибегать к большому количеству тестов, проводя различные операции с данными, руководствуясь частными случаями и здравому смыслу.

Очевидно, что устойчивость является положительным свойством модели. Однако если изменение входных воздействий или параметров модели (в некотором заданном диапазоне) не отражается на значениях выходных параметров, то польза от такой модели невелика. В связи с этим возникает задача оценивания чувствительности модели к изменению параметров рабочей нагрузки и внутренних параметров самой системы [11].

Файловые структуры

4.1 Физическая организация файлов, операции с файлами данных

Файл – упорядоченный набор данных на носителе, именованная область данных в памяти.

Работа с файлами осуществляется средствами операционных систем. Обычно выделяются следующие операции:

  • связь полного имени файла с его указателем;
  • открытие файла (для записи, чтения);
  • закрытие файла;
  • изменение его атрибутов;
  • обеспечение целостности файлов: гарантия того, что файл содержит только те данные, которые и требовались;
  • управление памятью: распределение внешней памяти для хранения данных.

Стоит отметить, что закрытие файла действительно является важной операцией. При ее выполнении, так как при ее совершении данные перезаписываются из оперативной памяти системы в физическую и занятые ресурсы операционной системы высвобождаются.

Основными критериями эффективности физической организации данных являются:

  • скорость доступа к данным;
  • объем адресной информации;
  • степень фрагментированности общего пространства памяти;
  • максимально возможный размер файла.

В современном мире у каждого пользователя хранится несколько тысяч различных файлов и структур данных. Если группировать все файлы и данные в одном месте, то организация работы с ними будет неэффективной, неудобной и долгой. Для этого используют многоуровневые каталоги файлов, вследствие чего, системное имя файла формируется из имени пути от корневой папки и расширения файла.

Рис. 11 - Пример многоуровневых каталогов

4.2 Логическая организация файлов

Данные, содержащиеся в файле, имеют какую-либо логическую структуру. Такая структура является базой при разработке программы, связанной с работой с файлами данных.

Сейчас известно пять видов организации файла:

  1. смешанный файл;
  2. последовательный файл;
  3. индексно-последовательный файл;
  4. индексируемый файл;
  5. файл прямого доступа.

При выборе организации файла, нужно учитывать такие критерии, как быстрота доступа, легкость обновления, экономность хранения, простота обслуживания и надежность.

Смешанный файл – наиболее простая форма организации файла. Данные в таком файле накапливаются по мере их поступления, образуя записи. Записи могут иметь различную длину и различные поля, расположенные в хаотичном порядке. Длинна каждого поля должна быть строго описана в данной записи.

Так как такой файл не имеет какой-либо структуры, то доступ к данным осуществляется обыкновенным перебором всех существующих в нем записей. Смешанные файлы используются только в том случае, если данные и структуры данных неудобно хранить в какой-либо другой форме организации файла. В таком виде память расходуется эффективно, но изменение данных и, например, вставка записи, довольно ресурсоемко.

Рис. 12 - Смешанный файл