Файл: Технологии программирования (Кодирование данных двоичным кодом).pdf
Добавлен: 01.04.2023
Просмотров: 391
Скачиваний: 2
СОДЕРЖАНИЕ
1.1 Связь понятий «информация, данные, знания». Модель DIWK
1.3. Системы обработки информации и данных
2.1 Кодирование данных двоичным кодом
Компьютеры и кодировка символов
2.2 Кодирование целых и действительных чисел
2.3 Кодирование текстовых данных
2.4 Универсальная система кодирования текстовых данных
2.5 Кодирование графических данных
Приведенный здесь список типовых операций с данными далеко не полон. Миллионы людей во всем мире занимаются созданием, обработкой, преобразованием и транспортировкой данных, и на каждом рабочем месте выполняются свои специфические операции, необходимые для управления социальными, экономическими, промышленными, научными и культурными процессами. Полный список возможных операций составить невозможно, да и не нужно. Сейчас нам важен другой вывод: работа с информацией может иметь огромную трудоемкость, и ее надо автоматизировать [12].
Процедура доступа к данным может быть инициирована как самим компьютером (для решения каких-либо своих технических задач), так и конечным пользователем. В последнем случае пользователь формирует запрос, куда включает, в частности, обозначение требуемого вида доступа или действия и указание на то, над какими данными это действие надо выполнить. Как отмечалось ранее, идентификация данных осуществляется с помощью ключей. В качестве же требуемого действия может производиться одно из следующих: добавление, удаление, изменение, просмотр элемента или обработка данных из элемента [2].
При добавлении элемента информационный массив пополняется новыми данными в виде записи файла или файла в целом, соответственно, для структурированных и неструктурированных данных. В запросе в этом случае, помимо указанной выше информации, приводится и сам новый элемент. При этом объем информационного массива увеличивается.
Удаление, наоборот, является обратным действием, вызывающим исключение упомянутых данных. Это действие приводит к уменьшению объема информационного массива.
Изменение относится не к элементу, а к его составляющим – полям записи файла или тексту, хранящемуся в файле, и означает, в свою очередь, удаление прежних значений полей или строк текста и/или добавление новых. В запрос включается дополнительная информация, указывающая на требуемые составляющие изменяемого элемента, а также сами новые значения этих составляющих. Объем информационного массива при этом не меняется для структурированных данных и, возможно, меняется для неструктурированных [15].
Просмотр связан с предоставлением данных пользователю на устройстве вывода компьютера, как правило, на дисплее. В запросе в этом случае дополнительно указывается, какие составляющие элемента требуется просмотреть (по умолчанию просматривается весь элемент) [20].
Обработка предусматривает выполнение некоторых арифметических операций над данными элемента, например, накопление суммы и т.д., и относится только к структурированным данным, а потому далее не рассматривается.
Чтобы выполнить любое их указанных выше действий, нужный элемент должен быть предварительно найден в информационном массиве, для чего выполняется его поиск (для добавления нового элемента тоже делается попытка его поиска, которая заканчивается неудачно, и тогда элемент добавляется). Под поиском элемента понимается определение его местонахождения в информационном массиве. Таким образом, любой доступ включает поиск, что делает эту фазу доступа наиболее значимой [17].
Данные характеризуются своим типом и множеством операций над ними. Данные в компьютере условно делятся на простые и сложные.
Примеры простых данных, которые может обрабатывать компьютер приведены в таблице 1:
Таблица 1-Типы данных, обрабатываемых компьютером
|
№ |
Типы данных |
Операции |
|
|
1 |
Числа (числовые данные) |
Все арифметические операции |
|
|
2 |
Тексты(символьные данные) |
Замещение, вставка, удаление символов, сравнение, конкатенация строк |
|
|
3 |
Логические(бинарные) данные |
Все логические операции (конъюнкция, дизъюнкция, отрицание и др.) |
|
|
4 |
Изображения: рисунки, графика, анимация (графические данные) |
Операции над пикселями, из которых состоит изображение: яркость, цвет, контрастность |
|
|
5 |
Видео данные |
Удаление фрагмента, вставка фрагмента, работа с кадрами |
|
|
6 |
Аудио данные |
Усиление, уменьшение, удаление фрагмента, вставка фрагмента |
|
К сложным данным относятся: массивы и списки (однотипные), структуры, записи, таблицы (разнотипные). В ходе информационного процесса данные преобразуются из одного вида в другой с помощью методов. Обработка данных включает в себя множество различных операций. По мере развития научно-технического прогресса и общего усложнения связей в человеческом обществе трудозатраты на обработку данных неуклонно возрастают. Прежде всего, это связано с постоянным усложнением условий управления производством и обществом. Второй фактор, также вызывающий общее увеличение объемов обрабатываемых данных, тоже связан с научно-техническим прогрессом, а именно с быстрыми темпами появления и внедрения новых носителей данных, средств их хранения и доставки [16].
В структуре возможных операций с данными можно выделить основные:
1) сбор данных - накопление информации с целью обеспечения достаточной полноты для принятия решений;
2) формализация данных - приведение данных, поступающих из разных источников, к одинаковой форме, чтобы сделать их сопоставимыми между собой, то есть повысить их уровень доступности;
3) фильтрация данных - отсеивание «лишних» данных, в которых нет необходимости для принятия решений; при этом должен уменьшаться уровень «шума», а достоверность и адекватность данных должны возрастать [3];
4) сортировка данных - упорядочение данных по заданному признаку с целью удобства использования; повышает доступность информации;
5) архивация данных - организация хранения данных в удобной и легкодоступной форме; служит для снижения экономических затрат по хранению данных и повышает общую надежность информационного процесса в целом;
6) защита данных - комплекс мер, направленных на предотвращение утраты, воспроизведения и модификации данных [3];
7) транспортировка данных - прием и передача (доставка и поставка) данных между удаленными участниками информационного процесса; при этом источник данных в информатике принято называть сервером, а потребителя - клиентом;
8) преобразование данных - перевод данных из одной формы в другую или из одной структуры в другую. Преобразование данных часто связано с изменением типа носителя, например книги можно хранить в обычной бумажной форме, но можно использовать для этого и электронную форму, и микрофотопленку [3].
Одна из основных задач, возникающих при работе с базами данных, – это задача поиска. При этом, поскольку информации в базе данных, как правило, содержится много, перед программистами встает задача не просто поиска, а эффективного поиска, т.е. поиска за сравнительно короткое время и с достаточно большой точностью. Для этого (для оптимизации производительности запросов) производят индексирование некоторых полей таблицы. Использовать индексы полезно для быстрого поиска строк с указанным значением одного столбца. Без индекса чтение таблицы осуществляется по всей таблице, начиная с первой записи, пока не будут найдены соответствующие строки [15].
Чем больше объем таблицы, тем выше накладные расходы. Если же таблица содержит индекс по рассматриваемым столбцам, то база данных может быстро определить позицию для поиска в середине файла данных без просмотра всех данных. Это происходит потому, что база данных помещает проиндексированные поля поближе в памяти, так, чтобы можно было побыстрее найти их значения. Для таблицы, содержащей 1000 строк, это будет как минимум в 100 раз быстрее по сравнению с последовательным перебором всех записей. Однако в случае, когда необходим доступ почти ко всем 1000 строкам, быстрее будет последовательное чтение, так как при этом не требуется операций поиска по диску. Так что иногда индексы бывают только помехой. Например, если копируется большой объем данных в таблицу, то лучше не иметь никаких индексов. Однако в некоторых случаях требуется задействовать сразу несколько индексов (например, для обработки запросов к часто используемым таблицам) [2].
Если говорить о MySQL, то там существует три вида индексов: PRIMARY, UNIQUE, и INDEX, а слово ключ (KEY) используется как синоним слова индекс (INDEX). Все индексы хранятся в памяти в виде B-деревьев.
PRIMARY – уникальный индекс (ключ) с ограничением, устанавливающим, что все индексированные им поля не могут иметь пустого значения (т.е. они NOT NULL). Таблица может иметь только один первичный индекс, который может состоять из нескольких полей [2].
UNIQUE – ключ (индекс), задающий поля, которые могут иметь только уникальные значения.
INDEX – обычный индекс (как описано выше). В MySqL, кроме того, можно индексировать строковые поля по заданному числу символов от начала строки.
1.3. Системы обработки информации и данных
Необходимые данные обработаны компьютером, чтобы стать полезной информации. На самом деле это определение обработки данных. Данные представляют собой набор фактов - неорганизованных, но может быть организовано в полезную информацию [6]. Обработка-это ряд действий или операций, которые преобразуют входы в выходы. Когда мы говорим об обработке данных, вход данных и выход полезной информации. Таким образом, можно определить обработки данных в серии действий или операций, которые преобразует данные в полезную информацию [6].
Термин системы обработки данных включает ресурсы, которые используются для выполнения обработки данных. Существует четыре типа ресурсов: людей, материалов, установок и оборудования. Люди вносят вклад в компьютеры, их эксплуатации, и использовать их вывода.
Основные операции по обработке данных: пять основных операций характерны для всех систем обработки данных: ввод, хранение, обработку, вывод и контроль. Они определяются следующим образом.
Ввод - это процесс ввода данных, которые собираются факты, в систему обработки данных. Хранение является сохранением данных или информации, так что они доступны для начальных или для дополнительной обработки. Обработка представляет собой выполнение арифметических или логических операций на данных, чтобы преобразовать их в полезную информацию. Вывод - это процесс производства полезной информации, такой как печатный отчет или визуального отображения [17].
Управление направляет порядок и последовательность, в которой все вышеуказанные операции выполняются.
Операции обработки данных включают в себя следующие операции.
1. Генерация данных.
2. Запись
Это включает в себя операцию сбора исходных данных. Это означает, что исходные данные собираются и представляются в форме исходного документа, называемого исходным документом [8].
Здесь необработанные данные преобразуются в приемлемую форму. То есть данные транскрибируются из исходных документов на карточках или в некоторых других указанных формах и делаются читаемыми для машин. Эта операция выполняется в течение всего цикла IPO. Перфокарты и бумажные ленты, магнитные ленты, магнитные диски, кассеты с магнитной лентой, дискеты, магнитные барабаны, кассеты с магнитной лентой, дискеты, картридж с ОЗУ, устройства с зарядовой связью и т. д. Используются в качестве носителя записи данных [7].
3. Проверка
После того, как данные были записаны, их точность должна быть проверена. Это можно сделать с помощью другой машины, называемой верификатором, или перечитав.
4. Классификация
Классификация информации - это следующая важная операция, в которой данные разделяются на различные категории.
5. Сортировка
Сортировка включает в себя упорядочение данных в заранее определенном порядке для облегчения обработки. Порядок может быть буквенным или числовым.
6. Объединение
Это операция объединения двух или более упорядоченных (отсортированных) наборов данных для формирования другого единого упорядоченного набора.
7. Расчет
8. Хранение данных [7].
Здесь вычисление большей величины может быть обработано. Расчет включает в себя решение уравнений и манипулирование исходными данными, такими как сложение, вычитание и т.д. Результаты обработки одного набора данных сохраняются в памяти для последующего использования в качестве эталона. Основным требованием для использования компьютера во всех бизнес- приложениях является возможность хранения и доступа к данным. Данные хранятся в месте памяти, называемой упомянутой по его адресу [7]. В крупных организациях необходимо хранить и получать доступ к огромному объему данных. Следовательно, некоторые вспомогательные запоминающие устройства также необходимы для эффективной обработки данных.
9. Получение данных: извлечение данных - это процесс поиска или определения местоположения элемента данных из хранилища. В системе EDP данные извлекаются из запоминающего устройства в последовательном, индексированном последовательном режиме или режиме произвольного доступа. Оперативное хранение и поиск данных очень полезны для правильного функционирования современного предприятия. В этой операции результаты обработки данных становятся доступными для других [7].