Файл: Методы кодирования данных (Системы счисления бывают позиционные и непозиционные).pdf

ВУЗ: Не указан

Категория: Курсовая работа

Дисциплина: Не указана

Добавлен: 02.04.2023

Просмотров: 320

Скачиваний: 2

ВНИМАНИЕ! Если данный файл нарушает Ваши авторские права, то обязательно сообщите нам.

Введение

Компьютер может обрабатывать информацию, поданную в числовой форме. Любая другая информация - звуковая, графическая, текстовая - для отображения на компьютере должна быть приведена к числовому виду. Например, чтобы перевести звук в цифровую форму, интенсивность звука измеряют через определенные промежутки времени, результаты измерения представляют в числовой форме. Полученную информацию можно преобразовать, например, звуки «наложить» друг на друга с разных источников. И наоборот, полученный результат можно снова преобразовать в звук.

Когда обрабатывается на компьютере текстовая информация, каждая буква кодируется определенным числом, а при выводе на экран монитора или на печать для удобства чтения каждому числу ставится в соответствие изображение буквы. Такое соответствие называют кодировкой символов. 

Информацию можно представить в текстовой, числовой, графической звуковой формах. Можно сказать, что информация кодируется, и наша задача научиться декодировать информацию, то есть переводить на понятный человеку язык.

Что такое кодирование данных

Чтобы автоматизировать работу с данными, которые относятся к различным типам, необходимо унифицировать их форму представления — для этого данные кодируют, то есть выражают данные одного типа через данные другого типа. Естественный человеческий язык — это система кодирования понятий для выражения мыслей через речь. К различным языкам примыкают азбуки. Были попытки создания универсального языка и азбуки, но безуспешные.

При составлении информационной модели объекта или явления необходимо определиться, как обозначать те или иные символы. Иными словами, какой будет вид представления информации.

Мысли человека выражаются предложениями, которые составляются из слов. Это алфавитное представление информации. 

Алфавит (основа любого языка) - конечный набор разных символов, при складывании которых получается сообщение на выбранном языке. 
Однако, одна и та же запись может иметь разный смысл. 
Например, цифра 150613 может обозначать: 

  • ширину объекта;
  • массу объекта;
  • время в секундах;
  • номер дома;
  • дату 15 июня 2013 года.

Поэтому, чтобы не было путаницы, существуют правила представления информации. Такие правила называются кодом.

Код – это набор условных обозначений для представления информации. 


Кодирование - процесс представления информации через код (символы одного алфавита представляются через символы другого; одна форма представления информации преобразуется к более удобной для хранения другой форме хранения информации).

Декодирование – это обратное преобразование информации.
Например, при общении друг с другом мы разговариваем на русском языке, который является кодом. Разговаривая, мы этот код передаем с помощью звуков, при письме - буквами. Водитель мигает фарами или сигналит, значит, передает сигнал. Сигнал светофора при переходе дороги – это тоже кодирование информации. Таким образом, при кодировании следует использовать строго определенные символы.

Способ кодирования зависит от: 

  • сокращения записи;
  • зашифровки информации;
  • удобства обработки;
  • и т. д.

Представление информации в компьютере

Системы счисления и формы представления чисел

Информация в компьютере кодируется, как правило, в двоичной или в десятичной системе счисления.

Система счисления – это способ изображения чисел с помощью символов, которые имеют определенные количественные значения.

Системы счисления бывают позиционные и непозиционные.

Позиционная система счисления – это когда количественное значение цифры зависит от ее позиции в числе. Непозиционная система счисления - значение каждой цифры не зависит от ее позиции в числе. Количество (Р) различных цифр, которые используются для изображения числа в позиционной системе счисления, называется основанием системы счисления. В общем случае запись любого числа в системе счисления с основанием Р можно представить:

где нижние индексы определяют местоположение цифры в числе.

Для представления двоичной системы счисления (Р=2) используются всего две цифры: 0 и 1. Из соотношения (1) вытекают правила перевода чисел из одной системы счисления в другую.

Двоичные числа представляются в двух формах:

  • естественная форма или форма с фиксированной запятой (точкой);
  • нормальная форма или форма с плавающей запятой (точкой).

С фиксированной запятой все числа представлены как последовательность цифр с постоянным для всех чисел положением запятой, которое отделяет целую часть от дробной.


Например, в десятичной системе счисления имеются 4 разряда в целой части числа (до запятой) и 4 разряда в дробной части числа (после запятой); такие числа имеют вид:

+0343,9531; +8888,0000; -5325,0565.

Эта форма не всегда применяется в вычислениях, так как у нее небольшой диапазон представления чисел.

С плавающей запятой все числа представлены как две группы цифр. Первая – это мантисса (абсолютная величина меньше единицы), вторая – порядок (целое число).

Например, числа в нормальной форме имеют вид: +0,67567*102 ; +0,111*10-6 ; -0,86777777* 109 .

Эта форма представления является основной в современных ЭВМ.

Двоично-десятичная система счисления получила большое распространение в современных компьютерах по причине легкости перевода в десятичную систему и обратно. В этой системе счисления каждая десятичная цифра кодируется с помощью четырех двоичных цифр (табл.1).

Таблица 1. Таблица двоичных кодов десятичных цифр и шестнадцатеричных

Цифра

0

1

2

3

4

5

6

7

8

9

А

В

С

D

Е

F

Код

0000

0001

0010

0011

0100

0101

0110

0111

1000

1001

1010

1011

1100

1101

1110

1111

Например, 9703 в десятичной системе выглядит в двоичной системе так: 1001011100000011.

В веб-дизайне, в программировании иногда пользуются шестнадцатеричной системой счисления. Чтобы отобразить цифры, большие 9, в шестнадцатеричной системе счисления используются буквы А = 10, В = 11, С = 12, D = 13, Е = 14, F = 15.

Например, F17B в шестнадцатеричной системе выглядит так в двоичной системе: 1111000101111011.

Варианты представления информации в ПК

Вся информация в компьютере представляется двоичными кодами. Для удобства работы двоичные разряды обозначены терминами (табл. 2). Эти термины применяются для измерения объемов информации, которая хранится и обрабатывается в ЭВМ.

Таблица 2. Двоичные разряды

Количество двоичных разрядов

1

8

16

8*1024

8*10242

8*10243

8*10244

Единица измерения

Бит

Байт

Параграф

Килобайт

Мегабайт

Гигабайт

Терабайт


Двоично-кодированные десятичные числа могут быть представлены в компьютере в двух форматах - упакованном и распакованном.

В упакованном формате каждая десятичная цифра кодируется четырьмя двоичными разрядами (полбайта).

Упакованный формат:

Здесь и далее: Цф – цифра, Знак – знак числа.

Используется этот формат в компьютере при сложении и вычитании двоично-десятичных чисел.

В распакованном формате каждой десятичной цифре отводится целый байт, при этом старшие полубайты каждого байта в ПК заполняются кодом 0011 (в соответствии с ASCII-кодом), а в левых полубайтах кодируются десятичные цифры. Старший полубайт самого правого байта используется для кодирования знака числа.

Распакованный формат:

Распакованный формат используется в компьютере при выполнении операций умножения и деления двоично-десятичных чисел и при вводе-выводе информации в ПК [2, стр.93].

Коды ASCII

Распакованный формат является следствием использования в компьютере ASCII-кода, чтобы представить символьную информацию.

Код ASCII– (Американский стандартный код для обмена информацией) представлен как основной стандарт и его расширение (табл. 3). Для кодирования символов используются шестнадцатиричные коды 00 - 7F, расширение стандарта – 80 - FF. Основной стандарт – международный, его используют, чтобы закодировать управляющие символы, цифры и буквы латинского алфавита; расширение стандарта кодирует символы псевдографики и буквы национального алфавита.

Таблица 3. Таблица кодов ASCII

В связи с множеством систем кодирования текстовой информации, действующего в России, возникает задача преобразования данных — это одна из главных задач информатики (Приложение А).

Кодирование информации

Кодирование текстовой информации

Существуют три основных способа кодирования текстовой информации:

  • числовой – это числа;
  • символьный – символы того же алфавита, что и исходный текст;
  • графический – специальные рисунки или значки.

Если каждому символу алфавита сопоставить определенное целое число, то двоичный код кодирует и текстовую информацию. Двоичный код одного символа хранит в себе 1 байт = 8 бит.

Так как каждый бит принимает два значения 0 или 1, количество возможных сочетаний в байте равно 256=28.


Значит, 256 кодовых комбинаций получается при помощи 1 байта и закодировать ними 256 различных символов. 

Это количество символов достаточно для кодирования текстовой информации. В неё входят прописные буквы русского и латинского алфавита, цифры, специальные символы, графические символы, знаки и т.д. 
Каждый символ колируется уникальным десятичным кодом от 0 до 255 или соответствующим двоичный код от 00000000 до 11111111. 

Таким образом, компьютер различает символы по их коду, а человек - по их начертанию.

Символу присваивается конкретный код – это соглашение фиксируется в кодовой таблице (Приложение Б). 

Кодирование текстовой информации с помощью байтов опирается на несколько различных стандартов, но первоосновой для всех стал стандарт ASCII, который ранее описывался.

В системе ASCII существуют две таблицы кодирования - базовая и расширенная

Базовая таблица имеет значения кодов от 0 до 127, а расширенная - номера от 128 до 255. Первые 33 кода соответствуют не символам, а разным операциям (ввод пробела, специальные знаки, переход строки, номер, скобки и т. д.). 

Коды с 33 по 127 – это стандарт интернациональный, состоящий из символов латинского алфавита, цифр, знаков арифметических операций и знаков препинания.

Коды с 128 по 255 – это стандарт национальный, т.е. один и тот же код могут иметь различные символы. 

Например, ASCII коды букв латинского алфавита:

Таблица 4. Таблица кодов ASCII

В языках, в которых используется кириллический алфавит, и русский в частности, поменяли полностью вторую половину таблицы ASCII, ее приспособили под кириллический алфавит. Однако из-за отсутствия согласованного стандарта появились различные кодовые таблицы для кодирования русскоязычных текстов, среди которых кодовая таблица Windows (CP-1251) (табл.5).

Таблица 5. Кодовая таблица Windows (CP-1251)

Со временем, с развитием информационных технологий в мире необходимо было кодировать символы алфавитов других языков: арабского, японского, корейского, хинди, и некоторые специальные символы.

На смену старой системе пришла новая универсальная, в которой один символ кодируется не одним, а двумя байтами. 
При анализе организационных трудностей, которые связаны с созданием единой системы кодирования текстовой информации, пришли к выводу, что они из-за небольшого набора кодов – всего 256. Лучше использовать не восьми разрядную, а шестнадцатиразрядную кодировку символов. Такая систему кодирования назвали универсальной UNICODE. Шестнадцати разрядов достаточно, чтобы закодировать 65 536 различных символов — этого поля достаточно для кодирования большинства языков планеты.