Файл: Анализ методов кодирования данных (Общие сведения и понятия в информатике).pdf
Добавлен: 18.05.2023
Просмотров: 351
Скачиваний: 3
СОДЕРЖАНИЕ
Глава 1. Общие сведения и понятия в информатике
1.4. Понятие избыточность информации и необходимость ее сжатия
2.1. Кодирование данных в вычислительной технике
2.2. Двоичная система счисления
ГЛАВА 3. ПРЕДСТАВЛЕНИЕ ДАННЫХ РАЗЛИЧНОЙ ПРИРОДЫ В ЭВМ
3.1. Представление логических данных
3.2. Кодирование текстовых данных
3.3. Единая система кодирования текстовых данных
3.4. Представление и обработка числовой информации в компьютере
3.5. Кодирование звуковых данных
Двоичная система счисления - позиционная система счисления с основанием 2. В этой системе счисления натуральные числа записываются с помощью всего лишь двух символов (в роли которых обычно выступают цифры 0 и 1). В двоичной системе счисления всего две цифры, называемые двоичными. Название разряда двоичного числа – бит. Веса разрядов в двоичной системе изменяются по степеням двойки. Поскольку вес каждого разряда уменьшается либо на 0, либо на 1, то в результате значение числа определяется как сумма соответствующих значений степени двойки. 10102=1⋅23+0⋅22+1⋅21+0⋅20=10.
Известны следующие преимущества использования двоичной системы в вычислительной технике:
- простота технической реализации;
- надёжность и помехоустойчивость;
- возможность применения аппарата булевой алгебры для выполнения логических операций;
- простота правил двоичной арифметики.
Двоичная система используется в цифровых устройствах, т.к. является наиболее простой и соответствует требованиям:
Чем меньше значений существует в системе, тем проще изготовить отдельные элементы, оперирующие этими значениями.
В частности, две цифры двоичной системы счисления могут быть легко представлены многими физическими явлениями: есть ток — нет тока, индукция магнитного поля больше пороговой величины или нет и т. д.
Чем меньше количество состояний у элемента, тем выше помехоустойчивость и тем быстрее он может работать.
Например, чтобы закодировать три состояния через величину индукции магнитного поля, потребуется ввести два пороговых значения, что не будет способствовать помехоустойчивости и надёжности хранения информации.
Двоичная арифметика является довольно простой. Простыми являются таблицы сложения и умножения - основных действий над числами.
Возможно применение аппарата алгебры логики для выполнения побитовых операций над числами.
ГЛАВА 3. ПРЕДСТАВЛЕНИЕ ДАННЫХ РАЗЛИЧНОЙ ПРИРОДЫ В ЭВМ
3.1. Представление логических данных
Логические данные (переменные) принимают два значения: Истина или Ложь, 1 или 0 — и обозначаются прописными латинскими буквами. Л, В, С, D, ..., X, Y, Z.
В компьютере для логической переменной отводится два байта, или 16 разрядов, которые заполняются 1, если она имеет значение Истина, и 0, если значение Ложь.
С логическими данными выполняются логические операции, среди которых наибольшее применение получили операции конъюнкции, дизъюнкции, отрицания и импликации. Результатом логической операции является также значение Истина или Ложь, 1 или 0.
Значение логической функции F можно определить с помощью ее таблицы истинности, которая показывает, какие значения принимает логическая функция при всех наборах ее аргументов, например А и В.
3.2. Кодирование текстовых данных
Главная идея кодирования текстовой информации в компьютере заключается в следующем. Текст состоит из отдельных символов, поэтому необходимо установить правила кодирования именно для символов. Общепринятый подход заключается в том, что определяется стандартная последовательность символов, и они нумеруются. В результате описанного подхода любой текстовый символ сохраняется в виде числа, которое является не чем иным, как его номером в общем стандартном списке символов (своеобразном алфавите). Кодирование символов с помощью номера в стандартной последовательности или, как часто говорят, в кодовой таблице очень компактно и удобно для компьютерной реализации.
Если каждому символу алфавита сопоставить определенное целое число (например, порядковый номер), то с помощью двоичного кода можно легко кодировать текстовую информацию.
Восьми двоичных разрядов достаточно для кодирования 256 различных символов. Этого хватит, чтобы выразить различными комбинациями восьми битов все символы английского и русского алфавитов, как строчные, так и прописные, а также знаки препинания, символы основных арифметических действий и некоторые общепринятые специальные символы, например символ «§». Технически это выглядит очень просто, однако всегда существовали достаточно веские организационные сложности.
В первые годы развития вычислительной техники они были связаны с отсутствием необходимых стандартов, а в настоящее время вызваны, наоборот, изобилием одновременно действующих и противоречивых стандартов. Для того чтобы весь мир одинаково кодировал текстовые данные, нужны единые таблицы кодирования, а это пока невозможно из-за противоречий между символами национальных алфавитов, а также противоречий корпоративного характера.
Институт стандартизации США (ANSI — American National Standard Institute) ввел в действие систему кодирования ASCII (American Standard Code for Information Interchange — стандартный код информационного обмена США).
В системе ASCII закреплены две таблицы кодирования: базовая и расширенная. Базовая таблица закрепляет значения кодов от 0 до 127, а расширенная относится к символам с номерами от 128 до 255. Первые 32 кода базовой таблицы, начиная с нулевого, отданы производителям аппаратных средств (в первую очередь производителям компьютеров и печатающих устройств). В этой области размещаются так называемые управляющие коды, которым не соответствуют никакие символы языков, и, соответственно, эти коды не выводятся ни на экран, ни на устройства печати, но ими можно управлять тем, как производится вывод прочих данных. Начиная, с кода 32 по код 127, размещены коды символов английского алфавита, знаков препинания, цифр, арифметических действий и некоторых вспомогательных символов.
Базовая таблица кодировки ascii
|
7 beep (звуковой сигнал) |
37 |
% |
52 |
4 |
67 |
C |
82 |
R |
97 |
a |
112 |
p |
|
|
38 |
& |
53 |
5 |
68 |
D |
83 |
S |
98 |
b |
113 |
q |
||
|
8 backspace (удаление предыдущего символа) |
39 |
' |
54 |
6 |
69 |
E |
84 |
T |
99 |
c |
114 |
r |
|
|
40 |
( |
55 |
7 |
70 |
F |
85 |
U |
100 |
d |
115 |
s |
||
|
41 |
) |
56 |
8 |
71 |
G |
86 |
V |
101 |
e |
116 |
t |
||
|
9 tab (табуляция) |
42 |
* |
57 |
9 |
72 |
H |
87 |
W |
102 |
f |
117 |
u |
|
|
10 linefeed (перевод строки) |
43 |
+ |
58 |
: |
73 |
I |
88 |
X |
103 |
g |
118 |
v |
|
|
44 |
, |
59 |
; |
74 |
J |
89 |
Y |
104 |
h |
119 |
w |
||
|
13 carriage return (возврат каретки) |
45 |
- |
60 |
< |
75 |
K |
90 |
Z |
105 |
i |
120 |
x |
|
|
46 |
. |
61 |
= |
76 |
L |
91 |
[ |
106 |
j |
121 |
y |
||
|
32 space (пробел) |
47 |
/ |
62 |
> |
77 |
M |
92 |
\ |
107 |
k |
122 |
z |
|
|
33 |
! |
48 |
0 |
63 |
? |
78 |
N |
93 |
] |
108 |
l |
123 |
{ |
|
34 |
« |
49 |
1 |
64 |
@ |
79 |
O |
94 |
^ |
109 |
m |
124 |
| |
|
35 |
# |
50 |
2 |
65 |
A |
80 |
P |
95 |
_ |
110 |
n |
125 |
} |
|
36 |
$ |
51 |
3 |
66 |
B |
81 |
Q |
96 |
` |
111 |
o |
126 |
~ |
Аналогичные системы кодирования текстовых данных были разработаны и в других странах. Так, например, в СССР в этой области действовала система кодирования КОИ-7 (код обмена информацией, семизначный). Однако поддержка производителей оборудования и программ вывела американский код ASCII на уровень международного стандарта, и национальным системам кодирования пришлось «отступить» во вторую, расширенную часть системы кодирования, определяющую значения кодов со 128 по 255.
Отсутствие единого стандарта в этой области привело к множественности одновременно действующих кодировок. Только в России можно указать три действующих стандарта кодировки и еще два устаревших. Так, например, кодировка символов русского языка, известная как кодировка Windows-1251, была введена «извне» — компанией Microsoft, но, учитывая широкое распространение операционных систем и других продуктов этой компании в России, она глубоко закрепилась и нашла широкое распространение.
Кодировка Windows-1251 (синоним CP1251)
Кодировка Windows-1251 (синоним CP1251)
|
.0 |
.1 |
.2 |
.3 |
.4 |
.5 |
.6 |
.7 |
.8 |
.9 |
.A |
.B |
.C |
.D |
.E |
.F |
|
|
|
Ђ |
Ѓ |
‚ |
ѓ |
„ |
… |
† |
‡ |
€ |
‰ |
Љ |
‹ |
Њ |
Ќ |
Ћ |
Џ |
|
|
ђ |
‘ |
’ |
“ |
” |
• |
– |
— |
™ |
љ |
› |
њ |
ќ |
ћ |
џ |
|
|
|
|
Ў |
ў |
Ј |
¤ |
Ґ |
¦ |
§ |
Ё |
© |
Є |
« |
¬ |
|
® |
Ї |
|
|
° |
± |
І |
і |
ґ |
µ |
¶ |
· |
ё |
№ |
є |
» |
ј |
Ѕ |
ѕ |
ї |
|
|
А |
Б |
В |
Г |
Д |
Е |
Ж |
З |
И |
Й |
К |
Л |
М |
Н |
О |
П |
|
|
Р |
С |
Т |
У |
Ф |
Х |
Ц |
Ч |
Ш |
Щ |
Ъ |
Ы |
Ь |
Э |
Ю |
Я |
|
|
а |
б |
в |
г |
д |
е |
ж |
з |
и |
й |
к |
л |
м |
н |
о |
п |
|
|
р |
с |
т |
у |
ф |
х |
ц |
ч |
ш |
щ |
ъ |
ы |
ь |
э |
ю |
я |
Эта кодировка используется на большинстве локальных компьютеров, работающих на платформе Windows. Де-факто она стала стандартной в российском секторе World Wide Web.
Другая распространенная кодировка носит название КОИ-8 (код обмена информацией, восьмизначный) — ее происхождение относится ко временам действия Совета Экономической Взаимопомощи государств Восточной Европы.
Кодировка KOI8-R (русская).
Кодировка KOI8-R (русская).
|
.0 |
.1 |
.2 |
.3 |
.4 |
.5 |
.6 |
.7 |
.8 |
.9 |
.A |
.B |
.C |
.D |
.E |
.F |
|
|
|
─ |
│ |
┌ |
┐ |
└ |
┘ |
├ |
┤ |
┬ |
┴ |
┼ |
▀ |
▄ |
█ |
▌ |
▐ |
|
|
░ |
▒ |
▓ |
⌠ |
■ |
∙ |
√ |
≈ |
≤ |
≥ |
|
⌡ |
° |
² |
· |
÷ |
|
|
═ |
║ |
╒ |
ё |
╓ |
╔ |
╕ |
╖ |
╗ |
╘ |
╙ |
╚ |
╛ |
╜ |
╝ |
╞ |
|
|
╟ |
╠ |
╡ |
Ё |
╢ |
╣ |
╤ |
╥ |
╦ |
╧ |
╨ |
╩ |
╪ |
╫ |
╬ |
© |
|
|
ю |
а |
б |
ц |
д |
е |
ф |
г |
х |
и |
й |
к |
л |
м |
н |
о |
|
|
п |
я |
р |
с |
т |
у |
ж |
в |
ь |
ы |
з |
ш |
э |
щ |
ч |
ъ |
|
|
Ю |
А |
Б |
Ц |
Д |
Е |
Ф |
Г |
Х |
И |
Й |
К |
Л |
М |
Н |
О |
|
|
П |
Я |
Р |
С |
Т |
У |
Ж |
В |
Ь |
Ы |
З |
Ш |
Э |
Щ |
Ч |
Ъ |