Файл: Технологии программирования (Теоретические аспекты кодирования информации).pdf
Добавлен: 01.04.2023
Просмотров: 336
Скачиваний: 2
СОДЕРЖАНИЕ
1.Теоретические аспекты кодирования информации
1.1. История возникновения и использования кодирования информации
1.2. Основные понятия кодирования данных, классификация кодов
2. Структура и особенности способов кодирования данных в настоящее время
2.1. Основная характеристика методов кодирования
2.2. Кодирование текстовой информации
2.3. Кодирование числовой информации
2.4. Кодирование звуковой информации
2.5. Кодирование графической информации.
3. Способы представления кодов
3.1 Матричное представление кодов
3.2 Представление кодов в виде кодовых деревьев
3.3 Представление кодов в виде многочленов
1. 2 знака - идентификатор страны-изготовителя товара;
2. 5 знаков - идентификатор фирмы-изготовителя товара;
3. 5 знаков - идентификатор товара;
4. 1 знак - контрольное число.
В этом коде, например, США и Канада имеют идентификаторы с 00 до 09, Франция - с 30 до 37, ФРГ - с 40 до 43, СНГ - 46, Япония - 49, Италия -с 80 до 83, Корея -88 и так далее.
В штриховом коде, построенном на основе ЕАН-13, каждому знаку цифрового кода соответствует комбинация из семи элементов - штрихов и пробелов между ними.
Штриховые коды могут использоваться кроме торговли также в таких областях, как медицина, банковское дело, промышленность и других. При этом в качестве цифровых кодов для них могут использоваться коды классификаторов ТЭСИ.
Использование кодов ТЭСИ требует обеспечения высокой степени достоверности кодированной информации. В классификаторах ТЭСИ для выявления ошибок в кодах используется метод контрольных чисел.
Контроль правильности записи кодов при обработке информация основан на принципе делимости чисел. Иначе его называют контролем по модулю. Суть метода заключается в том, что к коду добавляется ещё один проверочный знак - контрольное число, связанный с кодом определенной математической зависимостью. При вводе кодированной информации в базу данных, ее обработке или использовании в ЭВМ специальной программой контроля выполняется проверка этой зависимости по каждому коду. Если зависимость нарушается, машина выдает информацию о наличии ошибки в коде.
Контроль по модулю широко используется в классификаторах ТЭСИ как у нас в стране, так и за рубежом. В качестве модуля используют различные числа, но наибольшее распространение получил в настоящее время контроль по модулю 11. Для общероссийских классификаторов расчет контрольных чисел осуществляется в соответствии с методикой, разработанной ВНИИКИ". В соответствии с этой методикой контрольным числом является остаток от деления на 11 суммы произведений весов на значения разрядов кода. Весом (весовым коэффициентом) является порядковый номер разряда в коде слева направо.
Формула, по которой вычисляется контрольное число, имеет следующий вид:
КЧ=? aixi-11
где КЧ - контрольное число по модулю 11,
ai - вес i-го разряда кода,
xi - значение I -го разряда кода,
? aixi - модуль 11, т.е целая часть суммы произведений значений разрядов кода на их веса.
Методика ВНИИКИ предлагает использовать в качестве весов натуральный ряд чисел от 1 до 10. Если разрядность кода больше 10, то набор весов повторяется. При использовании данного метода остаток может получить значение от 0 до 10. Так как методика предусматривает использование одноразрядных контрольных чисел, то при получении остатка, равного 10, следует сделать повторный расчет контрольного числа со сдвигом строки весов. В этом случае весовой ряд начинается с 3 до 10, а если разрядность кода больше, то дальше веса идут с 1 до 10. В случае повторного получения контрольного числа, равного 10, в качестве контрольного числа используется 0. В случае, если сумма произведений весов на значения разрядов получается меньше 10, то эта сумма и является контрольным числом.
Использование контрольных чисел обеспечивает возможность обнаруживать и исправлять ошибки в кодированной документной информации, что повышает ее достоверность.
Как правило, при кодировании товаров используют в основном 10 –разрядный штриховой код, удобный для машинной обработки данных.
Для образования кода применяют регистрационный и классификационный порядок.
Регистрационное кодирование осуществляется порядковым номером. Это самый простой метод и кодовыми обозначениям в этом случае являются натуральные числа. Разновидностью этого метода является серийно-порядковый метод.
К классификационному методу относятся последовательный и параллельный метод кодирования. Последовательный метод применяют для объектов, разделенных по иерархическому методу. В его кодовом обозначении указываются признаки классификации. По этому методу образуются коды продукции в ОКП.
Параллельный метод применяется для объектов, разделенных по фасетному методу, при сочетании иерархического и фасетного методов. В этом случае значение каждой части кодового обозначения не зависят от других.
В современных условиях применяются много различных по типу стандартов ШК, которые можно разделить на две группы: товарные и технологические.
В данное время в мире используют несколько основных систем штрихового кодирования:
Западногерманская система BAN. Эта система введена в ФРГ в 1968 году и является усовершенствованной формой прежней идентификации. Символ кода состоит из 8 цифр: первая и вторая цифра содержат информацию о виде товара; третья – номер товарной группы; четвёртая – номер ассортиментной группы; пятая, шестая и седьмая – порядковый номер товара; восьмая – номер пробы.
ХХ Х Х ХХХ Х
Вид товара
Товарная группа
Ассортиментная группа
Порядковый номер
Номер пробы
В таком виде BAN применяется только для обозначения потребительских товаров.
Американская система UPC. Она введена в 1973 году в США и Канаде и была приспособлена к системе розничной торговли. Символ кода обозначается 12 цифрами, так как префикс стран в этой системе всегда состоит из 2-х цифр. Каждая позиция кода образуется двумя тёмными и двумя светлыми штрихами. Ширина и расстояние между этими знаками отмеряется с помощью фотоэлектронного устройства. Символ кода UPC состоит из 2-х частей – левой и правой. Каждая часть имеет форму прямоугольника. Элементы левой части представляют собой зеркальное отражение правой. Светлая полоса означает ноль, темная – единицу. Прочтение символа совершается посредством движения луча света фотоэлемента, который должен быть направлен под углом 180, чтобы охватить обе стороны символа.
Код UPC бывает 3-х видов:
- UPC – A – содержит 11 информационных и 1 контрольный знак. Предназначен для кодирования продовольственных и непродовольственных товаров, продаваемых через супермаркеты
- UPC – D – предназначен для кодирования непродовольственных товаров. Кодируется любая информация.
- UPC – E – имеет 6 знаков распространён и является половиной версией UPC – A. Применяется для кодирования товаров малыми геометрическими размерами.
Европейская система EAN. Эта система используется с 1977 года. Для её введения была основана международная европейская ассоциация кодирования товаров (JANA). Данная система представляет собой международный стандарт, в соответствии с которым осуществляется разработка технических средств для нанесения и считывания кодов обозначений. Символ кода состоит из цифровых обозначений и штрихов. Цифровые обозначения состоят из 8, либо из 13 цифр.
ХХХ ХХХХ ХХХХХ Х
Страна
Производитель
Товар
Контрольный
Индекс
Цифровое обозначение кода EAN – 13.
Последняя цифра – контрольный индекс, в коде EAN – 13.
Код EAN не классифицирует, а идентифицирует товары таким образом, что никакой другой товар не может иметь такого же кода. Его наличие позволяет потребителю определить страну-импортёра товара, его конкретный номер, предъявить при необходимости претензии к качеству товара и его безопасности.
Японская система CALRA-CODE. Эта новая система кодирования, введена в Японии в 1987 году и представляет собой графический год. Он состоит из 10 больших квадратов, каждый из которых разделён на меньшие одинаковые величины, им приписываются конкретные цифры – 1,2,4,8. Эта система более проста в применении. Она содержит большой объём информации, причем устройство для её расшифровки дешевле и эффективней при нечётном шрифте. Её можно прочитать при искажении квадрата до 1 мм. Данная система применяется только в Японии, так как не получила распространения в других странах.
Так же применяются ещё несколько систем кодирования, но они широко не используются.
2.2. Кодирование текстовой информации
Множество символов, используемых при записи текста, называется алфавитом. Количество символов в алфавите называется его мощностью.
Для представления текстовой информации в компьютере чаще всего используется алфавит мощностью 256 символов. Один символ из такого алфавита несет 8 бит информации, т. к. 28 = 256. Но 8 бит составляют один байт, следовательно, двоичный код каждого символа занимает 1 байт памяти ЭВМ. Все символы такого алфавита пронумерованы от 0 до 255, а каждому номеру соответствует 8-разрядный двоичный код от 00000000 до 11111111. Этот код является порядковым номером символа в двоичной системе счисления.
Для разных типов ЭВМ и операционных систем используются различные таблицы кодировки, отличающиеся порядком размещения символов алфавита в кодовой таблице. Международным стандартом на персональных компьютерах является таблица кодировки ASCII.
Принцип последовательного кодирования алфавита заключается в том, что в кодовой таблице ASCII латинские буквы (прописные и строчные) располагаются в алфавитном порядке. Расположение цифр также упорядочено по возрастанию значений.
Стандартными в этой таблице являются только первые 128 символов, т. е. символы с номерами от нуля (двоичный код 00000000) до 127 (01111111). Сюда входят буквы латинского алфавита, цифры, знаки препинания, скобки и некоторые другие символы. Остальные 128 кодов, начиная со 128 (двоичный код 10000000) и кончая 255 (11111111), используются для кодировки букв национальных алфавитов, символов псевдографики и научных символов.
Сейчас существует несколько различных кодовых таблиц для русских букв (КОИ-8, СР-1251, СР-866, Mac, ISO), причем тексты, созданные в одной кодировке, могут неправильно отображаться в другой. Решается такая проблема с помощью специальных программ перевода текста из одной кодировки в другую. В операционной системе Windows пришлось передвинуть русские буквы в таблице на место псевдографики, и получили кодировку Windows 1251 (Win-1251).
В течение долгого времени понятия «байт» и «символ» были почти синонимами. Однако, в конце концов, стало ясно, что 256 различных символов - это не так много. Математикам требуется использовать в формулах специальные математические знаки, переводчикам необходимо создавать тексты, где могут встретиться символы из различных алфавитов, экономистам необходимы символы валют ($, £, ¥). Для решения этой проблемы была разработана универсальная система кодирования текстовой информации - Unicode. В этой кодировке для каждого символа отводится не один, а два байта, т.е. шестнадцать бит. Таким образом, доступно 65536 (216) различных кодов. Этого хватит на латинский алфавит, кириллицу, иврит, африканские и азиатские языки, различные специализированные символы: математические, экономические, технические и многое другое. Главный недостаток Unicode состоит в том, что все тексты в этой кодировке становятся в два раза длиннее. В настоящее время стандарты ASCII и Unicode мирно сосуществуют.
Учитывая, что каждый бит принимает значение 0 или 1, количество их возможных сочетаний в байте равно. Значит, с помощью 1 байта можно получить 256 разных двоичных кодовых комбинаций и отобразить с их помощью 256 различных символов.
Такое количество символов вполне достаточно для представления текстовой информации, включая прописные и заглавные буквы русского и латинского алфавита, цифры, знаки, графические символы и т.д.
Таким образом, человек различает символы по их начертанию, а компьютер - по их коду. Важно, что присвоение символу конкретного кода - это вопрос соглашения, которое фиксируется в кодовой таблице.
В настоящее время существует много различных кодовых таблиц (DOS, ISO, WINDOWS, KOI8-R, KOI8-U, UNICODE и др.), поэтому тексты, созданные в одной кодировке, могут не правильно отображаться в другой.
2.3. Кодирование числовой информации
Числовую информацию компьютер обрабатывает в двоичной системе счисления. Таким образом, числа в компьютере представлены последовательностью цифр 0 и 1, называемых битами (бит – один разряд двоичного числа). В начале 1980-х гг. процессоры для персональных компьютеров были 8-разрядными, и за один такт работы процессора компьютер мог обработать 8 бит, т.е. максимально обрабатываемое десятичное число не могло превышать 111111112 (или 25510). Последовательность из восьми бит называют байтом, т.е. 1 байт = 8 бит.
Затем разрядность процессоров росла, появились 16-, 32- и, наконец, 64-разрядные процессоры для персональных компьютеров, соответственно возросла и величина максимального числа, обрабатываемого за один такт.
Использование двоичной системы для кодирования целых и действительных чисел позволяет с помощью 8 разрядов кодировать целые числа от 0 до 255, 16 бит дает возможность закодировать более 65 тыс. значений.
В ЭВМ применяются две формы представления чисел:
• естественная форма, или форма с фиксированной запятой. В этой форме числа изображаются в виде последовательности цифр с постоянным для всех чисел положением запятой, отделяющей целую часть от дробной, например +00456,78800; +00000,00786; -0786,34287. Эта форма неудобна для вычислений и применяется только как вспомогательная для целых чисел;
• нормальная форма, или форма с плавающей точкой. В этой форме число выражается с помощью мантиссы и порядка как N = ±Μ • Р±r, где Μ – мантисса числа (|M| < 1), r – порядок числа (целое число), Р – основание системы счисления. Приведенные выше числа в нормальной форме будут представлены как +0,456788 • 103, +0,786 • 102, -0,3078634287 • 105.
Нормальная форма представления обеспечивает большой диапазон отображения чисел и является основной в современных ЭВМ. Все числа с плавающей запятой хранятся в ЭВМ в нормализованном виде. Нормализованным называют такое число, старший разряд мантиссы которого больше нуля.