Файл: Технологии программирования (Теоретические аспекты кодирования информации).pdf

ВУЗ: Не указан

Категория: Курсовая работа

Дисциплина: Не указана

Добавлен: 01.04.2023

Просмотров: 336

Скачиваний: 2

ВНИМАНИЕ! Если данный файл нарушает Ваши авторские права, то обязательно сообщите нам.

1. 2 знака - идентификатор страны-изготовителя товара;

2. 5 знаков - идентификатор фирмы-изготовителя товара;

3. 5 знаков - идентификатор товара;

4. 1 знак - контрольное число.

В этом коде, например, США и Канада имеют идентификаторы с 00 до 09, Франция - с 30 до 37, ФРГ - с 40 до 43, СНГ - 46, Япония - 49, Италия -с 80 до 83, Корея -88 и так далее.

В штриховом коде, построенном на основе ЕАН-13, каждому знаку цифрового кода соответствует комбинация из семи элементов - штрихов и пробелов между ними.

Штриховые коды могут использоваться кроме торговли также в таких областях, как медицина, банковское дело, промышленность и других. При этом в качестве цифровых кодов для них могут использоваться коды классификаторов ТЭСИ.

Использование кодов ТЭСИ требует обеспечения высокой степени достоверности кодированной информации. В классификаторах ТЭСИ для выявления ошибок в кодах используется метод контрольных чисел.

Контроль правильности записи кодов при обработке информация основан на принципе делимости чисел. Иначе его называют контролем по модулю. Суть метода заключается в том, что к коду добавляется ещё один проверочный знак - контрольное число, связанный с кодом определенной математической зависимостью. При вводе кодированной информации в базу данных, ее обработке или использовании в ЭВМ специальной программой контроля выполняется проверка этой зависимости по каждому коду. Если зависимость нарушается, машина выдает информацию о наличии ошибки в коде.

Контроль по модулю широко используется в классификаторах ТЭСИ как у нас в стране, так и за рубежом. В качестве модуля используют различные числа, но наибольшее распространение получил в настоящее время контроль по модулю 11. Для общероссийских классификаторов расчет контрольных чисел осуществляется в соответствии с методикой, разработанной ВНИИКИ". В соответствии с этой методикой контрольным числом является остаток от деления на 11 суммы произведений весов на значения разрядов кода. Весом (весовым коэффициентом) является порядковый номер разряда в коде слева направо.

Формула, по которой вычисляется контрольное число, имеет следующий вид:

КЧ=? aixi-11

где КЧ - контрольное число по модулю 11,

ai - вес i-го разряда кода,

xi - значение I -го разряда кода,

? aixi - модуль 11, т.е целая часть суммы произведений значений разрядов кода на их веса.

Методика ВНИИКИ предлагает использовать в качестве весов натуральный ряд чисел от 1 до 10. Если разрядность кода больше 10, то набор весов повторяется. При использовании данного метода остаток может получить значение от 0 до 10. Так как методика предусматривает использование одноразрядных контрольных чисел, то при получении остатка, равного 10, следует сделать повторный расчет контрольного числа со сдвигом строки весов. В этом случае весовой ряд начинается с 3 до 10, а если разрядность кода больше, то дальше веса идут с 1 до 10. В случае повторного получения контрольного числа, равного 10, в качестве контрольного числа используется 0. В случае, если сумма произведений весов на значения разрядов получается меньше 10, то эта сумма и является контрольным числом.


Использование контрольных чисел обеспечивает возможность обнаруживать и исправлять ошибки в кодированной документной информации, что повышает ее достоверность.

Как правило, при кодировании товаров используют в основном 10 –разрядный штриховой код, удобный для машинной обработки данных.

Для образования кода применяют регистрационный и классификационный порядок.

Регистрационное кодирование осуществляется порядковым номером. Это самый простой метод и кодовыми обозначениям в этом случае являются натуральные числа. Разновидностью этого метода является серийно-порядковый метод.

К классификационному методу относятся последовательный и параллельный метод кодирования. Последовательный метод применяют для объектов, разделенных по иерархическому методу. В его кодовом обозначении указываются признаки классификации. По этому методу образуются коды продукции в ОКП.

Параллельный метод применяется для объектов, разделенных по фасетному методу, при сочетании иерархического и фасетного методов. В этом случае значение каждой части кодового обозначения не зависят от других.

В современных условиях применяются много различных по типу стандартов ШК, которые можно разделить на две группы: товарные и технологические.

В данное время в мире используют несколько основных систем штрихового кодирования:

Западногерманская система BAN. Эта система введена в ФРГ в 1968 году и является усовершенствованной формой прежней идентификации. Символ кода состоит из 8 цифр: первая и вторая цифра содержат информацию о виде товара; третья – номер товарной группы; четвёртая – номер ассортиментной группы; пятая, шестая и седьмая – порядковый номер товара; восьмая – номер пробы.

ХХ Х Х ХХХ Х

Вид товара

Товарная группа

Ассортиментная группа

Порядковый номер

Номер пробы

В таком виде BAN применяется только для обозначения потребительских товаров.

Американская система UPC. Она введена в 1973 году в США и Канаде и была приспособлена к системе розничной торговли. Символ кода обозначается 12 цифрами, так как префикс стран в этой системе всегда состоит из 2-х цифр. Каждая позиция кода образуется двумя тёмными и двумя светлыми штрихами. Ширина и расстояние между этими знаками отмеряется с помощью фотоэлектронного устройства. Символ кода UPC состоит из 2-х частей – левой и правой. Каждая часть имеет форму прямоугольника. Элементы левой части представляют собой зеркальное отражение правой. Светлая полоса означает ноль, темная – единицу. Прочтение символа совершается посредством движения луча света фотоэлемента, который должен быть направлен под углом 180, чтобы охватить обе стороны символа.


Код UPC бывает 3-х видов:

- UPC – A – содержит 11 информационных и 1 контрольный знак. Предназначен для кодирования продовольственных и непродовольственных товаров, продаваемых через супермаркеты

- UPC – D – предназначен для кодирования непродовольственных товаров. Кодируется любая информация.

- UPC – E – имеет 6 знаков распространён и является половиной версией UPC – A. Применяется для кодирования товаров малыми геометрическими размерами.

Европейская система EAN. Эта система используется с 1977 года. Для её введения была основана международная европейская ассоциация кодирования товаров (JANA). Данная система представляет собой международный стандарт, в соответствии с которым осуществляется разработка технических средств для нанесения и считывания кодов обозначений. Символ кода состоит из цифровых обозначений и штрихов. Цифровые обозначения состоят из 8, либо из 13 цифр.

ХХХ ХХХХ ХХХХХ Х

Страна

Производитель

Товар

Контрольный

Индекс

Цифровое обозначение кода EAN – 13.

Последняя цифра – контрольный индекс, в коде EAN – 13.

Код EAN не классифицирует, а идентифицирует товары таким образом, что никакой другой товар не может иметь такого же кода. Его наличие позволяет потребителю определить страну-импортёра товара, его конкретный номер, предъявить при необходимости претензии к качеству товара и его безопасности.

Японская система CALRA-CODE. Эта новая система кодирования, введена в Японии в 1987 году и представляет собой графический год. Он состоит из 10 больших квадратов, каждый из которых разделён на меньшие одинаковые величины, им приписываются конкретные цифры – 1,2,4,8. Эта система более проста в применении. Она содержит большой объём информации, причем устройство для её расшифровки дешевле и эффективней при нечётном шрифте. Её можно прочитать при искажении квадрата до 1 мм. Данная система применяется только в Японии, так как не получила распространения в других странах.

Так же применяются ещё несколько систем кодирования, но они широко не используются.

2.2. Кодирование текстовой информации

Множество символов, используемых при записи текста, называется алфавитом. Количество символов в алфавите называется его мощностью.

Для представления текстовой информации в компьютере чаще всего используется алфавит мощностью 256 символов. Один символ из такого алфавита несет 8 бит информации, т. к. 28 = 256. Но 8 бит составляют один байт, следовательно, двоичный код каждого символа занимает 1 байт памяти ЭВМ. Все символы такого алфавита пронумерованы от 0 до 255, а каждому номеру соответствует 8-разрядный двоичный код от 00000000 до 11111111. Этот код является порядковым номером символа в двоичной системе счисления.


Для разных типов ЭВМ и операционных систем используются различные таблицы кодировки, отличающиеся порядком размещения символов алфавита в кодовой таблице. Международным стандартом на персональных компьютерах является таблица кодировки ASCII.

Принцип последовательного кодирования алфавита заключается в том, что в кодовой таблице ASCII латинские буквы (прописные и строчные) располагаются в алфавитном порядке. Расположение цифр также упорядочено по возрастанию значений.

Стандартными в этой таблице являются только первые 128 символов, т. е. символы с номерами от нуля (двоичный код 00000000) до 127 (01111111). Сюда входят буквы латинского алфавита, цифры, знаки препинания, скобки и некоторые другие символы. Остальные 128 кодов, начиная со 128 (двоичный код 10000000) и кончая 255 (11111111), используются для кодировки букв национальных алфавитов, символов псевдографики и научных символов.

Сейчас существует несколько различных кодовых таблиц для русских букв (КОИ-8, СР-1251, СР-866, Mac, ISO), причем тексты, созданные в одной кодировке, могут неправильно отображаться в другой. Решается такая проблема с помощью специальных программ перевода текста из одной кодировки в другую. В операционной системе Windows пришлось передвинуть русские буквы в таблице на место псевдографики, и получили кодировку Windows 1251 (Win-1251).

В течение долгого времени понятия «байт» и «символ» были почти синонимами. Однако, в конце концов, стало ясно, что 256 различных символов - это не так много. Математикам требуется использовать в формулах специальные математические знаки, переводчикам необходимо создавать тексты, где могут встретиться символы из различных алфавитов, экономистам необходимы символы валют ($, £, ¥). Для решения этой проблемы была разработана универсальная система кодирования текстовой информации - Unicode. В этой кодировке для каждого символа отводится не один, а два байта, т.е. шестнадцать бит. Таким образом, доступно 65536 (216) различных кодов. Этого хватит на латинский алфавит, кириллицу, иврит, африканские и азиатские языки, различные специализированные символы: математические, экономические, технические и многое другое. Главный недостаток Unicode состоит в том, что все тексты в этой кодировке становятся в два раза длиннее. В настоящее время стандарты ASCII и Unicode мирно сосуществуют.

Учитывая, что каждый бит принимает значение 0 или 1, количество их возможных сочетаний в байте равно. Значит, с помощью 1 байта можно получить 256 разных двоичных кодовых комбинаций и отобразить с их помощью 256 различных символов.


Такое количество символов вполне достаточно для представления текстовой информации, включая прописные и заглавные буквы русского и латинского алфавита, цифры, знаки, графические символы и т.д.

Таким образом, человек различает символы по их начертанию, а компьютер - по их коду. Важно, что присвоение символу конкретного кода - это вопрос соглашения, которое фиксируется в кодовой таблице.

В настоящее время существует много различных кодовых таблиц (DOS, ISO, WINDOWS, KOI8-R, KOI8-U, UNICODE и др.), поэтому тексты, созданные в одной кодировке, могут не правильно отображаться в другой.

2.3. Кодирование числовой информации

Числовую информацию компьютер обрабатывает в двоичной системе счисления. Таким образом, числа в компьютере представлены последовательностью цифр 0 и 1, называемых битами (бит – один разряд двоичного числа). В начале 1980-х гг. процессоры для персональных компьютеров были 8-разрядными, и за один такт работы процессора компьютер мог обработать 8 бит, т.е. максимально обрабатываемое десятичное число не могло превышать 111111112 (или 25510). Последовательность из восьми бит называют байтом, т.е. 1 байт = 8 бит.

Затем разрядность процессоров росла, появились 16-, 32- и, наконец, 64-разрядные процессоры для персональных компьютеров, соответственно возросла и величина максимального числа, обрабатываемого за один такт.

Использование двоичной системы для кодирования целых и действительных чисел позволяет с помощью 8 разрядов кодировать целые числа от 0 до 255, 16 бит дает возможность закодировать более 65 тыс. значений.

В ЭВМ применяются две формы представления чисел:

• естественная форма, или форма с фиксированной запятой. В этой форме числа изображаются в виде последовательности цифр с постоянным для всех чисел положением запятой, отделяющей целую часть от дробной, например +00456,78800; +00000,00786; -0786,34287. Эта форма неудобна для вычислений и применяется только как вспомогательная для целых чисел;

• нормальная форма, или форма с плавающей точкой. В этой форме число выражается с помощью мантиссы и порядка как N = ±Μ • Р±r, где Μ – мантисса числа (|M| < 1), r – порядок числа (целое число), Р – основание системы счисления. Приведенные выше числа в нормальной форме будут представлены как +0,456788 • 103, +0,786 • 102, -0,3078634287 • 105.

Нормальная форма представления обеспечивает большой диапазон отображения чисел и является основной в современных ЭВМ. Все числа с плавающей запятой хранятся в ЭВМ в нормализованном виде. Нормализованным называют такое число, старший разряд мантиссы которого больше нуля.