Файл: Диалектическое единство данных и методов в информационном процессе.pdf

ВУЗ: Не указан

Категория: Курсовая работа

Дисциплина: Не указана

Добавлен: 04.04.2023

Просмотров: 385

Скачиваний: 2

ВНИМАНИЕ! Если данный файл нарушает Ваши авторские права, то обязательно сообщите нам.

Несмотря на тривиальную очевидность такого подхода, простой механический переход на данную систему долгое время сдерживался из-за недостаточных ресурсов средств вычислительной техники (в системе кодирования UNICODE все текстовые документы автоматически становятся вдвое длиннее). Во второй половине 90-х годов технические средства достигли необходимого уровня обеспеченности ресурсами, и сегодня мы наблюдаем постепенный перевод документов и программных средств на универсальную систему кодирования. Для индивидуальных пользователей это еще больше добавило забот по согласованию документов, выполненных в разных системах кодирования, с программными средствами, но это надо понимать как трудности переходного периода.

3.5. Кодирование графических данных

Представление данных является одним из основных компонентов визуализации данных. Основное внимание в представлении данных уделяется отображению значений данных в графические представления. Дизайнеры визуализации используют элементарные графические единицы, называемые «графическими кодировками», чтобы отобразить данные в графическое представление. Рассмотрим случай, в котором мы визуализируем два числовых значения с использованием двух столбцов разной длины. Здесь длина - это основная переменная кодирования, используемая для сопоставления значений данных. Альтернативно, угол является основным графическим кодированием для круговой диаграммы.

Почему понимание графического кодирования имеет значение при визуализации данных?

Во многих предыдущих исследованиях изучалось влияние графических кодировок, таких как положение, длина, площадь, форма и цвет, на эффективность визуализации данных. Эти исследования часто измеряли способность зрителей точно воспринимать значения данных, закодированные с использованием графических кодировок.

Одним из наиболее известных исследований, посвященных изучению эффективности графического кодирования, является исследование Кливленда и Макгилла . В ходе исследования проверялось восприятие пользователем 10 элементарных графических кодировок. Участников попросили визуально сравнить значения двух меток (например, двух столбцов разной длины) и оценить, какой процент меньшего значения был больше. Они использовали результаты для ранжирования графических кодировок; одно элементарное графическое кодирование считается более точным, чем другое, если оно приводит к человеческим суждениям, которые ближе к фактическим кодированным значениям.


Понимание того, как люди воспринимают различные графические кодировки, позволяет дизайнерам оптимизировать свои визуализации и помогает в разработке программного обеспечения для автоматического представления.

Что такое интерактивные графические кодировки?

В последнее время наблюдается тенденция к увеличению визуализации информации и визуальной аналитики, которая позволяет пользователям напрямую взаимодействовать с графическими кодировками. Мы определяем интерактивные графические кодировки как элементарную графическую кодировку, которой можно напрямую манипулировать или настраивать.

Например, DimpVis - это новейшая система, которая позволяет пользователям напрямую взаимодействовать с длиной, углом и положением графических кодировок, используемых в визуальных представлениях, в качестве средства для временной навигации (см. Рис. 2). В DimpVis пользователи могут настроить длину бара, чтобы увидеть его значение в разные моменты времени. Например, чтобы проверить, что в любой момент времени значение, связанное с баром, равно половине его текущего значения, пользователь может перетащить бар вертикально вниз, чтобы сравнить его значения в разные моменты времени.

Визуализация посредством демонстрации - это еще один пример, в котором пользователи могут напрямую взаимодействовать с графическими кодировками, чтобы обеспечить наглядную демонстрацию постепенных изменений в представлении данных. Например, пользователь увеличивает размер точки данных в два раза, чтобы продемонстрировать заинтересованность в создании визуализации, в которой эта точка и аналогичные точки классифицируются вместе и отображаются крупнее, чем другие точки данных. В ответ система ищет атрибуты данных, которые можно сопоставить с размером, и предлагает атрибуты.

3.6. Кодирование звуковой информации

Аудиокодирование относится к способу сохранения и передачи аудиоданных. Документация ниже описывает, как работают такие кодировки. Для рекомендаций по выбору лучшего кодирования для вашего приложения.

Цифровое аудио кодирование является сложной темой, и вам, как правило, не нужно знать детали для обработки аудио в Speech API. Представленные здесь концепции предназначены только для общего обзора. Некоторая из этой справочной информации может быть полезна для понимания того, как работает API, и как аудио следует формулировать и обрабатывать в ваших приложениях.


Аудио форматы против кодировок

Обратите внимание, что аудиоформат не эквивалентен аудио кодированию. Популярный формат файла, такой как, .WAVнапример, определяет формат заголовка аудиофайла, но сам по себе не является аудиокодировкой. .WAVаудиофайлы часто, но не всегда, используют линейную кодировку PCM; не предполагайте, что .WAVфайл имеет какую-либо конкретную кодировку, пока вы не проверите его заголовок.

FLACОднако это и формат файла, и кодировка, что иногда приводит к некоторой путанице. В Speech-to-Text API FLAC- единственная кодировка, которая требует, чтобы аудиоданные включали заголовок; все остальные аудиокодировки определяют аудиоданные без заголовка. Когда мы ссылаемся FLACна Speech-to-Text API, мы всегда ссылаемся на кодек. Когда

мы ссылаемся на формат файла FLAC, мы будем использовать формат « .FLACфайл».

От вас не требуется указывать кодировку и частоту дискретизации для файлов WAV или FLAC. Если пропущено, Cloud Speech-to-Text автоматически определяет кодировку и частоту дискретизации для файлов WAV или FLAC на основе заголовка файла. Если вы укажете значение кодировки или частоты дискретизации, которое не совпадает со значением в заголовке файла, тогда Cloud Speech-to-Text вернет ошибку.

Поддерживаемые аудио кодировки

Speech-to-Text API поддерживает несколько различных кодировок. В следующей таблице перечислены поддерживаемые аудиокодеки:

Примечание: это и аудио кодек, и аудио формат файла. Чтобы транскрибировать аудиофайлы с использованием кодировки, вы должны предоставить их в формате файла, который включает заголовок, содержащий метаданные. FLACFLAC.FLACПримечание: Cloud Speech-to-Text поддерживает WAVфайлы с аудио LINEAR16или MULAWзакодированными аудио.

Для получения дополнительной информации об аудиокодеках Cloud Speech-to-Text см. Справочную документацию AudioEncoding .

Если у вас есть выбор при кодировании исходного материала, используйте кодирование без потерь, например FLACили LINEAR16для лучшего распознавания речи. Для руководящих принципов , касающихся выбора соответствующего кодека для вашей задачи, см Best Practices .

Зачем кодировать?

Аудио состоит из сигналов, состоящих из взаимного расположения волн разных частот и амплитуд. Для представления этих сигналов в цифровом мультимедиа сигналы должны быть дискретизированы с частотой, которая может (по крайней мере) представлять звуки самой высокой частоты, которые вы хотите воспроизвести, и они также должны хранить достаточную битовую глубину для представления правильной амплитуды (громкости). и мягкость) форм волны через образец звука.


Способность устройства обработки звука воссоздавать частоты известна как его частотная характеристика, а способность создавать правильную громкость и мягкость известна как его динамический диапазон . Вместе эти термины часто называют верностью звукового устройства . Кодирование в его самой простой форме является средством восстановления звука с использованием этих двух основных принципов, а также возможностью эффективного хранения и передачи таких данных.

Частота выборки

Звук существует как аналоговый сигнал. Сегмент цифрового аудио аппроксимирует эту аналоговую волну путем выборки амплитуды этой аналоговой волны с достаточно высокой скоростью, чтобы имитировать собственные частоты волны. Частота дискретизации сегмента цифрового аудио определяет количество выборок, взятых из исходного материала аудио (в секунду); высокая частота дискретизации увеличивает способность цифрового аудио точно представлять высокие частоты.

Как следствие теоремы Найквиста-Шеннона , вам, как правило, необходимо сэмплировать, по крайней мере, в два раза большую частоту любой звуковой волны, которую вы хотите записать в цифровом виде. Например, для представления звука в диапазоне человеческого слуха (20–20000 Гц) цифровой аудиоформат должен производить выборку не менее 40000 раз в секунду (что является одной из причин того, почему в аудио CD используется частота дискретизации 44100 Гц).

Битовые глубины

Глубина в битах влияет на динамический диапазон данного аудиосэмпла. Более высокая битовая глубина позволяет вам представлять более точные амплитуды. Если у вас есть много громких и тихих звуков в одном и том же аудиосэмпле, вам потребуется больше битовой глубины, чтобы правильно представить эти звуки.

Большая битовая глубина также уменьшает отношение сигнал / шум в аудиосэмплах. Музыкальный звук на CD предоставляется с использованием 16 битной глубины. DVD Audio использует 24 битную глубину, в то время как большинство телефонного оборудования использует 8 битную глубину. (Некоторые методы сжатия могут компенсировать меньшую битовую глубину, но они, как правило, с потерями.)

Несжатый звук

Большая часть цифровой обработки звука использует эти два метода - частоту дискретизации и битовую глубину - для непосредственного хранения аудиоданных. Один из самых популярных методов цифрового аудио (популяризируемый при использовании компакт-диска) известен как импульсная кодовая модуляция (или ИКМ). Аудио дискретизируется с установленными интервалами, а амплитуда дискретизированной волны в этой точке сохраняется в виде цифрового значения с использованием битовой глубины дискретизации.


Линейный PCM (который указывает на то, что амплитудный отклик линейно однороден по выборке) - это стандарт, используемый на компакт-дисках и в LINEAR16кодировке Speech-to-Text API. Оба кодирования создают несжатый поток байтов, соответствующий непосредственно аудиоданным, и оба стандарта содержат 16 бит глубины. Linear PCM использует частоту дискретизации 44,100 Гц на компакт-дисках, что подходит для перекомпоновки музыки; однако частота дискретизации 16000 Гц больше подходит для перекомпоновки речи.

Linear PCM ( LINEAR16) - это пример несжатого аудио, в котором цифровые данные хранятся в точности так, как подразумевают вышеупомянутые стандарты. Считывая одноканальный поток байтов, закодированных с использованием Linear PCM, вы можете отсчитывать каждые 16 бит (2 байта), например, чтобы получить другое значение амплитуды сигнала. Почти все устройства могут манипулировать такими цифровыми данными изначально - вы даже можете обрезать аудиофайлы Linear PCM с помощью текстового редактора, но (очевидно) несжатый звук - не самый эффективный способ передачи или хранения цифрового звука. По этой причине в большинстве аудио используются методы цифрового сжатия.

Сжатый звук

Аудиоданные, как и все данные, часто сжимаются, чтобы их было легче хранить и транспортировать. Сжатие в аудиокодировании может быть без потерь или с потерями . Сжатие без потерь можно распаковать, чтобы восстановить цифровые данные в их первоначальном виде. Сжатие с потерями обязательно удаляет некоторую такую ​​информацию во время сжатия и распаковки и параметризуется, чтобы указать, какой допуск дать методике сжатия для удаления данных.

Сжатие без потерь

Сжатие без потерь сжимает цифровые аудиоданные, используя сложные перестановки сохраненных данных, но не приводит к ухудшению качества исходного цифрового образца. При сжатии без потерь при распаковке данных в исходную цифровую форму информация не будет потеряна.

Так почему же методы сжатия без потерь иногда имеют параметры оптимизации? Эти параметры часто обменивают размер файла на время распаковки. Например, FLACиспользуется параметр уровня сжатия от 0 (самый быстрый) до 8 (самый маленький размер файла). Сжатие FLAC более высокого уровня не потеряет никакой информации по сравнению со сжатием более низкого уровня. Вместо этого алгоритм сжатия просто должен будет тратить больше вычислительной энергии при создании или деконструкции оригинального цифрового аудио.