Файл: Информация в материальном мире (Понятия и сущность данных).pdf
Добавлен: 20.05.2023
Просмотров: 260
Скачиваний: 3
Введение
Данная работа рассматривает определение данных, информации в материальном мире и их взаимосвязь между собой. Будут рассматриваться операции с данными и свойство информации. Подробно разъяснены основные структуры данных, формы существования информации, и её передачи.
Информация является динамическим объектом, образующимся в момент взаимодействия объективных данных и субъективных методов. Как и всякий объект, она обладает свойствами (объекты различимы по своим свойствам). Характерной особенностью информации, отличающей ее от других объектов природы и общества, является отмеченный выше дуализм: на свойства информации влияют как свойства данных, составляющих ее содержательную часть, так и свойства методов, взаимодействующих с данными в ходе информационного процесса. По окончании процесса свойства информации переносятся на свойства новых данных, то есть свойства методов могут переходить на свойства данных.
Можно привести немало разнообразных свойств информации. Каждая научная дисциплина рассматривает те свойства, которые ей наиболее важны. С точки зрения информатики наиболее важными представляются следующие свойства: объективность, полнота, достоверность, адекватность, доступность и актуальность информации.
Целью данной работы является изучение информации в материальном мире.
Для реализации поставленной цели необходимо выполнить ряд задач:
- Рассмотреть виды и типы данных;
- Изучить основные структуры данных;
- Рассмотреть передачу и обработка информации;
- Изучить взаимосвязь данных и информации и т.д.
Глава 1. Понятия и сущность данных
1.1 Виды и типы данных
Само слово «данные» происходит от латинского слова data, что означает информация. Таким образом, в самом общем значении это слово обозначает информацию, которая передаётся в каком-либо формализованном виде: слова, цифры, коды. Из всего многообразия подходов к определению понятия "данные" справедливо то, которое говорит о том, что данные несут в себе информацию о событиях, произошедших в материальном мире, поскольку они являются регистрацией сигналов, возникших в результате этих событий. Однако данные не тождественны информации. Станут ли данные информацией, зависит от того, известен ли метод преобразования данных в известные понятия.[1]
То есть, чтобы извлечь из данных информацию необходимо подобрать соответствующий форме данных адекватный метод получения информации. Данные, составляющие информацию, имеют свойства, однозначно определяющие адекватный метод получения этой информации. Причем необходимо учитывать тот факт, что информация не является статичным объектом - она динамически меняется и существует только в момент взаимодействия данных и методов. Все прочее время она пребывает в состоянии данных. Информация существует только в момент протекания информационного процесса. Все остальное время она содержится в виде данных.
Одни и те же данные могут в момент потребления представлять разную информацию в зависимости от степени адекватности взаимодействующих с ними методов.
По своей природе данные являются объективными, так как это результат регистрации объективно существующих сигналах, вызванных изменениями в материальных телах или полях. Методы являются субъективными. В основе искусственных методов лежат алгоритмы (упорядоченные последовательности команд), составленные и подготовленные людьми (субъектами). В основе естественных методов лежат биологические свойства субъектов информационного процесса. Таким образом, информация возникает и существует в момент диалектического взаимодействия объективных данных и субъективных методов.[2]
Данные могут быть представлены следующими видами:
- целыми и действительными числами;
- текстом;
- мультимедийными (графическими объектами, звуковыми сигналами, цветными изображениями).
В зависимости от вида данных, они могут подразделяться на следующие типы:
- байтовый тип;
- целочисленные типы простой и двойной точности;
- типы действительных чисел простой и двойной точности;
- типы даты и времени;
- строковый тип;
- логический тип;
- тип объектов.
Данные представляют собой определенным образом полученные и зафиксированные наблюдения относительно окружающей действительности.
Исходя из того, для каких целей были собраны данные, их можно разделить на первичные и вторичные. Первичными являются такие данные, которые собраны для решения целей данного исследования. Соответственно, вторичными являются данные, собранные в рамках другого исследования, то есть для решения целей, отличных от целей данного исследования.[3]
Принято начинать с анализа вторичных данных, а уже в случае их недостаточности переходить к сбору первичных.
Рисунок 1
Поскольку вторичные данные собираются в рамках других исследовательских проектов, всегда существует проблема их качества. Критериями его оценки являются следующие:
Таблица 1
Критерии качества
|
Критерии |
Ключевые факторы |
|
Процедура и методика сбора |
Метод сбора данных, процент ответов, способ формирования выборки, размер выборки, объем и логика анкеты, полевой этап, анализ данных. |
|
Ошибки и точность |
Сравнение данных, полученных из разных источников. |
|
Своевременность |
Временной промежуток между сбором данных и их публикацией, частота обновления (если исследование предполагает несколько этапов). |
|
Степерь соответствия цели исследования |
|
|
Содержание данных |
Ключевые переменные, шкалы измерения, исследуемые связи. |
|
Надежность |
Компетентность, достоверность, репутация и надежность источника информации. |
Если же говорить о сущностных характеристиках данных, то принято выделять качественные и количественные данные. Можем ли мы редуцировать данные к форме чисел или они могут быть представлены только с помощью слов? Важно проводить различие между этими двумя типами данных, поскольку они определяют способы их получения, фиксации и анализа.
Большое количество научной информации фиксируется в виде чисел. Природа чисел разрешает манипулировать соответствующими данными с помощью методов математической статистики. Такого рода данные являются количественными. Главная проблема сбора количественных данных - разработка точных измерительных инструментов в виде анкетных вопросов, шкал или тестов. Такие измерительные инструменты должны тщательно проверяться на валидность и надежность.
В зависимости от особенностей измеряемых свойств и/или точности самого измерения, количественные данные можно получить с помощью одной из трех измерительных шкал – номинальной, порядковой и метрической.
Вместе с тем, существует важная информация, которую нельзя редуцировать к форме чисел. Мысли, чувства, идеи и традиции людей нуждаются в их словесном выражении.[4]
Соответствующие данные называют качественными. Вербальные концепты и взаимосвязи между ними являются менее точными, чем числа и соответствующие связи. Это делает качественные исследования более зависимыми от особенностей определения значения слов, разработки понятий и определения взаимосвязей между ними. В отличии от количественных исследований, в качественных не существует общепринятых образцов анализа соответствующих данных, что требует рефлексивности ученого (внимания к возможным субъективным смещениям).
По способу получения, данные можно разделить на четыре типа:
- Наблюдение Фиксация случаев, ситуаций или событий, известных из собственного опыта, в том числе с использованием специальных средств (например, камеры, диктофона, микроскопа и т.д.).
- Участие Данные получаются благодаря опыту, который может рассматриваться как интенсивная форма наблюдения (например, опыт обучения управлению автомобилем сообщит такие нюансы относительно авто, которые невозможно получить, лишь наблюдая за ним извне).
- Измерение Фиксация величины или количества какого-либо параметра (например, демографическая статистика, измерение физических величин и т.д.).
- Интерегация Данные получаются посредством вопросов к людям (информация относительно убеждений людей, их мотивации и т.д.).
В data science и области больших данных выделяют много разных типов данных, для каждого из которых требуются свои инструменты и методы. Основные категории данных перечислены ниже.
- Структурированные.
- Неструктурированные.
- На естественном языке.
- Машинные.
- Графовые.
- Аудио, видео и графика.
- Потоковые.
Все эти типы данных представляют интерес, и их стоит рассмотреть подробнее. Структурированные данные зависят от модели данных и хранятся в фиксированном поле внутри записи. Соответственно, структурированные данные часто бывает удобно хранить в таблицах, в базах данных или файлах Excel:
Рисунок 2 База данных
SQL (Structured Query Language, язык структурированных запросов) является основным средством управления и обращения с запросами к данным, хранящимся в базах данных. Также иногда встречаются структурированные данные, которые достаточно трудно сохранить в традиционной реляционной базе данных (один из примеров — иерархические данные, например генеалогическое дерево).
Впрочем, мир не состоит из структурированных данных; просто это представление удобно для человека и машин. Чаще реальные данные хранятся в неструктурированном виде. Неструктурированные данные трудно подогнать под конкретную модель данных, потому что их содержимое зависит от контекста или имеет переменный характер. Один из примеров неструктурированных данных — обычные сообщения электронной почты:
Рисунок 3 Примеров неструктурированных данных
Хотя сообщение содержит структурированные элементы (отправитель, заголовок, тело), одни и те же задачи могут решаться множеством разных способов, например, существует бесчисленное количество вариантов упоминания конкретного человека в сообщениях.
Проблема дополнительно усложняется существованием тысяч языков и диалектов. Сообщение электронной почты, написанное человеком (наподобие показанного выше), также является идеальным примером данных на естественном языке.[5]
Данные на естественном языке составляют особую разновидность неструктурированных данных; обработка таких данных достаточно сложна, потому что она требует знания как лингвистики, так и специальных методов data science.
Сообщество обработки данных на естественном языке добилось успеха в области распознавания сущностей, распознавания тематических областей, обобщения, завершения текста и анализа эмоциональной окраски, но модели, адаптированные для одной предметной области, плохо обобщаются для других областей. Даже самые современные методы не смогут расшифровать смысл произвольного фрагмента текста. И этот факт вряд ли кого-то удивит: у людей также возникают проблемы с восприятием естественного языка. Он неоднозначен по своей природе. Сама концепция смысла выглядит спорно. Два человека слушают один разговор; вынесут ли они одинаковый смысл из него? Даже смысл отдельных слов может изменяться в зависимости от настроения говорящего.
К машинным данным относится информация, автоматически генерируемая компьютером, процессом, приложением или устройством без вмешательства человека. Машинные данные становятся одним из основных источников информации, и ситуация вряд ли изменится. Wikibon предсказывает, что рыночная стоимость промышленного Интернета (термин, предложенный компанией Frost&Sullivan для обозначения совокупности сложного физического оборудования с сетевыми датчиками и программным обеспечением) к 2020 году составит приблизительно 540 миллиардов долларов.
По оценкам IDC (International Data Corporation), количество узлов сети к 2020 году в 26 раз превысит численность населения. Эта сеть часто называется Интернетом вещей.
Анализ машинных данных из-за их громадных объемов и скоростей сильно зависит от инструментов с высокой масштабируемостью. К примерам машинных данных относятся журналы веб-серверов, записи детализации звонков, журналы сетевых событий и телеметрии:
Машинные данные на рисунке выше хорошо укладываются в структуру классической базы данных. Это не лучший формат для данных с высокой степенью связности или «сетевых» данных, в которых достаточно значимую роль играют отношения между сущностями.