Файл: Ципилева Т.А_Геоинформационные системы_Учебное пособие_Томск_ТМЦДО_2004.pdf

ВУЗ: Не указан

Категория: Не указан

Дисциплина: Не указана

Добавлен: 23.02.2024

Просмотров: 1348

Скачиваний: 5

ВНИМАНИЕ! Если данный файл нарушает Ваши авторские права, то обязательно сообщите нам.

38

1.Знак. Знак – это элементарная единица информации, являющаяся реализацией свойств объекта в заранее заданной, структурно организованной знаковой системе.

Примеры знаков:

- знаковая система – целые десятичные числа. Знаками в ней будут «1», «3», «77» и др., но не «3.14»;

- взнаковойсистемедвоичныхчисел– «1», «11», «101», «10,11»; - в системе русского алфавита – «ы», «в», «А».

2.Тип. Тип – это совокупность моделей или объектов, объединенных общим набором признаков, или класс подобных знаков. Для первого из вышеприведенных примеров: тип – «целый»; для второго: тип– «двоичный», длятретьего: тип– «кириллица».

Для выделения типов применяют процедуры типизации. Типизация – объединение данных по набору заданных признаков или выделение из множества данных тех, которые удовлетворяют заданным критериям (признакам).

Знак рассматривают как реализацию типа, тип – как обобщение совокупности знаков. Следовательно, знак представляет индивидуальные свойства модели, а тип – ее общие свойства.

3.Сущность. Сущность – это элемент модели, описывающий законченный объект или понятие (например, сущность – «человек»).

4.Атрибут. Элементарное данное, описывающее одно из свойств сущности (например, «рост человека») .

5.Атрибут данных. Свойство данных («рост человека, равный 170 см»).

6.Запись данных. Формальное представление сложной информационной модели без описания ее структуры. Запись бывает физической и логической.

Логическая запись – это информационная единица, соответствующая одному шагу обработки информации.

Физическая запись – это порция информации, которая является единицей обмена данными между внешней и внутренней памятью ЭВМ.

7.Даталогическая модель ГИС – это модель логического уровня описания геоинформационной системы, состоящая из логических записей и отображения связей между ними безотно-


39

сительно к виду реализации. Описание даталогической модели называют схемой.

Даталогическое проектирование – это этап построения схемы ГИС.

8. Физическая модель ГИС – это модель среды хранения данных физического уровня. Физическая модель строится с учетом реальных СУБД.

Абстракция – это процедура структуризации (типизации) данных. Различают два вида: обобщение и агрегация.

Обобщение. Бываетсобственнообобщениеиклассификация. Собственно обобщение. Процедура соотнесения множества

типов одному типу («есть часть...»).

Классификация. Соотнесение множества знаководному типу. Экземпляция (от слова «экземпляр»). Процедура порождения реализации на основе известной классификации (обратная

классификации).

Специализация. Процедура порождения типов на основе общего класса типов (обратная обобщению).

Агрегация. Процедура конструирования объекта из других объектов (соотносится с понятием «есть некоторые ...»).

2.2 Классификационные модели в ГИС

2.2.1 Основные определения классификации

При создании информационной модели ГИС чаще всего используются методы классификационного анализа.

Разделение исследуемой совокупности объектов или явлений на однородные (в принятом смысле) группы называется классификацией.

Термин «классификация» используют как для обозначения самого процесса разбиения набора данных на группы, так и для описания его результата. Потребность анализа информации, связанной с распределением объектов по группам через классификацию их характеристик, сознавали ученые далекого прошлого. Еще Аристотель (д.н.э.) ввел некоторые понятия классификации, основанные на сходстве и различии характеристик при «построении дерева вещей жизни». После Аристотеля наиболее

40

крупный вклад внесли М. Адансон (иерархическая классификация растений, 1757 г.), Д.И. Менделеев (периодическая таблица химических элементов, 1869 г.) и др.

Все задачи классификации подразделяются на два типа.

К задачам классификации первого типа относятся те, в ко-

торых некоторое множество измерений необходимо разделить на устойчивые группы. Эти задачи называются задачи классификации без учителя, кластеризации, таксономии, типизации.

Задачи классификации второго типа характеризуются тем, что исходные данные уже заранее были разгруппированы, необходимо оценить их и информативность относительно совокупности известных эталонов. Называются такие процедуры также распознавание образов, обучение с учителем.

Ниже приведены четыре основных методологических принципа, на которых базируются все основные разделы и подходы математического аппарата классификации.

Принцип первый. Эффект существенной многомерности.

Сущность принципа заключается в том, что выводы, получаемые в результате анализа и классификации множества статистически обследованных (по ряду свойств) объектов, должны опираться одновременно на совокупность этих взаимосвязанных свойств с обязательнымучетомструктурыихарактераихсвязей.

Суть этого принципа можно объяснить на примере. Однажды была сделана попытка различить два типа потребительского поведения семей. Были накоплены данные по двум характеристикам: расходы на питание и расходы на приобретение промышленных товаров. К каждой из характеристик (отдельно) применяли критерий однородности Стьюдента, результат анализа не показал значимого различия групп семей. Многомерный аналог этого же критерия, учитывающий одновременно значения обоих упомянутых признаков и характер статистической связи между ними, обнаружил статистически значимое различие между двумя анализируемыми совокупностями семей. То есть, статистический анализ множества объектов будет неполным, если ограничиться при этом только средними значениями признаков и не использовать разнообразные характеристики тесноты и структуры связи между ними.


41

Принцип второй. Возможность лаконичного объяснения природы анализируемых многомерных структур. Много-

мерная структура – это множество статистически обследованных объектов реального мира {О1 ,О2 ,...,Ок}. Результаты обсле-

дования представляются в одной из двух форм:

- в виде таблицы «объект-свойство» (ТОС), которая имеет вид X = (Х1, Х2 ,..., Хn ), где Xi = (Xi1, Xi2 ,..., Xip ) – вектор значений анализируемых признаков, зарегистрированных на i-том объекте.

- матрицы парных сравнений вида объектов вида:

a11

a12

...

a1n

a22

...

a21

a2n

A =

...

...

...

,

...

an 2

...

an1

ann

где элемент aij определяет результат сопоставления объектов Oi и Oj в смысле некоторого заданного отношения: aij . Отно-

шение может выражать, например, меру сходства или различия элементов Oi и Oj , меру их связи, геометрическое расстояние

между объектами, отношение предпочтения ( aij =1, если объект Oi не хуже объекта Oj и aij = 0 в противном случае) и др.

Под возможностью лаконичного объяснения природы анализируемой многомерной структуры понимается априорное допущение, что существует небольшое (по сравнению с числом признаков ) число типообразующих (определяющих) факторов, с помощью которых могут быть достаточно точно описаны все элементы матриц Х и А, а также характер связей между ними. При этом определяющие факторы могут находиться как среди статистически исследуемых данных, так и среди латентных, т.е. статистически не наблюдаемых, но восстанавливаемых через исходную информацию данных. Пример – периодическая система Менделеева. В ней определяющим фактором (характеристикой) всех элементовобъектовявляетсязарядатомного ядраэлемента.


42

Принцип третий. Максимальное использование «обучения» в настройке математических моделей классификации.

Если исследователь располагает «входами» и «выходами» модели классификации, то исходный набор данных называют обучающей выборкой. Целью исследования является описание процедур, с помощью которых для любого элемента, вновь поступившего на вход, можно было бы с достаточной точностью определить номер класса, к которому он относится. Такие задачи – типичные задачи медицинской диагностики, где заранее известны наборы симптомов различных заболеваний, и пациенту, обратившемуся к врачу, после обследования ставится диагноз на основе уже имеющегося опыта.

Однако имеется ряд задач, для которых обучающая выборка полностью неизвестна, например, в больницу поступил больной с симптомами неизвестной врачу болезни. В этом случае по такой обедненной входной информации может быть произведена «настройка» математической модели.

Принцип четвертый. Оптимизационная формулировка задач классификации. Среди множества возможных методов, реализующих поставленную цель классификационной обработки входных данных, нужно найти наилучший метод с помощью оптимизации некоторого заданного критерия (функционала) качества. Как правило, это достигается с учетом априорной информации об объекте исследования.

Содержательная постановка задачи автоматической классификации. Всякие закономерности ищутся для практического удобства. Закономерности «групповой похожести» позволяют сильно сократить описание ТОС при малой потере информации. Вместо перечисления всех объектов исходного множества можно составить список «типовых» или «эталонных» представителей групп, указать номера объектов, попавших в эти группы, и средние или максимальные отличия их свойств от свойств «эталонов». При небольшом числе групп описание расклассифицированных данных становится обозримым и легко интерпретируемым. Такая группировка выполняется с помощью методов таксономии (синонимы: автоматическая классификация, кластерный анализ, самообучение). Алгоритмы автоматической классификации (АК), а их известно более сотни, отличаются друг от друга процедурой группи-

43

ровки (разбиения) и критерием качества. Но во всех алгоритмах используются общие понятия.

Пусть данные ТОС, подлежащие классификации, содержат М

объектов O =(О1,О2 ,...,Оm ), описанных N свойствами

каждый

X =(x1, x2 ,..., x f ,..., xn ). Требуется сформировать К

таксонов

K ≤ M , каждый из которых описывался бы Т характеристиками S = (s1, s2 ,...,s f ,., st ), 1

объектовнаK таксоновбудемсравниватьпокритериюкачества F . Если свойства представить в виде координат метрического пространства, то каждый объект со своими значениями свойств будет отображаться в некоторую точку этого пространства (рис. 2.1). Два объекта с почти одинаковыми значениями свойств отобразятся в две близкие точки, объекты с сильно различающимися свойствами будут представлены далекими друг от друга точками. Если получатся «сгустки» точек, отделенные от других сгустков промежутками, то их целесообразно выделить в отдельные структурные части множества – классы. Таким образом, можно получить K таксонов ( K < M ), каждый из которых объединяет точки с «близкими» значениями свойств. В дальнейшем каждый новый объект, описанный набором характери-

стик xn , с помощью методов распознавания образов может быть отнесен к тому или иному классу.

Таблица А

Объект

1

2

3

4

5

6

7

8

9

X

2

5

3

9

6

0

2

4

5

Y

3

1

2

7

7

2

4

4

8

У

1 0

В

8

6

4

2

0

5

1 0

0

Х

Рисунок 2.1 – Распределение точек (таблица А) в пространстве признаков X и Y