ВУЗ: Не указан
Категория: Не указан
Дисциплина: Не указана
Добавлен: 25.08.2025
Просмотров: 1431
Скачиваний: 0
226
Е 0.33 В
Ж ЛО
Существует множество вариантов процедуры кластеризации, из них наиболее простым считается метод "ближайшего соседа", не требующий обязательного использования ЭВМ. Сначала по матрице расстояний (табл. 9.2) отыскиваются ближайшие соседи для всех объектов и заносятся в таблицу наименьших расстояний (табл. 9.3). Так, к лишайниковому сосняку (А) ближе всего сосняк-зеленомошник (Б): SАБ = 0.27, а к сосняку-зеленомошнику (Б) – лиственное мелколесье (Д): SБД = 0.07, (минимальное расстояние из всех изученных биотопов).
Таблица 9.3 |
|||||||
Сосед 1 |
Сосед 2 |
Расстояние, S |
Кластер |
Сосед 2 |
Расстояние, |
Кластер |
|
S |
|||||||
А |
Б |
0.27 |
1 |
||||
Б |
Д |
0.07 |
1 |
||||
В |
Г |
0.17 |
2 |
Б |
0.26 |
||
Г |
В |
0.17 |
2 |
Д |
0.21 |
3 |
|
Д |
Б |
0.07 |
1 |
||||
Е |
Б |
0.17 |
1 |
||||
Ж |
Е |
0.33 |
1 |
||||
Заполнив четыре первые графы, приступают к построению предварительного дерева расстояний (рис. 9.1, А). Для этого на график наносят индексы объектов и расстояния между ними, соединяют их прямыми линиями. В нашем случае сначала образовалось два отдельных кластера (АБДЕЖ и ВГ), но их может быть и больше. Теперь вновь возвращаемся к таблицам 9.2 и 9.3. В пятой графе против объектов из меньшего кластера следует отметить индекс ближайших объектов из большего кластера, а в шестой – расстояние между ними. Далее выбираем звено наименьшей протяженности – это спелые лиственные леса (Г) и молодняки (Д): SГД = 0.21. Соединим на рисунке 9.1 кластеры пунктирной линией, и кластеризация завершена.
Последний этап – построение окончательного варианта дендрограммы. Здесь также есть несколько возможностей.
227
Представленное на рис. 9.1, Б "древо минимальной протяженности" строится с учетом единственного условия – соблюдения пропорций расстояний между биотопами-соседями.
Е |
0.33 |
Ж |
||||||
А |
0.17 |
|||||||
0.27 |
||||||||
А |
Б |
|||||||
0.07 |
||||||||
Д |
||||||||
В |
0.17 |
Г |
0.21 |
|||||
Ж
Б |
Е |
|
А |
Б |
|
Д |
Г |
В
Рис. 9.1. А – схема поэтапной кластеризации; Б – "древо минимальной протяженности"; А–Ж – индексы биотопов
Классический вариант дендрограммы приведен на рис. 9.2. По оси абсцисс размещаются объекты в том порядке, который продиктован логикой их связей и субъективными вкусами исследователя, отдельные ветви "древа" при этом не должны пересекаться. По оси ординат откладывается расстояние между ближайшими соседями (рис. 9.2).
Интерпретация полученных результатов подчеркивает достоинства дендрограммы как емкой иллюстрации обобщающих характеристик. Так, в данных по Приладожью кластерный анализ
228
выделил группы биотопов, наиболее близких по условиям обитания и видовому составу зверьков. Наиболее богаты видами еловые и смешанные леса (В и Г). Обедненными териокомплексами, представленными в основном политопными видами, характеризуются сосняки-зеленомошники, вырубки и лиственное мелколесье (Б, Е, Д). Население сосняков (Б и А) в общем сходно (табл. 9.1), но в лишайниковых сосняках видов очень мало. Наконец, наиболее обособленное положение занимает биотопический комплекс экотона – границы между лугом и лесом (Ж), включающий представителей смежных биотопов.
0.4
Ж А Г В Е Б Д
Рис. 9.2. Дендрограмма сходства биотопов по видовому составу мелких млекопитающих
При использовании в кластерном анализе количественных признаков применяют евклидову меру расстояния:
d ji |
( x kj |
x ki ) 2 |
|
m |
|||
где xkj, xki – значения k-го признака у j-го и i-го объектов, m – число учитываемых признаков.
Рассчитав матрицу расстояний между объектами по комплексу количественных признаков, проводят кластеризацию и построение дендрограмм по описанному выше методу. Рассмотрим эту процедуру на уже знакомом примере многовидовых группировок мелких млекопитающих в трех типах биотопов Приладожья (Б –сосняки- зеленомошники, В – ельники, Д – мелколесье), но по данным количественных учетов канавками (экз. на 10 канавко-суток; табл. 9.4).
229
Рассчитаем евклидово расстояние сначала между двумя биотопами – сосняком (Б) и ельником (В):
( 3 . 9 7 . 2 ) 2 |
(1 . 8 |
1 . 1 ) 2 |
... ( 0 |
0 . 2 ) 2 |
12 |
. 252 |
0 . 971 . |
|||||||
d ji |
||||||||||||||
13 |
13 |
|||||||||||||
Таблица 9.4 |
||||||||||||||
Численность, |
||||||||||||||
экз. на 10 канавко-суток |
||||||||||||||
Вид |
||||||||||||||
сосняки-зеле- |
ельники |
лиственное |
||||||||||||
номошники |
мелколесье |
|||||||||||||
(Б) |
(В) |
(Д) |
||||||||||||
Обыкновенная бурозубка |
3.9 |
7.2 |
6.0 |
|||||||||||
Средняя бурозубка |
1.8 |
1.1 |
0.5 |
|||||||||||
Малая бурозубка |
1.9 |
2.0 |
1.6 |
|||||||||||
Равнозубая бурозубка |
0.01 |
0.2 |
0.1 |
|||||||||||
Крошечная бурозубка |
0.04 |
0.04 |
0 |
|||||||||||
Водяная кутора |
0.04 |
0.06 |
0.4 |
|||||||||||
Лесная мышовка |
0.6 |
0.3 |
0.7 |
|||||||||||
Лесной лемминг |
0.2 |
0 |
0.05 |
|||||||||||
Мышь-малютка |
0.04 |
0 |
0 |
|||||||||||
Рыжая полевка |
1.5 |
0.8 |
0.8 |
|||||||||||
Красная полевка |
0.06 |
0.6 |
0.02 |
|||||||||||
Темная полевка |
0.2 |
0 |
0.7 |
|||||||||||
Полевка-экономка |
0 |
0.2 |
0.2 |
|||||||||||
Всего |
10.3 |
12.9 |
10.9 |
|||||||||||
Повторив эту процедуру для других пар биотопов, получим dБД = 0.741 и dВД = 0.417. Сведем полученные данные в матрицу расстояний:
Б |
0.97 |
0.74 |
|||||
В |
0.42 |
||||||
Д |
|||||||
Сосед 1 |
Сосед 2 |
Расстояние, |
|||||
230
d |
||
Б |
Д |
0.74 |
В |
Д |
0.42 |
Д |
В |
0.42 |
Дендрограмма приведена на рис. 9.3. По сравнению с предыдущим случаем она выявляет новые нюансы отношений между биоценотическими комплексами млекопитающих. Если по видовому составу лиственные леса (Д) были ближе к соснякам (Б) (в отличие от ельников и там и тут встречались лесной лемминг и темная полевка), то по уровню численности лиственные леса ближе к ельникам (в отличие от сосняков в этих биотопах существенно больше обыкновенных бурозубок и рыжих полевок).
БВ Д
Рис. 9.3. Дендрограмма сходства биотопов по численности мелких млекопитающих
Когда изучаемые признаки имеют разную размерность (экз./га, кг, мм, %), то вместо таблицы исходных данных (см. табл. 9.4) для вычисления евклидовой меры расстояния следует подготовить таблицу нормированных значений. Для этого по каждой строке первичной таблицы рассчитываются средняя арифметическая (Мj) и стандартное отклонение (Sj), а затем – нормированные значения каждой варианты из этой строки:
x M |
j |
, |
||
t |
||||
S j |
||||
где |
x – исходные значения вариант 1-й строки (i-го признака). |
|||
Например, для первой строки таблицы 9.4 М1 = 5.7, S1 = 1.67. Новые значения строки будут равны: t11 = (3.9–5.7)/1.67 = –1.078,
t12 = (7.2–5.7)/1.67 = 0.89, t13 = (6.0–5.7)/1.67 = 0.18.
Полученная таким образом таблица используется для
231
вычисления евклидовой меры расстояния между объектами по рассмотренному выше алгоритму.
Кроме рассмотренных мер расстояния для кластерной классификации объектов исследования используют коэффициент корреляции (r) в форме коэффициента "не-корреляции": dji = 1– rji. При этом следует использовать нормированные значения признаков.
Вэтом случае матрица расстояний формируется по предварительно рассчитанной корреляционной матрице. Поскольку метод корреляционного анализа рассмотрен нами выше, а дальнейшие процедуры несложны и очевидны, мы не иллюстрируем этот прием конкретным примером.
Всреде Excel нет программы для проведения кластерного анализа. Но его можно выполнить с помощью пакета StatGraphics.
Основы дискриминантного анализа
Этот метод многомерной статистики служит для дискриминации, т. е. различения (дифференциации) и диагностирования (распознавания) биологических объектов и явлений, отличия между которыми неочевидны. В медицине этот метод используется для идентификации заболевания по ряду показателей (характерных симптомов), а в биологии – для установления групповой принадлежности отдельных особей (объектов). Иными словами, общая задача дискриминантного анализа заключается в том, чтобы определить, к какой из двух известных групп объектов принадлежит изучаемый объект. Как и в кластерном анализе, исследуемые объекты представлены несколькими численными признаками и (в простейшем случае) требуется сформировать один расчетный признак, однозначно характеризующий каждый объект. Однако задачи дискриминантного анализа прямо противоположны кластерному: не выделить из множества объектов группы близких, а отнести тот или иной объект к определенной, априорно выделенной группе. Эта идентификация (дискриминация) объекта выполняется с помощью уравнения дискриминации (дискриминантной функции), которое воплощает в себе максимальное отличие между предварительно заданными группами (дискриминация "с обучением").
Рассмотрим общий принцип использования этого метода на примере определения пола у пеночек-весничек. Визуально молодые
самцы и самки этого вида не различаются, а распределения