ВУЗ: Не указан
Категория: Не указан
Дисциплина: Не указана
Добавлен: 25.08.2025
Просмотров: 1419
Скачиваний: 0
12
–выбор вида статистической задачи
–выдвижение нулевой гипотезы
–решение по алгоритму
–статистический вывод
–ответ на вопрос.
Конкретизация. Формулирование биологической задачи, требующей статистического решения, определения объекта исследования, характеристика условий (факторов, методов) получения выборки, определение численно выраженных свойств и признаков, явное определение отдельной варианты (объекта измерения) и всей выборки вариант. Подготовка данных для последующей обработки.
Формализация. Этот этап требует отойти несколько от биологического содержания задачи и дать ответы на вопросы общего характера "Что доказать?" и "Что описать?", предшествующие выбору конкретного статистического метода.
Ответ на вопрос "Что доказать?" помогает явно назвать один из четырех типов биометрических задач: доказать чужеродность варианты (принадлежность к классу вариант), доказать отличие двух выборок, доказать влияние фактора (отличие нескольких выборок),
доказать зависимость признаков.
Ответ на вопрос "Что описать?" заставляет сделать выбор того обобщенного показателя, который интересует исследователя: описание может касаться величины признака (оценивается средней), его изменчивости (оценивается дисперсией), распределения частот (выражается вариационным рядом), выборки в целом (выражается совокупностью ранжированных вариант).
Выбор вида статистической задачи. В зависимости от характера имеющихся данных, способа описания и установленной задачи подбирается тот или иной статистический метод. Именно здесь отчетливее всего проявляются уровень биометрической подготовки исследователя, его профессионализм и мастерство, наконец, чутье на адекватный статистический метод. В этом смысле биометрия выступает как своеобразное искусство постановки статистической задачи. Вместе с тем многие биологические задачи решаются по принципу аналогии. Это позволяет предложить "Определитель статистического метода", несколько формальных критериев подбора адекватного статистического приема (табл. 1.1), включая как раз те
13
распространенные статистические приемы, что рассмотрены в настоящем пособии. С помощью этой таблицы можно предварительно подобрать метод, способный решить поставленную задачу, а затем уже непосредственно перейти к вычислительным процедурам по приведенным в книге алгоритмам.
Таблица 1.1
Что доказать? |
Что изучено? |
Метод |
|
Чужеродность |
Сравнение средней и |
||
варианты в |
Величина |
||
варианты |
|||
выборке |
|||
Величина |
Сравнение средних |
||
арифметических |
|||
Изменчивость |
Сравнение дисперсий |
||
Достоверность |
|||
Распределени |
Сравнение эмпирического и |
||
отличия двух |
|||
е частот |
теоретического распределений |
||
выборок |
|||
Сравнение двух эмпирических |
|||
распределений |
|||
В целом |
Сравнение двух наборов |
||
значений |
|||
Величина |
Дисперсионный анализ |
||
Достоверность |
|||
Изменчивость |
Сравнение серии дисперсий |
||
отличия |
|||
Распределени |
Сравнение нескольких |
||
нескольких |
|||
е частот |
эмпирических распределений |
||
выборок |
|||
В целом |
Непараметрический |
||
дисперсионный анализ |
|||
Достоверность |
|||
влияния фактора |
Величина |
Дисперсионный анализ |
|
на признак |
|||
Достоверность |
|||
влияния |
Величина |
Регрессионный анализ |
|
признака на |
|||
признак |
|||
Достоверность |
|||
сопряженности |
Величина |
Корреляционный анализ |
|
варьирования |
14
двух признаков
Выдвижение нулевой гипотезы. Этот этап призван дать четкую статистическую формулировку поставленного вопроса. Нулевая гипотеза – это предположение об отношениях объектов, выраженное в терминах статистики и предназначенное для дальнейшей статистической проверки. Во введении уже упоминалось, что математическая статистика изучает случайные события, процессы и явления, поведение случайных величин. При этом она пытается отделить случайность от закономерности, случайные причины от систематических, доминирующих.
С позиций случайного, вероятностного характера явлений исходит и нулевая гипотеза. В самой общей форме эта гипотеза звучит так: "Отличия недостоверны". Согласно ей, например, наблюдаемые отличия двух выборок являются случайными, различия между выборочными параметрами есть ошибки репрезентативности; в действительности обе выборки вместе составляют один и тот же однородный материал и принадлежат к одной генеральной совокупности. В процессе статистического анализа нулевая гипотеза либо отвергается (опровергается, отклоняется), и тогда различия считаются достоверными, либо принимается (сохраняется). Последнее, однако, не означает доказательства случайности различий (их отсутствия), а лишь говорит о том, что при данном объеме и качестве материала различия остаются недоказанными. Опираясь на полученный в процессе научной работы материал, статистика способна лишь доказать выдвинутые гипотезы или же отсеять и отвергнуть те предположения, для которых недостаточно информации, отделить, как зерна от плевел, истинные отличия от случайных, привнесенных неучтенными факторами, вычленить реальную закономерность из обилия сырого экспериментального материала.
Решение по алгоритму. Реализация одного из алгоритмов статистических расчетов. Приведенные в книге алгоритмы вычислений, как правило, снабжены числовыми примерами, и их использование не должно вызывать особых затруднений. Однако при "ручном счете" возможны небольшие технические ошибки, способные, тем не менее, привести к неправильным результатам. Чтобы избежать этих ошибок или, по крайней мере, не пропустить их при вычислениях,
15
необходимо придерживаться нескольких правил. Так, арифметические ошибки нетрудно выявить, если еще до начала расчетов ориентировочно прикинуть ожидаемый результат. Для этого полезно дважды пересчитывать рабочие формулы, меняя местами слагаемые и сомножители. При использовании стандартных формул целесообразно вначале выписать их в символьной форме и лишь затем подставлять числовые значения. Очень важно также не путать сумму квадратов (Σx²) с квадратом суммы ((Σx)²) вариант, объем выборки (n) с числом градаций или групп (k). Вероятность правильного ответа увеличится, если формировать таблицы вычислений по приведенному в книге алгоритму полностью. При этом полезно проверять схождение сумм по строкам и столбцам, а вычисленных величин – по модели анализа. Например, при вычислении критерия хи-квадрат сумма частот эмпирического распределения должна точно совпадать с суммой теоретических частот. На ошибку в расчетах, как правило, указывает большое различие эмпирических и теоретических частот распределения, а также несовпадение величины исходного признака с рассчитанным по регрессионной модели. Кроме того, подозрение на допущенную ошибку должны вызывать отрицательные суммы квадратов (за исключением регрессионного и корреляционного анализов) и минусовые значения критерия Стьюдента (его всегда берут по модулю), а также величины, в десятки и сотни раз превышающие табличные. Наконец, следует помнить, что если "на глаз" распределение количественных признаков приближается к нормальному, то стандартное отклонение примерно равно четверти от всего размаха выборки: S≈(max–min)/4. Только распределение Пуассона имеет равные среднюю и дисперсию (M≈S²). Эффективен контроль за результатами и с помощью графических возможностей Excel. В частности, для контроля правильности применения критерия хиквадрат необходимо сравнивать гистограммы эмпирических и теоретических частот.
Статистический вывод. Статистический вывод служит главным результатом статистического анализа – это заключение о справедливости или опровержении нулевой гипотезы. Строится он на основе сравнения полученной (эмпирической) величины статистического критерия с табличной (теоретической). Если вычисленные значения критерия больше табличного, говорят о
16
достоверном отличии (влиянии, исключении), если же меньше, то нулевая гипотеза остается в силе. Это позволяет использовать статистический критерий для опровержения нулевой гипотезы. Когда статистический вывод отвергает нулевую гипотезу, отличия выборок считаются доказанными, если же не отвергает, то отсутствие отличий доказанным не считается. На практике для правильного статистического вывода можно воспользоваться упрощенной схемой сравнения эмпирических значений критерия с табличными (рис. 1.1). Числа 0.95 и 0.05 – это доверительная вероятность и уровень значимости (вероятность правильности или неправильности вывода). Разместив в этой схеме табличные и эмпирические значения критериев, нетрудно заметить, что вычисленная величина лежит правее табличной, в критической области, а это говорит о достоверности отличий сравниваемых параметров, в данном случае двух средних арифметических.
95%
5%
отличия недостоверны |
отличия достоверны |
табличное значение
Рис. 1.1. Схема использования критериев. Отмечены критические зоны для уровней значимости α = 0.05 и α = 0.01 (доверительные вероятности Р = 0.95 и Р = 0.99). Границами зон служат значения критериев из таблиц Приложения при данном уровне значимости. Если вычисленные величины критерия попадают в критическую зону (правее табличных), значит, отличие сравниваемых параметров достоверно
Сказанное можно проиллюстрировать следующим примером. Пусть при сравнении двух средних арифметических нулевая гипотеза состояла в том, что отличие средних арифметических случайно. В расчетах было получено значение критерия T = 3.5. Табличная величина для этого случая равна T = 2.1. Поскольку полученное
17
значение критерия (3.5) больше табличного (2.1), можно утверждать, что эти средние арифметические достоверно отличаются. Слово "достоверно" значит буквально "статистически доказано": отличие двух сравниваемых средних и без того бросалось в глаза, но лишь статистическое доказательство показало реальность этих различий, позволило распространять конкретный вывод на все явление. Критерий доказал, что отличие средних не случайно, а закономерно.
Какую роль играют отмеченные на схеме значения вероятностей? Это станет ясным из следующих рассуждений. Статистический вывод можно сделать с разной степенью достоверности, иначе говоря, – с разной степенью уверенности, или вероятности. Можно быть уверенным в правильности вывода на 95% (тогда доверительная вероятность Р = 0.95) или на 99% (Р = 0.99). Аналогично говорят о степени "неуверенности", иначе – об уровне значимости. Его значения обычно берут равными 5%, 1%, 0.1% (или соответственно α = 0.05, α = 0.01, α = 0.001). Если точность проведения наблюдений или экспериментов невысока, если требуемый вывод не нуждается в особой точности (обычные условия проведения биологических исследований), то выбирается уровень значимости α = 0.05. В таблицах Приложения приведены значения критериев при разных уровнях точности и числе степеней свободы. Чем выше требуется точность вывода, тем выше берут табличное значение критерия. Это понятно: чем точнее и ответственнее должен быть вывод, тем жестче требования к критерию. Подробнее статистический смысл уровня значимости объясняется в специальных математических руководствах. Для практического же понимания достаточно знать, что уровень значимости – это приблизительная ожидаемая ошибка (ее вероятность) наших выводов. И с этой позиции 5% – достаточно мало.
Понятие числа степеней свободы – это число вариант (градаций, групп, случаев, т. е. объем выборки) без числа ограничивающих условий – конкретнее будет рассмотрено ниже.
Ответ на вопрос. Формулируется биологическое утверждение, доказанное статистически. Если удалось доказать достоверность неких отличий, то для биолога принципиально важна их направленность, не только факт отличий, например, средних арифметических, но и как именно они отличаются, какая величина превышает другую. Биологический ответ есть, по существу, перифраза статистического