ВУЗ: Не указан
Категория: Не указан
Дисциплина: Не указана
Добавлен: 10.11.2024
Просмотров: 607
Скачиваний: 1
Рассуждая аналогично, в результате мы получим:
1 |
T |
p 1 |
T |
p 1 |
T |
p |
||
X |
Xt ! V1; |
X |
Xt 1"t ! V2; |
Xt |
Xt2 1 ! V3; |
|||
T 3=2 |
t=1 |
T |
t=1 |
T 2 |
=1 |
|||
где V1; V2; V3 – некоторые случайные величины.
Если мы теперь используем МНК-оценку для , которое равно единице, то асимптотические свойства этой оценки будут следующие:
p V2
T (b 1) ! V3 :
Во-первых, МНК-оценка в данном случае суперсостоятельна, т.е. скорость сходимо- p
сти к асимптотическому распределению превышает T . Во-вторых, асимптотическое распределение нестандартно: оно не является нормальным, зато обладает ненулевыми смещением и скошенностью. Оно носит название распределения Дики–Фуллера.
II Бутстраповский подход
1Приближение истинного распределения бутстраповским
В основе бутстраповского подхода лежит идея, что истинное распределение данных можно хорошо приблизить эмпирическим. Таким образом может быть получено приближенное распределение интересующей нас статистики. Пусть из исходной популяции с распределением F (x) была получена выборка размера n. Тогда эмпирическая функция распределения Fn(x) = n1 Pni=1 I(Xi 6 x) равномерно почти наверное стремится к F (x) при n ! 1. Это свойство мотивирует использование бутстрапа.
Чтобы более наглядно пояснить бутстраповский метод, рассмотрим простейший пример. Пусть у нас есть всего два наблюдения:
y1 |
= |
2 ; |
y2 |
= |
1 : |
x1 |
1 |
x2 |
2 |
Допустим, нас интересует коэффициент регрессии y на x, т.е. yi = xi + "i. В этом случае МНК-оценка равна
= |
x1y1 + x2y2 |
= |
1 2 + 2 1 |
= |
4 |
: |
x12 + x22 |
||||||
b |
12 + 22 |
5 |
Эмпирическая функция распределения данных есть
(x; y)0 = ( |
(1; 2)0 |
с вероятностью 1=2 |
(2; 1)0 |
с вероятностью 1=2 |
19
По отношению к этому распределению данные из двух наблюдений распределены следующим образом:
(x1; y1)0; (x2; y2)0 = |
> |
(1; 2)0 |
; (1; 2)0 |
с вероятностью 1=4 |
> |
||||
> |
(2; 1)0 |
; (2; 1)0 |
с вероятностью 1=4 |
|
8 |
||||
< |
||||
> (1; 2)0; (2; 1)0 |
с вероятностью 1=4 |
|||
> |
||||
> |
||||
> |
(2; 1)0 |
; (1; 2)0 |
с вероятностью 1=4 |
|
> |
||||
: |
||||
Это распределение и является бутстраповским. Соответственно, МНК-оценка распределена согласно ее бутстраповскому распределению
8 > 1=2 с вероятностью 1=4
<
b2 = 4=5 с вероятностью 1=2
>
: 2 с вероятностью 1=4
Используя это бутстраповское распределение, можно строить доверительные интервалы или тестировать гипотезы обычным образом.
Пример, рассмотренный нами, был чрезвычайно прост: размер исходной выборки был равен 2. В общем случае, когда мы имеем n наблюдений, количество вариантов для бутстраповских статистик имеет порядок nn. Таким образом, в вычислительном плане задача сильно усложняется по мере роста n.
2Приближение с помощью симуляций
Как упоминалось, при увеличении размера выборки объем вычислений для получения бутстраповского распределения быстро возрастает. Поэтому, как правило, процедура бутстрапирования осуществляется с помощью симуляций. Здесь мы приведем описательный алгоритм построения бутстраповских доверительных интервалов.
Бутстраповский алгоритм.
1.Выбрать количество псевдовыборок B (обычно хватает 1000). Для b = 1; 2; : : : ; B
построить псевдовыборки (z1; z2; : : : ; zn)b, вытягивая элементы псевдовыборок случайным образом с возвращением из исходной выборки (z1; : : : ; zn). Для каждой псевдовыборки вычислить псевдостатистику bb = b((z1; : : : ; zn)b).
2.Полученные псевдостатистики b1; : : : ; bB отсортировать в порядке возрастания. В качестве квантилей q 1 ; q1 2 взять значения b[B 1]; b[B(1 2)+1], на основе которых построить доверительный интервал.
20
3Какие статистики бутстрапировать?
Ответ на вопрос, какие статистики лучше использовать при построении доверительных интервалов с помощью бутстрапа, кроется в двух простых соображениях. Вопервых, бутстраповское распределение центрировано не около истинного значения статистики, а около его выборочного аналога. Во-вторых, полагается бутстрапировть асимптотически пивотальные статистики.
Рассмотрим несколько вариантов бутстраповских статистик, используемых для построения доверительных интервалов и подчеркнем их положительные и отрицательные качества. Пусть нас интересует построение статистических выводов относительно параметра из ее оценки b.
Эфроновский доверительный интервал. В данном случае бутстрапируемой статистикой является сама оценка, т.е. b = b. Таким образом, мы полу-
чаем бутстраповское распределение fbb = bb gBb=1. Соответствующие квантили распределения – q =2; q1 =2, а доверительный интервал –
CIE = [q =2; q1 =2]:
Эфроновский доверительный интервал был популярен, когда бутстраповский подход только начинал использоваться. На самом деле, этот доверительный интервал дает плохую аппроксимацию для истинных уровней значимости, поскольку сохраняет смещение исходной выборки.
Холловский доверительный интервал. Холл предложил использовать для построения доверительного интервала рецентрированную статистику b= b , что снимает проблему смещения, связанного с конечностью выборки. Таким
образом, получается бутстраповское распределение fbb = bb bgBb=1. Соответствующие квантили – q =2; q1 =2, а доверительный интервал –
CIH = [b q1 =2; b q =2]:
Холловский доверительный интервал дает лучшую, чем Эфроновский, аппроксимацию уровней значимости. Плюсом использования Холловского доверительного интервала является отсутствие необходимости оценивания стандартных ошибок, хотя, как увидим впоследствии, такая стратегия оборачивается серьезным минусом.
t-процентный доверительный интервал. Такой интервал использует в качестве бутстрапируемой статистики t-статистику, т.е. b . Таким образом,
se(b)
21
b |
B |
|||||
b |
b b |
b=1 |
||||
находят бутстраповское распределение статистики ( se( ) ) |
и соответству- |
|||||
ющие квантили |
q |
; q |
, а сам t-процентный |
доверительный интервал стро- |
||
=2 |
1 =2 |
b |
||||
ят как
CIt = [b se(b)q1 =2; b se(b)q =2]:
t-процентный доверительный интервал еще лучше аппроксимирует истинные уровни значимости, чем Холловский доверительный интервал. Но использовать его рекомендуется только если стандартные ошибки можно построить качественно.
Симметричный t-процентный доверительный интервал. Такой интервал использует в качестве бутстрапируемой “симметризованную t-статистику”
j j |
j b j |
B |
|||||||
. Распределение бутстраповской статистики есть |
( |
) |
, а пра- |
||||||
se( ) |
se( ) |
||||||||
b |
b |
b b |
b=1 |
||||||
квантиль – q |
. Симметричный t-процентный доверительный интервал есть |
||||||||
выйb |
b |
||||||||
CIjtj = [b se(b)q1 ; b+ se(b)q1 ]:
Симметричный t-процентный доверительный интервал имеет в определенных случаях преимущество перед t-процентным доверительным интервалом. А именно, если асимптотическое распределение статистики b симметрично (как раз как в случае асимптотической нормальности), то CIjtj дает лучшую аппроксимацию уровней значимости.
4Корректировка смещения
Бутстрап позволяет скорректировать смещение, связанное с конечностью выборки. Пусть у нас есть смещённая, но состоятельная статистика b:
E[b] 6= :
Тогда мы можем выразить смещение следующим образом:
Bias = E[b] :
Если у нас есть возможность качественно оценить смещение, то мы можем скорректировать исходную статистику:
[
e = b Bias:
22