Файл: 38. 03. 01 Экономика, 38. 03. 02 Менеджмент.pdf

ВУЗ: Не указан

Категория: Не указан

Дисциплина: Не указана

Добавлен: 11.12.2023

Просмотров: 1294

Скачиваний: 2

ВНИМАНИЕ! Если данный файл нарушает Ваши авторские права, то обязательно сообщите нам.

214
подставив их в полученное выше выражение, получим систему, состоящую из k линейных уравнений с k неизвестными
11 1 12 2 1
01 21 1 22 2 2
01 1 1 2 2 0
n n
n n
n
n
nn n
n
r
r
r
r
r
r
r
r
r
r
r
r
β + β + + β =

 β + β + + β =



 β + β + + β =

(7)
Матрица этой системы называется корреляционной матри- цей R:
12 13 1
21 23 2
1 2
3 1
1
n
n
n
n
n
nn
r
r
r
r
r
r
R
r
r
r
r






=






по главной диагонали матрицы R стоят единицы, поскольку
r
ii
= 1. Матрица является симметричной, поскольку r
ik
= r
ki
. кроме того, при внимательном отношении к сбору данных она является невырожденной, т. е. решение системы (7) всегда существует.
решив систему (7), получим значения нормализованных коэф- фициентов регрессии β
1
, …, β
n
для получения оценок коэффициентов исходного уравне- ния (3) подставим переменные (4) в уравнение (5):
1 1
1 1
n
n
n
n
y
x
x
y y
x x
x x
d
d
d



= α
+ + α


преобразовав это выражение, получаем:
1 2
1 2
1 1
2 1
1 2
n
n
y
y
y
n
x
x
x
y
y
y
n
n
x
x
x
d
d
d
y
x
x
x
d
d
d
d
d
d
y
x
x
x
d
d
d
= α
+ α
+ + α
+


+
− α
− α
− − α













215
сравнивая данное выражение с исходным, получаем формулы для вычисления коэффициентов регрессии
1 2
1 1
2 2
0 1 1
,
,
,
n
y
x
y
x
y
n
n
x
k n
d
d
d
d
d
d
y
x
x

β = α



β = α




β = α


β = − α − − α












таким образом, зная нормализованные коэффициенты, можно найти исходные коэффициенты регрессии.
Пример. Используя данные табл. 42 необходимо:
1) изобразить облако наблюдений на графике;
2) по графику подобрать наиболее подходящую модель и оценить ее параметры.
Таблица 42
выборка из 14 наблюдений с переменными X
i
и Y
i
№ наблюдения
X
i
Y
i
1 39 31 2
43 33 3
44 34 4
50 36 5
59 37 6
57 40 7
63 41 8
58 43 9
64 44 10 70 46 11 72 48 12 79 51 13 35 23 14 33 27


216
Р е ш е н и е:
1. Построим диаграмму рассеяния (рис. 23).
0 2
4 6
8 10 12 0
5 10 15 20
рис. 23. диаграмма рассеяния
Нелинейность прослеживается.
2. Найдем оценки параметров параболической регрессии
2 0
1 2
,
Y b b X b X
= +
+

воспользовавшись методом наименьших квадратов оценки параметров множественной линейной регрессионной модели, для чего примем
Если в уравнение подставить
Z вместо X
2
, получим множественную линей­
ную регрессионную модель
Введем следующие обозначения:
1
N
y
Y
y
 
 
=  
 
 
— вектор;
1 1
1 1
N
N
X
Z
X
X
Z




= 





— матрица размера
3 × N (в нашем случае N = 15);
0 1
2
b
b
b
b
 
 
=  
 
 
— вектор параметров регрессии, который надо найти;
1
( ' )
' ,
b
X X X Y

=
где X ' — транспонированная матрица X.

217
Получаем:
X
i
1 7
49 6
1 7
49 5
1 7
49 4
1 8
64 5
1 9
81 6
1 10 100 4
1 11 121 3
Х =
1 13 169
Y =
2 1
14 196 2
1 15 225 3
1 6
36 6
1 5
25 7
1 5
25 8
1 4
16 11 1
3 9
9 1
1 1
1 1
1 1
1 1
1 1
1 1
1 1
X ' = 7 7
7 8
9 10 11 13 14 15 6
5 5
4 3
49 49 49 64 81 100 121 169 196 225 36 25 25 16 9
Матрица
(X 'X) размера 3 × 3 имеет следующую структуру:
1 1
2 1
1 1
2 1
1 1
( ' )
N
N
i
i
i
i
N
N
N
i
i
i i
i
i
i
N
N
N
i
i i
i
i
i
i
N
X
Z
X X
X
X
X Z
Z
X Z
Z
=
=
=
=
=
=
=
=








= 

















Вектор X 'Y имеет структуру
1 1
1
'
N
i
i
N
i
i
i
N
i i
i
Y
Y X
X Y
Y Z
=
=
=










= 















218
Для нахождения указанных выше матриц составим и заполним вспо- могательную таблицу (табл. 43).
Таблица 43
1   ...   12   13   14   15   16   17   18   19   ...   23

Параметры регрессииNXiYiXi× ZiXi× YiZi× Yi1 749 6343 49 2 401 42 294 27 49 5343 49 2 401 35 245 37 49 4343 49 2 401 28 196 48 64 5512 64 4 096 40 320 59 81 6729 81 6 561 54 486 610 100 41000 100 10 000 40 400 711 121 31331 121 14 641 33 363 813 169 22197 169 28 561 26 338 914 196 22744 196 38 416 28 392 10 15 225 33375 225 50 625 45 675 11 636 6216 36 1 296 36 216 12 525 7125 25 625 35 175 13 525 8125 25 625 40 200 14 416 11 64 16 256 44 176 15 39 927 981 27 81сумма в столбце 124 1 214 81 13 474 1214 162 986 553 4 557Тогда15 124 1214 81X 'X =124 1 214 13 474X 'Y=553 1 214 13 474 162 986 4 557 2,6626−0,629 0,0321 14,5(X 'X)−1 =−0,629 0,158−0,008(X 'X)−1X 'Y =−1,66 0,0321−0,008 0,0005 0,057Итак, b0 = 14,5; b1 = −1,66; b2 = 0,057.Получаем уравнение регрессии:2 14,5 1,66 0,057YXX=+ −⋅ +⋅

219
после расчетов Мнк-коэффициентов и получения выбороч- ной линии регрессии необходимо проверить, насколько рассматри- ваемая модель подходит имеющимся данным. показателем соот- ветствия реальных и модельных данных является коэффициент детерминации, которому посвящена следующая глава.
Задания по теме
1. даны уравнения:
0 1
2
log log
;
Y
W
S
= β + β
+ β + ε
0 1
2
log( / )
log
,
Y W
W
S
= γ + γ
+ γ + ε
где Y — годовой доход работника; W — число рабочих дней в году; S — полное число лет, потраченных работником на образование.
а) покажите, что для соответствующих Мнк-оценок выполнены соотношения:
0 0
2 2
1 1
;
;
1.
γ = β γ = β γ = β −






б) покажите, что остатки этих регрессий совпадают.
в) при каких условиях коэффициент детерминации в первой регрес- сии будет больше коэффициента детерминации во второй регрессии? что можно сказать о качестве подгонки?
2. покажите, что в регрессии Y на прогнозные значения свободный коэффициент равен нулю, а коэффициент наклона — единице.
3. имеются 20 наблюдений (в млн руб.) следующих переменных:
Y — выпуск продукции предприятия;
X
1
— объем основных фондов;
Х
2
— объем оборотных средств;
Х
3
— объем фонда оплаты труда.
оцените методом наименьших квадратов следующие зависимости:
а)
2
;
Y
X
= α + β
+ ε
б)
2
;
Y
X
β
= α ε
в)
0 1 1 2
2 3
3
;
Y
X
X
X
= β + β
+ β
+ β
+ ε
г)
3 1
2 0
1 2
3
Y
X X X
β
β
β
= β
ε

220
в каждом случае:
1) оцените качество подгонки линии регрессии к имеющимся данным;
2) рассчитайте стандартную ошибку регрессии и стандартные ошибки коэффициентов;
3) проверьте значимость регрессии в целом;
4) проверьте значимость коэффициентов;
5) сравните линейную и логарифмическую модели;
6) проведите F-тест на улучшение качества оценивания моделей «в» и «а».
сделайте выводы.
контрольные вопросы
1. система нормальных уравнений для нахождения коэффициентов по Мнк.
2. в каком случае линия регрессии по методу наименьших квадра- тов не существует?
3. приведите пример модели, в которой присутствует полная мультиколлинеарность.
4. укажите размерности матриц, участвующих в формуле
Мнк-коэффициентов.
5. как устранить проблему полной мультиколлинеарности?
6. выведите систему нормальных уравнений.
7. выведите матричную формулу Мнк-коэффициентов.
8. приведите пример ситуации, когда линейной зависимости между объясняющими переменными нет, а коэффициенты МлрМ не существуют.
9. как влияют выбросы на результаты оценивания?
10. как исследовать устойчивость результатов оценивания?
глава 4
Оценка качества подгонки линии регрессии
к имеющимся данным
итак, гиперплоскость мы построили. насколько хорошо нам удалось объяснить изменение переменной Y нашей моделью? чтобы выявить это, разложим вариацию Y на две части. после


221
чего посмотрим, насколько наше уравнение объясняет вариа- цию Y и какова часть Y, которую мы не можем объяснить нашим уравнением.
рассмотрим величину
2 1
(
) ,
N
i
i
Y Y
=


являющуюся мерой вариа- ции переменной Y вокруг ее среднего значения. распишем эту величину:
2 2
1 1
2 2
1 1
1
(
)
(
)
(
) 2 (
)(
)
(
) .
N
N
i
i
i
i
i
i
N
N
N
i
i
i
i
i
i
i
i
i
Y Y
Y Y Y Y
Y Y
Y Y Y Y
Y Y
=
=
=
=
=

=
− + −
=
=




+






 

 

I
II
III
в этой сумме слагаемое II = 0, если в уравнении есть свобод- ный член. таким образом, в разложении этой суммы остаются только два слагаемых:
2 2
2 1
1 1
(
)
(
)
(
)
TSS ESS RSS
N
N
N
i
i
i
i
i
i
i
Y Y
Y Y
Y Y
=
=
=

=

+






,
где TSS (Total Sum of Squares) — вся дисперсия или вариация Y, характеризующая степень случайного разброса значений функции регрессии около среднего значения Y; ESS (Error Sum of Squares) — сумма квадратов остатков регрессии, та величина, которую мы минимизируем при построении прямой, часть дисперсии, кото- рая нашим уравнением не объясняется; RSS (Regression Sum of
Squares) — объясненная нашей моделью часть вариации.
естественно полагать, что чем «лучше» рассматриваемая модель, тем больше прогнозные значения похожи на реальные значения Y (рис. 24), и, следовательно, объясненная часть вариации переменной Y больше, а необъясненная соответственно меньше.

222
Y
i
Y
i
Y

Y
i
i
Y Y


i
Y Y

i
Y Y


X
i
X
X
рис. 24. разложение отклонения от среднего значения переменной Y
Коэффициентом детерминации или долей, объясненной нашим уравнением дисперсии, называется величина
2
RSS
ESS
1
TSS
TSS
R =
= −
свойства коэффициента детерминации:
1.
2 0
1
R


в силу определения.
2. если
, то RSS = 0, т. е. наша регрессия ничего не объяс няет, ничего не дает по сравнению с тривиальным прогнозом наши данные позволяют сделать вывод о независимости Y
и X: изменение в переменной X никак не влияет на изменение сред- него значения переменной.
3. при R
2
= 1 все точки (X
i
, Y
i
) лежат на одной прямой (ESS = 0). тогда на основании наших данных можно сделать вывод о наличии функциональной, а именно линейной, зависимости между пере- менными Y и X. изменение переменной Y полностью объясняется изменением переменной X.


223 4. если то чем ближе R
2
к 1, тем лучше качество под- гонки кривой к нашим данным, тем точнее аппроксимирует Y.
5. величина R
2
возрастает при добавлении еще одного регрес- сора, поэтому при выборе между несколькими регрессионными уравнениями не следует полагаться только на коэффициент детер- минации R
2
попыткой устранить эффект, связанный с ростом R
2
при уве- личении числа регрессоров, является коррекция R
2
на число рег- рессоров — наложение «штрафа» за увеличение числа независи- мых переменных. скорректированный R
2
имеет вид:
2
ESS
(
1)
1
,
TSS
(
1)
adj
N k
R
N
− −
= −

где в числителе — несмещенная оценка дисперсии ошибок, в зна- менателе — несмещенная оценка дисперсии Y.
свойства скорректированного
2 2
1 1)
1 (1
)
;
1
adj
N
R
R
N k

= − −
− −
2 2
1;
2)
,
adj
k
R
R
>
>
2 2
2 2
2 1
1 1 (1
)
(1
)
1 0
,
1;
adj
N
N
R
R
R
R
R
N
k
k
N k





=
− + −
= −
+
− >



>



2 3)
1,
adj
R
но может быть и
2 0.
adj
R
в определенном смысле использование для сравнения рег- рессий при изменении числа регрессоров более корректно.
Упражнение. Покажите, что статистика увеличится при добав- лении новой переменной тогда и только тогда, когда
t­статистика коэф- фициента при этой переменной по модулю больше 1.
таким образом, если в результате регрессии с новой пере- менной статистика увеличилась, это еще не означает, что

224
коэффициент при этой переменной значимо отличается от нуля, поэтому мы не можем сказать, что спецификация модели улучши- лась. Это первая причина, почему статистика не стала широко использоваться в качестве диагностической величины. вторая причина — уменьшение внимания к самому коэффициенту R
2
на практике даже плохо определенная модель регрессии может давать высокий коэффициент R
2
. поэтому теперь он рассматри- вается в качестве одного из целого ряда диагностических показа- телей, которые должны быть проверены при построении модели регрессии. следовательно, и корректировка его мало что дает.
итак, при помощи регрессионного анализа мы получили оценки интересующей нас зависимости: однако это всего лишь статистические оценки. возникает вопрос, насколько они хороши. оказывается, что наши оценки получаются достаточно надежными при выполнении некоторых условий. Эти условия будут рассмотрены в следующей главе.
Пример. Воспользовавшись данными, представленными в табл. 44, выполним следующее:
1) оценим зависимости:
а) где X — располагаемый личный доход (млрд долл. в ценах 1992 г.), Y — расходы на медицинские услуги (млрд долл. в ценах 1992 г.);
б) где
t — относительное время, переменная, равная 1 для 1991 г., равная 2 для 1992 г., …, равная 10 для 2000 г.;
2) рассчитаем
R
2
для обоих уравнений и проинтерпретируем резуль- таты.
Таблица 44
личный располагаемый доход и расходы на медицинские услуги
потребителей в период с 1991 по 2000 г. (млрд долл. в ценах 1992 г.)
годы
1991 1992 1993 1994 1995 1996 1997 1998 1999 2000
время
1 2
3 4
5 6
7 8
9 10
личный располагаемый доход
858,4 875,8 906 942,9 988,8 1 015,5 1 021,6 1 049,3 1 095,4 1 095
Медицинские услуги
17,2 17,8 18 19,2 18,6 20,1 21,5 22 23,3 23,3