개요 : 회귀식
- 두 변수 간의 함수적인 방법을 알고 싶다고 하자.
- 변수 하나를 알때, 다른 변수의 미래값을 예측하는 것이 관심사!
- 이 중 E(Y|X=x)를 추정해보자.
- 일반적으로 x가 늘면 E(Y|X=x) 역시 증가함을 기대할 수 있다.
- 그렇다면 E(Y|X=x) = g(x) 는 1차식, 2차식, 또는 지수식이 될 수 있다.
- E(Y|X=x) = g(x) 를 추정하기 위해 각각의 점들을 살펴본다.
- 함수 g(x)를 우리는 회귀식이라고 한다.
선형모형
다음과 같이 회귀식이 선형인 경우 그 모형을 선형모형이라고 한다.
E(Y|X=x) = \alpha + \beta x + \gamma x^2
- 모수 \alpha, \beta, \gamma에 대해 선형이다.
- 선형: 더하기, 곱하기, 제곱까지의 연산을 의미
- 지수, 로그 등이 담겨 있다면 이는 비선형
1차회귀
Y_i = \alpha_1 + \beta x_i + \epsilon_i
\kern{15pt} i=1,2,3,\cdots,n
각 변수들이 의미하는 바는 다음과 같다.
- \alpha : 1차회귀식의 기울기
- \beta : 1차회귀식의 y절편
- \epsilon : 오차. 정규분포 N(0, \sigma^2)를 따른다.
계산을 편하게 하기 위해서 \alpha_1 = \alpha - \beta\overline{X} 로 변경.
\begin{align*}
Y_i &= \alpha - \beta\overline{X}
+ \beta x_i + \epsilon_i
\\[10pt]
&= \alpha
+ \beta(x_i - \overline{X})
+ \epsilon_i
\end{align*}
여기서 숫자(값)와 확률변수를 구분해보자.
- \alpha + \beta(x_i - \overline{X}) : 숫자(일종의 값)
- \epsilon_i : 확률변수임. 정규분포 : N(0, \mu)
즉, 전체 식은 정규분포와 숫자의 합임을 알 수 있다.
Y 자체를 확률변수로 생각해주기 위해 평균과 분산의 법칙을 생각해보자.
E(a + X) = a + E(X)
\\[10pt]
Var(a + X) = Var(X)
따라서, Y \sim N(\alpha + \beta(x_i - \overline{X}),~\sigma^2) 이다.
최대가능도 추정
이제 여기서 우리가 추정해야 할 변수는 \alpha, \beta, \sigma 이다.
이를 토대로 결합 pdf와 가능도함수를 만들어보자.
f_Y(y) = {1 \over \sqrt{2\pi\sigma^2}}
\exp \bigg[- {\{y_i -\alpha
+ \beta(x_i - \overline{X})\}^2 \over 2\sigma^2}
\bigg]
L(\alpha, \beta, \sigma^2) =
\prod_{i=1}^{n}~
{1 \over \sqrt{2\pi\sigma^2}}
\exp \bigg[- {\{y_i -\alpha
+ \beta(x_i - \overline{X})\}^2 \over 2\sigma^2}
\bigg]
\\[20pt]
= \bigg(
{1 \over \sqrt{2\pi\sigma^2}} \bigg)^{n/2}
\exp \bigg[- {\sum_{i=1}^{n}
\{y_i -\alpha +
\beta(x_i - \overline{X})\}^2
\over 2\sigma^2}
\bigg]
l(\alpha, \beta, \sigma^2) = {n\over 2}\ln(2\pi\sigma^2) +
{\sum_{i=1}^{n}
\{y_i -\alpha +
\beta(x_i - \overline{X})\}^2
\over 2\sigma^2}
여기서 최소화해야 하는 대상은 다음과 같다.
H(\alpha, \beta) =
{\sum_{i=1}^{n}
\{y_i -\alpha +
\beta(x_i - \overline{X})\}^2
\over 2\sigma^2}
최소제곱법
다음 부분을 다시 한번 살펴보자.
|y_i -\alpha - \beta(x_i - \overline{X})| = |y_i - \mu(x_i)|
- 각 점의 y좌표에서 평균을 팬 것을 알 수 있다.
- 즉, 수직 거리이다.
따라서 H(\alpha, \beta) 는 수직거리의 제곱합이다.
이때, 두 모수 \alpha, \beta를 정하는 문제를 최소제곱법이라고 한다.
알파 추정
우선 알파로 함수 H를 편미분한다.
{\partial \over \partial \alpha}~
H(\alpha, \beta) = 2~\sum_{i=1}^{n}
~[y_i - \alpha - \beta(x_i - \overline{X})]\cdot(-1) = 0
\\[15pt]
\sum_{i=1}^{n}
~[y_i - \alpha - \beta(x_i - \overline{X})] = 0
\sum_{i=1}^{n}~y_i -
n\alpha -
\sum_{i=1}^{n}
~ \beta(x_i - \overline{X}) = 0
\\[20pt]
\sum_{i=1}^{n}~y_i -
n\alpha = 0. \kern{10pt}
\sum_{i=1}^{n}~y_i = n\alpha
\\[20pt]
{1 \over n}\sum_{i=1}^{n}~y_i = \overline{Y} = \hat\alpha
베타 추정
이번에는 베타로 함수 H를 편미분한다.
\begin{align*}
&{\partial \over \partial \beta}~
H(\alpha, \beta) = 2~\sum_{i=1}^{n}
~[y_i - \alpha - \beta(x_i - \overline{x})]\cdot
[-(x_i - \overline{x})]
\\[20pt]
&= -2~\sum_{i=1}^{n}
~\{y_i - \alpha -
\beta(x_i - \overline{x})\}\cdot
(x_i - \overline{x})
\\[20pt]
&= -2~\sum_{i=1}^{n}~\Big\{
(y_i - \alpha)
(x_i - \overline{x}) -
\beta(x_i - \overline{x})
(x_i - \overline{x})
\Big\}
\\[20pt]
&= -2~\sum_{i=1}^{n}~\Big\{
(y_i - \alpha)
(x_i - \overline{x}) -
\beta(x_i - \overline{x})^2
\Big\}
=~0
\\[20pt]
\end{align*}
앞에서 얻은 \alpha의 추정값을 활용.
\sum_{i=1}^{n}~
(y_i - \overline{Y})
(x_i - \overline{x}) -
\sum_{i=1}^{n}~
\beta(x_i - \overline{x})^2 = 0
\\[20pt]
\sum_{i=1}^{n}~
(y_i - \overline{Y})
(x_i - \overline{x}) -
\beta~\sum_{i=1}^{n}~
(x_i - \overline{x})^2 = 0
\\[20pt]
\beta~\sum_{i=1}^{n}~
(x_i - \overline{x})^2
= \sum_{i=1}^{n}~
(y_i - \overline{Y})
(x_i - \overline{x})
\hat\beta ~=~ {
\displaystyle\sum_{i=1}^{n}~
(y_i - \overline{Y})
(x_i - \overline{X})
\over
\displaystyle\sum_{i=1}^{n}~
(x_i - \overline{X})^2
}
=
{\displaystyle
\sum_{i=1}^{n}~
Y_i(X_i - \overline{X})
\over
\displaystyle
\sum_{i=1}^{n}~
(x_i - \overline{X})^2
}
잔차추정
이제 남은 하나의 모수, \sigma^2을 추정해보자.
{\partial \over \partial (\sigma^2)}~l(\alpha, \beta, \sigma^2) =
{n \over 2\sigma^2} -
{[y_i-\alpha-\beta(x_i-\overline{X})]^2
\over 2(\sigma^2)^2} =0
\widehat{\sigma^2} = \dfrac{1}{n}~
\sum_{i=1}^{n}~
[Y_i-\hat\alpha-
\hat\beta(x_i-\overline{x})]^2
여기서 다음 식은 Y_i 값과 \hat{E}(Y_i) 의 차이이다. 이를 i번째 잔차라고 한다.
Y_i - \hat Y_i =
Y_i-\hat\alpha-
\hat\beta(x_i-\overline{x})
결국 분산 \sigma^2의 mle는 잔차제곱합을 n으로 나눈 것이다.
- 잔차제곱합은 반드시 0이 되어야 하지만, 꼭 그렇지 않을 때도 있다.
- 잔차는 산점도를 이용해 보통 시각화하며, 이를 통해 모형이 적합한지 알 수 있다.
추정량 : 알파헷과 베타헷
앞에서 \hat\alpha와 \hat\beta를 다음과 같이 정의했다.
\begin{align*}
\hat\alpha &= \overline{Y}
= \dfrac{1}{n}~\sum_{i=1}^{n}~Y_i
\\[20pt]
\hat\beta &=
{\sum_{i=1}^{n}~
Y_i(X_i - \overline{X})
\over
\sum_{i=1}^{n}~
(x_i - \overline{X})^2
}
{\over}
\end{align*}
이 역시 일종의 확률분포라고 할 수 있다.
알파헷의 분포
정규분포를 따른다.
\hat\alpha \sim N\bigg(\alpha,
~{\sigma^2 \over n}\bigg)
\begin{align*}
E(\hat\alpha) &= E\bigg(~ {1\over n} \sum_{i=1}^{n}~Y_i~\bigg)
= {1\over n}~E\bigg( \sum_{i=1}^{n}~Y_i~\bigg)
\\[15pt]
&= {1\over n} \sum_{i=1}^{n}~
[\alpha + \beta(x_i - \overline{x})]
= \alpha
\\[20pt]
Var(\hat\alpha) &=
Var\bigg( \dfrac{1}{n}~\sum_{i=1}^{n}~Y_i \bigg)
\\[20pt]
&= \bigg({1 \over n}\bigg)^2~\sum_{i=1}^{n}~
Var(Y_i) = \dfrac{\sigma^2}{n}
\end{align*}
베타헷의 분포
역시 정규분포를 따른다.
\hat\beta \sim N
\bigg( \beta,
~{\sigma^2 \over \sum_{i=1}^{n}
(x_i - \overline{x})^2}
\bigg)
\begin{align*}
E(\hat\beta) &=
{\sum_{i=1}^{n}~
E(Y_i)(x_i - \overline{x})
\over
\sum_{i=1}^{n}~
(x_i - \overline{x})^2}
\\[20pt]
&=
{\sum_{i=1}^{n}~
[\hat\alpha+
\hat\beta(x_i-\overline{x})]
(x_i - \overline{x})
\over
\sum_{i=1}^{n}~
(x_i - \overline{x})^2}
\\[20pt]
&=
{\sum_{i=1}^{n}~\hat\alpha
(x_i - \overline{x}) +
\sum_{i=1}^{n}~
[\hat\beta(x_i-\overline{x})]
(x_i - \overline{X})
\over
\sum_{i=1}^{n}~
(x_i - \overline{x})^2}
\\[20pt]
&=
{\hat\alpha\sum_{i=1}^{n}~
(x_i - \overline{x}) +
\hat\beta\sum_{i=1}^{n}~
(x_i-\overline{x})^2
\over
\sum_{i=1}^{n}~
(x_i - \overline{x})^2}
= \beta
\end{align*}
\begin{align*}
Var(\hat\beta) &=
Var~\Bigg[~
{\sum_{i=1}^{n}~
Y_i(x_i - \overline{x})
\over
\sum_{i=1}^{n}~
(x_i - \overline{x})^2}
~\Bigg]
\\[20pt]
&= \Bigg[ {1 \over
\sum_{i=1}^{n}~
(x_i - \overline{x})^2}
\Bigg]^2
Var~\bigg(
\sum_{i=1}^{n}~
(x_i - \overline{x})
{Y_i} \bigg)
\\[20pt]
&= \textcolor{blue}{\sum_{i=1}^{n}}
\bigg[~{(x_i - \overline{x})
\over
\sum_{i=1}^{n}~
(x_i - \overline{x})^2}~
\bigg]^2
\textcolor{blue}{Var(Y_i)}
\\[20pt]
&=
~{\sum_{i=1}^{n}
(x_i - \overline{x})
\over
{\big[ \sum_{i=1}^{n}~
(x_i - \overline{x})^2
\big]}^2
}~\sigma^2
= {\sigma^2 \over
\sum_{i=1}^{n}~
(x_i - \overline{x})^2
}
\end{align*}