열렬히.뛰기

최소제곱법 (OLS)

수학 & 통계 > 수리통계2 > 2. 점 추정 > 최소제곱법 (OLS)

개요 : 회귀식

  • 두 변수 간의 함수적인 방법을 알고 싶다고 하자.
  • 변수 하나를 알때, 다른 변수의 미래값을 예측하는 것이 관심사!
  • 이 중 E(Y|X=x)를 추정해보자.
    • 일반적으로 x가 늘면 E(Y|X=x) 역시 증가함을 기대할 수 있다.
    • 그렇다면 E(Y|X=x) = g(x) 는 1차식, 2차식, 또는 지수식이 될 수 있다.
    • E(Y|X=x) = g(x) 를 추정하기 위해 각각의 점들을 살펴본다.
  • 함수 g(x)를 우리는 회귀식이라고 한다.

선형모형

다음과 같이 회귀식이 선형인 경우 그 모형을 선형모형이라고 한다.

E(Y|X=x) = \alpha + \beta x + \gamma x^2
  • 모수 \alpha, \beta, \gamma에 대해 선형이다.
  • 선형: 더하기, 곱하기, 제곱까지의 연산을 의미
  • 지수, 로그 등이 담겨 있다면 이는 비선형

1차회귀

Y_i = \alpha_1 + \beta x_i + \epsilon_i \kern{15pt} i=1,2,3,\cdots,n

각 변수들이 의미하는 바는 다음과 같다.

  • \alpha : 1차회귀식의 기울기
  • \beta : 1차회귀식의 y절편
  • \epsilon : 오차. 정규분포 N(0, \sigma^2)를 따른다.

계산을 편하게 하기 위해서 \alpha_1 = \alpha - \beta\overline{X} 로 변경.

\begin{align*} Y_i &= \alpha - \beta\overline{X} + \beta x_i + \epsilon_i \\[10pt] &= \alpha + \beta(x_i - \overline{X}) + \epsilon_i \end{align*}

여기서 숫자(값)와 확률변수를 구분해보자.

  • \alpha + \beta(x_i - \overline{X}) : 숫자(일종의 값)
  • \epsilon_i : 확률변수임. 정규분포 : N(0, \mu)

즉, 전체 식은 정규분포와 숫자의 합임을 알 수 있다.

Y 자체를 확률변수로 생각해주기 위해 평균과 분산의 법칙을 생각해보자.

E(a + X) = a + E(X) \\[10pt] Var(a + X) = Var(X)

따라서, Y \sim N(\alpha + \beta(x_i - \overline{X}),~\sigma^2) 이다.

최대가능도 추정

이제 여기서 우리가 추정해야 할 변수는 \alpha, \beta, \sigma 이다.

이를 토대로 결합 pdf와 가능도함수를 만들어보자.

f_Y(y) = {1 \over \sqrt{2\pi\sigma^2}} \exp \bigg[- {\{y_i -\alpha + \beta(x_i - \overline{X})\}^2 \over 2\sigma^2} \bigg]
L(\alpha, \beta, \sigma^2) = \prod_{i=1}^{n}~ {1 \over \sqrt{2\pi\sigma^2}} \exp \bigg[- {\{y_i -\alpha + \beta(x_i - \overline{X})\}^2 \over 2\sigma^2} \bigg] \\[20pt] = \bigg( {1 \over \sqrt{2\pi\sigma^2}} \bigg)^{n/2} \exp \bigg[- {\sum_{i=1}^{n} \{y_i -\alpha + \beta(x_i - \overline{X})\}^2 \over 2\sigma^2} \bigg]
l(\alpha, \beta, \sigma^2) = {n\over 2}\ln(2\pi\sigma^2) + {\sum_{i=1}^{n} \{y_i -\alpha + \beta(x_i - \overline{X})\}^2 \over 2\sigma^2}

여기서 최소화해야 하는 대상은 다음과 같다.

H(\alpha, \beta) = {\sum_{i=1}^{n} \{y_i -\alpha + \beta(x_i - \overline{X})\}^2 \over 2\sigma^2}

최소제곱법

다음 부분을 다시 한번 살펴보자.

|y_i -\alpha - \beta(x_i - \overline{X})| = |y_i - \mu(x_i)|
  • 각 점의 y좌표에서 평균을 팬 것을 알 수 있다.
  • 즉, 수직 거리이다.

따라서 H(\alpha, \beta) 는 수직거리의 제곱합이다.

이때, 두 모수 \alpha, \beta를 정하는 문제를 최소제곱법이라고 한다.

알파 추정

우선 알파로 함수 H를 편미분한다.

{\partial \over \partial \alpha}~ H(\alpha, \beta) = 2~\sum_{i=1}^{n} ~[y_i - \alpha - \beta(x_i - \overline{X})]\cdot(-1) = 0 \\[15pt] \sum_{i=1}^{n} ~[y_i - \alpha - \beta(x_i - \overline{X})] = 0
\sum_{i=1}^{n}~y_i - n\alpha - \sum_{i=1}^{n} ~ \beta(x_i - \overline{X}) = 0 \\[20pt] \sum_{i=1}^{n}~y_i - n\alpha = 0. \kern{10pt} \sum_{i=1}^{n}~y_i = n\alpha \\[20pt] {1 \over n}\sum_{i=1}^{n}~y_i = \overline{Y} = \hat\alpha

베타 추정

이번에는 베타로 함수 H를 편미분한다.

\begin{align*} &{\partial \over \partial \beta}~ H(\alpha, \beta) = 2~\sum_{i=1}^{n} ~[y_i - \alpha - \beta(x_i - \overline{x})]\cdot [-(x_i - \overline{x})] \\[20pt] &= -2~\sum_{i=1}^{n} ~\{y_i - \alpha - \beta(x_i - \overline{x})\}\cdot (x_i - \overline{x}) \\[20pt] &= -2~\sum_{i=1}^{n}~\Big\{ (y_i - \alpha) (x_i - \overline{x}) - \beta(x_i - \overline{x}) (x_i - \overline{x}) \Big\} \\[20pt] &= -2~\sum_{i=1}^{n}~\Big\{ (y_i - \alpha) (x_i - \overline{x}) - \beta(x_i - \overline{x})^2 \Big\} =~0 \\[20pt] \end{align*}

앞에서 얻은 \alpha의 추정값을 활용.

\sum_{i=1}^{n}~ (y_i - \overline{Y}) (x_i - \overline{x}) - \sum_{i=1}^{n}~ \beta(x_i - \overline{x})^2 = 0 \\[20pt] \sum_{i=1}^{n}~ (y_i - \overline{Y}) (x_i - \overline{x}) - \beta~\sum_{i=1}^{n}~ (x_i - \overline{x})^2 = 0 \\[20pt] \beta~\sum_{i=1}^{n}~ (x_i - \overline{x})^2 = \sum_{i=1}^{n}~ (y_i - \overline{Y}) (x_i - \overline{x})
\hat\beta ~=~ { \displaystyle\sum_{i=1}^{n}~ (y_i - \overline{Y}) (x_i - \overline{X}) \over \displaystyle\sum_{i=1}^{n}~ (x_i - \overline{X})^2 } = {\displaystyle \sum_{i=1}^{n}~ Y_i(X_i - \overline{X}) \over \displaystyle \sum_{i=1}^{n}~ (x_i - \overline{X})^2 }

잔차추정

이제 남은 하나의 모수, \sigma^2을 추정해보자.

{\partial \over \partial (\sigma^2)}~l(\alpha, \beta, \sigma^2) = {n \over 2\sigma^2} - {[y_i-\alpha-\beta(x_i-\overline{X})]^2 \over 2(\sigma^2)^2} =0
\widehat{\sigma^2} = \dfrac{1}{n}~ \sum_{i=1}^{n}~ [Y_i-\hat\alpha- \hat\beta(x_i-\overline{x})]^2

여기서 다음 식은 Y_i 값과 \hat{E}(Y_i) 의 차이이다. 이를 i번째 잔차라고 한다.

Y_i - \hat Y_i = Y_i-\hat\alpha- \hat\beta(x_i-\overline{x})

결국 분산 \sigma^2의 mle는 잔차제곱합을 n으로 나눈 것이다.

  • 잔차제곱합은 반드시 0이 되어야 하지만, 꼭 그렇지 않을 때도 있다.
  • 잔차는 산점도를 이용해 보통 시각화하며, 이를 통해 모형이 적합한지 알 수 있다.

추정량 : 알파헷과 베타헷

앞에서 \hat\alpha\hat\beta를 다음과 같이 정의했다.

\begin{align*} \hat\alpha &= \overline{Y} = \dfrac{1}{n}~\sum_{i=1}^{n}~Y_i \\[20pt] \hat\beta &= {\sum_{i=1}^{n}~ Y_i(X_i - \overline{X}) \over \sum_{i=1}^{n}~ (x_i - \overline{X})^2 } {\over} \end{align*}

이 역시 일종의 확률분포라고 할 수 있다.

알파헷의 분포

정규분포를 따른다.

\hat\alpha \sim N\bigg(\alpha, ~{\sigma^2 \over n}\bigg)
\begin{align*} E(\hat\alpha) &= E\bigg(~ {1\over n} \sum_{i=1}^{n}~Y_i~\bigg) = {1\over n}~E\bigg( \sum_{i=1}^{n}~Y_i~\bigg) \\[15pt] &= {1\over n} \sum_{i=1}^{n}~ [\alpha + \beta(x_i - \overline{x})] = \alpha \\[20pt] Var(\hat\alpha) &= Var\bigg( \dfrac{1}{n}~\sum_{i=1}^{n}~Y_i \bigg) \\[20pt] &= \bigg({1 \over n}\bigg)^2~\sum_{i=1}^{n}~ Var(Y_i) = \dfrac{\sigma^2}{n} \end{align*}

베타헷의 분포

역시 정규분포를 따른다.

\hat\beta \sim N \bigg( \beta, ~{\sigma^2 \over \sum_{i=1}^{n} (x_i - \overline{x})^2} \bigg)
\begin{align*} E(\hat\beta) &= {\sum_{i=1}^{n}~ E(Y_i)(x_i - \overline{x}) \over \sum_{i=1}^{n}~ (x_i - \overline{x})^2} \\[20pt] &= {\sum_{i=1}^{n}~ [\hat\alpha+ \hat\beta(x_i-\overline{x})] (x_i - \overline{x}) \over \sum_{i=1}^{n}~ (x_i - \overline{x})^2} \\[20pt] &= {\sum_{i=1}^{n}~\hat\alpha (x_i - \overline{x}) + \sum_{i=1}^{n}~ [\hat\beta(x_i-\overline{x})] (x_i - \overline{X}) \over \sum_{i=1}^{n}~ (x_i - \overline{x})^2} \\[20pt] &= {\hat\alpha\sum_{i=1}^{n}~ (x_i - \overline{x}) + \hat\beta\sum_{i=1}^{n}~ (x_i-\overline{x})^2 \over \sum_{i=1}^{n}~ (x_i - \overline{x})^2} = \beta \end{align*}
\begin{align*} Var(\hat\beta) &= Var~\Bigg[~ {\sum_{i=1}^{n}~ Y_i(x_i - \overline{x}) \over \sum_{i=1}^{n}~ (x_i - \overline{x})^2} ~\Bigg] \\[20pt] &= \Bigg[ {1 \over \sum_{i=1}^{n}~ (x_i - \overline{x})^2} \Bigg]^2 Var~\bigg( \sum_{i=1}^{n}~ (x_i - \overline{x}) {Y_i} \bigg) \\[20pt] &= \textcolor{blue}{\sum_{i=1}^{n}} \bigg[~{(x_i - \overline{x}) \over \sum_{i=1}^{n}~ (x_i - \overline{x})^2}~ \bigg]^2 \textcolor{blue}{Var(Y_i)} \\[20pt] &= ~{\sum_{i=1}^{n} (x_i - \overline{x}) \over {\big[ \sum_{i=1}^{n}~ (x_i - \overline{x})^2 \big]}^2 }~\sigma^2 = {\sigma^2 \over \sum_{i=1}^{n}~ (x_i - \overline{x})^2 } \end{align*}