인트로: 확률과정
- 확률변수들의 집합을 확률과정이라고 한다
- 다음과 같이 표기한다 : \{X_t,~~ t \ge 0\}
상태공간
- X_t의 값들의 집합을 의미한다.
- X_t의 값이 이산형인 경우, 이산형 상태공간
X_a = 1,~X_b = 2,~X_c = 5,~ \cdots~X_n = x_n
- X_t의 값이 연속형인 경우, 연속형 상태공간
X_a = 2.3,~X_b = 12.6,~X_c = 33.8,~ \cdots~X_n=x_n
시점 t
- 시점 t는 확률변수들을 구분하는 구분자로, 보통 시간을 의미함.
- 시점 t가 이산형인 경우, 이산형 확률과정
X_1, ~X_2, ~X_3, ~X_4 ~\cdots ~X_i,~X_{i+1}~\cdots~X_n
- 시점 t가 연속형인 경우, 연속형 확률과정
X_{0.9}, X_{1.1}, X_{2.78}, X_{6.19}, X_{11.7}~\cdots~,
X_{20.8}~\cdots~X_n
확률과정의 종류
1. 시점과 상태공간
시점과 상태공간을 가지고 확률과정의 종류를 구분할 수 있다.
| 상태공간: 이산 | 상태공간: 연속 | |
| 시점 t = 이산 | 마르코프 체인 | |
| 시점 t = 연속 | 포아송과정 | 브라운운동 |
여기서는 두 가지 확률과정을 집중적으로 본다.
- 포아송과정
- 마르코프 체인
2. 정상 vs 비정상
정상성을 가지고도 확률과정의 종류를 구분할 수 있다.
- 정상과정: 확률변수 X_t 간의 확률분포가 시간에 상관없이 일정한 경우
- 비정상과정: 확률변수 X_t 간의 확률분포가 시간에 따라 달라지는 경우
정상과정에는 크게 두가지 종류가 있다.
- 강정상과정 : 확률변수 X_t 간 분포를 아는 경우
- 약정상과정 : 확률변수 X_t 간 분포를 모르는 경우
강정상과정
-
결합분포함수가 시점에 상관없고, 변수들의 시점 간격에만 의존.
편의를 위해 다음 표기를 사용한다 : F_{X, Y, Z}(x,y,z) = F_{X, Y, Z}
F_{X_{t1}, \cdots, X_{tn}} =
F_{X_{t1+h}, \cdots, X_{tn+h}}
<대표적인 예시>
F_{X_1,~X_2} = F_{X_9,~X_{10}}
= F_{X_{109},~X_{110}}
- 확률변수들 간 같은 간격이 유지되고 있다.
- 이 상황에서 과연 X_1 = X_2 인가?
- 비교시에 괄호 안에 들어가는 값은 x, y로 모두 똑같이 설정한다.
\begin{align*}
&F_{X_1,~X_2}(x,y) =
P(X_1 \le x_1,~X_2 \le x_2)
\\[5pt]
&= P(X_1 \le x,~X_2 \le \infty)
= F_{X_1,~X_2}(x,\infty)
\\[5pt]
&= F_{X_1}(x_1)
\end{align*}
\begin{align*}
&F_{X_2,~X_3}(x,y) =
P(X_2 \le x_2,~X_3 \le x_3)
\\[5pt]
&= P(X_2 \le x,~X_3 \le \infty)
= F_{X_2,~X_3}(x,\infty)
\\[5pt]
&
= F_{X_2}(x_2)
\end{align*}
\therefore~
F_{X_1}(x_1) = F_{X_2}(x_2)
- 독립은 아니더라도 분포는 같다.
약정상과정
\begin{align*}
&E(X_{t+h}) = E(X_t) = \mu
\\[10pt]
&cov(X_{t_1},X_{t_2})=
c \big(~|t_1 - t_2|~\big)
\end{align*}
- 1차, 2차 적률이 시점에 상관없고 변수들의 시점 간격에 의존.
- 분포를 모르더라도 쓸 수 있다.
- 강정상과정이 성립하면, 약정상과정도 성립한다.
- 반대는 성립하지 않는다.
3. 직전 정보
-
확률과정 속 각 확률변수들은 독립이 아니므로, 서로 영향을 받는다.
-
특히, 바로 직전의 정보가 어떻게 현재의 정보에 영향을 미치느냐에 따라
확률과정을 두 가지로 나눌 수 있다.
마팅게일
E(X_{t_{n+1}} =x | X_{t_1} = x_1,
~X_{t_2} = x_2,~
\cdots,~X_{t_n} = x_n) = x_n
- 1차적률의 관점에서 직전 정보와 현재 정보의 관련성을 이야기한다.
- 보통 연속형 상태공간에서 많이 이야기한다.
마코프 과정
P(X_{t_{n+1}} =x | X_{t_1} = x_1,
~X_{t_2} = x_2,~
\cdots,~X_{t_n} = x_n) = x_n
- 분포의 관점에서 직전 정보와 현재 정보의 관련성을 이야기한다.
- 보통 이산형 상태공간에서 많이 이야기 한다.
- 마코프과정의 종류 : 포아송과정, 마코프체인
마코프가 성립한다고 마팅게일이 성립하지는 않는다. 둘은 다른 개념!
반대도 마찬가지!
확률과정의 계산
- 확률과정에서 평균, 분산 등의 적률을 구하려면 어떻게 해야 할까?
- 여기서의 확률변수들은 독립이 아니지만, 규칙을 가지고 구할 수 있다.
증분과 독립증분
X_{tk} - X_{tk-1,} \kern{10pt}
t_1 < t_2 < \cdots < t_n
- X_t 값들의 차이를 증분이라고 한다.
- X_{tk}는 현재 시점의 관측값을 의미한다.
- X_{tk-1}은 그 전 시점의 관측값을 의미한다.
증분은 왜 계산에 도움을 주는가?
- X_1, X_2, X_3, X_4 가 있다고 가정하자.
- 각 확률변수끼리는 독립이 아니다.
- 그런데 여기서 Y_i = X_{i+1} - X_i 를 구해보자.
Y_2 = X_2 - X_1\\
Y_3 = X_3 - X_2\\
Y_4 = X_4 - X_3\\
-
이들은 서로 독립이다!
-
이때, 확률과정 \{X_{t}\}는 독립증분을 가진다고 한다.
즉, 증분을 통해 좀 더 계산을 편하게 할 수 있다.
정상증분과 정상독립증분
- 정상과정: 증분 Y_{t_i}들이 정상과정인 케이스.
- 단 Y_{t_i}를 만드는 확률변수 X_{t_i}가 정상증분인지는 모른다.
F~_{Y_{t1 + h}, ~Y_{t2 + h}
~\cdots~Y_{tn + h}}
=
F~_{Y_{t1}, ~Y_{t2}
~\cdots~Y_{tn}}
- 정상독립증분: 증분 Y_{t_i}들이 정상과정이면서 독립인 케이스
F~_{Y_{t1 + h}, ~Y_{t2 + h}
~\cdots~Y_{tn + h}}
=
F_{Y_{t1}} \times F_{Y_{t2}}
\times \cdots \times F_{Y_{tn}}
F_{Y_2,~Y_3}(x,y) =
F_{Y_{10},~Y_{11}}(x,y)
= F_{Y_{12}}(x)~F_{Y_{13}}(y)
마코프 과정 + 정상성
\{x_{t}\}는 마코프 과정이라고 가정할 때,
변수 2개인 case
\small
P(X_1=x_1,~X_2=x_2) = P(X_1=x_1)
\cdot P(X_2=x_2~|~X_1=x_1)
변수 3개인 case
\small
\begin{align*}
P(&X_1=x_1,~X_2=x_2,
~\cdots,~X_n=x_n)
\\[15pt]
=~&~ P(X_1=x_1)~P(X_2=x_2|X_1=x_1)~
P(X_3=x_3|X_1=x_1, X_2=x_2)
\end{align*}
변수 n개인 case
\small
\begin{align*}
P(&X_1=x_1,~X_2=x_2,
~\cdots,~X_n=x_n)
\\[15pt]
=~&~ P(X_1=x_1)~
\cdots~
P(X_n=x_n|X_1=x_1, \cdots, X_{n-1}=x_{n-1})
\end{align*}
변수가 늘어남으로 인해 시각화도 안되고, 계산이 복잡해진다.
그런데, 마코프 과정임을 가정하면 식을 좀 더 쉽게 변형할 수 있다.
가령 변수 n개인 case의 경우 다음과 같이 변형할 수 있다.
\footnotesize
\begin{align*}
P(&X_1=x_1,~X_2=x_2,
~\cdots,~X_n=x_n)
\\[15pt]
=~&~ P(X_1=x_1) ~\times~ P(X_2=x_2|X_1=x_1) ~\times~ P(X_3=x_3|X_2 = x_2, X_1=x_1)
\\[5pt]
~&~ ~\times~ P(X_4=x_4|X_3 = x_3,
X_2 = x_2, X_1=x_1)~\times~\cdots
\\[5pt]
~&~ ~\times~
P(X_n=x_n|X_1=x_1, \cdots, X_{n-1}=x_{n-1})
\\[15pt]
&\text{(if. markov process)}\\[15pt]
=~&~ P(X_1 = x_1) ~\times~
P(X_2=x_2|X_1=x_1)
~\times~
P(X_3=x_3|X_2=x_2)
\\[10pt]
&~\times~
P(X_4=x_4|X_3=x_3) \times \cdots
P(X_n=x_n|X_{n-1}=x_{n-1})
\end{align*}
정상과정이면 모든 조건부분포가 전부 같다!
독립은 아니지만, 어느 정도 계산이 가능하다!
예시: 마코프 과정
\begin{align*}
&~E(X_4X_5~|~X_3=x_3)
\\[10pt]
=~&\sum_{x_4}\sum_{x_5}~x_4~x_5~
P(X_4=x_4, X_5=x_5~|~X_3=x_3)
\end{align*}
조건부 파트를 바꿔보자.
\begin{align*}
&~P(X_4=x_4, X_5=x_5~|~X_3=x_3)
\\[15pt]
=&~{P(X_3=x_3, X_4=x_4, X_5=x_5) \over P(X_3=x_3)}
\\[15pt]
=&~P(X_4=x_4|X_3=x_3)
P(X_5=x_5|X_3=x_3, X_4=x_4)
\end{align*}
만약 마코프과정이라는 가정이 붙으면…
\begin{align*}
&\sum_{x_4}\sum_{x_5}~x_4~x_5~
P(X_4=x_4|X_3=x_3)~
P(X_5=x_5|X_4=x_4)
\\[20pt]
&= \sum_{x_4}~x_4~P(X_4=x_4|X_3=x_3)~
\textcolor{purple}
{\sum_{x_5}~x_5~P(X_5=x_5|X_4=x_4)}
\\[20pt]
&=
\sum_{x_4}~x_4~
\textcolor{purple}{x_4~}~
\sum_{x_5}~x_5~P(X_4=x_4|X_3=x_3)
\\[20pt]
&= E(x_4~g(x_4)~|~X_3=x_3)
\\[20pt]
&= E(x_4~E(x_5|x_4)~|~X_3=x_3)
\end{align*}
\therefore~E(X_4X_5~|~X_3) = E(X_4~E(X_5|X_4)~|~X_3)