열렬히.뛰기

4. 확률과정이란?

수학 & 통계 > 확률과정론 > 확률과정론 > 4. 확률과정이란?

인트로: 확률과정

  • 확률변수들의 집합을 확률과정이라고 한다
  • 다음과 같이 표기한다 : \{X_t,~~ t \ge 0\}

상태공간

  • X_t의 값들의 집합을 의미한다.
  • X_t의 값이 이산형인 경우, 이산형 상태공간
X_a = 1,~X_b = 2,~X_c = 5,~ \cdots~X_n = x_n
  • X_t의 값이 연속형인 경우, 연속형 상태공간
X_a = 2.3,~X_b = 12.6,~X_c = 33.8,~ \cdots~X_n=x_n

시점 t

  • 시점 t는 확률변수들을 구분하는 구분자로, 보통 시간을 의미함.
  • 시점 t가 이산형인 경우, 이산형 확률과정
X_1, ~X_2, ~X_3, ~X_4 ~\cdots ~X_i,~X_{i+1}~\cdots~X_n
  • 시점 t가 연속형인 경우, 연속형 확률과정
X_{0.9}, X_{1.1}, X_{2.78}, X_{6.19}, X_{11.7}~\cdots~, X_{20.8}~\cdots~X_n

확률과정의 종류

1. 시점과 상태공간

시점과 상태공간을 가지고 확률과정의 종류를 구분할 수 있다.

상태공간: 이산 상태공간: 연속
시점 t = 이산 마르코프 체인
시점 t = 연속 포아송과정 브라운운동

여기서는 두 가지 확률과정을 집중적으로 본다.

  1. 포아송과정
  2. 마르코프 체인

2. 정상 vs 비정상

정상성을 가지고도 확률과정의 종류를 구분할 수 있다.

  • 정상과정: 확률변수 X_t 간의 확률분포가 시간에 상관없이 일정한 경우
  • 비정상과정: 확률변수 X_t 간의 확률분포가 시간에 따라 달라지는 경우

정상과정에는 크게 두가지 종류가 있다.

  • 강정상과정 : 확률변수 X_t 간 분포를 아는 경우
  • 약정상과정 : 확률변수 X_t 간 분포를 모르는 경우

강정상과정

  • 결합분포함수가 시점에 상관없고, 변수들의 시점 간격에만 의존.

    편의를 위해 다음 표기를 사용한다 : F_{X, Y, Z}(x,y,z) = F_{X, Y, Z}

F_{X_{t1}, \cdots, X_{tn}} = F_{X_{t1+h}, \cdots, X_{tn+h}}

<대표적인 예시>

F_{X_1,~X_2} = F_{X_9,~X_{10}} = F_{X_{109},~X_{110}}
  • 확률변수들 간 같은 간격이 유지되고 있다.
  • 이 상황에서 과연 X_1 = X_2 인가?
    • 비교시에 괄호 안에 들어가는 값은 x, y로 모두 똑같이 설정한다.
\begin{align*} &F_{X_1,~X_2}(x,y) = P(X_1 \le x_1,~X_2 \le x_2) \\[5pt] &= P(X_1 \le x,~X_2 \le \infty) = F_{X_1,~X_2}(x,\infty) \\[5pt] &= F_{X_1}(x_1) \end{align*}
\begin{align*} &F_{X_2,~X_3}(x,y) = P(X_2 \le x_2,~X_3 \le x_3) \\[5pt] &= P(X_2 \le x,~X_3 \le \infty) = F_{X_2,~X_3}(x,\infty) \\[5pt] & = F_{X_2}(x_2) \end{align*}
\therefore~ F_{X_1}(x_1) = F_{X_2}(x_2)
  • 독립은 아니더라도 분포는 같다.

약정상과정

\begin{align*} &E(X_{t+h}) = E(X_t) = \mu \\[10pt] &cov(X_{t_1},X_{t_2})= c \big(~|t_1 - t_2|~\big) \end{align*}
  • 1차, 2차 적률이 시점에 상관없고 변수들의 시점 간격에 의존.
  • 분포를 모르더라도 쓸 수 있다.
  • 강정상과정이 성립하면, 약정상과정도 성립한다.
    • 반대는 성립하지 않는다.

3. 직전 정보

  • 확률과정 속 각 확률변수들은 독립이 아니므로, 서로 영향을 받는다.

  • 특히, 바로 직전의 정보가 어떻게 현재의 정보에 영향을 미치느냐에 따라

    확률과정을 두 가지로 나눌 수 있다.

마팅게일

E(X_{t_{n+1}} =x | X_{t_1} = x_1, ~X_{t_2} = x_2,~ \cdots,~X_{t_n} = x_n) = x_n
  • 1차적률의 관점에서 직전 정보와 현재 정보의 관련성을 이야기한다.
  • 보통 연속형 상태공간에서 많이 이야기한다.

마코프 과정

P(X_{t_{n+1}} =x | X_{t_1} = x_1, ~X_{t_2} = x_2,~ \cdots,~X_{t_n} = x_n) = x_n
  • 분포의 관점에서 직전 정보와 현재 정보의 관련성을 이야기한다.
  • 보통 이산형 상태공간에서 많이 이야기 한다.
  • 마코프과정의 종류 : 포아송과정, 마코프체인

마코프가 성립한다고 마팅게일이 성립하지는 않는다. 둘은 다른 개념!

반대도 마찬가지!

확률과정의 계산

  • 확률과정에서 평균, 분산 등의 적률을 구하려면 어떻게 해야 할까?
  • 여기서의 확률변수들은 독립이 아니지만, 규칙을 가지고 구할 수 있다.

증분과 독립증분

X_{tk} - X_{tk-1,} \kern{10pt} t_1 < t_2 < \cdots < t_n
  • X_t 값들의 차이를 증분이라고 한다.
  • X_{tk}는 현재 시점의 관측값을 의미한다.
  • X_{tk-1}은 그 전 시점의 관측값을 의미한다.

증분은 왜 계산에 도움을 주는가?

  • X_1, X_2, X_3, X_4 가 있다고 가정하자.
  • 각 확률변수끼리는 독립이 아니다.
  • 그런데 여기서 Y_i = X_{i+1} - X_i 를 구해보자.
Y_2 = X_2 - X_1\\ Y_3 = X_3 - X_2\\ Y_4 = X_4 - X_3\\
  • 이들은 서로 독립이다!

  • 이때, 확률과정 \{X_{t}\}는 독립증분을 가진다고 한다.

    즉, 증분을 통해 좀 더 계산을 편하게 할 수 있다.

정상증분과 정상독립증분

  • 정상과정: 증분 Y_{t_i}들이 정상과정인 케이스.
  • Y_{t_i}를 만드는 확률변수 X_{t_i}가 정상증분인지는 모른다.
F~_{Y_{t1 + h}, ~Y_{t2 + h} ~\cdots~Y_{tn + h}} = F~_{Y_{t1}, ~Y_{t2} ~\cdots~Y_{tn}}
  • 정상독립증분: 증분 Y_{t_i}들이 정상과정이면서 독립인 케이스
F~_{Y_{t1 + h}, ~Y_{t2 + h} ~\cdots~Y_{tn + h}} = F_{Y_{t1}} \times F_{Y_{t2}} \times \cdots \times F_{Y_{tn}}
F_{Y_2,~Y_3}(x,y) = F_{Y_{10},~Y_{11}}(x,y) = F_{Y_{12}}(x)~F_{Y_{13}}(y)

마코프 과정 + 정상성

\{x_{t}\}는 마코프 과정이라고 가정할 때,

변수 2개인 case

\small P(X_1=x_1,~X_2=x_2) = P(X_1=x_1) \cdot P(X_2=x_2~|~X_1=x_1)

변수 3개인 case

\small \begin{align*} P(&X_1=x_1,~X_2=x_2, ~\cdots,~X_n=x_n) \\[15pt] =~&~ P(X_1=x_1)~P(X_2=x_2|X_1=x_1)~ P(X_3=x_3|X_1=x_1, X_2=x_2) \end{align*}

변수 n개인 case

\small \begin{align*} P(&X_1=x_1,~X_2=x_2, ~\cdots,~X_n=x_n) \\[15pt] =~&~ P(X_1=x_1)~ \cdots~ P(X_n=x_n|X_1=x_1, \cdots, X_{n-1}=x_{n-1}) \end{align*}

변수가 늘어남으로 인해 시각화도 안되고, 계산이 복잡해진다.

그런데, 마코프 과정임을 가정하면 식을 좀 더 쉽게 변형할 수 있다.

가령 변수 n개인 case의 경우 다음과 같이 변형할 수 있다.

\footnotesize \begin{align*} P(&X_1=x_1,~X_2=x_2, ~\cdots,~X_n=x_n) \\[15pt] =~&~ P(X_1=x_1) ~\times~ P(X_2=x_2|X_1=x_1) ~\times~ P(X_3=x_3|X_2 = x_2, X_1=x_1) \\[5pt] ~&~ ~\times~ P(X_4=x_4|X_3 = x_3, X_2 = x_2, X_1=x_1)~\times~\cdots \\[5pt] ~&~ ~\times~ P(X_n=x_n|X_1=x_1, \cdots, X_{n-1}=x_{n-1}) \\[15pt] &\text{(if. markov process)}\\[15pt] =~&~ P(X_1 = x_1) ~\times~ P(X_2=x_2|X_1=x_1) ~\times~ P(X_3=x_3|X_2=x_2) \\[10pt] &~\times~ P(X_4=x_4|X_3=x_3) \times \cdots P(X_n=x_n|X_{n-1}=x_{n-1}) \end{align*}

정상과정이면 모든 조건부분포가 전부 같다!

독립은 아니지만, 어느 정도 계산이 가능하다!

예시: 마코프 과정

\begin{align*} &~E(X_4X_5~|~X_3=x_3) \\[10pt] =~&\sum_{x_4}\sum_{x_5}~x_4~x_5~ P(X_4=x_4, X_5=x_5~|~X_3=x_3) \end{align*}

조건부 파트를 바꿔보자.

\begin{align*} &~P(X_4=x_4, X_5=x_5~|~X_3=x_3) \\[15pt] =&~{P(X_3=x_3, X_4=x_4, X_5=x_5) \over P(X_3=x_3)} \\[15pt] =&~P(X_4=x_4|X_3=x_3) P(X_5=x_5|X_3=x_3, X_4=x_4) \end{align*}

만약 마코프과정이라는 가정이 붙으면…

\begin{align*} &\sum_{x_4}\sum_{x_5}~x_4~x_5~ P(X_4=x_4|X_3=x_3)~ P(X_5=x_5|X_4=x_4) \\[20pt] &= \sum_{x_4}~x_4~P(X_4=x_4|X_3=x_3)~ \textcolor{purple} {\sum_{x_5}~x_5~P(X_5=x_5|X_4=x_4)} \\[20pt] &= \sum_{x_4}~x_4~ \textcolor{purple}{x_4~}~ \sum_{x_5}~x_5~P(X_4=x_4|X_3=x_3) \\[20pt] &= E(x_4~g(x_4)~|~X_3=x_3) \\[20pt] &= E(x_4~E(x_5|x_4)~|~X_3=x_3) \end{align*}
\therefore~E(X_4X_5~|~X_3) = E(X_4~E(X_5|X_4)~|~X_3)