포아송과정을 응용한 확률과정 4개를 살펴보자.
복합포아송과정
특징과 확률함수
\begin{align*}
&P(X_t=x) = {e^{-\lambda t}
(\lambda t)^x\over x!}~~
I(x \in \{0, 1, 2, \cdots\})
\\[10pt]
&Z_t = \sum_{i=1}^{X_t}Y_i
= Y_1 + Y_2 + \cdots + Y_{X_n}
\end{align*}
\begin{align*}
E(X_t) &= \lambda t \\[3pt]
E(Z_t) &= E\big(E(Z_t~|~X_t)\big) \\[3pt]
&= E\big(E(Y_0 + \cdots + Y_t~|~X_t)\big) \\[3pt]
&= E(\mu \cdot X_t) \\[3pt]
&= \mu \cdot \lambda t \\[10pt]
E(X_tZ_t) &= E\big(E(X_tZ_t~|~X_t)\big)
= E(X_t~E(Z_t~|~X_t))\\[5pt]
&= E(X_t \cdot \mu \cdot X_t)
=\mu \cdot E({X_t}^2)\\[5pt]
&= \mu~\{ \lambda t + (\lambda t)^2\}\\[5pt]
&= \mu~(\lambda t + \lambda^2 t^2)
\end{align*}
Cov(X_t, Z_t) = \mu \cdot
(\lambda t + \lambda^2 t^2)
- \mu \cdot \lambda^2 t^2
= \mu \cdot \lambda t
예시문제
X_t는 t 시점 동안 방문자를 의미하고, Y_i는 방문자들의 구매 금액이다.
Y_i \sim N(2000, 1000^2)이면서, 전부 i.i.d이다.
Z_t를 t 시점 동안의 판매금액라고 할 때, Z_t의 평균과 분산은?
(1) 평균 구하기
우선 E(Z_t) = E(E(Z_t|X_t))이다. 먼저, 안에 있는 E(Z_t~|~X_t)를 구해보자.
그런데, 이 값을 바로 구하긴 힘드니 확률변수 X_t의 값이 x로 고정된 상황을 먼저 보자.
\begin{align*}
E(Z_t|X_t=x) &= E(Y_1 + Y_2 + \cdots + Y_n~|~X_t=x)
\\[10pt]
&=E(Y_1 + Y_2 + \cdots + Y_n)
\\[10pt]
&=x \cdot \mu
\end{align*}
다시 원래의 식으로 돌아가면, E(Z_t|X_t) = X_t \cdot \mu 이다.
이를 가지고 다시 E(Z_t)를 구해보면 다음과 같다.
E(Z_t) = E(E(Z_t|X_t)) =
E(X_t \cdot \mu) = \mu \cdot E(X_t)
= \mu \cdot \lambda t
(2) 분산 구하기
인제 분산을 구해보자. Var(Z_t) = E(Var(Z_t|X_t)) + Var(E(Z_t|X_t))이다.
E(Z_t|X_t)는 아까 구했기 때문에, Var(Z_t|X_t)를 구하면 된다.
\begin{align*}
Var(Z_t|X_t) &= E({Z_t}^2|X_t) - [E(Z_t|X_t)]^2
\\[10pt]
&= E({Z_t}^2|X_t) - (\mu^2 {X_t}^2)
\end{align*}
그러면, E(Z_t^2~|~X_t)는 어떻게 구할까? 이 역시 X_t의 변수를 x로 고정시켜보자.
이때 Y_i \sim N(\mu, \sigma^2) 이므로, \sum^x_0 Y_i \sim N(x\mu, x\sigma^2) 임을 참고하자.
\begin{align*}
&E({Z_t}^2~|~X_t=x) =
E\big\{ (Y_1 + \cdots + Y_t)^2
~|~X_t=x \big\}
\\[10pt]
&=\big\{ E(Y_1 + \cdots + Y_t)^2 \big\}
\\[10pt]
&= var(Y_1 + \cdots + Y_t)
+ [E(Y_1 + \cdots + Y_t)]^2
\\[10pt]
&= x\sigma^2 + x^2\mu
\end{align*}
\therefore~
E({Z_t}^2~|~X_t) =
X_t~\sigma^2 + {X_t}^2~\mu
이를 통해 다시 Var(Z_t|X_t)을 구하고, Var(Z_t)를 구하자.
\begin{align*}
var(Z_t|X_t)
&=\sigma^2{X_t}^2 + \mu^2{X_t}^2 -
\mu^2{X_t}^2
= \sigma^2{X_t}^2
\\[10pt]
Var(Z_t) &= E(Var(Z_t|X_t)) + Var(E(Z_t|X_t))
\\[5pt]
&= E(\sigma^2{X_t}^2) + Var(\mu~X_t)
\\[5pt]
&= \sigma^2\lambda t + \mu^2 \lambda t
\end{align*}
비정상 포아송과정
ex. 식당에 찾아오는 손님의 수
- 특정 구간에서 사람이 몰린다.
- 따라서 정상성이 없다.
특징과 확률함수
-
X_0 = 0
-
독립증분
-
P(X_{t+h} - X_{t} \ge 2) = o(h)
-
P(X_{t+h} - X_{t} = 1) = \lambda_{t}h + o(h).
t 시점에 따라 비율이 달라진다.
ex. 11시 : \lambda_{11h} = 30.
11시 반 : \lambda_{11.5h} = 40.
11시 반 : \lambda_{12h} = 30.
주변확률함수 (marginal pdf)
P(X_t =x) = {e^{-\Lambda(t)}~
\{\Lambda(t)\}^x \over x!}
\\[10pt]
\Lambda(t) = \int_{0}^{t}~
\lambda_s ds
확률함수 (pdf)
P(X_{t+s}-X_{s}=k) =
{e^{-[\Lambda(t+s)-\Lambda(s)]}~
[\Lambda(t+s)-\Lambda(s)]^k
\over k!}
X_{t+s}-X_{s} \sim poi\Big(\Lambda(t+s)-\Lambda(s)\Big)
기댓값
\begin{align*}
&E(X_1X_2) =
E\Big(X_1~(X_2-X_1+X_1)\Big)
\\[10pt]
&= E\Big(X_1~(X_2-X_1)\Big) +
E({X_1}^2)
\\[10pt]
&= E(X_1)~E(X_2-X_1) +
E({X_1}^2)
\\[10pt]
&= \Lambda(1)~
[\Lambda(2)-\Lambda(1)]
+ \Big[\Lambda(1) + \Lambda(1)^2\Big]
\\[10pt]
&= \Lambda(1)
[\Lambda(2)+1]
\end{align*}
출생사망과정
포아송과정을 응용해서 시간에 따른 인구변화를 알 수 있다.
- birth process라고도 한다.
- 바로 직전의 수에 따라 달라짐 (\lambda_t)
- X_t = 생존자의 수로 생각
특징과 확률함수
- X_0 = 0
- 정상증분
- P(X_{t+h} - X_{t} \ge 2~|~X_t = x) = o(h)
- P(X_{t+h} - X_{t} = 1~|~X_t = x) = \lambda_x~h + o(h)
- P(X_{t+h} - X_{t} = -1~|~X_t = x) = \mu_x~h + o(h)
- P(|X_{t+h} - X_{t}| \ge 2~|~X_t = x) = o(h)
분기과정
- branching process라고 한다.
- 출생사망과정을 조금 더 확장시킨 것으로 이해해 보자.
특징과 확률함수
- 각 개체는 한 세대만 산다.
- 각 개체는 자식을 낳을 수 있지만, 그 수는 무작위이다.
- X_t는 t 시점(세대)에서의 개체 수를 의미한다.
- X_t = x이면, X_{t+1} = \sum_{j=1}^{x} Y_{tj} 이다.
- {X_t} 는 마코프체인
\begin{align*}
&P(X_2 = x_2~|~X_1 = x_1) \\[3pt]
&= P(Y_{11} + \cdots + Y_{1x_1} = x_2~|~X_1 = x_1) \\[3pt]
&= P(Y_{11} + \cdots + Y_{1x_1} = x_2)
\\[25pt]
&P(X_3 = x_3~|~X_1 = x_{1,}~X_2 = x_2) \\[3pt]
&= P(Y_{21} + \cdots + Y_{2x_1} = x_3~|~X_1 = x_{1,}~X_2 = x_2) \\[3pt]
&= P(Y_{21} + \cdots + Y_{2x_1} = x_3)
\end{align*}
- X_t와 Y_{t_i}는 서로 독립
마코프체인인지 확인하기
\begin{align*}
&P(X_3 = x_3~|~X_1 = x_{1,}~X_2 = x_2) \\[3pt]
&= P(Y_{21} + \cdots + Y_{2x_2} = x_3~|~X_1 = x_{1,}~X_2 = x_2) \\[3pt]
&= P(Y_{21} + \cdots + Y_{2x_2} = x_3) \\[3pt]
&= P(Y_{21} + \cdots + Y_{2x_2} = x_3~|~X_2 = x_2) \\[3pt]
&= P(X_3 = x_3~|~X_2=x_2)
\end{align*}
결과적으로 마코프체인의 한 종류라고 할 수 있다.
예시문제 1
Y_{tj}는 t 시점의 부모들이고, X_t 는 t 시점 출생아이다.
-
t 시점에서 부모들이 평균적으로 \mu명 있을 때, 평균 출생아 수는?
즉 E(Y_{tj}) = \mu일때, E(X_t)는?
-
먼 미래의 출생아 수는 얼마인가? 즉 E(X_\infty)는?
1번 문제 :
E(X_t) = E\Big(E(X_t~|~X_{t-1})\Big)
그러나 이 값을 그대로 구하는 것은 불가능하므로, 확률변수 X_{t-1}의 값이
x로 고정된 상황을 먼저 보자.
\begin{align*}
&E(X_t~|~X_{t-1} = x) \\[3pt]
=~&E(Y_{t-1,~1} + \cdots + Y_{t-1,~x}~|~X_{t-1} = x) \\[3pt]
=~&E(Y_{t-1,~1} + \cdots + Y_{t-1,~x}) \\[3pt]
=~&\mu \cdot x
\end{align*}
다시 원래의 평균을 구해보자.
E(X_t) = \mu \cdot E(X_{t-1}) = \mu^t \cdot E(X_0)
이 식을 통해 X_0 = 0이면 식이 이상해짐을 알 수 있다.
(부모가 한 명도 없을 순 없다.)
2번 문제:
E(X_\infty) =
E \Big(\lim\limits_{t \to \infty} X_t\Big) =
\lim\limits_{t \to \infty}
\mu^t \cdot E(X_0)
그래서 먼 미래의 출생아 수는 평균 출생아의 수에 따라 달라진다.
E(X_\infty) =
\begin{cases}
0 &\text{if } \mu < 1 \\
not~0 &\text{else } \\
\end{cases}
평균 출생아 수가 1보다 작은 경우, 멸망할 확률도 구해보자.
\begin{align*}
\text{if }\mu\text{ < 1, }
&\lim\limits_{t \to \infty}
P(X_t \ge 1) = 0 \\[3pt]
&\lim\limits_{t \to \infty}
P(X_t = 0) = 1
\end{align*}
이는 아까 구한 \mu < 1일때 의 E(X_\infty)를 잘 보면 알 수 있다.
\begin{align*}
E(X_\infty)
&= \lim\limits_{t \to\infty}
~\sum_{t=0}^\infty~x~P(X_t=x)
\\[8pt]
&= \lim\limits_{t \to\infty}
~\sum_{t=1}^\infty~x~P(X_t=x)
\\[8pt]
&\ge \lim\limits_{t \to \infty}~\sum_{t=1}^\infty~1
\cdot P(X_t = x)
\end{align*}
E(X_\infty)
\ge \lim\limits_{t \to \infty}~\sum_{t=1}^\infty~1
\cdot P(X_t = x)
= \lim\limits_{t \to \infty}
P(X_t \ge 1) \ge 0
예시문제 2
Y_{tj} \sim bernoulli(p)일때, E(X_t)와 Var(X_t)는?
\begin{align*}
E(X_t) &= p^tE(X_0) \\
Var(X_t) &=
E\big(Var(X_t|X_{t-1})\big) +
Var\big(E(X_t|X_{t-1})\big)
\end{align*}
E(X_t)는 E(X_0)만 알면 쉽게 구할 수 있다. 이제, Var(X_t)를 생각해보자.
먼저, E(X_t~|~X_{t-1})을 생각해보자. 그러나 이 값을 바로 구하는 것이
어렵기에, 확률변수 X_{t-1}이 값이 고정된 상황을 먼저 보자.
\begin{align}
&E(X_t~|~X_{t-1} = x) = p \cdot x \\[3pt]
&E(X_t~|~X_{t-1}) = p \cdot X_{t-1}
\end{align}
확률변수 X_{t-1}이 값이 고정된 상황이 (1)이므로, 원래 상황은 (2)와 같다.
또 Var(X_t~|~X_{t-1})를 생각해보자. 역시 확률변수 X_{t-1}이 값이 x로 고정
된 상황을 보는 것이 편하다.
\begin{align*}
&Var(X_t~|~X_{t-1} = x) \\[3pt]
=~&Var(Y_{t-1,~1} + \cdots + Y_{t-1,~x}~|~X_{t-1} = x) \\[3pt]
=~&Var(Y_{t-1,~1} + \cdots + Y_{t-1,~x}) \\[3pt]
=~&x \cdot p \cdot (1-p)
\end{align*}
다시 원래 상황을 생각해보면…
Var(X_t~|~X_{t-1}) = X_{t-1} \cdot p \cdot (1-p)
그래서 이를 이용해 Var(X_t)를 구해보면 다음과 같다.
\begin{align*}
Var(X_t) &=
E\big(Var(X_t|X_{t-1})\big) +
Var\big(E(X_t|X_{t-1})\big) \\[5pt]
&=E(X_{t-1} \cdot p \cdot (1-p)) + Var(p \cdot X_{t-1}) \\[5pt]
&=E(X_{t-1})\cdot p \cdot (1-p) +
p \cdot Var(X_{t-1}) \\[5pt]
&=p^t \cdot (1-p) \cdot E(X_{0}) +
p \cdot Var(X_{t-1})
\end{align*}
식의 형태를 보면, 일종의 점화식이라고 할 수 있다.
이러한 점화식은 특유의 푸는 방법이 있거나, 행렬을 써서 찾을 수 있다.
C_t = p^2~C_{t-1} + p^t~(1-p)~a
예시문제 3
Y_{tj} \sim bernoulli(p)일때, E(X_t)와 Var(X_t)는?
→ 예시문제 2에서 구했던 식을 응용하면 된다.
우선적으로 평균은 다음과 같다.
E(X_t) = \bigg(\dfrac{1}{p}\bigg)^t~E(X_0)
다음으로 분산을 구해보자. 그 전에, 필요했던 식을 정리해보면 다음과 같다.
\begin{align*}
E(X_t~|~X_{t-1}) &= \dfrac{1}{p}
\cdot X_{t-1} \\[10pt]
Var(X_t~|~X_{t-1}) &=
X_{t-1}\cdot Var(Y_{t-1}, 1)
\\[10pt]
&= \dfrac{1-p}{p^2} \cdot X_{t-1}
\end{align*}
\begin{align*}
Var(X_t) &= E\big(Var(X_t|X_{t-1})\big) +
Var\big(E(X_t|X_{t-1})\big)
\\[5pt]
&=
E\bigg\{ \dfrac{1-p}{p^2} \cdot X_{t-1} \bigg\} +
Var\bigg\{ \dfrac{1}{p}
\cdot X_{t-1}\bigg\}
\\[10pt]
&= \dfrac{1-p}{p^2} \cdot
E(X_{t-1}) + \dfrac{1}{p^2} \cdot
Var(X_{t-1})
\\[10pt]
&= \dfrac{1-p}{p^{t+1}} \cdot
E(X_0) + \dfrac{1}{p^2} \cdot
Var(X_{t-1})
\end{align*}