outlier이란?
- 데이터 중 다른 데이터들과 다른 메커니즘으로 만들어진 듯한 것.
- outlier를 포함시키냐, 포함시키지 않느냐를 판단하는 것은 중요하다.
- 즉, outlier 역시 컨텍스트에 대한 이해가 필요하다.
- 결측값과 이상치는 내가 다루는 데이터에서 언제나 존재한다.
- 표본 1000개 중 outlier가 30라면 괜찮다.
- 그러나 표본 10개 중 4개가 outlier라면 문제가 된다.
outlier 찾아내기
크게 분류와 클러스터링을 이용해서 outlier를 다룰 수 있다.
-
supervised: 분류(classification)를 응용
-
unsupervised: 클러스터링(clustering)을 응용
-
semi-supervised: 혼합모델에 사용할 수 있는 방법
ex. 정규분포 2개를 합하기
즉, 지금까지 배운 모든 기법을 사용해서 outlier를 찾아낼 수 있다.
Proximity based
- knn 기반 (k-nearest neighbor)
- 거리를 기반으로 outlier 찾아내기
cluster-based
- k-means 기반 (k = main body의 갯수)
- 클러스터를 기반으로 outlier 찾기
PCA-based
- 원래 모형 vs 차원 축소한 모형
- 모형의 차이를 이용해서 outlier 찾기
구조방정식 기반
- FA로 Y를 이용한 새 변수 y 만들고, X를 이용한 새 변수 x 만든다.
- y와 x 비교해서 식 1 만들기.
- Y와 x 비교해서 식 2 만들기
- 식 1과 식 2 비교해서 outlier 찾기.