열렬히.뛰기

14. 이상치 찾기

수학 & 통계 > 탐색적 자료분석 > 탐색적 자료분석 : 목차 > 14. 이상치 찾기

outlier이란?

  • 데이터 중 다른 데이터들과 다른 메커니즘으로 만들어진 듯한 것.
  • outlier를 포함시키냐, 포함시키지 않느냐를 판단하는 것은 중요하다.
    • 즉, outlier 역시 컨텍스트에 대한 이해가 필요하다.
  • 결측값과 이상치는 내가 다루는 데이터에서 언제나 존재한다.
    • 표본 1000개 중 outlier가 30라면 괜찮다.
    • 그러나 표본 10개 중 4개가 outlier라면 문제가 된다.

outlier 찾아내기

크게 분류와 클러스터링을 이용해서 outlier를 다룰 수 있다.

  • supervised: 분류(classification)를 응용

  • unsupervised: 클러스터링(clustering)을 응용

  • semi-supervised: 혼합모델에 사용할 수 있는 방법

    ex. 정규분포 2개를 합하기

즉, 지금까지 배운 모든 기법을 사용해서 outlier를 찾아낼 수 있다.

Proximity based

  • knn 기반 (k-nearest neighbor)
  • 거리를 기반으로 outlier 찾아내기

cluster-based

  • k-means 기반 (k = main body의 갯수)
  • 클러스터를 기반으로 outlier 찾기

PCA-based

  • 원래 모형 vs 차원 축소한 모형
  • 모형의 차이를 이용해서 outlier 찾기

구조방정식 기반

  • FA로 Y를 이용한 새 변수 y 만들고, X를 이용한 새 변수 x 만든다.
  • y와 x 비교해서 식 1 만들기.
  • Y와 x 비교해서 식 2 만들기
  • 식 1과 식 2 비교해서 outlier 찾기.