데이터의 정제
집계, 일반화, 정규화, 평활화
데이터 결측값 처리
단순대치법
- 완전분석
- 평균 대치법
- 회귀 대치법
- 단순확률 대치법 : hot-deck
- 최근접 대치법
다중대치법
이상치의 탐지
- 상자수염그림
분포형태별 변환
왼쪽으로 치우쳐짐
- 왜도 > 0
- 최빈값 < 중앙값 <평균
- 제곱근, 로그, 역수
오른쪽으로 치우쳐짐
- 왜도 < 0
- 중앙값 < 최빈값 < 평균
- x^2, x^3
불균형 데이터 처리
| 참 | 거짓 | |
|---|---|---|
| 참 | TP | FP |
| 거짓 | FN | TN |
- 정확도 = (TP + TN) / 전체 : 정확하게 맞춘 전체 예측
- 재현율 = (TP) / (TP + FN) : 진짜 양성 찾기
공분산
- 독립이면 → 공분산(x, y) = 0 : 성립
- 공분산(x, y) = 0 → 독립 : 모름.
- 정규분포면 둘 다 성립.
불균형 데이터 처리
- 범주형 반응 변수끼리의 양의 차이가 너무 큰 경우
- 정확도가 높아도 재현율이 크게 낮아진다.
처리방법
- 가중치 균형방법
- 고정비율 이용
- 최적비율 이용
- 언더샘플링 : 대표 중 일부, 소수 중 최대한 많이
- 오버샘플링 : 소수의 복사본을 만들어 계속 복사
인코딩
레이블 인코딩
- 순차적인 정수 레이블을 할당하여 데이터를 변환
- 숫자값에 의도적으로 순서나 크기를 부여할수도 있다. (순서형 데이터에서 문제)
원-핫 인코딩
- 범주에 해당하는 인덱스만 1. 나머지는 전부 0
타깃 인코딩
- 분류문제. 종속변수의 평균 값을 인코딩으로 사용
- 평균 값을 해당 범주에 대한 인코딩 값으로 대체