변수 선택법
전진 선택법
- 영 모형에서 시작, 모든 독립변수 중 종속변수와의 상관계수의 절댓값이 가장 큰 변수를 모형에 포함
- 부분 f검정 시행, 유의한 경우 가장 큰 f통계량을 가지는 모형을 선택
- 한번 추가된 변수를 제거하지 않음.
후진 선택법
- 전체모형에서 시작, 모든 독립변수 중 종속변수와의 상관계수의 절댓값이 가장 작은 변수를 모형에서 제외
- 부분 f검정 시행, 유의하지 않은 경우 변수 제거
- 한번 제거된 변수를 제거하지 않음.
단계적 선택법
- 전진 선택법으로 가장 유의한 변수를 모형에 포함, 후진 선택법으로 새롭게 유의하지 않은 변수들 제거
- 제거된 변수들은 다시 모형에 포함하지 않으며, 유의한 설명변수가 존재하지 않을때까지 과정을 반복
차원축소
- 차원이 커질수록 과적합 가능성이 커진다. (오적합이 아니다)
요인분석
- 요인에 대한 중요도를 파악하고 필요시 지우는 것도 가능
파생변수의 생성
요약변수
- 수집된 정보를 분석에 맞게 종합
- 데이터마트에서 가장 기본적인 변수
- 많은 분석 모델에서 공통으로 사용할 수 있어 사용성이 높다.
파생변수
- 보편적이고 전 데이터 구간에서 대표성을 가진다.
변수변환
- 우로 치우칠 수록 값이 커짐
불균형 데이터
- 클래스에 속한 데이터의 양의 차이가 클 경우, 이를 클래스 불균형이라 한다.
언더샘플링, 오버샘플링
- 다수에서 일부만 = 언더
- 소수를 증가 = 오버