열렬히.뛰기

1-2. 분석 변수 처리

수학 & 통계 > 빅데이터 분석기사 > 개념정리 > 빅분기 개념정리 > 1-2. 분석 변수 처리

변수 선택법

전진 선택법

  • 영 모형에서 시작, 모든 독립변수 중 종속변수와의 상관계수의 절댓값이 가장 큰 변수를 모형에 포함
  • 부분 f검정 시행, 유의한 경우 가장 큰 f통계량을 가지는 모형을 선택
  • 한번 추가된 변수를 제거하지 않음.

후진 선택법

  • 전체모형에서 시작, 모든 독립변수 중 종속변수와의 상관계수의 절댓값이 가장 작은 변수를 모형에서 제외
  • 부분 f검정 시행, 유의하지 않은 경우 변수 제거
  • 한번 제거된 변수를 제거하지 않음.

단계적 선택법

  • 전진 선택법으로 가장 유의한 변수를 모형에 포함, 후진 선택법으로 새롭게 유의하지 않은 변수들 제거
  • 제거된 변수들은 다시 모형에 포함하지 않으며, 유의한 설명변수가 존재하지 않을때까지 과정을 반복

차원축소

  • 차원이 커질수록 과적합 가능성이 커진다. (오적합이 아니다)

요인분석

  • 요인에 대한 중요도를 파악하고 필요시 지우는 것도 가능

파생변수의 생성

요약변수

  • 수집된 정보를 분석에 맞게 종합
  • 데이터마트에서 가장 기본적인 변수
  • 많은 분석 모델에서 공통으로 사용할 수 있어 사용성이 높다.

파생변수

  • 보편적이고 전 데이터 구간에서 대표성을 가진다.

변수변환

  • 우로 치우칠 수록 값이 커짐

불균형 데이터

  • 클래스에 속한 데이터의 양의 차이가 클 경우, 이를 클래스 불균형이라 한다.

언더샘플링, 오버샘플링

  • 다수에서 일부만 = 언더
  • 소수를 증가 = 오버