[하] 분석 절차 수립
01 분석 모형 선정
- 분석 모형 선정 필요성
- 분석 기법 또는 분석 알고리즘을 적용하기 전에 분석 모형에 대한 선정이 필요함.
- 분석이 필요한 데이터 속성을 세부적으로 파악, 처리한 뒤에 분석 모형을 선정, 적합한 분석 기법을 선택하게 됨.
- 데이터가 준비되어 있지 않다면 사전 분석 목적을 정확하게 파악해야 문제 인식과 필요 데이터 준비에 따른 분석 모형 선정을 수월하게 진행할 수 있음.
- 분석 목적: 의사결정, 불확실성 해소, 요약, 인과관계 파악, 예측
- 분석 모형 선정 프로세스
- 분석 모형 선정은 다음 순서와 같은 분석 이전의 단계들을 수행하면서 선정을 진행한다.
- 문제요건 정의
- 데이터 수집, 정리 및 도식화
- 데이터 전처리
- 최적의 분석 모형 선정
02 분석 모형 정의
- 분석 모형의 정의와 종류
- 분석 모형은 분석 목표에 따라 테이터 특성을 도출하고, 가설 수립에 따라 전체적인 분석 방향을 정의하는 모형으로 예측 분석 모형, 현황 진단 모형, 최적화 분석 모형 등으로 구분한다.
- 예측 분석 모형 (어떤 일들이 발생할 것인가?)
- 현황 진단 모형 (과거에 어떠한 상황이 어떻게 일어났는가? 그리고 현재 어떤 상태인가?)
- 최적화 분석 모형 (어떻게 하면 원하는 결과가 일어날 수 있을까?)
- 분석 모형 정의를 위한 사전 고려사항
- 분석 모형을 정의하기 전에 분석이 실제로 추진될 수 있을지 가능성을 타진하는 것이 중요
- 분석을 진행하기 이전 상황에 맞는 평가 기준표, 테이블을 작성하여 항목별로 점수를 부여하고 총점을 매긴 후 분석 모형 정의의 가능성을 판별할 수 있다.
- 추진시급성과 구현가능성만으로 분석 모형 정의를 위한 사전 판별 기준 활용이 가능하다.
- 분석 모형 정의에 필요한 데이터가 충분히 확보되어 있는지를 판단하여 관련 과거 분석 사례 또는 솔루션을 최대한 활용할 수 있는지 검토한다면 보다 효율적인 분석 모형 설계를 할 수 있다.
-
상향식 접근 (Bottom-up): 문제 정의가 어려울 경우 많은 양의 데이터 분석을 통해 인사이트를 도출
- 특정 영역을 지정하여 의사결정 지점으로 진행하는 과정에서 분석 과제를 발굴하는 방식
-
하향집 접근 (Top-down): 문제 정의가 가능할 시 문제 탐색과 연관되어 비즈니스 모델, 외부 참조 모델, 분석 유스 케이스 기반 모델로 발굴하는 방식을 적용할 수 있다.
비즈니스 모델은 어떻게 수익을 창출할 것인가에 대한 검증으로 문제해결을 위한 분석 과제를 발굴하며 외부 참조 모델은 벤치마킹으로 분석 테마 후보 Pool 을 구축, 선택하는 것.
또한 분석 유스케이스 문제에 대한 상세 설명과 해결 시 효과에 대해 명시함으로써 구체적인 분석 과제들을 도출
- 분석 모형을 정의하기 전에 분석이 실제로 추진될 수 있을지 가능성을 타진하는 것이 중요
03 분석 모형 구축 절차
- 분석 시나리오 작성
- 분석 시나리오 작성을 통해 분석 과정과 결과가 어떻게 활용되는지 명확하게 이해할 수 있다.
- 데이터 분석 대상 및 범위를 요구사항에 맞게 정의하며 분석을 통해 해결할 수 있는 문제와 목표 그리고 분석 목표별 구현 모델과 예상 결과를 작성한다.
- 분석 과정에 필요한 데이터, 절차, 분석기법 등의 세부사항들을 정리한다. 데이터의 경우 사전 확보 및 유형 분석이 필요하며 기존에 잘 구현되어 활용되고 이는 유사 분석 시나리오 및 솔루션을 고려할 수 있다.
- 분석 시나리오 작성을 통해 분석 과정과 결과가 어떻게 활용되는지 명확하게 이해할 수 있다.
- 분석 모형 설계
- 분석 모형 설계는 분석 대상 및 범위를 정하여 분석 목적을 구현하기 위한 분석 방법론을 설계하는 단계이다.
- 분석 모형 설계 시 사전 확인 사항
- 필요한 데이터 사항이 정해졌는가?
- 데이터 단위를 고려, 항목에 따른 표준화 방법을 정하였는가?
- 데이터를 수집한 항목에 따라, 단계별로 모델이 설계되었는가?
- 분석 검증 통계 기법을 선정하였는가?
- 분석 모델링 설계와 검정
- 분석 목적에 기반한 가설검정 방법을 수립한다.
- 추정방법에 대한 기술을 검토한다.
- 분석 모델링 설계와 검정 방법을 수립한다.
- 분석 모델링에 적합한 할고리즘 설계
- 비지도학습: 군집분석, 연관성분석, 오토인코더 등
- 지도학습: 의사결정트리, 랜덤 포레스트, 서포트벡터머신, 회귀분석 등
- 준지도학습: 셀프 트레이닝, 적대적 생성 모델 등
- 강화학습: Q-Learning, 정책경사 (Policy Gradient) 등
- 분석 모형 개발 및 테스트
- 모듈 기능을 정의한다.
- 모듈을 설계한다.
- 모듈 개발 결과물과 모델 설계 일치를 확인한다.
- 모듈의 정상 동작 여부를 검증한다.
- 분석 모델링 설계와 검정 - 분석 목적에 기반한 가설검정 방법
- 가설검증은 다음과 같은 5단계의 절차를 거치게 된다.
- 유의수전 결정, 귀무가설과 대립가설 설정
- 귀무가설은 직접 검정 대상이 되는 가설
- ‘영가설’ 이라고도 하며 대립가설에 상반되는 가설로서 기각되는 것이 예상되어 세워진 가설
- 가설검정을 시행할 때는 귀무가설이 옳다는 가정하에 시작
- 반대로 말하면 진실일 가능성이 적어 처음부터 기각될 것이 예상되는 가설
- 대립가설은 귀무가설이 기각될때 받아들여지는 가설로 정의
- 귀무가설은 직접 검정 대상이 되는 가설
- 검정통계랑의 설정
- 검정통계랑은 가설을 검정하기 위한 기준으로 사용하는 값
- 검정통계량이 확률분포 상에 어디에 위치하는지에 따라 귀무가설을 기각하거나 기각하지 않음
- 기각역의 설정
- 기각역은 확률분포에서 귀무가설을 기각하는 영역을 말함
- 기각역에 검정통계량이 위치하면 귀무가설을 기각함
- 검정통계랑 계산
- (표본평균 - 모평균) / (표본 표준편차)
- 신뢰수준: 가설을 검정할 때 어느 정도로 검정할 것인지에 대한 수준
- 유의수준: 가설을 검정할 때 일정 수준을 벗어나면 귀무가설이 오류라고 판단하는 수준
- 귀무가설이 참임에도 불구하고 기각할 확률로 알파 값이라고도 함
- 통계적인 의사결정 (가설검정)
- 가설검정에서 검정 방법은 양측검정과 단측검정 두 가지가 있음.
- 양측검정이란 귀무가설을 기각하는 영역이 양쪽에 있는 검정.
- 만약 대립가설이 ‘~가 아니다 (크거나 작다)’ 라면 양측검정을 사용
- 단측검정이란 양측검정과 달리 귀무가설을 기각하는 영역이 한쪽 끝에 있는 검정
- 만약 대립가설이 ~보다 작다 혹은 크다인 경우 단측검정을 사용
- 통계적인 의사결정 단계에서는 계산한 검정 통계량을 t값 분포도와 비교하여 기각역에 속하는지 아닌지를 판단
- 분석 모델링 설계와 검정 - 추정 방법에 대한 기술 검토
- 전체적으로 데이터 대한 전처리 과정을 마치게 되면 모형에 활용될 후보 변수와 후보 분석 모형에 사용할 알고리즘을 파악하게 됨
- 기초 통계, 데이터 검증, 데이터 정제 등의 데이터 변환 과정을 거치면 후보 변수는 전처리 과정에서 선정됨
- 분석 모형은 크게 분류예측 추천 등의 예측 분석, 과거 데이터를 기반하여 현재를 진단하는 현황 진단, 시뮬레이션과 제한된 환경 최적화를 모색하는 예측 최적화로 나누어진다.
- 분석 모형을 선정하는 문제는 비즈니스 환경이나 종속 변수의 유무에 따라 달라지기 때문에 종속 변수가 있는지 없는지를 살펴야 함
- 종속 변수의 유무에 따라 사용할 알고지름이 제한을 받는다.
- 예를 들어 종속 변수가 없으면 사용할 수 있는 알고리즘이 군집과 원인 분석, 이상치, 연관 법칙 등으로 제한된다. 또한 변수의 속성에 따라 알고리즘의 선택이 달라짐.
p. 346
01회차 틀린문제
03번, 05번, 06번, 08번
[하] 분석 환경 구축
p. 351
01회차 틀린문제
05번