분석기법 개요
지도학습
- 분류 : 트리, 포레스트, 신경망, SVM, 로지스틱 회귀
- 회귀 : 트리, 선형회귀, 다중회귀
비지도학습
정답이 없는 데이터가 숨겨진 의미, 패턴을 찾아내는 과정
예시 : 군집분석, 연관성분석, 인공신경망, 오토인코더
준지도학습
정답이 있는 데이터와 없는 데이터를 동시에 학습
예시 : 셀프 트레이닝, GAN
- 셀프 트레이닝 : 정답이 있는 데이터로 학습 후 정답이 없는 데이터를 예측, 이 중 가장 확률값이 높은 데이터들만 정답 데이터로 다시 가져가는 방식을 반복한 학습법.
- GAN : 생성적 적대 신경망. 생성모델과 판별모델이 존재. 생성모델에서 데이터 분포 법칙에 따라 데이터를 생성하면 판별 모델에서는 이를 판별하는 방식으로 학습을 진행.
강화학습
보상을 최대화하도록 에이전트를 학습
예시) Q-Learning, 정책경사(PG)
회귀분석
기본가정 5가지
- 선형성
- 잔차 정규성
- 잔차 독립성
- 잔차 등분산성
- 다중 공산성
다중회귀 결과해석 절차
다중공선성 진단 → 회귀계수 유의성 확인 → 수정된 결정계수 확인 → 모형의 적합도 평가
로지스틱 회귀
종속변수 : 범주형 변수
독립변수 : 연속형 변수
분포 : 이항분포
의사결정나무
의사결정나무의 구성
- 뿌리마디
- 중간마디 : 뿌리 마디에서 나온 각 나무줄기 중간에 있는 마디
- 끝 마디 : 각 나무줄기 끝에 위치한 마디. 자식이 없다.
- 자식 마디 : 하나의 마디로부터 분리된 2개 이상의 마디
- 부모 마디 : 자식 마디의 상위 마디
- 가지 : 하나의 마디로부터 끝 마디까지 연결된 마디들
- 깊이 : 가장 긴 가지의 크기
정보이론
순도가 증가하고, 불확실성이 감소하는 것을 정보획득이라고 함.
대표적 알고리즘
- CART
- 불순도 측도로 범주형이면 지니지수, 연속형이면 분산의 감소를 이용한 이진분리.
- 랜덤 포레스트
-
부트스트래핑 : 랜덤 샘플링으로 크기가 동일한 여러개의 표본자료를 생성
-
배깅 : 여러 부트스트랩 자료를 생성해 학습하는 모델링, 분류기를 생성한 후 그 결과를 앙상블
추츨한 각 샘플별 모델링 학습 뒤 결과를 집계, 최종결과를 만드는 방식.
범주형이면 다수결 투표, 연속형이면 평균으로 결과를 집계
-
부스팅 : 가중치를 활용하여 약분류기를 강분류기로 만드는 방법
-
신경망
인공신경망의 원리
- 층간연결 : 서로 다른 층에 존재하는 뉴런과 연결
- 층내연결 : 동일 층 내의 뉴런과의 연결
- 순환연결 : 어떠한 뉴런의 출력이 자기 자신에게 입력되는 연결
- 기존 신경망과 달리 활성화함수의 차이가 있음.
손실함수
- 손실함수 : 출력값과 실제값의 차이
- 손실함수의 최소화를 위해 가중치와 편향을 찾는다.
- 대표적인 손실함수가 바로 평균제곱오차와 교차엔트로피 오차
- 평균제곱오차 (MSE)
- 교차엔트로피 오차 : 분류 부문으로 t값이 원-핫 인코딩 벡터. 출력값에 자연로그를 적용해 곱한다.
학습 알고리즘
- 미니배치
- 기울기 산출
- 매개변수 갱신
오차역전파
가중치 매개변수의 기울기를 미분을 통해 진행하면 시간이 너무 많이 소모.
따라서 연쇄법칙을 이용해 가중치와 편향을 계산해 업데이트하는 기법을 오차역전파라고 한다.
신경망의 대표모델
오토인코더
- 생성모델과 분류모델로 나뉨.
SVM
주요 요소
- 벡터
- 결정영역 : 직선
- 초평면
- 서포트벡터
- 마진
핵심적 특징
마진이 가장 큰 초평면을 분류기라고 한다.
초평면의 마진 = 2/|w| (일종의 거리)
군집분석
군집분석의 척도
- 제곱합에 루트를 씌우면 유클리드 거리
- 절댓값이 있으면 맨해튼 거리
- 민코프스키 거리 = 둘을 모두 포괄