열렬히.뛰기

2-1. 분석기법

수학 & 통계 > 빅데이터 분석기사 > 개념정리 > 빅분기 개념정리 > 2-1. 분석기법

분석기법 개요

지도학습

  • 분류 : 트리, 포레스트, 신경망, SVM, 로지스틱 회귀
  • 회귀 : 트리, 선형회귀, 다중회귀

비지도학습

정답이 없는 데이터가 숨겨진 의미, 패턴을 찾아내는 과정

예시 : 군집분석, 연관성분석, 인공신경망, 오토인코더

준지도학습

정답이 있는 데이터와 없는 데이터를 동시에 학습

예시 : 셀프 트레이닝, GAN

  • 셀프 트레이닝 : 정답이 있는 데이터로 학습 후 정답이 없는 데이터를 예측, 이 중 가장 확률값이 높은 데이터들만 정답 데이터로 다시 가져가는 방식을 반복한 학습법.
  • GAN : 생성적 적대 신경망. 생성모델과 판별모델이 존재. 생성모델에서 데이터 분포 법칙에 따라 데이터를 생성하면 판별 모델에서는 이를 판별하는 방식으로 학습을 진행.

강화학습

보상을 최대화하도록 에이전트를 학습

예시) Q-Learning, 정책경사(PG)

회귀분석

기본가정 5가지

  1. 선형성
  2. 잔차 정규성
  3. 잔차 독립성
  4. 잔차 등분산성
  5. 다중 공산성

다중회귀 결과해석 절차

다중공선성 진단 → 회귀계수 유의성 확인 → 수정된 결정계수 확인 → 모형의 적합도 평가

로지스틱 회귀

종속변수 : 범주형 변수

독립변수 : 연속형 변수

분포 : 이항분포

의사결정나무

의사결정나무의 구성

  1. 뿌리마디
  2. 중간마디 : 뿌리 마디에서 나온 각 나무줄기 중간에 있는 마디
  3. 끝 마디 : 각 나무줄기 끝에 위치한 마디. 자식이 없다.
  4. 자식 마디 : 하나의 마디로부터 분리된 2개 이상의 마디
  5. 부모 마디 : 자식 마디의 상위 마디
  6. 가지 : 하나의 마디로부터 끝 마디까지 연결된 마디들
  7. 깊이 : 가장 긴 가지의 크기

정보이론

순도가 증가하고, 불확실성이 감소하는 것을 정보획득이라고 함.

대표적 알고리즘

  1. CART
    • 불순도 측도로 범주형이면 지니지수, 연속형이면 분산의 감소를 이용한 이진분리.
  2. 랜덤 포레스트
    • 부트스트래핑 : 랜덤 샘플링으로 크기가 동일한 여러개의 표본자료를 생성

    • 배깅 : 여러 부트스트랩 자료를 생성해 학습하는 모델링, 분류기를 생성한 후 그 결과를 앙상블

      추츨한 각 샘플별 모델링 학습 뒤 결과를 집계, 최종결과를 만드는 방식.

      범주형이면 다수결 투표, 연속형이면 평균으로 결과를 집계

    • 부스팅 : 가중치를 활용하여 약분류기를 강분류기로 만드는 방법

신경망

인공신경망의 원리

  • 층간연결 : 서로 다른 층에 존재하는 뉴런과 연결
  • 층내연결 : 동일 층 내의 뉴런과의 연결
  • 순환연결 : 어떠한 뉴런의 출력이 자기 자신에게 입력되는 연결
  • 기존 신경망과 달리 활성화함수의 차이가 있음.

손실함수

  1. 손실함수 : 출력값과 실제값의 차이
    1. 손실함수의 최소화를 위해 가중치와 편향을 찾는다.
    2. 대표적인 손실함수가 바로 평균제곱오차와 교차엔트로피 오차
  2. 평균제곱오차 (MSE)
  3. 교차엔트로피 오차 : 분류 부문으로 t값이 원-핫 인코딩 벡터. 출력값에 자연로그를 적용해 곱한다.

학습 알고리즘

  1. 미니배치
  2. 기울기 산출
  3. 매개변수 갱신

오차역전파

가중치 매개변수의 기울기를 미분을 통해 진행하면 시간이 너무 많이 소모.

따라서 연쇄법칙을 이용해 가중치와 편향을 계산해 업데이트하는 기법을 오차역전파라고 한다.

신경망의 대표모델

오토인코더

  • 생성모델과 분류모델로 나뉨.

SVM

주요 요소

  1. 벡터
  2. 결정영역 : 직선
  3. 초평면
  4. 서포트벡터
  5. 마진

핵심적 특징

마진이 가장 큰 초평면을 분류기라고 한다.

초평면의 마진 = 2/|w| (일종의 거리)

군집분석

군집분석의 척도

  • 제곱합에 루트를 씌우면 유클리드 거리
  • 절댓값이 있으면 맨해튼 거리
  • 민코프스키 거리 = 둘을 모두 포괄