열렬히.뛰기

1. 한눈에 보는 머신러닝 (개념)

머신러닝 & 딥러닝 > 핸즈온 머신러닝 2 > 1. 한눈에 보는 머신러닝 (개념)

머신러닝이란?

  • 명시적인 프로그래밍 없이 컴퓨터가 학습하는 능력을 갖추게 하는 연구분야
  • ex. 스팸 메일
    • 시스템이 학습할 때 사용하는 샘플 : 훈련세트
    • 각 훈련데이터: 훈련 사례

왜 머신러닝인가?

  • 작업의 자동화
  • 전통적인 방식으로 해결할 수 없는 부분을 해결 (ex. 음성인식)
  • 데이터 마이닝 → 머신러닝 알고리즘의 찾은 패턴을 분석

애플리케이션 사례

  • 이미지 분류 작업

  • 상품 추천

  • 지능형 봇 만들기

  • 요약하기

  • 자동 뉴스 기사 분류

  • 음성 인식

  • 부정 거래 감지

  • 마케팅 전략 기획

시스템의 종류

  • 사람의 감독하에서 훈련하는지 아닌지 (지도, 비지도, 준지도, 강화학습)
  • 실시간으로 점진적 학습을 하는지 안하는지 (온라인 학습 vs 배치학습)
  • 데이터 포인트 vs 패턴 발견 (사례 기반 학습 vs 모델 기반 학습)

1. 지도 vs 비지도

지도학습

훈련 데이터에 레이블을 걸어놓음.

  • k-최근접 이웃
  • 선형회귀
  • 로지스틱 회귀
  • 서포트 벡터 머신
  • 결정트리와 랜덤 포레스트
  • 신경망 (일부)

비지도학습

레이블 없음. 시스템이 인간 도움 없이 학습.

  • 군집
    • K-평균
    • DBSCAN
    • 계층 군집 분석
    • 이상치 탐지 & 특이치 탐지
    • 원-클래스
    • 아이솔레이션 포레스트
  • 시각화와 차원축소
    • 주성분 분석
    • 커널 PCA
    • 지역적 선형 임베딩
    • t-SNE
  • 연관 규칙 학습
    • Apriori
    • Eclat

준지도 학습

데이터 중 일부에만 레이블이 있는 경우

  • 심층 신뢰 신경망: 여러 겹으로 쌓은 ‘제한된 볼츠만 머신’에 기초

강화학습

학습하는 시스템(에이전트)가 환경을 관찰해서 행동을 실행하고 그 결과로 보상을 받는 시스템. 정책이라고 부르는 최상의 전략을 스스로 학습.

2. 배치 vs 온라인

배치 학습

가용한 데이터를 모두 사용해 훈련. 즉 학습한 것을 단지 적용함.

온라인 학습 (점진적 학습)

미니배치라고 부르는 작은 묶음 단위로 주입하여 시스템을 훈련.

3. 사례 기반 vs 모델 기반

일반화를 위한 접근법을 놓고 비교해보기

사례 기반 학습

시스템이 훈련 샘플을 기억함으로써 학습함. 그리고 유사도 측정을 통해 새로운 데이터와 학습한 샘플을 비교하는 식으로 일반화.

모델 기반 학습

샘플들의 모델을 만들어서 예측에 사용하는 것. (= 회귀분석)

y = \theta_{0} + \theta_{1} \cdot x

  • 먼저 \theta_{0}\theta_{1}을 측정해야 한다.
    • 모델이 얼마나 좋은지 측정하는 효용함수
    • 모델이 얼마나 나쁜지 측정하는 비용함수
  • 파라미터를 찾아낸다.

머신러닝의 주요 과제

  1. 불충분한 훈련 데이터량

    • 아직 충분한 데이터가 없으면 제대로 결과가 나오지 않음.
  2. 대표성 없는 훈련 데이터

    • sampling noise, sampling bias에 관한 문제
  3. 낮은 품질의 데이터

    • 데이터 전처리가 필요한 이유
  4. 관련 없는 특성

    • 좋은 특성이 필요한 이유
  5. 훈련 데이터 과대적합

    샘플의 특성만 따라간 나머지, 일반화 과정에서 오류가 일어남.

    • 파라미터 수가 적은 모델을 선택하거나 모델에 제약을 가한다.
    • 훈련 데이터의 양을 늘린다.
    • 훈련 데이터의 잡음을 줄인다.
  6. 훈련 데이터 과소적합

    • 모델 파라미터가 더 많은 강력한 모델 선택
    • 학습 알고리즘에 더 좋은 특성을 제공
    • 모델의 제약을 줄임.

테스트와 검증

  • 훈련 데이터를 훈련 세트와 테스트 세트로 나누기
    • 훈련 세트 : 모델 훈련
    • 테스트 세트 : 테스트 훈련
    • 새 샘플에 대한 오답 비율 : 일반화 오차
  • 하이퍼파라미터 튜닝과 모델 선택