1과목
- 2번 : (CRISP-DM 방법) 비즈니스 이해 → 데이터 이해 → 데이터 준비 → 모델링 → 평가 → 전개
- 4번 : (하둡으로 전환) 적합한 직무 : 데이터 엔지니어
- 5번 : (개인정보 비식별화) 데이터 범주화 = 개인정보를 대표 값이나 구간으로 변환
- 7번 : (데이터 3법) 가명처리 후 활용 시, 정보주체의 동의 없이 활용 가능
- 9번 : (총계처리의 특징) 총계처리는 비식별화가 가능하다.
- 10번 : (자료수집 방법) FGI (focus group interview) : 전문가의 설문조사 후 온-오프라인 면담.
- 11번 : (데이터 수집 기술) FTP = 시스템 간 파일 공유 기술
- 14번 : (빅데이터 플랫폼 계층) 플랫폼 레이어 = 데이터 & 자원 할당관리, 빅데이터 앱 실행을 위한 서비스 제공
- 15번 : (병렬 DBMS 특성) 데이터 중복 저장이 아니다.
2과목
- 23번 : (공분산) 독립이면 → 공분산 0. 공분산 0 이면 독립인지 모른다.
- 24번 : 대응표본 단측 검정 : 약의 투약 전후 → 대응표본
- 단일표본, 독립표본, 대응표본
- 28번 : (변수변환) 왼쪽 → 양의 왜도 → 로그, 제곱근, 역수
- 29번 : (전처리기법) 클래스 불균형 처리 : 분류문제에서 하나의 클래스보다 다른 클래스가 훨씬 더 많은 경우
- 31번 : (사분위수) 제1사분위 : 하위 25백분위
- 32번 : (표본분포) 표본의 크기에 따라 표본평균의 기댓값은 모평균과 동일하지 않을 수도 있다.
- 불편성의 개념 → 표본이 클 때 성립한다.
- 33번 : (인코딩) 타깃 인코딩 = 종속변수 값들의 평균을 활용
- 34번 : (다중공선성) 상관계수가 높은 변수를 제거해야 한다.
- 37번 : (변수의 종류) 범주형은 평균, 표준편차를 구하기 힘들다.
- 40번 : (상자그림) 모든 바깥쪽 데이터가 이상치는 아니다.
3과목
- 41번 : (과적합 방지) 드롭아웃, 데이터 증강
- 42번 : (단어의 벡터화) POS-tagging은 전처리 기법!
- 43번 : (k-fold) 데이터셋 중 하나만 검증셋.
- 47번 : (과적합 방지) 가지치기 = 신경망이 아닌 의사결정나무
- 50번 : (연관규칙 척도) 신뢰도
- 51번 : (생존률)
- 52번 : (비모수) 만-휘트니 : 비모수검정
- 53번 : (회귀) → [문제 잘못 봄]
- 56번 : (시계열) → 백색잡음 : 관측치 간 독립적이지 않음.
- 59번 : (변수척도에 따른 모형) 공분산분석 → 종속 : 연속형, 독립 : 범주형
- 60번 : (머신러닝 산출물) “알고리즘 보완 계획서” 산출물에 없다.
4과목
- 61번 : (모델 평가기준) “표본의 충분성”이 고려사항이 아니다.
- 62번 : (ROC 곡선) 민감도, 특이도 → ROC 곡선을 이루는 지표
- 63번 : (ROC 곡선) Roc 곡선으로 혼동행렬을 구할 수 없다.
- 64번 : (스토리텔링) 스토리보드 도구 검증 → 스토리텔링 준비과정에서 불필요
- 69번 : (일반화 선형모형) 정규성 성립 안해도 가능.
- 70번 : (앙상블 모형) 직관적으로 이해하기 어렵다.
- 71번 : (비교시각화) 버블차트는 관계시각화
- 75번 : (앙상블 모형) 평가 데이터셋의 다양화 = 앙상블 모형의 베이스 모형들을 독립적 최적화시키는 것과는 상관이 없다.
- 78번 : (분석 모형의 해석) 분석 유형 = 설명, 진단, 예측, 처방
- 79번 : (빅데이터 시각화 절차) ‘정제’는 포함되어 있다. ‘지시’는 아니다.
- 80번 : (재현율) 재현율 = tp + (tp/fn)