1과목
- 2번 : 네트워크를 통해 공유하는 여러 호스트 컴퓨터의 데이터에 접근할 수 있는 파일 공유 방식 = FTP
- 6번 :
- 7번 : 분석 준비도의 구성 : 분석업무, 분석 인력 및 조직, 분석 기법, 분석 데이터, 분석 문화, 분석 인프라
- 9번 : 데이터 전처리 = 데이터 준비 단계
- 11번 : 데이터 거버넌스의 구성요소 = 원칙, 조직, 프로세스
- 12번 : 데이터 산업을 통해 Human to Human 상호작용이 높아지지는 않는다.
- 13번 : 빅데이터 플랫폼 : 소프트웨어 계층, 플랫폼 계층, 인프라 계층
- 16번 : 데이터 분석조직 → 기능형, 집중형, 분산형. 분산형은 DSCoE가 있음.
- 17번 : 데이터를 추출해서 저장하는 기술 : ETL
- 19번 : 이기종 데이터 저장 장치를 하나의 데이터 서버에 연결~~ : 네트워크 파일 시스템. 분산 파일 시스템이 아니다
- 20번 : 데이터 중복의 최소화 = 관계형 DBMS의 특징
2과목
- 22번 : 표본분산 계산법
- 23번 : 최대-최소 정규화는 다음과 같이 계산
\frac{data - min}{max - min}
- 24번 : 노이즈 제거법 → 평활화, 정규화, 이동평균
- 25번 : 독립변수 * 3 + 1 (절편 : b0)
- 26번 : 원-핫 인코딩
- 35번 : 3분위 - 1분위 = IQR
- 37번 : 완전 삭제법는 데이터의 손실을 불러옴. 따라서 결측치 대체로 쓰면 안됨.
3과목
- 41번 : GRU = 업데이트 게이트와 리셋 게이트를 사용해 장기 의존성 문제 해결
- 48번 : 다중선형회귀는 MSE를 이용해 평가지표에 활용
- 49번 : 랜덤포레스트는 배깅을 사용한다.
- 52번 : (시계열분석) 종단면의 변수들은 종속이다. 지수평활법은 최근값에 더 높은 가중치 부여.
- 53번 : (인과분석) casual discovery는 모두 데이터 칼럼을 X로 정의하고 시작.
- 57번 : (회귀분석 구축절차) → 독립/종속변수 설정, 회귀계수 추정, 변수 유의성검정, 모형 유의성검정
- 59번 : (부스팅의 특징) 동시 병렬적으로 학습 = 배깅
4과목
- 61번 : (SVM 최적화) Leave-One-Out 교차검증 = 두 명의 분석가의 분석결과를 동일하게 하기 위한 방법
- 64번 : (군집화 알고리즘) 군집 수 지정 안해도 됨 = DBSCAN
- 66번 : (인포그래픽) 주제 및 내용의 연관성이 중요 = 콘셉트 맵
- 69번 : (ROC 곡선) 로지스틱 회귀모형 추정에 쓰지 않음. 분류모형에 씀.
- 71번 : (분석모형 만들기) 학습하는 과정의 분류 횟수는 정해져 있지 않음.
- 72번 : (k-fold 교차검증) k-1개를 학습 데이터셋, 1개를 검증 데이터셋
- 73번 : (회귀분석 결과해석) 오차범위가 적을수록 y에 영향을 미친다.
- 오차범위가 큰 “효과성”은 서비스 만족도에 영향을 미치지 않는다.
- 74번 : (데이터 분할방법) stratified 방법 : 교차검증에 씀. 분할방법이 아니다.
- 77번 : (배깅) 모델의 분산은 줄인다. 모델의 편향은 줄이지 않는다.
- 78번 : (데이터 시각화) 인포그래픽을 위해서 시각화 소프트웨어를 설치할 필요는 없다.
- 79번 : (매개변수, 초매개변수) 매개변수는 학습의 결과로 조정, 초매개변수는 사람이 직접 조정.