외어야 할 것 위주로 정리! 책에 없는 내용도 문제로 나오는 듯하다.
정보의 특징
- 정확성, 적시성, 적당성, 관련성
데이터의 유형
- 정형 : 구조가 엄격히 정해진 데이터. 연산 가능.
- 반정형 : 구조가 느슨히 정해진 데이터. 연산 안됨. 스키마 존재. (XML, JSON, HTML)
- 비정형 : 구조가 정해지지 않은 데이터.
- 가역 : 환원이 가능한 데이터. ex) 데이터 웨어하우스
- 비가역 : 환원이 불가능한 데이터. ex) 데이터 전처리
- 암묵지 : 경험 등을 통해 체계화된 지식.
- 형식지 : 형상화된 유형의 지식.
지식창조 메커니즘
- 암묵지 → 형식지 → 암묵지의 반복 과정이라고 생각.
- 공통화, 표출화, 연결화, 내면화
- 공통화 : 서로 간의 암묵지 공유 및 발전.
- 표출화 : 암묵지를 형식지로
- 연결화 : 형식지를 재분류
- 내면화 : 형식지를 다시 암묵지로
데이터베이스
종류 : 관계형, 객체지향, 네트워크, 계층형
- 관계형 = 데이터프레임. 엑셀 같은 모양
- 객체지향 = 객체 형태로 표현
- 네트워크 = 그래프 구조
- 계층형 = 트리 구조
OLTP(OnLine Transaction Processing) : 호스트와 여러 단말 간 실시간으로 DB를 갱신하는 프로세스.
OLAP(OnLine Analytical Processing) : OLTP로 처리된 트랜잭션 데이터를 조회 및 분석.
데이터 웨어하우스
특징 : 주제지향성, 통합성, 시계열성, 비휘발성
구성요소 : 데이터 모델, ETL, ODS, 데이터 마이닝, DW 메타데이터, OLAP, 분석도구, 경영기반 솔루션
- ETL : 데이터 추출, 정제, 가공해 데이터 웨어하우스에 적재
- ODS : 다양한 DB 시스템에서 추출한 데이터를 통합적으로 관리
빅데이터
빅데이터의 등장과 변화
- 빅데이터의 3V (5V) : 규모(volume), 유형(variety), 속도(velocity) + 품질, 가치
- 사전처리에서 사후처리
- 표본조사에서 전수조사로 확대 : 샘플링으로 확인 못하는 패턴 발견
- 데이터의 질보다 데이터의 양
- 이론적 인과관계에서 단순한 상관관계로
빅데이터의 활용 3요소 : 자원, 기술, 인력
데이터 산업의 구조 : 인프라 & 서비스
빅데이터 분석용 조직의 구조
- 집중형, 기능형, 분산형
- DSCoE : 분석 전담 조직
- 집중형
- 분석업무를 별도의 조직에서 수행.
- 내부에서 분석과제들의 우선순위를 정함.
- 현업부서와 업무 중복 가능성 존재.
- 기능형
- 분석업무를 각 현업 부서에서 수행.
- 전사적 관점에서 전략적 핵심 분석이 어려움.
- 협소한 분석을 할 가능성이 높아짐.
- 분산형
- 분산 전문 인력을 현업 부서에 배치해 분석 업무 수행
- 전사 차원에서 분석과제의 우선수위를 정하고 수행.
- 분석 결과를 현업에 빠르게 적용 가능