702 단어
4 분
데이터마이닝
핵심 정리 (지도 vs 비지도)
| 구분 | 지도학습 | 비지도학습 |
|---|---|---|
| 목표변수(Label) | 있음 | 없음 |
| 주요 목적 | 분류·예측(회귀 포함) | 군집·연관관계·구조/패턴 발견 |
| 대표 기법 | 의사결정나무, 회귀(선형/로지스틱, GLM), 신경망, kNN, 사례기반추론 | 군집분석, 연관성 규칙, SOM, OLAP(탐색/조회) |
기법별 포인트
- kNN: 이웃의 _정답(레이블)_을 이용 → 지도학습
- SOM: 정답 없이 유사성으로 군집/시각화 → 비지도학습
- OLAP: ML 알고리즘이라기보다 다차원 데이터 탐색/조회 방식(시험에서 비지도와 함께 제시되기도 함)
데이터 마이닝 추진단계
- 목적 설정(문제 정의)
- 무엇을 예측/분류/군집할지, 성공 기준(정확도·재현율·ROI 등), 범위/제약을 확정
- 데이터 준비(수집·통합·이해)
- 데이터 소스 확보, 조인/통합, 품질(결측·오류·중복) 점검, 기초 탐색(EDA)
- 데이터 가공(전처리·변환·특성 생성)
- 정제, 결측/이상치 처리, 스케일링, 인코딩, 파생변수 생성, 학습/검증 데이터 분할
- 기법 적용(모델링/패턴 발견)
- 목적에 맞는 기법 선택(분류·회귀·군집·연관규칙 등) 후 학습/튜닝
- 검증(평가·해석·개선)
- 성능평가(교차검증, 테스트셋), 과적합 점검, 결과 해석/리포트, 필요 시 단계 반복(피드백 루프)
데이터 마이닝을 위한 데이터 분할
데이터를 학습용, 검증용, 평가용으로 나누어 모델의 일반화 성능을 확인하는 방법이다. 보통 로 분할한다.
1. 학습용 데이터(Train)
모델 학습에 사용.
2. 검증용 데이터(Validation)
모델/하이퍼파라미터 선택, 과적합 확인.
3. 평가용 데이터(Test)
최종 성능 평가(학습·선택에는 미사용).
데이터의 양이 충분하지 않거나 입력변수에 대한 설명이 충분한 경우
| 방법 | 설명 | 장점 | 단점 |
|---|---|---|---|
| 홀드아웃(Hold-out) | 데이터를 한 번만 학습용·평가용으로 분할 | 간단, 계산 빠름 | 데이터가 적으면 성능 평가가 불안정 |
| k-fold 교차검증 | 개 fold로 나누어 번 학습·검증 (fold 크기 ) | 평가가 안정적, 데이터 활용도 높음 | 계산량 증가 |
| LOOCV (Leave-One-Out) | 데이터 1개만 검증용으로 사용, 번 반복 | 데이터 활용도 최대 | 계산량 매우 큼 |