702 단어
4 분
데이터마이닝
2026-07-24
태그 없음

핵심 정리 (지도 vs 비지도)#

구분지도학습비지도학습
목표변수(Label)있음없음
주요 목적분류·예측(회귀 포함)군집·연관관계·구조/패턴 발견
대표 기법의사결정나무, 회귀(선형/로지스틱, GLM), 신경망, kNN, 사례기반추론군집분석, 연관성 규칙, SOM, OLAP(탐색/조회)

기법별 포인트#

  • kNN: 이웃의 _정답(레이블)_을 이용 → 지도학습
  • SOM: 정답 없이 유사성으로 군집/시각화 → 비지도학습
  • OLAP: ML 알고리즘이라기보다 다차원 데이터 탐색/조회 방식(시험에서 비지도와 함께 제시되기도 함)

데이터 마이닝 추진단계#

  1. 목적 설정(문제 정의)
    • 무엇을 예측/분류/군집할지, 성공 기준(정확도·재현율·ROI 등), 범위/제약을 확정
  2. 데이터 준비(수집·통합·이해)
    • 데이터 소스 확보, 조인/통합, 품질(결측·오류·중복) 점검, 기초 탐색(EDA)
  3. 데이터 가공(전처리·변환·특성 생성)
    • 정제, 결측/이상치 처리, 스케일링, 인코딩, 파생변수 생성, 학습/검증 데이터 분할
  4. 기법 적용(모델링/패턴 발견)
    • 목적에 맞는 기법 선택(분류·회귀·군집·연관규칙 등) 후 학습/튜닝
  5. 검증(평가·해석·개선)
    • 성능평가(교차검증, 테스트셋), 과적합 점검, 결과 해석/리포트, 필요 시 단계 반복(피드백 루프)

데이터 마이닝을 위한 데이터 분할#

데이터를 학습용, 검증용, 평가용으로 나누어 모델의 일반화 성능을 확인하는 방법이다. 보통 Train:Validation:Test=5:3:2\text{Train} : \text{Validation} : \text{Test} = 5 : 3 : 2 로 분할한다.

1. 학습용 데이터(Train)#

모델 학습에 사용.

2. 검증용 데이터(Validation)#

모델/하이퍼파라미터 선택, 과적합 확인.

3. 평가용 데이터(Test)#

최종 성능 평가(학습·선택에는 미사용).

데이터의 양이 충분하지 않거나 입력변수에 대한 설명이 충분한 경우#

방법설명장점단점
홀드아웃(Hold-out)데이터를 한 번만 학습용·평가용으로 분할간단, 계산 빠름데이터가 적으면 성능 평가가 불안정
k-fold 교차검증kk개 fold로 나누어 kk번 학습·검증 (fold 크기 =n/k= n/k)평가가 안정적, 데이터 활용도 높음계산량 증가
LOOCV (Leave-One-Out)데이터 1개만 검증용으로 사용, k=nk = n번 반복데이터 활용도 최대계산량 매우 큼
데이터마이닝
https://fuwari.vercel.app/posts/데이터마이닝/
저자
Argon
게시일
2026-07-24
라이선스
CC BY-NC-SA 4.0