출제확률 💯 99% · ⭐ 80% · 🔥 50% · 🤔 20% | ❗ = 기출 포인트 | 🥔 = 암기법 | 🚫 = 기출 함정 | 📗 = 예시/공식 이 과목 예상 출제 범위 — 이 페이지는 4과목 3장(정형 데이터마이닝) + 4장(비정형 데이터마이닝) 담당. 💯 의사결정나무·앙상블·연관규칙 / ⭐ 지니/엔트로피·성과지표·K-means·군집분석 / 🔥 신경망·텍스트마이닝
제3장 정형 데이터마이닝
1) 데이터마이닝 정의 · 프로세스 ⭐
데이터마이닝 ❗ : 대용량 데이터에서 겉으로 드러나지 않던 패턴이나 규칙을 발견하여 의사결정에 활용하는 것. 통계·인공지능·기계학습이 결합된 기술
🥔 프로세스 외우는법! 목데가기검 — 목적설정 → 데이터 준비 → 데이터 가공 → 기법 적용 → 검증
2) 분석 목적 · 지도/비지도 학습 ⭐
분석 목적 2가지 ❗ : 예측(분류 포함) / 설명(연관규칙, 군집화 등)
| 구분 | 기법 |
|---|---|
| 지도학습 ❗(목표변수 O) | 의사결정나무, 인공신경망, 일반화선형모형, 선형회귀분석, 로지스틱회귀분석, 사례기반추론(CBR), k-최근접이웃(k-NN) |
| 비지도학습 ❗(목표변수 X) | OLAP, 연관성규칙, 군집분석, SOM |
3) 성과 평가 지표 💯
혼동행렬(Confusion Matrix) 기반 지표 ❗
| 지표 | 공식 | 의미 |
|---|---|---|
| 정분류율(Accuracy) ❗ | (TP+TN)/전체 | 전체 중 올바르게 분류한 비율 |
| 민감도(Sensitivity)=재현율(Recall) ❗ | TP/(TP+FN) | 실제 양성 중 양성으로 맞힌 비율 |
| 특이도(Specificity) ❗ | TN/(TN+FP) | 실제 음성 중 음성으로 맞힌 비율 |
| 정밀도(Precision) ❗ | TP/(TP+FP) | 양성으로 예측한 것 중 실제 양성 비율 |
| F1-score ❗ | 2×(Precision×Recall)/(Precision+Recall) | 정밀도와 재현율의 조화평균 |
📗 예시: TP=40, FN=10, FP=5, TN=45 일 때 → 정분류율=(40+45)/100=0.85, 민감도=40/50=0.8, 특이도=45/50=0.9, 정밀도=40/45≈0.89, F1≈(2×0.89×0.8)/(0.89+0.8)≈0.84
AUROC ❗ : ROC곡선(가로축=1-특이도, 세로축=민감도) 하단 면적. 1에 가까울수록 모형 성능이 좋음(0.5=무작위 분류와 동일)
Lift Chart ❗ : 모형을 사용했을 때 나타나는 **향상도(Lift)**를 무작위 추출 결과와 비교 — 상위 %를 선별했을 때 모형이 얼마나 향상된 적중률을 보이는지 시각화
4) 데이터 분할 검증 방법 ⭐
| 방법 | 키워드 |
|---|---|
| 홀드아웃(Holdout) ❗ | 데이터를 학습·검증(·테스트)용으로 한 번만 분할 |
| k-Fold Cross Validation ❗ | 데이터를 k개 폴드로 분할해 하나를 검증용으로, 나머지를 학습용으로 k번 반복(모든 데이터가 한 번씩 검증에 사용) |
| 붓스트랩(Bootstrap) ❗ | 데이터에서 **복원추출(중복 허용)**로 여러 표본을 만들어 모형 평가 |
5) 최대우도추정(MLE) 🔥
우도(Likelihood) ❗ : 관측된 데이터가 주어진 모수(파라미터) 하에서 발생할 확률(가능성) / 최대우도추정 ❗ : 관측된 데이터가 나오도록 하는 모수의 값을 찾는 추정 방법(우도함수를 최대화하는 파라미터 추정)
6) 의사결정나무 💯
의사결정나무 ❗ : 분류나무(범주형 목표변수) + 회귀나무(연속형 목표변수). 활용: 세분화, 분류, 예측, 차원축소·변수선택, 교호작용 효과 파악
| 구분 | 내용 |
|---|---|
| 장점 ❗ | 계산이 빠름, 상관성 높은 다른 변수가 있어도 영향 안 받음, 해석 용이해 정확도 높음 |
| 단점 ❗ | 과대적합 가능, 경계선 부근 자료 오차 발생 가능, 변수 중요도 판단 어려움 |
분할 기준(불순도 측도) ❗ : 분류나무에는 지니지수와 엔트로피가 주로 사용
| 측도 | 공식 | 해석 |
|---|---|---|
| 지니지수(Gini) ❗ | 1-Σpᵢ² | 0(완전 순수)~0.5(이진분류 최대 불순도), 값이 작을수록 좋은 분할 |
| 엔트로피(Entropy) ❗ | -Σpᵢlog₂pᵢ | 0(완전 순수)~1(이진분류 최대 불순도), 값이 작을수록 좋은 분할 |
📗 예시: 전체 10개 중 Y=0이 4개, Y=1이 6개이면 → 지니지수 = 1-(0.4²+0.6²) = 1-0.52 = 0.48 / 엔트로피 = -(0.4×log₂0.4+0.6×log₂0.6) ≈ 0.97
7) 나이브베이즈 · KNN · SVM 🔥
| 기법 | 정의 |
|---|---|
| 베이즈 정리 ❗ | 사전확률과 새로운 증거로 사후확률을 갱신하는 확률 공식 |
| 나이브베이즈 분류 ❗ | 모든 변수가 서로 독립이라고 가정(단순화)하고 베이즈 정리로 분류. 텍스트 분류·스팸 필터링에 많이 활용 |
| K-NN ❗ | 새 관측치와 가장 가까운 K개 이웃의 다수결(또는 평균)으로 예측. 별도 학습 과정 없음(게으른 학습) |
| SVM ❗ | 두 부류 간 마진(margin)을 최대화하는 초평면(경계)을 찾는 기법. 고차원에서도 성능 좋음 |
8) 앙상블 기법 💯
| 구분 | 키워드 |
|---|---|
| 배깅(Bagging) ❗ | 원본 데이터에서 부트스트랩으로 여러 표본 생성 → 병렬로 학습 → 투표/평균으로 결합. 분산 감소(과적합 방지) |
| 부스팅(Boosting) ❗ | 순차적으로 모델을 학습하며 이전 모델이 틀린 사례에 가중치를 부여해 다음 모델이 보완. 편향(오차) 감소, 과적합 위험 상대적으로 높음 |
RF vs GBM 장단점
| 알고리즘 | 장점 | 단점 |
|---|---|---|
| 랜덤포레스트(RF) ❗ | 배깅+변수 무작위 선택으로 과적합 방지, 안정적·병렬처리 용이 | 모델 해석력(블랙박스화) 낮음 |
| GBM(Gradient Boosting) ❗ | 부스팅 기반으로 예측 정확도 매우 높음 | 순차 학습으로 학습 속도 느림, 과적합 위험 |
9) K-means 군집분석 ⭐
K-means ❗ : 비계층적 군집분석. 연속형 변수에 주로 활용, 초기 중심값을 임의(무작위)로 선택한 뒤 중심을 반복 갱신하는 탐욕적(Greedy) 알고리즘
| 구분 | 키워드 |
|---|---|
| 장점 | 알고리즘이 간단하고 빠름, 대용량 데이터에 적합 |
| 단점 ❗ | 군집 개수(k)를 사전에 지정해야 함, 초기값에 따라 결과가 달라짐(지역 최적해 가능성), 이상치에 민감 |
10) SOM(자기조직화지도) 🔥
SOM ❗ : 고차원 입력을 **저차원(보통 2차원) 격자에 사상(투영)**시키는 비지도 신경망. **입력층 + 경쟁층(출력층)**으로 구성되며, 객체간 유사성을 보존하며 군집화
| 구분 | 키워드 |
|---|---|
| 일반 신경망과 차이 ❗ | 일반 신경망은 역전파(지도학습) 사용 vs SOM은 **경쟁학습(비지도)**로 승자(BMU) 주변만 가중치 갱신 |
| 특징 | 고차원 데이터의 시각화에 유리, 차원 축소 공간이 입력 데이터의 위상(토폴로지)을 유지 |
11) 계층적 · 분할적 군집화 · DBSCAN ⭐
| 군집화 | 키워드 |
|---|---|
| 계층적 군집화 ❗ | 개별 개체를 하나씩 **병합(응집적) 또는 분할(분할적)**하며 덴드로그램 형태로 표현. 군집 수를 미리 정하지 않아도 됨 |
| 분할적 군집화 ❗ | K-means처럼 전체를 몇 개의 군집으로 한 번에 분할, 군집 수(k)를 미리 지정해야 함 |
| DBSCAN ❗ | 밀도(density) 기반 군집화. 임의 모양의 군집을 찾을 수 있고 군집 수를 미리 정하지 않아도 됨, 밀도 낮은 점은 노이즈(이상치)로 별도 식별 가능 |
12) 연관규칙 💯
연관규칙 ❗ : 항목들 간의 “if A then B” 형태의 관계를 발견(장바구니 분석 대표적)
| 지표 | 공식 |
|---|---|
| 지지도(Support) ❗ | P(A∩B) |
| 신뢰도(Confidence) ❗ | P(A∩B)/P(A) — A를 살 때 B도 살 조건부 확률 |
| 향상도(Lift) ❗ | P(A∩B)/(P(A)×P(B)) — 독립 가정 대비 연관성 정도(1보다 크면 양의 상관) |
장단점
| 장점 | 단점 |
|---|---|
| 계산 간단, 직관적으로 이해 쉬움 | 품목(아이템) 수 늘어나면 계산량 급증(지수적 증가) |
| 조건부(if-then) 규칙으로 해석 용이 | 드물게(희귀) 아이템은 지지도가 낮아서 규칙 누락 가능 |
제4장 비정형 데이터마이닝
1) 딥러닝 모델 🔥
| 모델 | 키워드 |
|---|---|
| DNN(심층신경망) ❗ | 은닉층이 2개 이상인 인공신경망 |
| CNN(합성곱신경망) ❗ | 합성곱층+풀링층으로 공간적 특징 추출, 이미지 처리에 특화 |
| RNN(순환신경망) ❗ | 은닉층의 출력이 다시 자신에게 입력되어 순서·시계열 데이터 처리에 적합 |
| GAN(생성적 적대신경망) ❗ | **생성자(Generator)와 판별자(Discriminator)**가 경쟁하며 학습, 새로운 데이터 생성 |
| RBM(제한 볼츠만 머신) ❗ | 가시층·은닉층 간 양방향 연결, 같은 층 내 연결 없음(제한적), 비지도 사전학습에 활용 |
| DBN(심층신뢰망) ❗ | RBM을 여러 층 쌓아 구성, 층별로 사전학습 후 미세조정 |
2) 활성화함수 🔥
| 함수 | 특징 |
|---|---|
| 시그모이드 | 0~1 출력, 양종말 기울기 소멸(vanishing gradient) 문제 |
| tanh | -1~1 출력, 시그모이드보다 나으나 여전히 기울기 소멸 있음 |
| ReLU ❗ | 0 이하는 0, 양수는 그대로 출력. 계산 간단·기울기 소멸 완화로 딥러닝에서 가장 많이 사용 |
| Softmax | 다중 분류 출력층에서 확률값으로 변환(합=1) |
3) 텍스트 마이닝 🔥
텍스트 마이닝 ❗ : 비정형 텍스트 데이터에서 의미 있는 정보를 추출하는 기법(자연어처리(NLP) 기반)
Corpus(말뭉치) ❗ : 더 이상 추가 절차 없이 데이터마이닝 알고리즘에 바로 활용할 수 있는 상태로 정제된 텍스트 모음
텍스트 전처리 과정 ❗
| 순서 | 단계 | 내용 |
|---|---|---|
| ① | 토큰화(Tokenization) | 문장·단어 단위로 분할 |
| ② | 불용어 처리 | 의미 없는 조사·관사 등 제거 |
| ③ | 대소문자 통일 | 대문자/소문자 하나로 통일 |
| ④ | 어근 추출(Stemming/Lemmatization) | 단어를 **원형(어근)**으로 환원 |
| ⑤ | 텍스트 인코딩 | 문자를 컴퓨터가 처리할 수 있는 수치(벡터)로 변환(예: BoW, TF-IDF) |
🥔 순서 외우는법! 토불대어인 — 토큰화 → 불용어처리 → 대소문자통일 → 어근추출 → 인코딩
4) 사회연결망 분석(SNA) 🔥
사회연결망분석 ❗ : 개체(노드)들 간의 **관계(연결)**를 분석해 네트워크의 구조와 패턴, 영향력을 파악하는 기법
| 구분 | 내용 |
|---|---|
| 표현 방식 ❗ | 그래프(노드+링크) 또는 행렬(인접행렬) 형태로 표현 |
| 구조 파악 기법 ❗ | 연결정도(Degree) 중심성(연결 수), 근접중심성(Closeness)(다른 노드와의 거리), 매개중심성(Betweenness)(중개자 역할 정도), 고유벡터중심성(Eigenvector)(영향력 큰 노드와의 연결 가중치) |
🥔 복습 체크리스트 (☐에 체크하며 회독)
- 1) 데이터마이닝 정의 · 목데가기검 프로세스 ⭐
- 2) 지도학습 7종 · 비지도학습 4종 · 예측 vs 설명 ⭐
- 3) 혼동행렬 5지표(정분류율·민감도·특이도·정밀도·F1) 계산 · AUROC · Lift Chart 💯 ❗
- 4) 홀드아웃 · k-Fold CV · 붓스트랩 ⭐
- 5) 우도 정의 · 최대우도추정(MLE) 🔥
- 6) 의사결정나무 활용분야 · 장단점 · 지니지수/엔트로피 공식+계산 💯 ❗
- 7) 베이즈정리 · 나이브베이즈 · KNN · SVM 🔥
- 8) 배깅 vs 부스팅 · RF vs GBM 장단점 💯 ❗
- 9) K-means 연속형·임의초기값·탐욕적 · 장단점 ⭐ ❗
- 10) SOM 구성(입력층+경쟁층) · 일반신경망과 차이(역전파 X) 🔥
- 11) 계층적 vs 분할적 군집화 · DBSCAN(밀도기반) ⭐
- 12) 지지도·신뢰도·향상도 공식 · 장단점 💯 ❗
- 13) DNN·CNN·RNN·GAN·RBM·DBN 구분 🔥
- 14) 활성화함수(시그모이드·tanh·ReLU·Softmax) 🔥
- 15) 텍스트마이닝 Corpus 정의 · 전처리 5단계(토불대어인) 🔥
- 16) SNA 표현방식(그래프/행렬) · 중심성 지표 4종 🔥