3157 단어
16 분
4과목-2 · 정형 · 비정형 데이터마이닝 — 압축 요약
2026-07-24
태그 없음

출제확률 💯 99% · ⭐ 80% · 🔥 50% · 🤔 20% | ❗ = 기출 포인트 | 🥔 = 암기법 | 🚫 = 기출 함정 | 📗 = 예시/공식 이 과목 예상 출제 범위 — 이 페이지는 4과목 3장(정형 데이터마이닝) + 4장(비정형 데이터마이닝) 담당. 💯 의사결정나무·앙상블·연관규칙 / ⭐ 지니/엔트로피·성과지표·K-means·군집분석 / 🔥 신경망·텍스트마이닝

제3장 정형 데이터마이닝#

1) 데이터마이닝 정의 · 프로세스 ⭐#

데이터마이닝 ❗ : 대용량 데이터에서 겉으로 드러나지 않던 패턴이나 규칙을 발견하여 의사결정에 활용하는 것. 통계·인공지능·기계학습이 결합된 기술

🥔 프로세스 외우는법! 목데가기검적설정 → 데이터 비 → 데이터 공 → 기법 용 →

2) 분석 목적 · 지도/비지도 학습 ⭐#

분석 목적 2가지 ❗ : 예측(분류 포함) / 설명(연관규칙, 군집화 등)

구분기법
지도학습 ❗(목표변수 O)의사결정나무, 인공신경망, 일반화선형모형, 선형회귀분석, 로지스틱회귀분석, 사례기반추론(CBR), k-최근접이웃(k-NN)
비지도학습 ❗(목표변수 X)OLAP, 연관성규칙, 군집분석, SOM

3) 성과 평가 지표 💯#

혼동행렬(Confusion Matrix) 기반 지표 ❗

지표공식의미
정분류율(Accuracy)(TP+TN)/전체전체 중 올바르게 분류한 비율
민감도(Sensitivity)=재현율(Recall)TP/(TP+FN)실제 양성 중 양성으로 맞힌 비율
특이도(Specificity)TN/(TN+FP)실제 음성 중 음성으로 맞힌 비율
정밀도(Precision)TP/(TP+FP)양성으로 예측한 것 중 실제 양성 비율
F1-score2×(Precision×Recall)/(Precision+Recall)정밀도와 재현율의 조화평균

📗 예시: TP=40, FN=10, FP=5, TN=45 일 때 → 정분류율=(40+45)/100=0.85, 민감도=40/50=0.8, 특이도=45/50=0.9, 정밀도=40/45≈0.89, F1≈(2×0.89×0.8)/(0.89+0.8)≈0.84

AUROC ❗ : ROC곡선(가로축=1-특이도, 세로축=민감도) 하단 면적. 1에 가까울수록 모형 성능이 좋음(0.5=무작위 분류와 동일)

Lift Chart ❗ : 모형을 사용했을 때 나타나는 **향상도(Lift)**를 무작위 추출 결과와 비교 — 상위 %를 선별했을 때 모형이 얼마나 향상된 적중률을 보이는지 시각화

4) 데이터 분할 검증 방법 ⭐#

방법키워드
홀드아웃(Holdout)데이터를 학습·검증(·테스트)용으로 한 번만 분할
k-Fold Cross Validation데이터를 k개 폴드로 분할해 하나를 검증용으로, 나머지를 학습용으로 k번 반복(모든 데이터가 한 번씩 검증에 사용)
붓스트랩(Bootstrap)데이터에서 **복원추출(중복 허용)**로 여러 표본을 만들어 모형 평가

5) 최대우도추정(MLE) 🔥#

우도(Likelihood) ❗ : 관측된 데이터가 주어진 모수(파라미터) 하에서 발생할 확률(가능성) / 최대우도추정 ❗ : 관측된 데이터가 나오도록 하는 모수의 값을 찾는 추정 방법(우도함수를 최대화하는 파라미터 추정)

6) 의사결정나무 💯#

의사결정나무 ❗ : 분류나무(범주형 목표변수) + 회귀나무(연속형 목표변수). 활용: 세분화, 분류, 예측, 차원축소·변수선택, 교호작용 효과 파악

구분내용
장점계산이 빠름, 상관성 높은 다른 변수가 있어도 영향 안 받음, 해석 용이해 정확도 높음
단점과대적합 가능, 경계선 부근 자료 오차 발생 가능, 변수 중요도 판단 어려움

분할 기준(불순도 측도) ❗ : 분류나무에는 지니지수엔트로피가 주로 사용

측도공식해석
지니지수(Gini)1-Σpᵢ²0(완전 순수)~0.5(이진분류 최대 불순도), 값이 작을수록 좋은 분할
엔트로피(Entropy)-Σpᵢlog₂pᵢ0(완전 순수)~1(이진분류 최대 불순도), 값이 작을수록 좋은 분할

📗 예시: 전체 10개 중 Y=0이 4개, Y=1이 6개이면 → 지니지수 = 1-(0.4²+0.6²) = 1-0.52 = 0.48 / 엔트로피 = -(0.4×log₂0.4+0.6×log₂0.6) ≈ 0.97

7) 나이브베이즈 · KNN · SVM 🔥#

기법정의
베이즈 정리사전확률과 새로운 증거로 사후확률을 갱신하는 확률 공식
나이브베이즈 분류모든 변수가 서로 독립이라고 가정(단순화)하고 베이즈 정리로 분류. 텍스트 분류·스팸 필터링에 많이 활용
K-NN새 관측치와 가장 가까운 K개 이웃의 다수결(또는 평균)으로 예측. 별도 학습 과정 없음(게으른 학습)
SVM두 부류 간 마진(margin)을 최대화하는 초평면(경계)을 찾는 기법. 고차원에서도 성능 좋음

8) 앙상블 기법 💯#

구분키워드
배깅(Bagging)원본 데이터에서 부트스트랩으로 여러 표본 생성 → 병렬로 학습 → 투표/평균으로 결합. 분산 감소(과적합 방지)
부스팅(Boosting)순차적으로 모델을 학습하며 이전 모델이 틀린 사례에 가중치를 부여해 다음 모델이 보완. 편향(오차) 감소, 과적합 위험 상대적으로 높음

RF vs GBM 장단점

알고리즘장점단점
랜덤포레스트(RF)배깅+변수 무작위 선택으로 과적합 방지, 안정적·병렬처리 용이모델 해석력(블랙박스화) 낮음
GBM(Gradient Boosting)부스팅 기반으로 예측 정확도 매우 높음순차 학습으로 학습 속도 느림, 과적합 위험

9) K-means 군집분석 ⭐#

K-means ❗ : 비계층적 군집분석. 연속형 변수에 주로 활용, 초기 중심값을 임의(무작위)로 선택한 뒤 중심을 반복 갱신하는 탐욕적(Greedy) 알고리즘

구분키워드
장점알고리즘이 간단하고 빠름, 대용량 데이터에 적합
단점 ❗군집 개수(k)를 사전에 지정해야 함, 초기값에 따라 결과가 달라짐(지역 최적해 가능성), 이상치에 민감

10) SOM(자기조직화지도) 🔥#

SOM ❗ : 고차원 입력을 **저차원(보통 2차원) 격자에 사상(투영)**시키는 비지도 신경망. **입력층 + 경쟁층(출력층)**으로 구성되며, 객체간 유사성을 보존하며 군집화

구분키워드
일반 신경망과 차이 ❗일반 신경망은 역전파(지도학습) 사용 vs SOM은 **경쟁학습(비지도)**로 승자(BMU) 주변만 가중치 갱신
특징고차원 데이터의 시각화에 유리, 차원 축소 공간이 입력 데이터의 위상(토폴로지)을 유지

11) 계층적 · 분할적 군집화 · DBSCAN ⭐#

군집화키워드
계층적 군집화개별 개체를 하나씩 **병합(응집적) 또는 분할(분할적)**하며 덴드로그램 형태로 표현. 군집 수를 미리 정하지 않아도 됨
분할적 군집화K-means처럼 전체를 몇 개의 군집으로 한 번에 분할, 군집 수(k)를 미리 지정해야 함
DBSCAN밀도(density) 기반 군집화. 임의 모양의 군집을 찾을 수 있고 군집 수를 미리 정하지 않아도 됨, 밀도 낮은 점은 노이즈(이상치)로 별도 식별 가능

12) 연관규칙 💯#

연관규칙 ❗ : 항목들 간의 “if A then B” 형태의 관계를 발견(장바구니 분석 대표적)

지표공식
지지도(Support)P(A∩B)
신뢰도(Confidence)P(A∩B)/P(A) — A를 살 때 B도 살 조건부 확률
향상도(Lift)P(A∩B)/(P(A)×P(B)) — 독립 가정 대비 연관성 정도(1보다 크면 양의 상관)

장단점

장점단점
계산 간단, 직관적으로 이해 쉬움품목(아이템) 수 늘어나면 계산량 급증(지수적 증가)
조건부(if-then) 규칙으로 해석 용이드물게(희귀) 아이템은 지지도가 낮아서 규칙 누락 가능

제4장 비정형 데이터마이닝#

1) 딥러닝 모델 🔥#

모델키워드
DNN(심층신경망) ❗은닉층이 2개 이상인 인공신경망
CNN(합성곱신경망) ❗합성곱층+풀링층으로 공간적 특징 추출, 이미지 처리에 특화
RNN(순환신경망) ❗은닉층의 출력이 다시 자신에게 입력되어 순서·시계열 데이터 처리에 적합
GAN(생성적 적대신경망) ❗**생성자(Generator)와 판별자(Discriminator)**가 경쟁하며 학습, 새로운 데이터 생성
RBM(제한 볼츠만 머신) ❗가시층·은닉층 간 양방향 연결, 같은 층 내 연결 없음(제한적), 비지도 사전학습에 활용
DBN(심층신뢰망) ❗RBM을 여러 층 쌓아 구성, 층별로 사전학습 후 미세조정

2) 활성화함수 🔥#

함수특징
시그모이드0~1 출력, 양종말 기울기 소멸(vanishing gradient) 문제
tanh-1~1 출력, 시그모이드보다 나으나 여전히 기울기 소멸 있음
ReLU0 이하는 0, 양수는 그대로 출력. 계산 간단·기울기 소멸 완화로 딥러닝에서 가장 많이 사용
Softmax다중 분류 출력층에서 확률값으로 변환(합=1)

3) 텍스트 마이닝 🔥#

텍스트 마이닝 ❗ : 비정형 텍스트 데이터에서 의미 있는 정보를 추출하는 기법(자연어처리(NLP) 기반)

Corpus(말뭉치) ❗ : 더 이상 추가 절차 없이 데이터마이닝 알고리즘에 바로 활용할 수 있는 상태로 정제된 텍스트 모음

텍스트 전처리 과정

순서단계내용
토큰화(Tokenization)문장·단어 단위로 분할
불용어 처리의미 없는 조사·관사 등 제거
대소문자 통일대문자/소문자 하나로 통일
어근 추출(Stemming/Lemmatization)단어를 **원형(어근)**으로 환원
텍스트 인코딩문자를 컴퓨터가 처리할 수 있는 수치(벡터)로 변환(예: BoW, TF-IDF)

🥔 순서 외우는법! 토불대어인 — 토큰화 → 불용어처리 → 대소문자통일 → 어근추출 → 인코딩

4) 사회연결망 분석(SNA) 🔥#

사회연결망분석 ❗ : 개체(노드)들 간의 **관계(연결)**를 분석해 네트워크의 구조와 패턴, 영향력을 파악하는 기법

구분내용
표현 방식그래프(노드+링크) 또는 행렬(인접행렬) 형태로 표현
구조 파악 기법연결정도(Degree) 중심성(연결 수), 근접중심성(Closeness)(다른 노드와의 거리), 매개중심성(Betweenness)(중개자 역할 정도), 고유벡터중심성(Eigenvector)(영향력 큰 노드와의 연결 가중치)

🥔 복습 체크리스트 (☐에 체크하며 회독)#

  • 1) 데이터마이닝 정의 · 목데가기검 프로세스 ⭐
  • 2) 지도학습 7종 · 비지도학습 4종 · 예측 vs 설명 ⭐
  • 3) 혼동행렬 5지표(정분류율·민감도·특이도·정밀도·F1) 계산 · AUROC · Lift Chart 💯 ❗
  • 4) 홀드아웃 · k-Fold CV · 붓스트랩 ⭐
  • 5) 우도 정의 · 최대우도추정(MLE) 🔥
  • 6) 의사결정나무 활용분야 · 장단점 · 지니지수/엔트로피 공식+계산 💯 ❗
  • 7) 베이즈정리 · 나이브베이즈 · KNN · SVM 🔥
  • 8) 배깅 vs 부스팅 · RF vs GBM 장단점 💯 ❗
  • 9) K-means 연속형·임의초기값·탐욕적 · 장단점 ⭐ ❗
  • 10) SOM 구성(입력층+경쟁층) · 일반신경망과 차이(역전파 X) 🔥
  • 11) 계층적 vs 분할적 군집화 · DBSCAN(밀도기반) ⭐
  • 12) 지지도·신뢰도·향상도 공식 · 장단점 💯 ❗
  • 13) DNN·CNN·RNN·GAN·RBM·DBN 구분 🔥
  • 14) 활성화함수(시그모이드·tanh·ReLU·Softmax) 🔥
  • 15) 텍스트마이닝 Corpus 정의 · 전처리 5단계(토불대어인) 🔥
  • 16) SNA 표현방식(그래프/행렬) · 중심성 지표 4종 🔥
4과목-2 · 정형 · 비정형 데이터마이닝 — 압축 요약
https://fuwari.vercel.app/posts/4과목-2-정형-비정형-데이터마이닝-압축-요약/
저자
Argon
게시일
2026-07-24
라이선스
CC BY-NC-SA 4.0