550 단어
3 분
나이브 베이즈 분류
2026-07-24
태그 없음

베이즈 정리를 이용해 데이터가 각 범주에 속할 확률을 계산하고, 가장 확률이 높은 범주로 분류하는 지도학습 알고리즘이다.

핵심 가정#

각 독립변수는 목표변수가 주어졌을 때 서로 조건부 독립이라고 가정한다.

예를 들어 이메일 분류에서 무료, 당첨, 광고라는 단어가 서로 독립적으로 나타난다고 가정한다.

분류 원리#

P(클래스 | 데이터) ∝ P(클래스) × P(데이터 | 클래스)

  • P(클래스): 사전확률
  • P(데이터 | 클래스): 우도
  • P(클래스 | 데이터): 사후확률

각 클래스의 사후확률을 계산한 뒤 가장 큰 클래스를 선택한다.

예시#

이메일에 무료, 당첨이라는 단어가 포함된 경우:

  • P(스팸 | 무료, 당첨) 계산
  • P(정상 | 무료, 당첨) 계산
  • 더 큰 확률의 범주로 분류

P(스팸 | 무료, 당첨)이 더 크면 스팸으로 분류한다.

종류#

종류적합한 데이터
가우시안 나이브 베이즈연속형 변수
다항 나이브 베이즈단어 빈도, 문서 분류
베르누이 나이브 베이즈단어 존재 여부와 같은 이진 변수

장단점#

장점단점
계산이 빠르고 구현이 간단함변수 간 독립 가정이 현실적으로 강함
적은 데이터에서도 성능이 좋음서로 관련된 변수가 많으면 성능 저하 가능
텍스트 분류에 효과적학습 데이터에 없는 경우 확률이 0이 될 수 있음

0 확률 문제#

학습 데이터에서 특정 조건이 한 번도 나타나지 않으면 전체 확률이 0이 될 수 있다.

이를 방지하기 위해 라플라스 스무딩을 사용한다.

핵심 암기#

  • 지도학습
  • 분류 알고리즘
  • 베이즈 정리 사용
  • 변수 간 조건부 독립 가정
  • 가장 높은 사후확률의 클래스로 분류
  • 스팸 메일·문서 분류에 많이 사용
나이브 베이즈 분류
https://fuwari.vercel.app/posts/나이브-베이즈-분류/
저자
Argon
게시일
2026-07-24
라이선스
CC BY-NC-SA 4.0