550 단어
3 분
나이브 베이즈 분류
베이즈 정리를 이용해 데이터가 각 범주에 속할 확률을 계산하고, 가장 확률이 높은 범주로 분류하는 지도학습 알고리즘이다.
핵심 가정
각 독립변수는 목표변수가 주어졌을 때 서로 조건부 독립이라고 가정한다.
예를 들어 이메일 분류에서 무료, 당첨, 광고라는 단어가 서로 독립적으로 나타난다고 가정한다.
분류 원리
P(클래스 | 데이터) ∝ P(클래스) × P(데이터 | 클래스)
- P(클래스): 사전확률
- P(데이터 | 클래스): 우도
- P(클래스 | 데이터): 사후확률
각 클래스의 사후확률을 계산한 뒤 가장 큰 클래스를 선택한다.
예시
이메일에 무료, 당첨이라는 단어가 포함된 경우:
- P(스팸 | 무료, 당첨) 계산
- P(정상 | 무료, 당첨) 계산
- 더 큰 확률의 범주로 분류
P(스팸 | 무료, 당첨)이 더 크면 스팸으로 분류한다.
종류
| 종류 | 적합한 데이터 |
|---|---|
| 가우시안 나이브 베이즈 | 연속형 변수 |
| 다항 나이브 베이즈 | 단어 빈도, 문서 분류 |
| 베르누이 나이브 베이즈 | 단어 존재 여부와 같은 이진 변수 |
장단점
| 장점 | 단점 |
|---|---|
| 계산이 빠르고 구현이 간단함 | 변수 간 독립 가정이 현실적으로 강함 |
| 적은 데이터에서도 성능이 좋음 | 서로 관련된 변수가 많으면 성능 저하 가능 |
| 텍스트 분류에 효과적 | 학습 데이터에 없는 경우 확률이 0이 될 수 있음 |
0 확률 문제
학습 데이터에서 특정 조건이 한 번도 나타나지 않으면 전체 확률이 0이 될 수 있다.
이를 방지하기 위해 라플라스 스무딩을 사용한다.
핵심 암기
- 지도학습
- 분류 알고리즘
- 베이즈 정리 사용
- 변수 간 조건부 독립 가정
- 가장 높은 사후확률의 클래스로 분류
- 스팸 메일·문서 분류에 많이 사용