연속형 변수의 거리 측정
두 관측치가 얼마나 비슷하거나 다른지를 수치로 나타낸다.
두 점을 다음과 같이 가정한다.
- A = (1, 2)
- B = (4, 6)
- 변수별 차이 = (3, 4)
거리가 작을수록 두 관측치는 더 유사하다.
거리 비교
| 거리 | 계산 방식 | 특징 |
|---|---|---|
| 유클리디안 | 차이의 제곱합의 제곱근 | 일반적인 직선거리 |
| 맨하탄 | 절댓값 차이의 합 | 격자 형태의 이동거리 |
| 체비셰프 | 절댓값 차이 중 최댓값 | 가장 큰 차이만 반영 |
| 캔버라 | 절댓값 차이를 변수 크기로 나누어 합산 | 작은 값의 차이에 민감 |
| 마할라노비스 | 분산과 변수 간 상관관계를 고려 | 척도와 상관관계 보정 |
1. 유클리디안 거리
두 점 사이의 직선거리이다.
공식:
d = √[(x1 - y1)² + (x2 - y2)² + …]
예시:
- A = (1, 2)
- B = (4, 6)
d = √[(1 - 4)² + (2 - 6)²]
= √(9 + 16)
= √25
= 5
특징
- 가장 일반적으로 사용하는 거리
- 큰 차이에 더 큰 영향을 받음
- 변수 단위가 다르면 표준화가 필요
2. 표준화 거리
표준화는 거리 측정법이 아니라, 변수의 단위를 맞추기 위한 전처리 방법이다.
공식:
z = (관측값 - 평균) / 표준편차
예시
고객 A와 B의 차이:
| 변수 | A | B | 차이 |
|---|---|---|---|
| 나이 | 20세 | 30세 | 10 |
| 연봉 | 3,000만 원 | 5,000만 원 | 2,000 |
표준화하지 않으면 연봉 차이 2,000이 나이 차이 10보다 훨씬 크게 반영된다.
표준편차가 다음과 같다고 가정한다.
- 나이 표준편차 = 5
- 연봉 표준편차 = 1,000
표준화된 차이:
- 나이 차이 = 10 / 5 = 2
- 연봉 차이 = 2,000 / 1,000 = 2
표준화 후에는 두 변수의 영향력이 동일해진다.
특징
- 단위가 다른 변수 비교에 필요
- 평균은 0, 표준편차는 1이 됨
- 유클리디안 거리, kNN, K-means 전에 자주 수행
3. 마할라노비스 거리
변수의 분산과 변수 간 상관관계를 고려한 거리이다.
공식:
d = √[(A - B)’ × 공분산행렬의 역행렬 × (A - B)]
예시
키와 몸무게는 일반적으로 함께 증가하는 상관관계가 있다.
- A: 키 170cm, 몸무게 65kg
- B: 키 180cm, 몸무게 75kg
키와 몸무게가 함께 증가한 것은 일반적인 변화이므로, 마할라노비스 거리는 상대적으로 작게 계산될 수 있다.
반면 다음과 같은 경우:
- C: 키 170cm, 몸무게 100kg
키에 비해 몸무게가 매우 크므로, 일반적인 상관구조에서 벗어나 마할라노비스 거리가 크게 계산될 수 있다.
특징
- 변수의 단위와 분산을 고려
- 변수 간 상관관계를 고려
- 이상치 탐지와 다변량 분석에 활용
- 공분산행렬이 단위행렬이면 유클리디안 거리와 같음
4. 맨하탄 거리
각 변수의 절댓값 차이를 모두 더한다.
공식:
d = |x1 - y1| + |x2 - y2| + …
예시:
- A = (1, 2)
- B = (4, 6)
d = |1 - 4| + |2 - 6|
= 3 + 4
= 7
특징
- 도시의 격자형 도로를 이동하는 거리와 유사
- 유클리디안보다 이상치의 영향을 덜 받음
- 고차원 데이터에 활용 가능
5. 체비셰프 거리
변수별 절댓값 차이 중 가장 큰 값만 사용한다.
공식:
d = max(|x1 - y1|, |x2 - y2|, …)
예시:
- A = (1, 2)
- B = (4, 6)
- 변수별 차이 = 3, 4
d = max(3, 4)
= 4
특징
- 가장 큰 차이가 전체 거리를 결정
- 체스에서 킹이 이동하는 최소 횟수와 유사
- 여러 조건 중 최대 차이가 중요한 경우 사용
6. 캔버라 거리
변수별 차이를 두 값의 크기 합으로 나눈 뒤 모두 더한다.
공식:
d = Σ [|xi - yi| / (|xi| + |yi|)]
예시:
- A = (1, 2)
- B = (4, 6)
첫 번째 변수:
|1 - 4| / (|1| + |4|)
= 3 / 5
= 0.6
두 번째 변수:
|2 - 6| / (|2| + |6|)
= 4 / 8
= 0.5
캔버라 거리:
d = 0.6 + 0.5
= 1.1
특징
- 변수의 상대적인 차이를 측정
- 값이 0에 가까울수록 차이에 민감
- 변수 크기가 서로 다른 데이터에 활용
- 두 값이 모두 0이면 해당 항은 일반적으로 0으로 처리
동일한 예시의 거리 비교
A = (1, 2), B = (4, 6)
| 거리 | 결과 |
|---|---|
| 유클리디안 | 5 |
| 맨하탄 | 7 |
| 체비셰프 | 4 |
| 캔버라 | 1.1 |
각 거리의 값은 계산 기준이 다르므로 숫자 자체를 직접 비교하기보다는, 같은 거리 측정법 안에서 관측치들의 상대적 거리를 비교한다.
핵심 정리
- 유클리디안: 직선거리
- 맨하탄: 절댓값 차이의 합
- 체비셰프: 가장 큰 차이
- 캔버라: 변수 크기 대비 상대적 차이
- 마할라노비스: 분산과 상관관계를 고려한 거리
- 표준화: 단위가 다른 변수의 영향력을 맞추는 전처리