1333 단어
7 분
연속형변수의 거리측정
2026-07-24
태그 없음

연속형 변수의 거리 측정#

두 관측치가 얼마나 비슷하거나 다른지를 수치로 나타낸다.

두 점을 다음과 같이 가정한다.

  • A = (1, 2)
  • B = (4, 6)
  • 변수별 차이 = (3, 4)

거리가 작을수록 두 관측치는 더 유사하다.

거리 비교#

거리계산 방식특징
유클리디안차이의 제곱합의 제곱근일반적인 직선거리
맨하탄절댓값 차이의 합격자 형태의 이동거리
체비셰프절댓값 차이 중 최댓값가장 큰 차이만 반영
캔버라절댓값 차이를 변수 크기로 나누어 합산작은 값의 차이에 민감
마할라노비스분산과 변수 간 상관관계를 고려척도와 상관관계 보정

1. 유클리디안 거리#

두 점 사이의 직선거리이다.

공식:

d = √[(x1 - y1)² + (x2 - y2)² + …]

예시:

  • A = (1, 2)
  • B = (4, 6)

d = √[(1 - 4)² + (2 - 6)²]

= √(9 + 16)

= √25

= 5

특징#

  • 가장 일반적으로 사용하는 거리
  • 큰 차이에 더 큰 영향을 받음
  • 변수 단위가 다르면 표준화가 필요

2. 표준화 거리#

표준화는 거리 측정법이 아니라, 변수의 단위를 맞추기 위한 전처리 방법이다.

공식:

z = (관측값 - 평균) / 표준편차

예시#

고객 A와 B의 차이:

변수AB차이
나이20세30세10
연봉3,000만 원5,000만 원2,000

표준화하지 않으면 연봉 차이 2,000이 나이 차이 10보다 훨씬 크게 반영된다.

표준편차가 다음과 같다고 가정한다.

  • 나이 표준편차 = 5
  • 연봉 표준편차 = 1,000

표준화된 차이:

  • 나이 차이 = 10 / 5 = 2
  • 연봉 차이 = 2,000 / 1,000 = 2

표준화 후에는 두 변수의 영향력이 동일해진다.

특징#

  • 단위가 다른 변수 비교에 필요
  • 평균은 0, 표준편차는 1이 됨
  • 유클리디안 거리, kNN, K-means 전에 자주 수행

3. 마할라노비스 거리#

변수의 분산과 변수 간 상관관계를 고려한 거리이다.

공식:

d = √[(A - B)’ × 공분산행렬의 역행렬 × (A - B)]

예시#

키와 몸무게는 일반적으로 함께 증가하는 상관관계가 있다.

  • A: 키 170cm, 몸무게 65kg
  • B: 키 180cm, 몸무게 75kg

키와 몸무게가 함께 증가한 것은 일반적인 변화이므로, 마할라노비스 거리는 상대적으로 작게 계산될 수 있다.

반면 다음과 같은 경우:

  • C: 키 170cm, 몸무게 100kg

키에 비해 몸무게가 매우 크므로, 일반적인 상관구조에서 벗어나 마할라노비스 거리가 크게 계산될 수 있다.

특징#

  • 변수의 단위와 분산을 고려
  • 변수 간 상관관계를 고려
  • 이상치 탐지와 다변량 분석에 활용
  • 공분산행렬이 단위행렬이면 유클리디안 거리와 같음

4. 맨하탄 거리#

각 변수의 절댓값 차이를 모두 더한다.

공식:

d = |x1 - y1| + |x2 - y2| + …

예시:

  • A = (1, 2)
  • B = (4, 6)

d = |1 - 4| + |2 - 6|

= 3 + 4

= 7

특징#

  • 도시의 격자형 도로를 이동하는 거리와 유사
  • 유클리디안보다 이상치의 영향을 덜 받음
  • 고차원 데이터에 활용 가능

5. 체비셰프 거리#

변수별 절댓값 차이 중 가장 큰 값만 사용한다.

공식:

d = max(|x1 - y1|, |x2 - y2|, …)

예시:

  • A = (1, 2)
  • B = (4, 6)
  • 변수별 차이 = 3, 4

d = max(3, 4)

= 4

특징#

  • 가장 큰 차이가 전체 거리를 결정
  • 체스에서 킹이 이동하는 최소 횟수와 유사
  • 여러 조건 중 최대 차이가 중요한 경우 사용

6. 캔버라 거리#

변수별 차이를 두 값의 크기 합으로 나눈 뒤 모두 더한다.

공식:

d = Σ [|xi - yi| / (|xi| + |yi|)]

예시:

  • A = (1, 2)
  • B = (4, 6)

첫 번째 변수:

|1 - 4| / (|1| + |4|)

= 3 / 5

= 0.6

두 번째 변수:

|2 - 6| / (|2| + |6|)

= 4 / 8

= 0.5

캔버라 거리:

d = 0.6 + 0.5

= 1.1

특징#

  • 변수의 상대적인 차이를 측정
  • 값이 0에 가까울수록 차이에 민감
  • 변수 크기가 서로 다른 데이터에 활용
  • 두 값이 모두 0이면 해당 항은 일반적으로 0으로 처리

동일한 예시의 거리 비교#

A = (1, 2), B = (4, 6)

거리결과
유클리디안5
맨하탄7
체비셰프4
캔버라1.1

각 거리의 값은 계산 기준이 다르므로 숫자 자체를 직접 비교하기보다는, 같은 거리 측정법 안에서 관측치들의 상대적 거리를 비교한다.

핵심 정리#

  • 유클리디안: 직선거리
  • 맨하탄: 절댓값 차이의 합
  • 체비셰프: 가장 큰 차이
  • 캔버라: 변수 크기 대비 상대적 차이
  • 마할라노비스: 분산과 상관관계를 고려한 거리
  • 표준화: 단위가 다른 변수의 영향력을 맞추는 전처리
연속형변수의 거리측정
https://fuwari.vercel.app/posts/연속형변수의-거리측정/
저자
Argon
게시일
2026-07-24
라이선스
CC BY-NC-SA 4.0