출제확률 💯 99% · ⭐ 80% · 🔥 50% · 🤔 20% | ❗ = 기출 포인트 | 🥔 = 암기법 | 🚫 = 기출 함정 | 📗 = 예시/공식 이 과목 예상 출제 범위 — 4과목은 배점 비중이 가장 크고(12문제 이상 과락 기준) R 기초·데이터마트, 통계분석, 정형/비정형 데이터마이닝으로 구성됨. 이 페이지는 1장(R 기초와 데이터마트) + 2장(통계분석) 담당.
제1장 R 기초와 데이터 마트
1) 데이터 마트 · 요약변수 · 파생변수 ⭐
데이터 마트(Data Mart) ❗ : 데이터 웨어하우스와 사용자 사이의 중간층에 위치. 특정 부서·목적에 맞게 축소·가공한 데이터 저장소
| 구분 | 정의 | 특징 |
|---|---|---|
| 요약변수 ❗ | 원 데이터를 분석 목적에 맞게 종합한 변수(합계·평균·횟수 등) | 재활용성이 높음(여러 분석에 공통 사용) |
| 파생변수 ❗ | 특정 조건을 만족하거나 특정 함수에 의해 값을 만들어 의미를 부여한 변수 | 주관적일 수 있음(분석자마다 정의 다를 수 있음), 재활용성 낮음 |
📗 예시: 요약변수 = “최근 3개월 평균 구매액”, “방문 횟수 합계” / 파생변수 = “우수고객 여부”(구매액 100만원 이상이면 1, 아니면 0), “연령대”(나이를 10대·20대로 변환)
2) reshape · sqldf · plyr · data.table 🔥
| 함수/패키지 | 키워드 | |
|---|---|---|
| melt() ❗ | 여러 칼럼을 하나의 key-value 형태로 녹임(wide → long) | |
| cast() ❗ | long 형태를 다시 넓은 형태로 재구성(long → wide), 집계 함수 지정 가능 | |
| sqldf | R에서 SQL 구문을 그대로 사용해 데이터프레임 조작. 일반 SQL 명령문과 달리 R 데이터프레임에 직접 SQL 질의 가능(DB 연결 없이) | |
| plyr 패키지 | split-apply-combine 전략. ddply(데이터프레임→데이터프레임), llply(list), sapply 등과 유사한 일관된 인터페이스로 그룹별 연산 수행 | |
| 구분 | data.frame | data.table |
| --- | --- | --- |
| 속도 ❗ | 상대적으로 느림 | 대용량 처리 시 훨씬 빠름(인덱싱 기반) |
| 문법 | 표준 R 문법 | DT[i, j, by] 형태의 자체 문법 |
| 메모리 | 복사 발생 多 | 참조에 의한 수정(메모리 효율적) |
🥔 head() = 데이터의 앞부분(기본 6행) 미리보기 / summary() = 최소값·1사분위수·중앙값·평균·3사분위수·최대값 등 기술통계 요약
3) 변수 구간화 · 결측값 처리 ⭐
변수 구간화(Binning) 방법 ❗ : Binning(등간격·등빈도 등으로 임의 구간화) · 의사결정나무 활용(정보 이득이 최대가 되는 지점을 기준으로 자동 구간화)
| 결측값 처리 | 세부 기법 | 키워드 |
|---|---|---|
| 단순 대치법 ❗ | 완전분석법(Complete Case) | 결측값 있는 행 자체를 제거 후 분석 |
| 평균 대치법 - 비조건부 | 전체 평균으로 일괄 대치 | |
| 평균 대치법 - 조건부 | 다른 변수 조건(그룹)별 평균으로 대치 | |
| 단순확률 대치법 | 평균 대치의 표준오차 과소추정 문제를 보완, 확률적 값으로 대치(예: Hot-deck) | |
| 다중 대치법 ❗ | 대치 → 분석 → 결합(3단계) | 결측값을 여러 번 대치해 여러 데이터셋 생성 → 각각 분석 → 결과를 결합(Rubin’s rule) |
🥔 다중대치 순서 외우는법! 대분결
complete.cases() vs is.na() ❗ : is.na()는 각 값이 결측인지 여부(TRUE/FALSE)를 원소별로 반환 / complete.cases()는 행(row) 단위로 결측값이 하나도 없는 완전한 행인지 여부를 반환
4) 이상값 처리 🔥
| 이상값 인식 방법 | 키워드 |
|---|---|
| ESD(Extreme Studentized Deviation) ❗ | 평균으로부터 k×표준편차 벗어난 값(보통 k=3)을 이상값으로 판단. 이상값 자체에 민감하다는 단점 |
| 기하평균 이용 | 데이터가 편포된 경우 로그 변환 후 기하평균 활용, 기하평균으로부터 일정 배수(약 2.5) 벗어난 값을 이상값으로 판단 |
| 사분위수(IQR) ❗ | Q1 - 1.5×IQR ~ Q3 + 1.5×IQR 범위를 벗어난 값 (IQR = Q3-Q1) |
| 극단값 절단·조정 방법 | 키워드 |
| --- | --- |
| 절단(Trimming) | 하단·상단 일정 % 제거 |
| 조정(Winsorizing) ❗ | 극단값을 하한·상한 경계값으로 대체(제거하지 않고 조정) |
| 기하평균 이용 조정 | 편포 자료에서 기하평균 기반으로 극단값 조정 |
5) 표본추출 방법 ⭐
| 방법 | 영어 | 키워드 |
|---|---|---|
| 단순랜덤추출 ❗ | Simple Random Sampling | 각 표본이 동일한 확률로 추출 |
| 계통추출 ❗ | Systematic Sampling | 목록에서 일정 간격으로 추출(첫 표본은 랜덤) |
| 집락추출 ❗ | Cluster Sampling | 모집단을 군집(집락)으로 나눠 일부 군집을 통째로 선택 |
| 층화추출 ❗ | Stratified Sampling | 모집단을 층(집단)으로 나눈 뒤 각 층에서 표본 추출 |
📗 집락 vs 층화 차이 ❗ : 집락추출 = 군집 내부는 이질적, 군집 간은 유사(군집 자체를 표본 단위로 통째 선택) / 층화추출 = 층 내부는 동질적, 층 간은 이질적(각 층에서 개별적으로 표본 추출) — 정반대 성격!
6) 척도의 종류 ⭐
| 척도 | 예시 | 특징 |
|---|---|---|
| 명목척도 ❗ | 성별, 혈액형, 지역 | 분류 목적, 순서 없음 |
| 순서척도 ❗ | 학점(A·B·C), 만족도(상·중·하) | 순서는 있으나 간격은 의미 없음 |
| 구간척도 ❗ | 온도(℃), 지능지수(IQ) | 간격이 일정, 절대적 0점 없음(사칙연산 중 +,- 만 의미) |
| 비율척도 ❗ | 키, 몸무게, 나이, 소득 | 절대적 0점 존재, 사칙연산 모두 가능 |
제2장 통계분석
1) 확률분포 💯
| 이산형(확률질량함수, pmf) ❗ | 정의·특징 |
|---|---|
| 베르누이분포 | 성공/실패 단 1회 시행 |
| 이항분포 | 베르누이 시행을 n번 독립 반복했을 때 성공 횟수 |
| 기하분포 | 첫 성공까지의 시행 횟수(또는 실패 횟수) |
| 다항분포 | 이항분포를 범주가 3개 이상으로 확장 |
| 포아송분포 | 단위 시간·공간 내 사건 발생 횟수(희귀 사건) |
| 연속형(확률밀도함수, pdf) ❗ | 정의·특징 |
| --- | --- |
| 균일분포 | 구간 내 모든 값의 확률이 동일 |
| 정규분포 | 평균 중심 좌우 대칭 종형 곡선 |
| 지수분포 | 사건 발생까지의 대기 시간(포아송과 연계) |
| t분포 ❗ | 표본 크기가 작을 때 정규분포 대신 사용, **두 집단 간 평균 비교(동일성 검정)**에 활용, 자유도 커지면 정규분포에 근사 |
| 카이제곱분포 | 분산 추정·적합도/독립성 검정에 사용, 항상 양수 |
| F분포 ❗ | 두 집단의 분산 동일성 검정에 사용, 자유도를 2개(분자·분모) 가짐, 자유도 커지면 정규분포에 근사 |
| 누적분포함수(CDF) | 특정 값 이하일 누적 확률을 나타내는 함수 |
🚫 헷갈리는 개념: 동질성 vs 동일성 — t검정·F검정에서 말하는 “동일성”은 모수(평균·분산)의 값 자체가 통계적으로 같은지를 검정하는 것이고, 카이제곱 동질성검정은 여러 집단(모집단)의 분포(비율) 형태가 서로 같은지를 비교하는 것. 즉 동일성=수치(모수) 비교, 동질성=분포(비율) 비교라는 뉘앙스 차이로 이해
2) 점추정 · 구간추정 · 가설검정 용어 💯
🥔 점추정 조건 외우는법! 불효일충 — 불편성 · 효율성 · 일치성 · 충족성(충분성)
| 용어 | 정의 |
|---|---|
| 점추정 ❗ | 모수가 특정한 값일 것이라고 추정 |
| 구간추정 ❗ | 모수가 특정 구간 안에 있을 것이라고 선언 |
| 신뢰수준 ❗ | 모수가 구간 안에 있을 가능성의 크기 |
| 유의수준(α) ❗ | 귀무가설이 옳은데도 기각하는 오류의 확률 크기 |
| 기각역 ❗ | 귀무가설이 옳다는 전제 하 검정통계량 분포에서 확률이 유의수준 α인 부분(그 값이 나오면 귀무가설 기각) |
| 검정통계량 ❗ | 가설 검정을 위해 표본자료로부터 계산한 통계량(이 값을 기각역과 비교) |
| 오류 | 정의 |
| --- | --- |
| 제1종 오류(α) ❗ | 귀무가설이 참인데 기각하는 오류 |
| 제2종 오류(β) ❗ | 귀무가설이 거짓인데 채택하는 오류 |
| 검정력(1-β) ❗ | 귀무가설이 거짓일 때 올바르게 기각할 확률 |
📗 α와 β의 상충관계란? α(1종 오류)를 줄이면 기각역이 좁아져 β(2종 오류)가 커지는 역의 관계 — 하나를 줄이면 다른 하나가 커짐(표본 크기를 늘리지 않는 한 동시에 줄일 수 없음)
3) 모수적 검정 vs 비모수적 검정 ⭐
| 구분 | 키워드 |
|---|---|
| 모수적 검정 ❗ | 모집단 분포를 가정(주로 정규분포), 표본평균·표본분산 등 사용 |
| 비모수적 검정 ❗ | 모집단 분포를 가정하지 않음. 자료 수가 적거나 순서(서열)척도일 때 사용. 크기에 의존하지 않는 순위(rank)나 관측값 차이의 부호를 이용 |
📗 비모수 검정 예시: 부호검정, 윌콕슨 순위합검정, 만-휘트니 U검정, 크루스칼-왈리스 검정, 스피어만 순위상관
4) 왜도 · 첨도 🔥
| 왜도 | 평균·중앙값·최빈값 위치 |
|---|---|
| 왜도 > 0(양, 오른쪽 꼬리) ❗ | 최빈값 < 중앙값 < 평균 |
| 왜도 = 0(대칭) | 평균 = 중앙값 = 최빈값 |
| 왜도 < 0(음, 왼쪽 꼬리) ❗ | 평균 < 중앙값 < 최빈값 |
🥔 외우는법! 꼬리가 긴 쪽으로 평균이 끌려감(왜도 방향 = 평균이 쏠리는 방향), 최빈값은 항상 봉우리(제일 두꺼운 곳)
첨도 ❗ : 첨도 값이 3이면 정규분포와 유사(뾰족한 정도가 정규분포 수준). 통계 패키지에 따라 첨도-3(초과첨도)이 0일 때 정규분포와 유사하다고도 표현
5) 산점도 · 공분산 · 상관분석 ⭐
산점도 ❗ : 두 변수 사이의 **선형관계, 함수관계(비선형), 이상값, 집단(군집)**을 시각적으로 확인 가능
| 구분 | 키워드 |
|---|---|
| 공분산 ❗ | 두 변수 간 방향성(양/음)만 확인 가능. 단위에 따라 값의 크기가 달라져 강도 비교 불가(한계) |
| 상관계수 ❗ | 공분산을 표준편차로 나누어 표준화 → 방향 + 강도까지 파악 가능(-1~1) |
| 상관분석 | 키워드 |
| --- | --- |
| 피어슨 상관계수 ❗ | 등간·비율척도, 두 변수의 선형관계 측정 |
| 스피어만 상관계수 ❗ | 순서척도(비모수), 값 대신 **순위(rank)**를 이용, 단조적(비선형 포함) 관계도 측정 |
6) t검정 💯
| 검정 | 가정 |
|---|---|
| 일표본 t검정 ❗ | 정규분포, 연속형 변수, 비교할 기준값 존재 |
| 대응표본 t검정 ❗ | 사전-사후 등 쌍을 이루는 데이터의 차이값이 정규성을 만족 |
| 독립표본 t검정 ❗ | 두 집단이 정규성 · 독립성 · 등분산성(모분산 동일)을 만족 |
📗 R 코드 해석 공통 포인트: t.test() 결과의 p-value가 유의수준보다 작으면 귀무가설 기각(평균 차이가 통계적으로 유의함), conf.int(신뢰구간)가 0을 포함하지 않으면 유의한 차이
7) 분산분석(ANOVA) · 교차분석 💯
분산분석 ❗ : 3개 이상 집단의 평균 차이를 F통계량(집단 간 분산/집단 내 분산)으로 검정. 가정: 독립성 · 정규성 · 등분산성
사후검정이 필요한 이유 ❗ : ANOVA는 “적어도 한 집단은 평균이 다르다”만 알려줄 뿐 어느 집단끼리 다른지는 알려주지 않음 → 사후검정으로 쌍별 비교 필요
| 사후검정 | 키워드 |
|---|---|
| Duncan MRT | 여러 그룹을 **범위(Range)**로 비교, 비교적 관대(1종오류 높음) |
| Fisher LSD | 가장 단순·관대한 방법(1종오류 통제 약함) |
| Tukey HSD ❗ | 모든 집단 쌍별 비교, 표본 수 같을 때 많이 사용, 가장 널리 사용 |
| Scheffe | 가장 보수적(엄격), 모든 대비(contrast)에 사용 가능 |
이원배치 분산분석 ❗ : 요인이 2개 → 교호작용(interaction) 검증이 필수(두 요인이 서로 영향을 주며 결과에 작용하는지 확인). 가정은 동일하게 정규성·등분산성
교차분석(카이제곱검정) ❗ : 범주형 자료 분석, 카이제곱 검정통계량 사용
| 검정 종류 | 정의 |
|---|---|
| 적합도 검정 ❗ | 한 개의 범주형 변수의 관찰빈도가 기대(이론적) 분포와 일치하는지 검정 |
| 독립성 검정 ❗ | 한 모집단 내 **두 범주형 변수 간에 연관성(독립 여부)**이 있는지 검정 |
| 동질성 검정 ❗ | 여러 모집단(그룹) 에서 범주별 분포(비율)가 서로 같은지 검정 |
8) 회귀분석 💯
🥔 회귀분석 가정 외우는법! 선등정독 — 선형성 · 등분산성 · 정규성 · 독립성
다중선형회귀 검토사항 ❗ : 회귀분석 기본 가정 충족 여부 + 다중공선성 진단 — 허용오차(Tolerance) ≤ 0.1 또는 VIF(분산팽창지수) ≥ 10이면 다중공선성 문제로 판단
| 변수선택법 | 키워드 |
|---|---|
| 전진선택법 ❗ | 변수를 하나씩 추가하며 유의한 변수만 채택 |
| 후진제거법 ❗ | 모든 변수를 넣고 유의하지 않은 변수를 하나씩 제거 |
| 단계적 선택법 ❗ | 전진+후진 혼합(추가와 제거를 반복) |
최적 모형 판단 기준 ❗ : AIC, BIC가 최소가 되는 모형이 가장 적합(모형의 적합도와 복잡도의 균형을 평가)
정규화 선형회귀 ❗ : 회귀계수 크기에 **패널티(제약)**를 부여해 과적합 방지
| 정규화 | 패널티 | 키워드 |
|---|---|---|
| 릿지(Ridge, L2) ❗ | 계수 제곱합에 패널티 | 계수를 0에 가깝게 축소(완전히 0은 안 됨), 다중공선성 완화 |
| 라쏘(Lasso, L1) ❗ | 계수 절대값 합에 패널티 | 일부 계수를 정확히 0으로(변수 선택 효과) |
| 엘라스틱넷(Elastic Net) ❗ | L1+L2 결합 | 변수 선택 + 다중공선성 완화 동시에 |
9) 시계열 분석 ⭐
정상성(Stationary) ❗ : ①평균이 일정 ②분산이 일정 ③공분산은 시차(lag)에만 의존, 특정 시점 t,s 자체에는 의존하지 않음
- **평균이 일정하지 않으면 → 차분(Differencing)**으로 정상화 ❗ (현시점 자료 - 전시점 자료)
- **분산이 일정하지 않으면 → 변환(로그 등)**으로 정상화 ❗
| 시계열 모형 | 키워드 |
|---|---|
| 자기회귀모형(AR) ❗ | 과거 자기 자신의 값들로 현재 값을 설명 |
| 이동평균모형(MA) ❗ | 과거의 오차(잔차) 항들로 현재 값을 설명 |
| 자기회귀누적이동평균모형(ARIMA) ❗ | AR+MA에 **차분(I, 누적)**을 결합, 비정상 시계열에 적용 |
분해 시계열 ❗ : 시계열을 추세(Trend) · 계절(Seasonal) · 순환(Cyclical) · 불규칙(Irregular) 요인으로 분해하여 분석
10) 다차원 척도법(MDS) · 주성분분석(PCA) 🔥
다차원척도법(MDS) ❗ : 개체들 간의 **거리(비유사성)**를 저차원 공간에 배치해 시각화. 거리 계산에는 유클리드 거리행렬 사용. 적합도(정확도)는 스트레스(Stress) 값으로 표현(낮을수록 적합)
| MDS 종류 | 키워드 |
|---|---|
| 계량적 MDS ❗ | 데이터가 구간·비율척도(양적 자료) |
| 비계량적 MDS ❗ | 데이터가 순서척도(순위 정보만 이용) |
주성분분석(PCA) 개수 선택 ❗ : 누적기여율(주로 85% 이상)을 기준으로 선택 하거나 Scree Plot에서 급격히 완만해지는 지점의 바로 전 단계(팔꿈치, elbow)까지 선택
🥔 복습 체크리스트 (☐에 체크하며 회독)
- 1) 데이터마트 위치 · 요약변수 vs 파생변수 ⭐
- 2) melt/cast · sqldf · plyr · data.table vs data.frame 🔥
- 3) Binning · 결측값(단순대치 4종·다중대치 대분결) · complete.cases vs is.na ⭐
- 4) 이상값(ESD·기하평균·IQR) · 극단값 절단/조정 🔥
- 5) 표본추출 4종(영어) · 집락 vs 층화 차이 ⭐ ❗
- 6) 척도 4종(명목·순서·구간·비율) 예시 ⭐
- 7) 이산형 5분포 · 연속형 7개념 · t/F분포 자유도 · 동질성 vs 동일성 💯 ❗
- 8) 점추정(불효일충) · 구간추정 용어 5개 · 1종/2종 오류 · α,β 상충 💯 ❗
- 9) 모수적 vs 비모수적 · 비모수 예시 5가지 ⭐
- 10) 왜도 방향별 위치 · 첨도=3 🔥
- 11) 공분산 vs 상관계수 · 피어슨 vs 스피어만 ⭐
- 12) t검정 3종 가정 💯
- 13) ANOVA 가정 · 사후검정 4종 · 이원배치 교호작용 · 카이제곱 3검정 💯 ❗
- 14) 회귀 가정(선등정독) · VIF/허용오차 · 변수선택 3법 · AIC/BIC · 릿지/라쏘/엘라스틱넷 💯 ❗
- 15) 정상성 3조건 · 차분/변환 · AR/MA/ARIMA · 분해시계열 4요소 ⭐ ❗
- 16) MDS(유클리드·스트레스·계량/비계량) · PCA(누적기여율85%·scree plot) 🔥