데이터 마트란 무엇인가. 데이터웨어하우스와 사용자 사이의 중간층에 위치한 것
요약변수는 분석에 맞게 종합한 변수, 재활용성이 높음
파생변수는 특정조건을 만족하거나 특정함수에 의해 값을 만들어 의미를 부여한 변수, 주관적일 수 있음. 각 변수의 예시에 대한 정리가 필요함
reshape페이지에 Melt와 cast함수의 코딩방식에 대한 정리 및 예시
sql명령문과 sqldf를 활용한 명령문의 차이
plyr패키지의 활용방식과 R코딩, 데이터 테이블과 데이터 프레임을 비교 특징 암기
head와 summary()함수에대한 내용
변수의 구간화방식에는 Binning와 의사결정나무가 있음
결측값 처리방법 단순(완전, 평균(비조건, 조건), 단순확률), 다중대치(대치, 분석, 결합)
complete.cases()와 is.na()의 차이
이상값인식방법(ESD, 기하평균2.5, 사분위수), 극단값 절단방법(기하평균(geo.mean, 하단상단%제거, 극단값조정)
표본추출방법(단순랜덤, 계통추출, 집락추출, 층화추출 영어로도 알기, 집락과 층화의 차이점)
명목, 순서, 구간, 비율의 예시와 특징
이산형 확률변수의 종류와 정의 그리고 특징←확률질량함수라고 함 (베르누이, 이항분포, 기하분포, 다항분포, 포아송분포)
연속형 확률변수의 종류와 정의 그리고 특징←확률밀도함수라고함 (균일분포, 정규분포, 지수분포, t분포, 카이제곱분포, f분포, 누적분포함수cdf), t분포는 두 집단간의 동질성 검정에 활용됨. f분포는 분산의 동일성검정에 사용됨. 자유도를 두개 가지고 있음. 자유도가 커질수록 정규분포에 가까움, 동질성과 동일성의 차이점이 무엇인가
점추정은 모수가 특정한 값일것이라고 추정하는것. 조건은 불효일충(불편성, 효율성, 일치성, 충족성), 구간추정은 모수가 특정한 구간에 있을것이라고 선언 모수가 구간안에 있을 가능성의 크기를 신뢰수준이라고 함. 유의수준 귀무가설이 옳은데도 이를 기각하는 확률의 크기, 기각역 귀무가설이 옳다는 전제 하에서 구한 검정통계량의 분포에서 확률이 유의수준a인 부분, 검정통계량이란?̊̈
제1종오류와 제2종오류, 기각력이란, a와b가 상충관계에 있다는 의미는?̊̈
모수적 검정과 비모수적 검정이란?̊̈ 모집단의 분포에 대해 측정하는 방법. 자료수가 많지 않거나 서열관계일때는 비모수를 사용해야함. 모수적검정은 표본평균, 표본분산등을 사용, 비모수검정은 크기에 의존하지 않은 rank나 관측값차이 부호를 이용해 검정 . 비모수 검정의 예시 등
왜도가 음, 양, 0일때 평균, 중앙값, 최빈값이 어디에 위치하는지 암기법, 첨도가 3일때 정규분포와 비슷
산점도에서 두변수사이의 선형관계, 함수관계, 이상값, 집단을 확인할 수 있음
공분산은 두 변수간의 방향성만 확인 가능 특징 및 한계
이를 보완하기 위한 상관계수의 특징 및 정의
상관분석에는 피어슨과 스피어만이 있으며 개념 특징에 대해 있어야함.
일표본 t 검정의 정의 및 가정(정규분포, 연속형변수, 기준값), 대응표본 t 검정(정규성), 독립표본 t 검정(정규성, 독립성, 등분산성, 모분산동일) 각 T 검정의 R 코드 결과 및 해석방법.
분산분석이란 무엇인지(F통계량 사용), 가정(독립성, 정규성, 등분산성), 사후검정이 왜 필요한지(던칸 MRT, 피셔LSD, 튜키 HSD, scheffe), 이원배치분산분석은 무엇인지(교호작용 검증 필수) 정규성 등분산성,
교차분석이란 무엇인지 적합도검정, 독립성검정, 동질성검정에 사용되며 카이제곱검정통계량 사용. 적합도검정이 무엇인지 독립성검정이 무엇인지, 동질성검정이 무엇인지
회귀분석의 가정(선형성, 등분산성, 정규성, 독립성), 다중선형회귀분석 시 검토사항(회귀분석의 가정, 다중공선성, 허용오차가 0.1이하 또는 VIF가 10 이상)
최적회귀방정식 선택하는법 (전진, 후진, 단계)의 각 장단점 , 가장 최적화된 모형은 AIC와 BIC가 최소가 되어야함.
정규화 선형회귀란 무엇인가. L1,L2 엘라스틱넷에 대한 정의
시계열 분석 시계열 자료의 종류에는 비정상성 시계열 자료와 정상성 시계열 자료가 있음. 정상성이란 무엇인지(평균일정, 분산일정, 공분산은 시차에만 의존 t,s에 의존하지 않음 평균은 차분을 통해 정상화 가능, 분산은 변환을 통해 정상화 가능) 차분이란 현시점 자료에서 저닛점 자료를 빼는것
시계열 모형에 대해(자기회귀모형, 이동평균모형, 자귀회귀누적이동평균모형)의 정의와 특징.
분해 시계열이란 무엇이고 일반적인 정의(추세, 계절, 순환, 불규칙)
다차원 척도란 무엇인가, 거리계산에는 유클리드 거리행렬을 사용한다, 정확도를 높이기 위해 적합정도를 스트레스값으로 나타낸다. 다차원척도의 종류(계량적, 비계량적)
주성분의 선택법에서 누적기여율이나 scree plot을 활용한 해석방법. 85%와 급격히 완만해지는 지점의 바로 전단계
데이터마이닝의 정의와 종류 그리고 프로세스
지도학습(의사결정나무, 인공신경망, 일반화선형모형, 선형회귀분석, 로지스틱 회귀분석, 사례기반추론, k-최근접이웃)과 비지도학습 (OLAP, 연관성규칙, 군집분석, SOM) 의 분석방법
분석목적에는 크게 예측과 설명이 있음 예측에는 분류가 있음, 설명에는 연관규칙, 연속규칙, 데이터 군집화 등이 있음
데이터 마이닝의 단계(목적설정 → 데이터준비 → 가공 → 기법적용 → 검증)
성과분석하는법메트릭스에서(정분류율, 특이도, 민감도, 재현율, F1-score을구하는 문제)
AUROC, Lift chart가 무엇인지
DNN, CNN, RNN, GAN, RBM, DBN의 정의와 차이
최대우도추정방법이 뭐인가, 우도란?̊̈
의사결정나무는 분류나무와 회귀나무가 있음. 세분화, 분류, 예측, 차원축소및변수선택, 교호작용효과의 파악에 활용됨. 장점: 빠름, 상관성이 높은 다른 변수가 있어도 영향 안받음, 정확도 높음, 단점: 과대적합가능, 경계선 부근 오차 가능, 중요도판단 어려움
지니지수의 예시와 지니지수 구하는법 , 엔트로피의 예시와 엔트로피 구하는법
나이브베이즈 분류의 개념, 베이즈정리란 무엇인지, K-NN, svm이란 무엇인지
앙상블 기법이란 무엇인지, 배깅과 부스팅의 차이점, GBM, RF의 각 장단점
뉴런의 활성화함수의 예시와 각 정의
비계층적 군집분석인 K-means군집분석 방식의 수행방식과 장단점 (연속형변수에 활용, 초기중심값은 임의선택, 탐욕적 알고리즘)
SOM이 무엇인지 그리고 구성은 어떻게 되어있는지, 신경망 모형과의 차이점은 무엇인지, 특징은 무엇인지
데이터 분활과정에서의 K-Fold Cross Validation, 홀드아웃, 붓스트랩의 방법과 개념의 특징
계층적 군집화와 분할적 군집화가 무엇인지. DBSCAN의 기법 설명
연관규칙이 무엇인지, 지지도, 신뢰도, 향상도란 무엇인지, 연관규칙의 장점과 단점
텍스트 마이닝의 정의와 기능, Corpus의 개념과 처리방법(더이상 추가적인 절차 없이 데이터 마이닝 알고리즘에 활용할 수 있는 상태) 텍스트 전처리 과정(토큰화, 불용어처리, 대소문자통일, 어근추출, 텍스트인코딩)
사회연결망 분석의 정의와 네트워크 표현방식, 그리고 네트워크 구조를 파악하기 위한 기법