본문으로 바로가기

코스

R에서 결측치 다루기

기초4시간

tidyverse 친화적 naniar로 결측값을 시각화·탐색·대치하세요. 결측 데이터 작업을 쉽고 효율적으로 수행합니다.

R4시간14개 동영상52개 연습 문제4,350 XP17,305수료 확인서

무료 계정 만들기

Google에서 계속 진행
또는
계속 진행하시면 다음 약관에 동의하는 것으로 간주됩니다: 이용약관, 우리의 개인정보 처리방침 그리고 귀하의 데이터가 미국에 저장된다는 점입니다.

수천 개 기업의 학습자가 선택한 서비스

코스 설명

현실 세계의 데이터 분석에서는 결측치가 흔히 발생합니다. 예상치 못한 곳에서 나타나 분석을 어렵게 만들기도 하죠. 이 과정에서는 tidyverse 도구와 naniar R 패키지를 활용해 결측값을 시각화하는 방법을 배웁니다. 결측값을 분석에 활용할 수 있도록 정리하고, 데이터 속 편향을 찾기 위해 결측값을 탐색해 보겠습니다. 마지막으로, 결측이 발생하는 다른 근본적인 패턴도 밝혀봅니다. 또한, 대치(imputation) 모델을 사용해 비어 있는 값을 "채워 넣는" 방법과, 이렇게 대치된 데이터셋을 시각화하고 평가하며 그에 기반해 의사결정을 내리는 방법을 학습합니다.

사전 요구 사항

커리큘럼

코스 개요

1

왜 결측치를 신경 써야 할까요?

1장에서는 결측치에 대해 소개합니다. 결측값이 무엇인지, R에서 어떻게 작동하는지, 그리고 이를 어떻게 탐지하고 개수를 세는지 설명합니다. 이어서 결측치 요약 방법을 소개하고, 사례와 변수 전반에서 결측을 요약하는 법, 그리고 데이터 내 집단별로 탐색하는 방법을 다룹니다. 마지막으로 결측치 시각화를 살펴보며, 전체 데이터셋과 변수, 사례, 기타 요약에 대한 개괄 시각화를 만드는 법, 그리고 이를 집단별로 탐색하는 방법을 알아봅니다.
챕터 시작하기
2

결측값 정리와 다듬기

2장에서는 "missing"이나 "N/A"처럼 숨겨진 결측값을 찾아 `NA`로 바꾸는 방법을 배웁니다. 또한 명시적으로 적혀 있지는 않지만 결측으로 간주되는, 암묵적 결측값을 효율적으로 처리하는 방법도 학습합니다. 아울러 결측 데이터의 의존성을 탐색하는 법을 다루며, 완전무작위 결측(MCAR), 무작위 결측(MAR), 비무작위 결측(MNAR)의 개념과 이것이 데이터 분석에 갖는 의미를 설명합니다.
챕터 시작하기
3

결측과의 관계 검정

이 장에서는 결측 데이터를 다루는 워크플로를 배웁니다. 그림자 행렬(shadow matrix)과 nabular 데이터 같은 특수한 데이터 구조를 소개하고, 이를 활용해 결측을 탐색하는 워크플로에서 결측 요약을 원 데이터의 값과 연결하는 방법을 보여 드립니다. ggplot을 사용해 다른 변수가 결측이 될 때 값이 어떻게 변하는지 탐색하고 시각화하는 방법도 학습합니다. 마지막으로 두 변수에 걸친 결측을 시각화하는 법, 그리고 산점도에서 결측을 시각화해야 하는 이유와 그 방법을 배웁니다.
챕터 시작하기
4

점들을 이어 보기(대치, Imputation)

이 장에서는 데이터의 결측값을 채우는, 즉 대치(imputation)에 대해 학습합니다. 결측값을 대치하고 추적하는 방법, 그리고 대치의 장단점을 이해해 원래 값과 비교하며 대치된 데이터를 탐색, 시각화, 평가하는 법을 배웁니다. 다양한 대치 모델을 사용하고 평가·비교하는 방법, 그리고 서로 다른 대치 모델이 모델에서 도출되는 추론에 어떤 영향을 미치는지도 탐색합니다.
챕터 시작하기
R

R에서 결측치 다루기

코스
완료

성취 확인서 획득하기

지금 등록하기

DataCamp for Mobile로 데이터 스킬을 키워보세요

모바일 강의와 매일 5분 코딩 챌린지로 이동 중에도 학습을 진행하세요.