본문으로 바로가기
R

강의

R로 데이터 정리하기

중급기술 수준
업데이트됨 2024. 8.
원시 데이터에서 유의미한 인사이트로 빠르게 나아가도록, 데이터를 신속하고 정확하게 정제하는 방법을 학습합니다.
무료로 강의 시작
RData Preparation
4시간
13 동영상
44 연습 문제
3,700 XP
61,199
성취 증명서

무료 계정 만들기

Google에서 계속 진행더 많은 옵션 보기

또는


계속 진행하시면 당사의 이용약관개인정보처리방침에 동의하고 및 귀하의 데이터가 미국에 저장되는 것에 동의하게 됩니다.

수천 개 기업의 학습자들이 사랑하는

Group

팀을 교육하시나요?

비즈니스용으로 체험해 보세요

강의 설명

R에서 중복 제거 등 흔한 데이터 문제 해결하기

데이터 과학자는 시간의 80%를 데이터 정리와 조작에, 20%만 분석에 쓴다는 말이 있죠. 정리는 필수입니다. 지저분한 데이터를 분석하면 잘못된 결론에 이를 수 있기 때문이에요.

이 강의에서는 R을 사용해 지저분한 데이터를 정리하는 다양한 기법을 배웁니다. 데이터 타입을 변환하고, 값의 범위를 제한하며, 완전/부분 중복을 처리해 이중 집계를 방지하는 것부터 시작해요.

더 어려운 데이터 문제에 도전하기

흔한 문제를 다뤄 본 뒤에는 단위 일관성 보장, 결측치 처리와 같은 고급 과제에 도전합니다. 각 개념을 배운 뒤에는 실습을 통해 바로 적용해 보며 이해를 확실히 다질 수 있어요.

데이터 정리에서 Record Linkage 활용하기

Record Linkage는 오탈자나 철자 차이가 있어도 데이터셋을 병합할 때 사용하는 기법입니다. 마지막 장에서는 이 유용한 방법을 살펴보고, 두 개의 음식점 리뷰 데이터셋을 하나로 결합하는 실습으로 적용해 봅니다.

선수 조건

Joining Data with dplyr
1

흔한 데이터 문제

이 장에서는 가장 흔한 지저분한 데이터 문제를 해결하는 방법을 배웁니다. 데이터 타입을 변환하고, 미래 시점의 값을 제거하기 위해 범위 제한을 적용하며, 중복된 데이터를 제거해 이중 집계를 피할 거예요.
챕터 시작
2

범주형과 텍스트 데이터

범주형과 텍스트 데이터는 비정형이라는 특성 때문에 데이터셋에서 가장 지저분한 부분이 되곤 합니다. 이 장에서는 범주 라벨의 공백과 대소문자 불일치를 고치고, 여러 범주를 하나로 통합하며, 문자열 형식을 일관되게 재구성하는 방법을 배웁니다.
챕터 시작
3

고급 데이터 문제

이 장에서는 파운드 대신 킬로그램으로 무게를 통일하는 것처럼 더 고급의 데이터 정리 문제를 다룹니다. 또한 값이 올바르게 입력되었는지 검증하고, 결측치가 분석에 부정적 영향을 주지 않도록 하는 데 필요한 핵심 기술을 익힐 수 있어요.
챕터 시작
4

Record Linkage

Record linkage는 값에 오탈자나 철자 차이가 있을 때 여러 데이터셋을 하나로 병합하는 강력한 기법입니다. 이 장에서는 문자열 간 유사도를 계산해 레코드를 연결하는 방법을 배우고, 이를 활용해 두 개의 음식점 리뷰 데이터셋을 하나의 깔끔한 마스터 데이터셋으로 결합합니다.
챕터 시작
R로 데이터 정리하기
강의
완료

수료증 획득

LinkedIn 프로필, 이력서 또는 CV에 이 인증서를 추가하세요
소셜 미디어와 성과 평가에서 공유하세요
지금 등록

19백만 명 이상의 학습자와 함께 R로 데이터 정리하기을(를) 시작하세요!

무료 계정 만들기

Google에서 계속 진행더 많은 옵션 보기

또는


계속 진행하시면 당사의 이용약관개인정보처리방침에 동의하고 및 귀하의 데이터가 미국에 저장되는 것에 동의하게 됩니다.

DataCamp for Mobile을 통해 데이터 분석 능력을 향상시키세요.

모바일 강좌와 매일 5분 코딩 챌린지를 통해 이동 중에도 학습 효과를 높이세요.