Build your ultimate AI agent
코스 설명
현실 세계의 데이터는 만만치 않죠. 복잡하고 지저분한 데이터셋을 마주하면, 어디서부터 시작해야 할지 막막할 때가 있어요. tidyr 패키지는 이런 데이터를 깔끔한 형태로 다듬을 수 있게 해 줍니다. 열 이름에 숨어 있던 값은 행으로 옮기고, JSON 파일은 데이터 프레임으로 바꾸며, 결측값도 놓치지 않도록 처리할 수 있어요. 이 과정에서 다양한 지저분한 데이터셋을 다루며, 소련이 우주로 보낸 개의 수와 뉴질랜드에서 가장 인기 있는 새가 무엇인지도 알아보게 됩니다. tidyverse 도구 상자에 tidyr를 더하면, 거의 모든 데이터셋을 분석에 유리한 깔끔한 형식으로 변환할 수 있고, 이후 분석 전반에서 큰 도움이 됩니다.
사전 요구 사항
커리큘럼
코스 개요
1
Tidy 데이터
이 장에서는 본 과목의 핵심 개념인 tidy 데이터를 소개합니다. 처음 두 레슨에서는 지저분한 문자형 열을 분리해, 분석에 바로 사용할 수 있는 깔끔한 변수와 관측값으로 만드는 작업부터 시작해요. 마지막 레슨에서는 결측값을 덮어쓰고 제거하는 방법을 배웁니다.
2
Wide ↔ Long 변환
이 장에서는 pivot_longer()와 pivot_wider() 함수를 사용해 데이터를 wide 형식에서 long 형식으로, 그리고 다시 되돌리는 방법을 다룹니다. 변수들이 지저분한 열 이름에 숨어 있거나, 열이 아닌 행에 저장되어 있을 때 이 함수들이 필요해요. 학습하는 동안 우주견, 핵폭탄, 행성 온도에 관한 데이터도 함께 살펴봅니다.
3
데이터 확장
데이터에는 값이 자주 빠져 있고, 때로는 관측 자체가 통째로 없을 때도 있어요. 이 장에서는 이러한 누락된 관측을 포함해 데이터셋을 완성하는 방법을 배웁니다. 집계 데이터에 0값 관측을 추가하고, 시계열을 전체 구간으로 확장하는 등 다양한 기법을 익혀 보세요!
4
데이터 직사각형화
마지막 장에서는 JSON과 XML 같은 중첩된 데이터 구조를 깔끔한 직사각형 형태의 데이터로 변환하는 방법을 배웁니다. 이 기술은 웹 API의 데이터를 처리하는 데 유용해요. 또한 중첩 구조를 활용해 깔끔한 결과물을 만들어 내는 우아한 모델링 파이프라인을 작성하는 방법도 배웁니다.
R
tidyr로 데이터 재구조화하기
코스
완료

