Build your ultimate AI agent
코스 설명
통계, 상품 리뷰, 가격처럼 데이터가 많은 정보를 보여 주지만, 바로 분석하기엔 적합하지 않은 형식의 웹사이트를 본 적이 있으신가요? 많은 기관과 데이터 제공자가 데이터를 깔끔한 표 형태로 공개하지만, 모든 사이트에 다운로드 버튼이 있는 것은 아닙니다. 걱정 마세요. 이 강의에서는 R을 사용해 어떤 웹사이트에서도 데이터를 효율적으로 수집하고 다운로드하는 방법을 배웁니다. rvest와 httr 패키지를 사용해 Wikipedia를 자동으로 스크레이핑하고 파싱하는 법을 익히게 됩니다. 또한 실습을 통해 웹페이지의 구성 요소인 HTML과 CSS에 대한 이해를 넓히고, 데이터 수집 워크플로를 더 안전하고 효율적으로 만드는 방법을 연습합니다.
사전 요구 사항
커리큘럼
코스 개요
1
HTML과 웹 스크레이핑 입문
이 챕터에서는 현대 웹사이트의 구조를 정의하는 선언형 언어인 Hyper Text Markup Language(HTML)를 소개합니다. rvest 라이브러리를 사용해 간단한 HTML 요소를 질의하고, 첫 번째 표를 스크레이핑하는 방법을 배웁니다.
2
CSS로 탐색하고 선택하기
Cascading Style Sheets(CSS)는 색상, 글꼴, 전반적인 레이아웃 등 웹페이지에서 HTML 요소가 표시되는 방식을 정의합니다. 이 챕터에서는 웹 스크레이핑에서 CSS 선택자와 결합자가 왜 핵심 도구인지 알아봅니다.
3
XPATH로 고급 선택하기
이전 챕터에서 배운 CSS 선택자는 강력하지만 한계가 있습니다. 예를 들어, 하위 요소의 속성에 따라 노드를 선택하고 싶을 때가 그렇습니다. 이럴 때는 XPath가 해결책입니다! 이 질의 언어를 사용하면 복잡하고 난해한 HTML도 탐색하고 스크레이핑할 수 있습니다.
4
스크레이핑 모범 사례
이제 웹페이지에서 콘텐츠를 추출하는 방법을 알게 되었으니, 무대 뒤를 살펴볼 시간입니다. 마지막 챕터에서는 모든 스크레이핑 작업의 기반이 HTTP 요청임을 이해하고, 웹 스크레이핑의 모범 사례를 준수하도록 요청을 커스터마이즈하는 방법을 배웁니다.
R
R로 배우는 웹 스크레이핑
코스
완료

