Build your ultimate AI agent
コース説明
統計、商品レビュー、価格など、データがたくさん載っているのに、そのままでは分析に使いにくい形式のWebサイトを見たことはありませんか? 行政機関やその他のデータ提供者は、きれいに整形された表でデータを公開することも多いですが、必ずしもダウンロードボタンがあるとは限りません。そこで本コースでは、Rを使ってあらゆるWebサイトから効率的にデータを収集・ダウンロードする方法を学びます。rvestとhttrパッケージを使って、Wikipediaのスクレイピングとパースを自動化する方法を身につけます。演習を通して、Webページの基盤であるHTMLとCSSへの理解も深め、データ収集のワークフローをより堅牢かつ効率的にしていきます。
前提条件
カリキュラム
コース概要
1
HTMLとWebスクレイピングの基本
この章では、現代のWebサイトの構造化に使われる宣言的言語、Hyper Text Markup Language (HTML) を紹介します。rvestライブラリを使い、シンプルなHTML要素のクエリ方法を学び、最初の表をスクレイピングします。
2
CSSでのナビゲーションと要素選択
Cascading Style Sheets (CSS) は、色、フォント、レイアウトなど、Webページ上でHTML要素がどのように表示されるかを定義します。この章では、CSSセレクタとコンビネータがWebスクレイピングにおいて重要な理由を学びます。
3
XPATHによる高度な選択
前の章で学んだCSSセレクタは強力ですが、限界もあります。たとえば、子孫の属性に基づいてノードを選択したい場合などです。そこで役立つのがXPathです! このクエリ言語を使えば、どんな扱いづらいHTMLでもナビゲートしてスクレイピングできます。
4
スクレイピングのベストプラクティス
Webページからコンテンツを抽出する方法がわかったところで、次はその裏側を見ていきましょう。最終章では、あらゆるスクレイピング処理の基盤がHTTPリクエストである理由と、ベストプラクティスに沿うようにそれらをカスタマイズする方法を学びます。
R
Rで学ぶWebスクレイピング
コース修了

