Build your ultimate AI agent
コース説明
表形式のデータを分析するのは楽しいものです。でも、いちばん知りたい情報が、きれいに整ったデータセットではなくプレーンテキストでしか手に入らないとしたらどうでしょう?ご安心ください。このコースでは、テキストの塊から分析に必要な情報を見つけ出せる、強力な正規表現の作り方を一から学びます。さらに、文字列距離の考え方を使って、誤字やスキャンミスを含むテキストでも、他のデータソースの正しい候補に照合できる(レコードリンケージ)方法を学びます。学習素材としては、スイスの映画館における興行収入に関する実在の文書を分析します。
前提条件
カリキュラム
コース概要
1
正規表現:カスタムパターンの作成
正規表現は特殊文字が多く、最初は圧倒されがちです。この章では、それらを読み解き、探したいものを的確に見つけるための自分だけのパターンを書けるようになります。
2
データから文字列を作る
この章では正規表現から少し離れて、ベクトルやリストといった他のデータ構造から文字列を作る、文字列操作に焦点を当てます。
3
テキストから構造化データを抽出する
正規表現が真価を発揮するタスクのひとつは、テキストの塊から意味を取り出すことです。この章では、整然とした表ではなくプレーンテキストで与えられた乱雑なデータから、情報を抽出する方法を学びます。
4
文字列同士の類似度
最後の章では、正規表現から離れて文字列距離の理解にシフトします。複数の文字列の違いを計算することで、互いに似ているものを突き止められます。これにより、誤字のような小さなエラーがあっても重複を発見できます。これは、複数のソースからデータセットを統合するレコードリンケージの重要な要素です。
R
Rで学ぶ中級正規表現
コース修了

