Build your ultimate AI agent
コース説明
データサイエンティストとして、巨大なテキストコーパスから重要な情報を抽出したり、文字列を含む乱れたデータをクリーンアップしたり、有用な単語を見つけるためにパターンを検出・照合したりする場面に多く出会います。これらはすべてテキストマイニングの一部であり、Machine Learning のアルゴリズムを適用する前の重要なステップです。本コースでは、文字列操作と正規表現に関する重要な概念をわかりやすく解説します。文字列の分割や結合、埋め込み(補間)に加え、正規表現を使った検出・抽出・置換・マッチングの方法を学びます。これらのスキルを身につける過程で、意見分析に使える映画レビューやストリーミングされたツイートのデータセット、さらにウェブから取得した生テキストも扱います。
前提条件
カリキュラム
コース概要
1
文字列操作の基本概念
正規表現の世界への第一歩を踏み出しましょう。スライスや連結、大小文字の変換、空白の除去、文字列の検索と置換まで、映画レビューのデータセットを使いながら、文字列操作の基本的な手順を身につけます。
2
文字列のフォーマット
学習を進めながら、ウェブから取得した情報を含むデータセットを用いて、Pythonで文字列をフォーマット(補間)する主なアプローチを学びます。位置指定によるフォーマット、文字列リテラル内への式の埋め込み、そして Template クラスの活用について、その利点と注意点を比較します。
3
パターンマッチングのための正規表現
正規表現の基本概念を学ぶ時間です。この重要な章では、正規表現の構文の基礎を理解します。感情分析向けの実データ(ツイート)を使って、通常文字と特殊文字、さらに欲張り(greedy)と非欲張り(lazy)な量指定子によるパターンマッチングを適用する方法を学びます。
4
正規表現の発展的な概念
学習の最終段階では、かっこを使って文字列をグループ化したり、以前にマッチしたのと同じテキストに一致させたりする、より高度なパターンマッチングを学びます。さらに、先読み・後読みといった「ルックアラウンド」表現の考え方もつかみます。
Pythonで学ぶ正規表現
コース修了

