メインコンテンツにスキップ

コース

Pythonで学ぶ正規表現

初級4 時間

文字列操作を学び、正規表現を自在に使いこなせるようになりましょう。

Python4 時間動画 15 本演習 54 件4,650 XP49,724修了証明書

無料アカウントを作成する

Googleで続行
または
続行すると、次に同意したものとみなされます: 利用規約プライバシーポリシー 、およびデータが米国内に保管されることに同意したものとみなされます。

何千もの企業の学習者に愛されています

チームでトレーニングをお考えですか?

法人向けプランを試す

コースの説明

データサイエンティストとして、巨大なテキストコーパスから重要な情報を抽出したり、文字列を含む乱れたデータをクリーンアップしたり、有用な単語を見つけるためにパターンを検出・照合したりする場面に多く出会います。これらはすべてテキストマイニングの一部であり、Machine Learning のアルゴリズムを適用する前の重要なステップです。本コースでは、文字列操作と正規表現に関する重要な概念をわかりやすく解説します。文字列の分割や結合、埋め込み(補間)に加え、正規表現を使った検出・抽出・置換・マッチングの方法を学びます。これらのスキルを身につける過程で、意見分析に使える映画レビューやストリーミングされたツイートのデータセット、さらにウェブから取得した生テキストも扱います。

前提条件

カリキュラム

コース概要

1

文字列操作の基本概念

正規表現の世界への第一歩を踏み出しましょう。スライスや連結、大小文字の変換、空白の除去、文字列の検索と置換まで、映画レビューのデータセットを使いながら、文字列操作の基本的な手順を身につけます。
2

文字列のフォーマット

学習を進めながら、ウェブから取得した情報を含むデータセットを用いて、Pythonで文字列をフォーマット(補間)する主なアプローチを学びます。位置指定によるフォーマット、文字列リテラル内への式の埋め込み、そして Template クラスの活用について、その利点と注意点を比較します。
3

パターンマッチングのための正規表現

正規表現の基本概念を学ぶ時間です。この重要な章では、正規表現の構文の基礎を理解します。感情分析向けの実データ(ツイート)を使って、通常文字と特殊文字、さらに欲張り(greedy)と非欲張り(lazy)な量指定子によるパターンマッチングを適用する方法を学びます。
4

正規表現の発展的な概念

学習の最終段階では、かっこを使って文字列をグループ化したり、以前にマッチしたのと同じテキストに一致させたりする、より高度なパターンマッチングを学びます。さらに、先読み・後読みといった「ルックアラウンド」表現の考え方もつかみます。

Pythonで学ぶ正規表現

コース修了

修了証明書を取得

今すぐ登録する

DataCamp for Mobileでデータスキルを伸ばしましょう

モバイルコースと毎日5分のコーディングチャレンジで、外出先でも学習を進められます。