メインコンテンツへスキップ

コース

Pythonで学ぶNLPの特徴量エンジニアリング

中級4 時間

テキストから有用な情報を抽出し、機械学習に適した形式へ処理する手法を学びます。

Python4 時間15 本の動画52 個の演習4,200 XP29,424修了証明書

無料アカウントを作成

Google で続行
または
続行することで、 利用規約、私たちの プライバシーポリシー そして、あなたのデータが米国に保存されること。

何千もの企業の学習者に支持されています

チームのトレーニングをお考えですか?

ビジネス向けに試す

コース説明

このコースでは、テキストから有用な情報を抽出し、Machine Learningモデルに適した形式へ処理するための手法を学びます。具体的には、品詞(POS)タグ付け、固有表現抽出(NER)、可読性スコア、n-gramやtf-idfモデルについて取り上げ、scikit-learnとspaCyを使った実装方法を学習します。さらに、2つの文書同士の類似度を計算する方法も扱います。学習の過程では、映画レビューの感情を予測し、映画とTED Talkのレコメンダを作成します。修了後は、あらゆるテキストから重要な特徴量を設計し、データサイエンスにおける難しい課題のいくつかを解決できるようになります。

前提条件

カリキュラム

コース概要

1

基本的な特徴量と可読性スコア

単語数、文字数、平均単語長、特殊文字(Twitterのハッシュタグやメンションなど)の数といった基本的な特徴量の計算方法を学びます。さらに、可読性スコアの計算と、そのテキストを理解するために必要な教育レベルの推定方法も学習します。
2

前処理、POSタグ付け、NER

この章では、トークン化とレンマ化について学びます。そのうえで、spaCyライブラリを使ってテキストクリーニング、品詞タグ付け、固有表現抽出を行う方法を学習します。これらの概念を身につけたら、ゲティスバーグ演説を機械処理しやすい形に整え、フェイクニュースにおける名詞の使われ方を分析し、TechCrunchの記事に登場する人物を特定していきます。

Pythonで学ぶNLPの特徴量エンジニアリング

コース修了

達成証明書を取得する

今すぐ登録

DataCamp for Mobileでデータスキルを磨きましょう

モバイルコースと毎日5分のコーディングチャレンジで、外出先でも学習を進めましょう。