メインコンテンツにスキップ

コース

人間のフィードバックによる強化学習(RLHF)

上級4 時間

人間の価値観を正確に反映するGenAIの作り方を学び、先進的なLLMで実践スキルを身につけましょう。

Python4 時間動画 13 本演習 38 件2,900 XP3,901修了証明書

無料アカウントを作成する

Googleで続行
または
続行すると、次に同意したものとみなされます: 利用規約プライバシーポリシー 、およびデータが米国内に保管されることに同意したものとみなされます。

何千もの企業の学習者に愛されています

チームでトレーニングをお考えですか?

法人向けプランを試す

コースの説明

このコースでは、生成AIの効率性と人間の専門知識の理解を組み合わせた、人間のフィードバックによる強化学習(RLHF)を学びます。GenAIモデルが人間の価値観や好みを的確に反映する方法を理解し、LLMを用いた実践も行います。報酬モデルの複雑さを把握し、LLMを基盤に現実世界に適応できるAIを構築する手法を身につけます。

前提条件

カリキュラム

コース概要

1

基礎概念

この章では、人間の入力を活用してAIモデルの学習をより効果的にする手法である人間のフィードバックによる強化学習(RLHF)の基本を紹介します。従来の強化学習との違いを理解し、人間のフィードバックがさまざまな領域でAIの性能をどのように高めるかを学んで、RLHFの第一歩を踏み出しましょう。
2

人間のフィードバックの収集

この章では、人間のフィードバックを収集するための仕組みの整え方を学びます。ペアワイズ比較から不確実性サンプリングまで、高品質なデータ収集のベストプラクティスを身につけ、データ収集を強化するための戦略も探ります。
3

人間のフィードバックによるモデルのチューニング

この章では、人間のフィードバックによる強化学習(RLHF)トレーニングの核心に踏み込みます。PPOを用いたファインチューニングの理解、効率的に学習するテクニック、メトリクスの目標からの乖離への対処までを扱います。
4

モデル評価

この最終章では、人間のフィードバックによる強化学習(RLHF)のモデル性能を評価・改善する主要手法を学びます。ファインチューニングの指標設計から多様なフィードバック源の取り込みまで、モデルを効果的に洗練させるための総合的なツールキットを提供します。

人間のフィードバックによる強化学習(RLHF)

コース修了

修了証明書を取得

今すぐ登録する

DataCamp for Mobileでデータスキルを伸ばしましょう

モバイルコースと毎日5分のコーディングチャレンジで、外出先でも学習を進められます。