メインコンテンツへスキップ

コース

人間のフィードバックによる強化学習(RLHF)

上級4 時間

人間の価値観を正確に反映するGenAIの作り方を学び、先進的なLLMで実践スキルを身につけましょう。

Python4 時間13 本の動画38 個の演習2,900 XP3,780修了証明書

無料アカウントを作成

Google で続行
または
続行することで、 利用規約、私たちの プライバシーポリシー そして、あなたのデータが米国に保存されること。

何千もの企業の学習者に支持されています

チームのトレーニングをお考えですか?

ビジネス向けに試す

コース説明

このコースでは、生成AIの効率性と人間の専門知識の理解を組み合わせた、人間のフィードバックによる強化学習(RLHF)を学びます。GenAIモデルが人間の価値観や好みを的確に反映する方法を理解し、LLMを用いた実践も行います。報酬モデルの複雑さを把握し、LLMを基盤に現実世界に適応できるAIを構築する手法を身につけます。

前提条件

カリキュラム

コース概要

1

基礎概念

この章では、人間の入力を活用してAIモデルの学習をより効果的にする手法である人間のフィードバックによる強化学習(RLHF)の基本を紹介します。従来の強化学習との違いを理解し、人間のフィードバックがさまざまな領域でAIの性能をどのように高めるかを学んで、RLHFの第一歩を踏み出しましょう。
2

人間のフィードバックの収集

この章では、人間のフィードバックを収集するための仕組みの整え方を学びます。ペアワイズ比較から不確実性サンプリングまで、高品質なデータ収集のベストプラクティスを身につけ、データ収集を強化するための戦略も探ります。
3

人間のフィードバックによるモデルのチューニング

この章では、人間のフィードバックによる強化学習(RLHF)トレーニングの核心に踏み込みます。PPOを用いたファインチューニングの理解、効率的に学習するテクニック、メトリクスの目標からの乖離への対処までを扱います。
4

モデル評価

この最終章では、人間のフィードバックによる強化学習(RLHF)のモデル性能を評価・改善する主要手法を学びます。ファインチューニングの指標設計から多様なフィードバック源の取り込みまで、モデルを効果的に洗練させるための総合的なツールキットを提供します。

人間のフィードバックによる強化学習(RLHF)

コース修了

達成証明書を取得する

今すぐ登録

DataCamp for Mobileでデータスキルを磨きましょう

モバイルコースと毎日5分のコーディングチャレンジで、外出先でも学習を進めましょう。

人間のフィードバックによる強化学習(RLHF) | DataCamp