Accéder au contenu principal

Cours

Reinforcement Learning from Human Feedback (RLHF)

Avancé4 h

Découvrez comment créer des modèles GenAI qui reflètent les valeurs humaines tout en acquérant une expérience pratique avec des LLM avancés.

Python4 h13 vidéos38 exercices2,900 XP3,781Attestation de réussite

Créez votre compte gratuit

Continuer avec Google
ou
En continuant, vous acceptez nos Conditions d’utilisation, notre notre Politique de confidentialité et que vos données sont stockées aux États-Unis.

Plébiscité par des apprenants dans des milliers d’entreprises

Description du cours

Alliez l’efficacité de l’IA générative à la compréhension de l’expertise humaine dans ce cours sur le Reinforcement Learning from Human Feedback. Vous apprendrez à faire en sorte que les modèles de GenAI reflètent réellement les valeurs et préférences humaines, tout en vous exerçant concrètement avec des LLM. Vous aborderez aussi les subtilités des modèles de récompense et verrez comment tirer parti des LLM pour créer une IA qui non seulement apprend, mais s’adapte aussi aux situations réelles.

Prérequis

Programme de formation

Plan du cours

1

Concepts fondamentaux

Ce chapitre présente les bases du Reinforcement Learning with Human Feedback (RLHF), une approche qui s’appuie sur des retours humains pour aider les modèles d’IA à apprendre plus efficacement. Commencez avec le RLHF en comprenant en quoi il diffère de l’apprentissage par renforcement classique et pourquoi les retours humains peuvent améliorer les performances de l’IA dans divers domaines.
Commencer le chapitre
2

Collecte de retours humains

Découvrez comment mettre en place des systèmes de collecte de retours humains dans ce chapitre. Apprenez les bonnes pratiques pour constituer des données de haute qualité — des comparaisons par paires à l’échantillonnage par incertitude — et explorez des stratégies pour renforcer votre collecte de données.
Commencer le chapitre
3

Ajuster les modèles à partir de retours humains

Dans ce chapitre, vous entrerez au cœur de l’entraînement en Reinforcement Learning from Human Feedback. Vous explorerez notamment le fine-tuning avec PPO, des techniques pour s’entraîner efficacement et la gestion des divergences possibles par rapport aux objectifs de vos métriques.
Commencer le chapitre
4

Évaluation des modèles

Explorez les techniques essentielles pour évaluer et améliorer les performances des modèles dans ce dernier chapitre sur le Reinforcement Learning from Human Feedback (RLHF) : des métriques de fine-tuning à l’intégration de sources de retours variées, vous disposerez d’une boîte à outils complète pour affiner vos modèles avec efficacité.
Commencer le chapitre

Reinforcement Learning from Human Feedback (RLHF)

Cours
terminé

Obtenir un certificat d'achèvement

S’inscrire maintenant

Apprenez où que vous soyez avec l'application DataCamp

Même en déplacement, suivez quotidiennement nos cours mobiles et nos défis de codage de 5 minutes.