Ir al contenido principal

Curso

Reinforcement Learning from Human Feedback (RLHF)

Avanzado4 h

Aprende a crear modelos de IA generativa que reflejen los valores humanos mientras adquieres experiencia práctica con LLM avanzados.

Python4 h13 vídeos38 ejercicios2,900 XP3,781Certificado de logro

Crea tu cuenta gratis

Continuar con Google
o
Al continuar, aceptas nuestros los Términos de uso, nuestro la Política de privacidad y que tus datos se almacenan en EE. UU.

Les encanta a estudiantes de miles de empresas

¿Formando a un equipo?

Prueba para empresas

Descripción del curso

Combina la eficiencia de la IA generativa con el criterio de la experiencia humana en este curso sobre Reinforcement Learning from Human Feedback. Aprenderás a hacer que los modelos de GenAI reflejen de verdad los valores y preferencias humanas mientras adquieres experiencia práctica con LLMs. También abordarás las complejidades de los modelos de recompensa y aprenderás a construir sobre LLMs para producir una IA que no solo aprenda, sino que también se adapte a escenarios del mundo real.

Requisitos previos

Programa de formación

Contenido del curso

1

Conceptos fundamentales

Este capítulo presenta las bases de Reinforcement Learning with Human Feedback (RLHF), una técnica que usa la aportación humana para que los modelos de IA aprendan de forma más efectiva. Empieza con RLHF entendiendo en qué se diferencia del aprendizaje por refuerzo tradicional y por qué el feedback humano puede mejorar el rendimiento de la IA en distintos ámbitos.
Empezar capítulo
2

Recopilación de feedback humano

Descubre cómo configurar sistemas para recopilar feedback humano en este capítulo. Aprende buenas prácticas para recoger datos de alta calidad, desde comparaciones por pares hasta muestreo por incertidumbre, y explora estrategias para potenciar tu proceso de recopilación de datos.
Empezar capítulo
3

Ajuste de modelos con feedback humano

En este capítulo, entrarás en el núcleo del entrenamiento con Reinforcement Learning from Human Feedback. Esto incluye explorar el fine-tuning con PPO, técnicas para entrenar de forma eficiente y cómo manejar posibles desviaciones respecto a los objetivos de tus métricas.
Empezar capítulo
4

Evaluación de modelos

Explora técnicas clave para evaluar y mejorar el rendimiento del modelo en este último capítulo de Reinforcement Learning from Human Feedback (RLHF): desde métricas de fine-tuning hasta la incorporación de fuentes de feedback diversas, contarás con un conjunto de herramientas completo para perfeccionar tus modelos de forma efectiva.
Empezar capítulo

Reinforcement Learning from Human Feedback (RLHF)

Curso
completado

Obtén el certificado de logro

Inscríbete ahora

Desarrolla tus habilidades con la aplicación móvil de DataCamp

Progresa sobre la marcha con nuestros cursos móviles y desafíos diarios de 5 minutos.