Build your ultimate AI agent
Kursbeschreibung
Kombiniere in diesem Kurs zur Methode Reinforcement Learning aus menschlichem Feedback die Effizienz von Generative AI mit dem Verständnis menschlicher Expertise. Du lernst, wie GenAI-Modelle menschliche Werte und Vorlieben wirklich widerspiegeln und sammelst praktische Erfahrung mit LLMs. Außerdem navigierst du die Komplexität von Belohnungsmodellen und erfährst, wie du auf LLMs aufbaust, um KI zu entwickeln, die nicht nur lernt, sondern sich auch an reale Szenarien anpasst.
Voraussetzungen
Lernprogramm
Kursübersicht
1
Grundlagen
Dieses Kapitel führt in die Grundlagen von Reinforcement Learning aus menschlichem Feedback (RLHF) ein – eine Technik, die menschliche Rückmeldungen nutzt, damit KI-Modelle effektiver lernen. Starte mit RLHF, indem du verstehst, wie es sich vom klassischen Reinforcement Learning unterscheidet und warum menschliches Feedback die KI-Leistung in verschiedenen Bereichen steigern kann.
- Einführung in RLHF50 XP
- Textgenerierung mit RLHF100 XP
- Generierten Text für RLHF klassifizieren100 XP
- RL vs. RLHF50 XP
- Vortrainierte LLMs erkunden50 XP
- Einen Textdatensatz tokenisieren100 XP
- Feinabstimmung für die Review-Klassifikation100 XP
- Daten für RLHF vorbereiten50 XP
- Den Präferenzdatensatz vorbereiten100 XP
- Prompts extrahieren50 XP
2
Menschliches Feedback sammeln
Erfahre in diesem Kapitel, wie du Systeme für das Sammeln von menschlichem Feedback aufsetzt. Lerne Best Practices für das Erheben hochwertiger Daten – von paarweisen Vergleichen bis hin zu Uncertainty Sampling – und entdecke Strategien, um deine Datenerhebung zu verbessern.
3
Modelle mit menschlichem Feedback optimieren
In diesem Kapitel tauchst du in den Kern des Trainings mit Reinforcement Learning aus menschlichem Feedback ein. Dazu gehören Fine-Tuning mit PPO, effiziente Trainingsmethoden und der Umgang mit möglichen Abweichungen von den Zielgrößen deiner Metriken.
4
Modellevaluierung
Entdecke in diesem letzten Kapitel zu Reinforcement Learning aus menschlichem Feedback (RLHF) zentrale Techniken zur Bewertung und Verbesserung der Modellleistung: von Fine-Tuning-Metriken bis zur Einbindung vielfältiger Feedbackquellen erhältst du ein umfassendes Toolkit, um deine Modelle gezielt zu verfeinern.
Reinforcement Learning aus menschlichem Feedback (RLHF)
Kurs
abgeschlossen

