Build your ultimate AI agent
รายละเอียดคอร์ส
ผสานประสิทธิภาพของ Generative AI เข้ากับความเชี่ยวชาญของมนุษย์ในคอร์สนี้ว่าด้วย Reinforcement Learning from Human Feedback เรียนรู้วิธีทำให้โมเดล GenAI สะท้อนค่านิยมและความต้องการของมนุษย์ได้อย่างแท้จริง พร้อมฝึกปฏิบัติจริงกับ LLMs นอกจากนี้ยังได้สำรวจความซับซ้อนของ reward model และเรียนรู้วิธีต่อยอด LLMs เพื่อสร้าง AI ที่ไม่เพียงแค่เรียนรู้ แต่ยังปรับตัวเข้ากับสถานการณ์จริงได้ด้วย
ข้อกำหนดเบื้องต้น
หลักสูตร
โครงสร้างคอร์ส
1
แนวคิดพื้นฐาน
บทนี้แนะนำพื้นฐานของ Reinforcement Learning with Human Feedback (RLHF) ซึ่งเป็นเทคนิคที่ใช้ข้อมูลป้อนกลับจากมนุษย์เพื่อช่วยให้โมเดล AI เรียนรู้ได้อย่างมีประสิทธิภาพมากขึ้น เริ่มต้นกับ RLHF โดยทำความเข้าใจว่าแตกต่างจาก reinforcement learning แบบดั้งเดิมอย่างไร และเหตุใด human feedback จึงช่วยยกระดับประสิทธิภาพของ AI ในหลากหลายด้าน
- RLHF เบื้องต้น50 XP
- การสร้างข้อความด้วย RLHF100 XP
- การจำแนกข้อความที่สร้างขึ้นสำหรับ RLHF100 XP
- RL vs. RLHF50 XP
- สำรวจ LLM ที่ผ่านการฝึกมาแล้ว50 XP
- Tokenize ชุดข้อมูลข้อความ100 XP
- การ Fine-tune สำหรับการจำแนกรีวิว100 XP
- การเตรียมข้อมูลสำหรับ RLHF50 XP
- การเตรียมชุดข้อมูล preference100 XP
- การดึงข้อมูล Prompt50 XP
2
การรวบรวม Human Feedback
เรียนรู้วิธีตั้งค่าระบบสำหรับรวบรวม human feedback ในบทนี้ ครอบคลุมแนวปฏิบัติที่ดีที่สุดในการเก็บข้อมูลคุณภาพสูง ตั้งแต่การเปรียบเทียบแบบคู่ (pairwise comparisons) ไปจนถึง uncertainty sampling พร้อมสำรวจกลยุทธ์ต่าง ๆ เพื่อยกระดับการเก็บข้อมูล
3
การปรับแต่งโมเดลด้วย Human Feedback
ในบทนี้จะเจาะลึกแก่นของการฝึก Reinforcement Learning from Human Feedback ครอบคลุมการ fine-tune ด้วย PPO เทคนิคการฝึกอย่างมีประสิทธิภาพ และการจัดการกับความเบี่ยงเบนที่อาจเกิดขึ้นจากวัตถุประสงค์ของ metric
4
การประเมินโมเดล
สำรวจเทคนิคสำคัญในการประเมินและปรับปรุงประสิทธิภาพของโมเดลในบทสุดท้ายของ Reinforcement Learning from Human Feedback (RLHF) ตั้งแต่การปรับแต่ง metric ไปจนถึงการนำ feedback จากแหล่งที่หลากหลายมาใช้ เพื่อมอบชุดเครื่องมือครบครันสำหรับการพัฒนาโมเดลอย่างมีประสิทธิผล
Reinforcement Learning from Human Feedback (RLHF)
เรียนจบแล้ว

