ข้ามไปยังเนื้อหาหลัก

คอร์ส

Reinforcement Learning from Human Feedback (RLHF)

ขั้นสูง4 ชม.

เรียนรู้วิธีทำให้โมเดล GenAI สะท้อนคุณค่าของมนุษย์อย่างแท้จริง พร้อมลงมือใช้ LLM ขั้นสูงจริงๆ

Python4 ชม.13 วิดีโอ38 แบบฝึกหัด2,900 XP3,901หนังสือรับรองความสำเร็จ

สร้างบัญชีฟรีของคุณ

ดำเนินการต่อด้วย Google
หรือ
เมื่อดำเนินการต่อ ถือว่าคุณยอมรับ ข้อกำหนดการใช้งานและ นโยบายความเป็นส่วนตัว และยอมรับว่าข้อมูลของคุณจะถูกจัดเก็บในสหรัฐอเมริกา

ได้รับความไว้วางใจจากผู้เรียนในบริษัทหลายพันแห่ง

กำลังฝึกอบรมทีมอยู่ใช่ไหม?

ทดลองใช้สำหรับองค์กร

รายละเอียดคอร์ส

ผสานประสิทธิภาพของ Generative AI เข้ากับความเชี่ยวชาญของมนุษย์ในคอร์สนี้ว่าด้วย Reinforcement Learning from Human Feedback เรียนรู้วิธีทำให้โมเดล GenAI สะท้อนค่านิยมและความต้องการของมนุษย์ได้อย่างแท้จริง พร้อมฝึกปฏิบัติจริงกับ LLMs นอกจากนี้ยังได้สำรวจความซับซ้อนของ reward model และเรียนรู้วิธีต่อยอด LLMs เพื่อสร้าง AI ที่ไม่เพียงแค่เรียนรู้ แต่ยังปรับตัวเข้ากับสถานการณ์จริงได้ด้วย

ข้อกำหนดเบื้องต้น

หลักสูตร

โครงร่างคอร์ส

1

แนวคิดพื้นฐาน

บทนี้แนะนำพื้นฐานของ Reinforcement Learning with Human Feedback (RLHF) ซึ่งเป็นเทคนิคที่ใช้ข้อมูลป้อนกลับจากมนุษย์เพื่อช่วยให้โมเดล AI เรียนรู้ได้อย่างมีประสิทธิภาพมากขึ้น เริ่มต้นกับ RLHF โดยทำความเข้าใจว่าแตกต่างจาก reinforcement learning แบบดั้งเดิมอย่างไร และเหตุใด human feedback จึงช่วยยกระดับประสิทธิภาพของ AI ในหลากหลายด้าน
เริ่มบท
2

การรวบรวม Human Feedback

เรียนรู้วิธีตั้งค่าระบบสำหรับรวบรวม human feedback ในบทนี้ ครอบคลุมแนวปฏิบัติที่ดีที่สุดในการเก็บข้อมูลคุณภาพสูง ตั้งแต่การเปรียบเทียบแบบคู่ (pairwise comparisons) ไปจนถึง uncertainty sampling พร้อมสำรวจกลยุทธ์ต่าง ๆ เพื่อยกระดับการเก็บข้อมูล
เริ่มบท
3

การปรับแต่งโมเดลด้วย Human Feedback

ในบทนี้จะเจาะลึกแก่นของการฝึก Reinforcement Learning from Human Feedback ครอบคลุมการ fine-tune ด้วย PPO เทคนิคการฝึกอย่างมีประสิทธิภาพ และการจัดการกับความเบี่ยงเบนที่อาจเกิดขึ้นจากวัตถุประสงค์ของ metric
เริ่มบท
4

การประเมินโมเดล

สำรวจเทคนิคสำคัญในการประเมินและปรับปรุงประสิทธิภาพของโมเดลในบทสุดท้ายของ Reinforcement Learning from Human Feedback (RLHF) ตั้งแต่การปรับแต่ง metric ไปจนถึงการนำ feedback จากแหล่งที่หลากหลายมาใช้ เพื่อมอบชุดเครื่องมือครบครันสำหรับการพัฒนาโมเดลอย่างมีประสิทธิผล
เริ่มบท

Reinforcement Learning from Human Feedback (RLHF)

เรียนคอร์สจบแล้ว

รับใบรับรองความสำเร็จ

ลงทะเบียนเลย

พัฒนาทักษะด้านข้อมูลของคุณด้วย DataCamp for Mobile

เรียนรู้ได้ทุกที่ด้วยคอร์สบนมือถือและโจทย์เขียนโค้ด 5 นาทีประจำวัน