ข้ามไปยังเนื้อหาหลัก

คอร์ส

Reinforcement Learning from Human Feedback (RLHF)

ขั้นสูง4 ชม.

เรียนรู้วิธีทำให้โมเดล GenAI สะท้อนคุณค่าของมนุษย์อย่างแท้จริง พร้อมลงมือใช้ LLM ขั้นสูงจริงๆ

Python4 ชม.13 วิดีโอ38 แบบฝึกหัด2,900 XP3,780ใบแสดงความสำเร็จ

สร้างบัญชีฟรีของคุณ

ดำเนินการต่อด้วย Google
หรือ
การดำเนินการต่อหมายความว่าคุณยอมรับ เงื่อนไขการใช้งาน, ของเรา นโยบายความเป็นส่วนตัว และข้อมูลของคุณถูกจัดเก็บไว้ในสหรัฐอเมริกา

ได้รับความไว้วางใจจากผู้เรียนในหลายพันบริษัท

รายละเอียดคอร์ส

ผสานประสิทธิภาพของ Generative AI เข้ากับความเชี่ยวชาญของมนุษย์ในคอร์สนี้ว่าด้วย Reinforcement Learning from Human Feedback เรียนรู้วิธีทำให้โมเดล GenAI สะท้อนค่านิยมและความต้องการของมนุษย์ได้อย่างแท้จริง พร้อมฝึกปฏิบัติจริงกับ LLMs นอกจากนี้ยังได้สำรวจความซับซ้อนของ reward model และเรียนรู้วิธีต่อยอด LLMs เพื่อสร้าง AI ที่ไม่เพียงแค่เรียนรู้ แต่ยังปรับตัวเข้ากับสถานการณ์จริงได้ด้วย

ข้อกำหนดเบื้องต้น

หลักสูตร

โครงสร้างคอร์ส

1

แนวคิดพื้นฐาน

บทนี้แนะนำพื้นฐานของ Reinforcement Learning with Human Feedback (RLHF) ซึ่งเป็นเทคนิคที่ใช้ข้อมูลป้อนกลับจากมนุษย์เพื่อช่วยให้โมเดล AI เรียนรู้ได้อย่างมีประสิทธิภาพมากขึ้น เริ่มต้นกับ RLHF โดยทำความเข้าใจว่าแตกต่างจาก reinforcement learning แบบดั้งเดิมอย่างไร และเหตุใด human feedback จึงช่วยยกระดับประสิทธิภาพของ AI ในหลากหลายด้าน
เริ่มบทเรียน
2

การรวบรวม Human Feedback

เรียนรู้วิธีตั้งค่าระบบสำหรับรวบรวม human feedback ในบทนี้ ครอบคลุมแนวปฏิบัติที่ดีที่สุดในการเก็บข้อมูลคุณภาพสูง ตั้งแต่การเปรียบเทียบแบบคู่ (pairwise comparisons) ไปจนถึง uncertainty sampling พร้อมสำรวจกลยุทธ์ต่าง ๆ เพื่อยกระดับการเก็บข้อมูล
เริ่มบทเรียน
3

การปรับแต่งโมเดลด้วย Human Feedback

ในบทนี้จะเจาะลึกแก่นของการฝึก Reinforcement Learning from Human Feedback ครอบคลุมการ fine-tune ด้วย PPO เทคนิคการฝึกอย่างมีประสิทธิภาพ และการจัดการกับความเบี่ยงเบนที่อาจเกิดขึ้นจากวัตถุประสงค์ของ metric
เริ่มบทเรียน
4

การประเมินโมเดล

สำรวจเทคนิคสำคัญในการประเมินและปรับปรุงประสิทธิภาพของโมเดลในบทสุดท้ายของ Reinforcement Learning from Human Feedback (RLHF) ตั้งแต่การปรับแต่ง metric ไปจนถึงการนำ feedback จากแหล่งที่หลากหลายมาใช้ เพื่อมอบชุดเครื่องมือครบครันสำหรับการพัฒนาโมเดลอย่างมีประสิทธิผล
เริ่มบทเรียน

Reinforcement Learning from Human Feedback (RLHF)

เรียนจบแล้ว

รับใบรับรองความสำเร็จ

ลงทะเบียนเลย

พัฒนาทักษะด้านข้อมูลของคุณด้วย DataCamp บนมือถือ

ก้าวหน้าได้ทุกที่ด้วยคอร์สมือถือและแบบฝึกหัดการเขียนโค้ด 5 นาทีประจำวันของเรา

Reinforcement Learning from Human Feedback (RLHF) | DataCamp