Build your ultimate AI agent
คำอธิบายเส้นทางการเรียน
การเรียนรู้แบบเสริมกำลัง ใน Python
เชี่ยวชาญพื้นฐานของการเรียนรู้แบบเสริมกำลัง (RL) และค้นพบวิธีสร้างโมเดลเพื่อรับมือกับสภาพแวดล้อมที่ซับซ้อนซึ่งมักพบในหุ่นยนต์และวิดีโอเกมหากคุณเพิ่งเริ่มต้นกับการเรียนรู้แบบเสริมแรง หรืออยากเชี่ยวชาญการเรียนรู้แบบเสริมแรงในฐานะสาขาหนึ่งของการเรียนรู้ของเครื่อง นี่คือจุดเริ่มต้นที่เหมาะอย่างยิ่งคุณจะเริ่มต้นด้วยการเรียนรู้แนวคิดหลักของการเรียนรู้แบบเสริมกำลัง เช่น กระบวนการตัดสินใจแบบมาร์คอฟ การแลกเปลี่ยนระหว่างการสำรวจ/การใช้ประโยชน์ และอัลกอริทึมการโปรแกรมแบบไดนามิก คุณจะได้เรียนรู้การประยุกต์ใช้ Q-learning, SARSA และวิธีการอื่นๆ เพื่อสำรวจเทือกเขาและทะเลสาบน้ำแข็งจากไลบรารี Gymnasiumคุณจะผสานการเรียนรู้เชิงลึกและการเรียนรู้แบบเสริมกำลัง และค้นพบการเรียนรู้เชิงลึกแบบเสริมกำลัง ซึ่งสามารถใช้ฝึกเอเจนต์ให้สำรวจสภาพแวดล้อมที่ซับซ้อนมากได้ด้วยการกำกับดูแลเพียงเล็กน้อยระหว่างทาง คุณจะนำเทคนิคเหล่านี้ไปใช้แก้โจทย์โปรเจกต์จริง รวมถึงการปรับเส้นทางแท็กซี่ให้เหมาะสมและการจำลองการซื้อขายหุ้นด้วยเครื่องมือการเรียนรู้แบบเสริมกำลังเหล่านี้อยู่ในมือ คุณก็พร้อมที่จะเริ่มรับมือกับการประยุกต์ใช้การเรียนรู้แบบเสริมกำลังรูปแบบใหม่ที่น่าตื่นเต้น: การเรียนรู้แบบเสริมกำลังจากข้อเสนอแนะของมนุษย์ (RLHF) RLHF สามารถใช้เพื่อปรับปรุงผลลัพธ์ของ LLM ได้โดยการฝึกจากข้อเสนอแนะของมนุษย์ต่อการตอบสนองของมันเริ่มต้นเส้นทางการเรียนรู้แบบเสริมกำลังของคุณวันนี้!
ข้อกำหนดเบื้องต้น
ไม่มีข้อกำหนดเบื้องต้นสำหรับเส้นทางการเรียนนี้