ข้ามไปยังเนื้อหาหลัก

คอร์ส

Deep Reinforcement Learning ด้วย Python

ขั้นสูง4 ชม.

เรียนรู้และใช้ขั้นตอนวิธี Deep Reinforcement Learning อันทรงพลัง รวมถึงเทคนิคการปรับแต่งและการเพิ่มประสิทธิภาพ

Python4 ชม.15 วิดีโอ49 แบบฝึกหัด4,050 XP5,775ใบแสดงความสำเร็จ

สร้างบัญชีฟรีของคุณ

ดำเนินการต่อด้วย Google
หรือ
การดำเนินการต่อหมายความว่าคุณยอมรับ เงื่อนไขการใช้งาน, ของเรา นโยบายความเป็นส่วนตัว และข้อมูลของคุณถูกจัดเก็บไว้ในสหรัฐอเมริกา

ได้รับความไว้วางใจจากผู้เรียนในหลายพันบริษัท

รายละเอียดคอร์ส

ค้นพบเทคนิคอันทันสมัยที่ช่วยให้เครื่องจักรเรียนรู้และโต้ตอบกับสภาพแวดล้อมของตนได้ คุณจะได้ดำดิ่งสู่โลกของ Deep Reinforcement Learning (DRL) และได้รับประสบการณ์ลงมือปฏิบัติจริงกับอัลกอริทึมที่ทรงพลังที่สุดซึ่งขับเคลื่อนวงการนี้ให้ก้าวหน้า คุณจะใช้ PyTorch และสภาพแวดล้อม Gymnasium เพื่อสร้างเอเจนต์ของคุณเอง

เชี่ยวชาญพื้นฐานของการเรียนรู้แบบเสริมกำลังเชิงลึก

การเดินทางของเราเริ่มต้นด้วยพื้นฐานของ DRL และความสัมพันธ์ของมันกับ Reinforcement Learning แบบดั้งเดิม จากนั้น เราจะก้าวไปสู่การนำ Deep Q-Networks (DQN) ไปใช้งานใน PyTorch อย่างรวดเร็ว รวมถึงการปรับปรุงขั้นสูง เช่น Double DQN และ Prioritized Experience Replay เพื่อเพิ่มพลังให้กับโมเดลของคุณยกระดับทักษะของคุณไปอีกขั้นเมื่อคุณสำรวจวิธีการแบบอิงนโยบาย คุณจะได้เรียนรู้และนำเทคนิคสำคัญของนโยบายกราเดียนต์ เช่น REINFORCE และวิธีการแบบ Actor-Critic ไปใช้จริง

ใช้ขั้นตอนวิธีล้ำสมัย

คุณจะได้พบกับอัลกอริทึม DRL อันทรงพลังที่นิยมใช้กันอย่างแพร่หลายในอุตสาหกรรมปัจจุบัน รวมถึง Proximal Policy Optimization (PPO) คุณจะได้รับประสบการณ์จริงกับเทคนิคที่ขับเคลื่อนความก้าวหน้าครั้งสำคัญในหุ่นยนต์ เกม AI และอื่นๆ อีกมากมาย สุดท้าย คุณจะได้เรียนรู้วิธีเพิ่มประสิทธิภาพโมเดลของคุณโดยใช้ Optuna สำหรับการปรับแต่งไฮเปอร์พารามิเตอร์เมื่อจบหลักสูตรนี้ คุณจะมีทักษะในการนำเทคนิคล้ำสมัยเหล่านี้ไปประยุกต์ใช้กับปัญหาในโลกจริง และปลดล็อกศักยภาพสูงสุดของ DRL!

ข้อกำหนดเบื้องต้น

หลักสูตร

โครงสร้างคอร์ส

2

Deep Q-learning

เจาะลึก Deep Q-learning ด้วยการสร้างอัลกอริทึม DQN ต้นฉบับ ซึ่งประกอบด้วย Experience Replay, epsilon-greedy policy และ Fixed Q-targets จากนั้นสำรวจสองส่วนขยายที่น่าสนใจซึ่งช่วยเพิ่มประสิทธิภาพและความเสถียรของ Deep Q-learning ได้แก่ Double DQN และ Prioritized Experience Replay
เริ่มบทเรียน
3

บทนำสู่ Policy Gradient Methods

เรียนรู้แนวคิดพื้นฐานของ policy gradient methods ใน DRL โดยเริ่มจาก policy gradient theorem ซึ่งเป็นรากฐานของวิธีการเหล่านี้ จากนั้นนำอัลกอริทึม REINFORCE มาใช้งาน ซึ่งเป็นแนวทางที่มีประสิทธิภาพในการเรียนรู้ policy บทนี้จะพาไปทำความรู้จักกับ Actor-Critic methods โดยเน้นที่อัลกอริทึม Advantage Actor-Critic (A2C) ที่ผสานจุดแข็งของทั้ง policy gradient และ value-based methods เพื่อเพิ่มประสิทธิภาพและความเสถียรในการเรียนรู้
เริ่มบทเรียน
4

Proximal Policy Optimization และเทคนิค DRL

สำรวจ Proximal Policy Optimization (PPO) เพื่อประสิทธิภาพ DRL ที่แข็งแกร่ง จากนั้นศึกษาการใช้ entropy bonus ใน PPO ซึ่งส่งเสริมการสำรวจโดยป้องกันไม่ให้ policy เข้าสู่แนวทางที่แน่นอนเร็วเกินไป รวมถึงเรียนรู้การอัปเดตแบบ batch ใน policy gradient methods และปิดท้ายด้วยการปรับ hyperparameter ด้วย Optuna เครื่องมือทรงพลังสำหรับเพิ่มประสิทธิภาพโมเดล DRL
เริ่มบทเรียน

Deep Reinforcement Learning ด้วย Python

เรียนจบแล้ว

รับใบรับรองความสำเร็จ

ลงทะเบียนเลย

พัฒนาทักษะด้านข้อมูลของคุณด้วย DataCamp บนมือถือ

ก้าวหน้าได้ทุกที่ด้วยคอร์สมือถือและแบบฝึกหัดการเขียนโค้ด 5 นาทีประจำวันของเรา