700+ courses, half price
รายละเอียดคอร์ส
ค้นพบเทคนิคอันทันสมัยที่ช่วยให้เครื่องจักรเรียนรู้และโต้ตอบกับสภาพแวดล้อมของตนได้ คุณจะได้ดำดิ่งสู่โลกของ Deep Reinforcement Learning (DRL) และได้รับประสบการณ์ลงมือปฏิบัติจริงกับอัลกอริทึมที่ทรงพลังที่สุดซึ่งขับเคลื่อนวงการนี้ให้ก้าวหน้า คุณจะใช้ PyTorch และสภาพแวดล้อม Gymnasium เพื่อสร้างเอเจนต์ของคุณเอง
เชี่ยวชาญพื้นฐานของการเรียนรู้แบบเสริมกำลังเชิงลึก
การเดินทางของเราเริ่มต้นด้วยพื้นฐานของ DRL และความสัมพันธ์ของมันกับ Reinforcement Learning แบบดั้งเดิม จากนั้น เราจะก้าวไปสู่การนำ Deep Q-Networks (DQN) ไปใช้งานใน PyTorch อย่างรวดเร็ว รวมถึงการปรับปรุงขั้นสูง เช่น Double DQN และ Prioritized Experience Replay เพื่อเพิ่มพลังให้กับโมเดลของคุณยกระดับทักษะของคุณไปอีกขั้นเมื่อคุณสำรวจวิธีการแบบอิงนโยบาย คุณจะได้เรียนรู้และนำเทคนิคสำคัญของนโยบายกราเดียนต์ เช่น REINFORCE และวิธีการแบบ Actor-Critic ไปใช้จริงใช้ขั้นตอนวิธีล้ำสมัย
คุณจะได้พบกับอัลกอริทึม DRL อันทรงพลังที่นิยมใช้กันอย่างแพร่หลายในอุตสาหกรรมปัจจุบัน รวมถึง Proximal Policy Optimization (PPO) คุณจะได้รับประสบการณ์จริงกับเทคนิคที่ขับเคลื่อนความก้าวหน้าครั้งสำคัญในหุ่นยนต์ เกม AI และอื่นๆ อีกมากมาย สุดท้าย คุณจะได้เรียนรู้วิธีเพิ่มประสิทธิภาพโมเดลของคุณโดยใช้ Optuna สำหรับการปรับแต่งไฮเปอร์พารามิเตอร์เมื่อจบหลักสูตรนี้ คุณจะมีทักษะในการนำเทคนิคล้ำสมัยเหล่านี้ไปประยุกต์ใช้กับปัญหาในโลกจริง และปลดล็อกศักยภาพสูงสุดของ DRL!ข้อกำหนดเบื้องต้น
หลักสูตร
โครงร่างคอร์ส
1
บทนำสู่ Deep Reinforcement Learning
ทำความเข้าใจว่า Deep Reinforcement Learning พัฒนาต่อยอดจาก Reinforcement Learning แบบดั้งเดิมอย่างไร พร้อมศึกษาและลงมือสร้างอัลกอริทึม Deep Q-Learning ตัวแรก
- Deep Reinforcement Learning เบื้องต้น50 XP
- การตั้งค่า Environment และโครงข่ายประสาทเทียม100 XP
- ลูปการฝึก DRL100 XP
- บทนำสู่ Deep Q Learning50 XP
- Deep Learning และ DQN50 XP
- สถาปัตยกรรมของ Q-Network100 XP
- การสร้าง Q-Network100 XP
- อัลกอริทึม DQN แบบพื้นฐาน50 XP
- การเลือก action ด้วย DQN พื้นฐาน100 XP
- ฟังก์ชัน Loss ของ DQN แบบพื้นฐาน100 XP
- ฝึก Barebone DQN100 XP
2
Deep Q-learning
เจาะลึก Deep Q-learning ด้วยการสร้างอัลกอริทึม DQN ต้นฉบับ ซึ่งประกอบด้วย Experience Replay, epsilon-greedy policy และ Fixed Q-targets จากนั้นสำรวจสองส่วนขยายที่น่าสนใจซึ่งช่วยเพิ่มประสิทธิภาพและความเสถียรของ Deep Q-learning ได้แก่ Double DQN และ Prioritized Experience Replay
3
บทนำสู่ Policy Gradient Methods
เรียนรู้แนวคิดพื้นฐานของ policy gradient methods ใน DRL โดยเริ่มจาก policy gradient theorem ซึ่งเป็นรากฐานของวิธีการเหล่านี้ จากนั้นนำอัลกอริทึม REINFORCE มาใช้งาน ซึ่งเป็นแนวทางที่มีประสิทธิภาพในการเรียนรู้ policy บทนี้จะพาไปทำความรู้จักกับ Actor-Critic methods โดยเน้นที่อัลกอริทึม Advantage Actor-Critic (A2C) ที่ผสานจุดแข็งของทั้ง policy gradient และ value-based methods เพื่อเพิ่มประสิทธิภาพและความเสถียรในการเรียนรู้
4
Proximal Policy Optimization และเทคนิค DRL
สำรวจ Proximal Policy Optimization (PPO) เพื่อประสิทธิภาพ DRL ที่แข็งแกร่ง จากนั้นศึกษาการใช้ entropy bonus ใน PPO ซึ่งส่งเสริมการสำรวจโดยป้องกันไม่ให้ policy เข้าสู่แนวทางที่แน่นอนเร็วเกินไป รวมถึงเรียนรู้การอัปเดตแบบ batch ใน policy gradient methods และปิดท้ายด้วยการปรับ hyperparameter ด้วย Optuna เครื่องมือทรงพลังสำหรับเพิ่มประสิทธิภาพโมเดล DRL
Deep Reinforcement Learning ด้วย Python
เรียนคอร์สจบแล้ว

