본문으로 바로가기

코스

Python으로 배우는 Deep Reinforcement Learning

고급4시간

정교화와 최적화 기법을 포함한 강력한 Deep Reinforcement Learning 알고리즘을 학습하고 활용합니다.

Python4시간15개 동영상49개 연습 문제4,050 XP5,775수료 확인서

무료 계정 만들기

Google에서 계속 진행
또는
계속 진행하시면 다음 약관에 동의하는 것으로 간주됩니다: 이용약관, 우리의 개인정보 처리방침 그리고 귀하의 데이터가 미국에 저장된다는 점입니다.

수천 개 기업의 학습자가 선택한 서비스

코스 설명

기계가 학습하고 주변 환경과 상호작용할 수 있게 하는 최첨단 기법을 알아보세요. 딥 강화 학습(DRL)의 세계에 뛰어들어 이 분야를 이끄는 가장 강력한 알고리즘을 직접 실습하며 경험하게 됩니다. PyTorch와 Gymnasium 환경을 사용하여 자신만의 에이전트를 구축하게 됩니다.

딥 강화 학습의 기초를 마스터하세요

우리의 여정은 DRL의 기초와 전통적인 강화 학습과의 관계에서 시작됩니다. 그다음에는 PyTorch에서 Deep Q-Networks(DQN)를 빠르게 구현하는 단계로 넘어가며, Double DQN과 Prioritized Experience Replay 같은 고급 개선 기법까지 포함해 모델의 성능을 한층 끌어올립니다.정책 기반 방법을 탐구하며 실력을 한 단계 끌어올리세요. REINFORCE와 Actor-Critic 기법과 같은 필수 정책 경사 기법을 배우고 구현하게 됩니다.

최첨단 알고리즘 사용하기

오늘날 업계에서 널리 사용되는 강력한 DRL 알고리즘들을 접하게 되며, 여기에는 Proximal Policy Optimization(PPO)도 포함됩니다. 로봇공학, 게임 AI 등에서 혁신을 이끄는 기법을 실무적으로 익히게 됩니다. 마지막으로, 하이퍼파라미터 튜닝을 위해 Optuna를 사용해 모델을 최적화하는 방법을 배우게 됩니다.이 강의를 마치면, 이러한 최첨단 기법을 실제 문제에 적용하고 DRL의 잠재력을 최대한 활용할 수 있는 역량을 갖추게 됩니다!

사전 요구 사항

커리큘럼

코스 개요

1

Deep Reinforcement Learning 소개

3

Policy Gradient 방법 소개

DRL에서 사용되는 정책 경사(policy gradient) 방법의 핵심 개념을 학습합니다. 이 방법들의 토대가 되는 정책 경사 정리부터 시작해, 정책을 학습하는 강력한 접근법인 REINFORCE 알고리즘을 구현합니다. 이어서 Actor-Critic 방법을 다루며, 정책 경사와 가치 기반 방법의 장점을 결합해 학습 효율성과 안정성을 높이는 Advantage Actor-Critic(A2C) 알고리즘에 집중합니다.
챕터 시작하기
4

Proximal Policy Optimization과 DRL 팁

강건한 DRL 성능을 위한 Proximal Policy Optimization(PPO)을 탐구합니다. 다음으로, 결정적 정책에 성급히 수렴하는 것을 막아 탐색을 장려하는 엔트로피 보너스를 PPO에서 어떻게 사용하는지 살펴봅니다. 또한 정책 경사 방법에서의 배치 업데이트를 학습합니다. 마지막으로, DRL 모델의 성능을 높이기 위한 강력한 도구인 Optuna로 하이퍼파라미터를 최적화하는 방법을 배웁니다.
챕터 시작하기

Python으로 배우는 Deep Reinforcement Learning

코스
완료

성취 확인서 획득하기

지금 등록하기

DataCamp for Mobile로 데이터 스킬을 키워보세요

모바일 강의와 매일 5분 코딩 챌린지로 이동 중에도 학습을 진행하세요.