본문으로 바로가기

코스

Reinforcement Learning from Human Feedback (RLHF)

고급4시간

인간적 가치를 충실히 반영하는 GenAI 모델을 설계하고, 최신 LLM을 직접 다루며 실무 역량을 키우십시오.

Python4시간13개 동영상38개 연습 문제2,900 XP3,780수료 확인서

무료 계정 만들기

Google에서 계속 진행
또는
계속 진행하시면 다음 약관에 동의하는 것으로 간주됩니다: 이용약관, 우리의 개인정보 처리방침 그리고 귀하의 데이터가 미국에 저장된다는 점입니다.

수천 개 기업의 학습자가 선택한 서비스

코스 설명

이 강의에서는 Generative AI의 효율성과 인간 전문성의 통찰을 결합한 Reinforcement Learning from Human Feedback를 다룹니다. GenAI 모델이 인간의 가치와 선호를 충실히 반영하도록 만드는 방법을 배우고, LLM을 직접 다루며 실습해 보세요. 또한 보상 모델의 복잡성을 이해하고, LLM을 기반으로 실제 환경에 잘 학습하고 적응하는 AI를 구축하는 방법을 익힙니다.

사전 요구 사항

커리큘럼

코스 개요

1

핵심 개념

이 챕터에서는 Reinforcement Learning with Human Feedback(RLHF)의 기초를 소개합니다. RLHF는 인간의 입력을 활용해 AI 모델이 더 효과적으로 학습하도록 돕는 기법입니다. 전통적인 강화학습과의 차이점, 그리고 인간 피드백이 다양한 분야에서 AI 성능을 어떻게 높이는지 이해하며 RLHF를 시작해 보세요.
챕터 시작하기
2

인간 피드백 수집

이 챕터에서는 인간 피드백을 수집하는 시스템을 구축하는 방법을 알아봅니다. 쌍대 비교부터 불확실성 샘플링까지, 고품질 데이터를 수집하기 위한 모범 사례를 배우고, 데이터 수집을 강화하는 전략도 살펴봅니다.
챕터 시작하기
3

인간 피드백으로 모델 튜닝

이 챕터에서는 Reinforcement Learning from Human Feedback 학습의 핵심을 다룹니다. PPO를 활용한 파인튜닝, 효율적인 학습 기법, 그리고 지표 목표에서 발생할 수 있는 일탈을 다루는 방법을 포함합니다.
챕터 시작하기
4

모델 평가

이 마지막 챕터에서는 Reinforcement Learning from Human Feedback(RLHF)에서 모델 성능을 평가하고 개선하는 핵심 기법을 살펴봅니다. 파인튜닝 지표부터 다양한 피드백 소스의 통합까지, 모델을 효과적으로 다듬는 데 필요한 포괄적인 도구 모음을 제공합니다.
챕터 시작하기

Reinforcement Learning from Human Feedback (RLHF)

코스
완료

성취 확인서 획득하기

지금 등록하기

DataCamp for Mobile로 데이터 스킬을 키워보세요

모바일 강의와 매일 5분 코딩 챌린지로 이동 중에도 학습을 진행하세요.

Reinforcement Learning from Human Feedback (RLHF) | DataCamp