Build your ultimate AI agent
Mô tả khóa học
Kết hợp hiệu quả của Generative AI với hiểu biết từ chuyên gia con người trong khóa học về Reinforcement Learning from Human Feedback này. Bạn sẽ học cách giúp các mô hình GenAI phản ánh đúng các giá trị và sở thích của con người, đồng thời thực hành trực tiếp với LLM. Bạn cũng sẽ tìm hiểu sự phức tạp của các mô hình phần thưởng và cách xây dựng trên nền tảng LLM để tạo ra AI không chỉ học mà còn thích ứng với các tình huống thực tế.
Yêu cầu tiên quyết
Chương trình học
Đề cương khóa học
1
Các khái niệm nền tảng
Chương này giới thiệu những điều cơ bản về Reinforcement Learning with Human Feedback (RLHF), một kỹ thuật sử dụng đầu vào của con người để giúp mô hình AI học hiệu quả hơn. Bắt đầu với RLHF bằng cách hiểu cách nó khác với học tăng cường truyền thống và vì sao phản hồi của con người có thể nâng cao hiệu suất AI trong nhiều lĩnh vực.
- Giới thiệu về RLHF50 XP
- Sinh văn bản với RLHF100 XP
- Phân loại văn bản sinh ra cho RLHF100 XP
- RL vs. RLHF50 XP
- Khám phá các LLM được huấn luyện sẵn50 XP
- Token hóa một tập dữ liệu văn bản100 XP
- Fine-tuning để phân loại đánh giá100 XP
- Chuẩn bị dữ liệu cho RLHF50 XP
- Chuẩn bị tập dữ liệu ưu tiên100 XP
- Trích xuất prompt50 XP
2
Thu thập phản hồi từ con người
Khám phá cách thiết lập hệ thống để thu thập phản hồi của con người trong Chương này. Tìm hiểu các phương pháp hay nhất để thu thập dữ liệu chất lượng cao, từ so sánh cặp đôi đến lấy mẫu theo độ bất định, và khám phá các chiến lược để tăng cường hoạt động thu thập dữ liệu của bạn.
3
Điều chỉnh mô hình bằng phản hồi của con người
Trong Chương này, bạn sẽ đi vào phần cốt lõi của quá trình huấn luyện Reinforcement Learning from Human Feedback. Nội dung bao gồm tìm hiểu fine-tuning với PPO, các kỹ thuật huấn luyện hiệu quả, và cách xử lý khả năng lệch khỏi mục tiêu của các thước đo.
4
Đánh giá mô hình
Khám phá các kỹ thuật chủ chốt để đánh giá và cải thiện hiệu suất mô hình trong Chương cuối của Reinforcement Learning from Human Feedback (RLHF): từ tinh chỉnh thước đo đến tích hợp nhiều nguồn phản hồi, bạn sẽ có một bộ công cụ toàn diện để tối ưu mô hình một cách hiệu quả.
Reinforcement Learning from Human Feedback (RLHF)
Hoàn
thành khóa học

