Lewati ke konten utama

Kursus

Reinforcement Learning from Human Feedback (RLHF)

Lanjutan4 jam

Python4 jam13 video38 Latihan2,900 XP3,782Pernyataan pencapaian

Buat Akun Gratis Anda

Lanjutkan dengan Google
atau
Dengan melanjutkan, Anda menyetujui Ketentuan Penggunaan, kami Kebijakan Privasi dan bahwa data Anda disimpan di AS.

Disukai pelajar di ribuan perusahaan

Deskripsi Kursus

Padukan efisiensi Generative AI dengan pemahaman keahlian manusia dalam kursus Reinforcement Learning from Human Feedback ini. Anda akan mempelajari cara membuat model GenAI benar-benar mencerminkan nilai dan preferensi manusia sekaligus mendapatkan pengalaman langsung dengan LLM. Anda juga akan menavigasi kompleksitas model penghargaan dan mempelajari cara membangun di atas LLM untuk menghasilkan AI yang tidak hanya belajar, tetapi juga beradaptasi dengan skenario dunia nyata.

Prasyarat

Kurikulum

Garis besar kursus

1

Konsep Dasar

Bab ini memperkenalkan dasar-dasar Reinforcement Learning with Human Feedback (RLHF), sebuah teknik yang menggunakan masukan manusia untuk membantu model AI belajar lebih efektif. Mulailah dengan RLHF dengan memahami perbedaannya dari reinforcement learning tradisional dan mengapa umpan balik manusia dapat meningkatkan kinerja AI di berbagai domain.
Mulai Bab
2

Mengumpulkan Umpan Balik Manusia

Pelajari cara menyiapkan sistem untuk mengumpulkan umpan balik manusia dalam Bab ini. Kuasai praktik terbaik untuk mengumpulkan data berkualitas tinggi, dari perbandingan berpasangan hingga pengambilan sampel berbasis ketidakpastian, serta jelajahi strategi untuk meningkatkan pengumpulan data Anda.
Mulai Bab
3

Penyelarasan Model dengan Umpan Balik Manusia

Dalam Bab ini, Anda akan masuk ke inti pelatihan Reinforcement Learning from Human Feedback. Ini mencakup penjelajahan fine-tuning dengan PPO, teknik untuk melatih secara efisien, dan menangani potensi penyimpangan dari tujuan metrik Anda.
Mulai Bab
4

Evaluasi Model

Jelajahi teknik-teknik kunci untuk menilai dan meningkatkan kinerja model dalam Bab terakhir Reinforcement Learning from Human Feedback (RLHF): mulai dari penyetelan metrik hingga mengintegrasikan beragam sumber umpan balik, Anda akan mendapatkan seperangkat alat komprehensif untuk menyempurnakan model secara efektif.
Mulai Bab

Reinforcement Learning from Human Feedback (RLHF)

Kursus
Selesai

Dapatkan Sertifikat Penyelesaian

Daftar Sekarang

Kembangkan keterampilan data Anda dengan DataCamp untuk Mobile

Lanjutkan pembelajaran Anda di mana saja dengan kursus mobile kami dan tantangan coding 5 menit setiap hari.