Lewati ke konten utama

Kursus

Reinforcement Learning from Human Feedback (RLHF)

Lanjutan4 jam

Python4 jam13 video38 Latihan2,900 XP3,906Pernyataan pencapaian

Buat Akun Gratis Anda

Lanjutkan dengan Google
atau
Dengan melanjutkan, Anda menyetujui Ketentuan Penggunaan, Kebijakan Privasi dan bahwa data Anda disimpan di AS.

Disukai oleh para pelajar di ribuan perusahaan

Melatih Sebuah Tim?

Coba untuk Bisnis

Deskripsi Kursus

Padukan efisiensi Generative AI dengan pemahaman keahlian manusia dalam kursus Reinforcement Learning from Human Feedback ini. Anda akan mempelajari cara membuat model GenAI benar-benar mencerminkan nilai dan preferensi manusia sekaligus mendapatkan pengalaman langsung dengan LLM. Anda juga akan menavigasi kompleksitas model penghargaan dan mempelajari cara membangun di atas LLM untuk menghasilkan AI yang tidak hanya belajar, tetapi juga beradaptasi dengan skenario dunia nyata.

Prasyarat

Kurikulum

Ringkasan kursus

1

Konsep Dasar

Bab ini memperkenalkan dasar-dasar Reinforcement Learning with Human Feedback (RLHF), sebuah teknik yang menggunakan masukan manusia untuk membantu model AI belajar lebih efektif. Mulailah dengan RLHF dengan memahami perbedaannya dari reinforcement learning tradisional dan mengapa umpan balik manusia dapat meningkatkan kinerja AI di berbagai domain.
Mulai Bab
2

Mengumpulkan Umpan Balik Manusia

Pelajari cara menyiapkan sistem untuk mengumpulkan umpan balik manusia dalam Bab ini. Kuasai praktik terbaik untuk mengumpulkan data berkualitas tinggi, dari perbandingan berpasangan hingga pengambilan sampel berbasis ketidakpastian, serta jelajahi strategi untuk meningkatkan pengumpulan data Anda.
Mulai Bab
3

Penyelarasan Model dengan Umpan Balik Manusia

Dalam Bab ini, Anda akan masuk ke inti pelatihan Reinforcement Learning from Human Feedback. Ini mencakup penjelajahan fine-tuning dengan PPO, teknik untuk melatih secara efisien, dan menangani potensi penyimpangan dari tujuan metrik Anda.
Mulai Bab
4

Evaluasi Model

Jelajahi teknik-teknik kunci untuk menilai dan meningkatkan kinerja model dalam Bab terakhir Reinforcement Learning from Human Feedback (RLHF): mulai dari penyetelan metrik hingga mengintegrasikan beragam sumber umpan balik, Anda akan mendapatkan seperangkat alat komprehensif untuk menyempurnakan model secara efektif.
Mulai Bab

Reinforcement Learning from Human Feedback (RLHF)

Kursus
Selesai

Memperoleh Surat Keterangan Prestasi

Daftar Sekarang

Tingkatkan keterampilan data Anda dengan DataCamp for Mobile

Terus maju di mana saja dengan kursus seluler kami dan tantangan coding 5 menit harian.