700+ courses, half price
Описание трека
Обучение с подкреплением на Python
Освойте основы обучения с подкреплением (RL) и узнайте, как создавать модели для навигации в сложных средах, часто встречающихся в робототехнике и видеоиграх.Если вы новичок в обучении с подкреплением или хотите специализироваться на обучении с подкреплением как разделе машинного обучения, это идеальное место для начала.Вы начнёте с изучения ключевых концепций обучения с подкреплением, таких как марковские процессы принятия решений, компромиссы между исследованием и эксплуатацией и алгоритмы динамического программирования. Вы научитесь применять Q-learning, SARSA и другие методы для навигации по горным хребтам и замёрзшим озёрам из библиотеки Gymnasium.Вы объедините глубокое обучение и обучение с подкреплением и познакомитесь с глубоким обучением с подкреплением, которое можно использовать для обучения агентов навигации в очень сложных средах при минимальном надзоре.По ходу дела вы примените эти методы для решения реальных проектов, включая оптимизацию маршрутов такси и симуляцию торговли акциями.С этими инструментами обучения с подкреплением под рукой вы готовы начать осваивать новое захватывающее применение обучения с подкреплением: обучение с подкреплением на основе обратной связи от человека (RLHF). RLHF можно использовать для улучшения результатов LLM, обучая их на человеческой обратной связи по их ответам.Начните свой путь в обучении с подкреплением уже сегодня!
Предварительные требования
Для этого трека нет предварительных требований