跳至主要内容

课程

使用 PyTorch 高效训练 AI 模型

高级4 小时

掌握使用 Accelerator 和 Trainer 进行分布式训练,加速大型语言模型的训练过程

Python4 小时13 个视频45 个练习3,850 XP1,658成就证明

创建您的免费账户

继续使用 Google
继续即表示您接受我们的 使用条款,我们的 隐私政策 ,并且您的数据存储在美国。

深受数千家公司学习者的喜爱

要培训团队?

试用企业版

课程简介

分布式训练是大规模机器学习中的一项关键技能,能够帮助您缩短训练拥有数万亿参数的大型语言模型所需的时间。 在本课程中,您将学习使用 PyTorch、Accelerator 和 Trainer 进行高效分布式训练所需的工具、技术与策略。

为分布式训练准备数据

您将首先通过在多台设备之间拆分数据集,并在每台设备上部署模型副本,为分布式训练做好数据准备。 您将获得在分布式环境中对数据进行预处理的实践经验,涵盖图像、音频和文本等内容。

探索高效技巧

当您的数据准备就绪后,您将学习如何在多个界面中提升训练和优化器使用的效率。 您将学习如何通过提升内存利用率、设备间通信和计算效率,来应对这些挑战。课程将介绍诸如梯度累积、梯度检查点、本地随机梯度下降以及混合精度训练等技术。 您将了解不同优化器之间的权衡,从而帮助您减少模型的内存占用。在本课程结束时,您将掌握构建分布式 AI 驱动服务所需的知识与工具。

先修要求

课程体系

课程大纲

1

使用 Accelerator 进行数据准备

您将通过将数据划分到多台设备并在每台设备上复制模型,为分布式训练做好数据准备。Accelerator 提供了便捷的数据准备接口,您将学习如何对图像、音频和文本进行预处理,作为分布式训练的第一步。
开始本章
2

结合 Accelerator 与 Trainer 的分布式训练

3

提升训练效率

使用 PyTorch 高效训练 AI 模型

课程已完成

获得成就证明

立即报名

通过 DataCamp 移动版提升您的数据技能

借助我们的移动课程和每日 5 分钟编程挑战,随时随地取得进步。