跳至内容

课程

用 Python 设计机器学习工作流

高级4 小时

学会构建经得起时间考验的数据管道。

Python4 小时16 个视频51 个练习4,200 经验值12,629结业证明

创建您的免费账户

继续使用 Google
继续即表示您接受我们的 使用条款,我们的 隐私政策 并且您的数据存储在美国。

深受上千家公司学习者喜爱

要培训团队?

试用企业版

课程介绍

借助现代工具,将机器学习模型部署到生产环境看似容易,但往往以失望收场:模型在生产中的表现不如开发阶段。通过本课程,您将掌握四项让您在数据科学领域脱颖而出的核心能力,打造经得起时间考验的流水线:如何在开发阶段穷尽式地调优模型的各个方面;如何最大化利用可用的领域专家知识;如何在生产中监控模型表现并应对性能退化;以及如何处理标签稀缺或质量欠佳的数据。课程将深入 sklearn 的前沿功能,并使用来自个性化医疗、网络安全等热门领域的真实数据集,带您从一线视角理解机器学习。

先修要求

课程大纲

课程大纲

1

标准工作流

本章将带您回顾有监督学习工作流的基础:模型拟合、调优与选择,特征工程与选择,以及数据划分技巧。您将理解工作流中各步骤彼此的依赖关系,并识别它们如何共同抑制或助长过拟合——数据科学家最大的敌人。学习完本章,您将熟练掌握有监督学习,并为后续章节的进阶内容做好准备。
开始本章
2

将人纳入环路

在上一章,您完善了对标准有监督学习工作流的理解。本章将批判性地审视如何将专家知识融入有监督学习。这包括:识别恰当的分析单元(可能需要跨多源数据进行特征工程)、处理在标注样本时难免出现的不完美过程,以及制定能真实反映业务错误代价的损失函数,从而刻画模型错误的实际业务价值。
开始本章
3

模型生命周期管理

上一章中,您以多种方式将专家的反馈融入工作流,并用与业务价值一致的方式进行评估。现在,是时候练习将模型产品化所需的技能,并通过迭代改进,确保其后续持续良好表现。您还将学习诊断数据集漂移,并减轻环境变化对模型准确率的影响。
开始本章
4

无监督工作流

在之前的章节中,您已夯实了有监督学习的基础,并了解了如何将模型部署到生产环境,但始终假设可获得带标签的数据集。本章将挑战在没有或仅有极少标签的情况下进行建模。您将学习异常检测这一类无监督建模方法,以及基于距离的学习:当我们对样本间"相似性"的信念能够替代标签时,也能帮助您达到可与有监督工作流媲美的准确度。完成本章后,您将自信地知道在面对常见的真实世界难题时,应如何调整工作流与选用工具,从而在数据科学人群中脱颖而出。
开始本章

用 Python 设计机器学习工作流

课程完成

获取成就证书

立即报名

通过 DataCamp for Mobile 提升您的数据技能

通过我们的移动课程和每日 5 分钟编程挑战,随时随地取得进步。