Build your ultimate AI agent
课程介绍
驾驭多模态 AI 的力量
深入探索前沿的多模态 AI 模型世界,在这里,文本、图像和语音相结合,打造强大的应用。 了解如何利用 Hugging Face 庞大的模型库,这些模型能够以前所未有的方式看、听和理解。 无论你是在分析社交媒体内容、构建语音助手,还是开发下一代 AI 应用,多模态模型都是你无缝处理多种数据类型的入门之选。掌握核心多模态技术
探索最先进的模型,如用于图文理解的 CLIP、用于语音合成的 SpeechT5,以及用于多模态情感分析的 Qwen2 Vision Language 模型。 通过实践练习,您将掌握领先 AI 公司用于构建复杂多模态系统的技术。让你的 AI 技能面向未来
本课程将为你提供一套强大的工具包,帮助你应对多模态 AI 任务。 您将学习如何有效处理和组合不同的数据模态,为定制应用微调预训练模型,并跨模态评估和提升模型性能。先修要求
课程大纲
课程大纲
1
访问 Hugging Face 模型与数据集
浏览 Hugging Face 模型中心,将原始文本、音频和视觉数据转换为适合 AI 处理的格式。学习如何为文本生成等任务找到最新最热门的模型,并充分利用预构建的 pipeline。
2
单模态的视觉、音频与文本模型
使用最先进的模型掌握各个单一模态。深入学习用于图像分类与分割的计算机视觉,探索语音识别与文本转语音合成,并掌握高效的微调技巧。基于 Hugging Face transformers 库中的预训练模型构建实用技能。
3
用于分类的多模态模型
融合视觉、文本与音频信息,打造更强大的 AI 应用。掌握如 CLIP 等零样本分类技术,构建"能看也能读"的情感分析器,并创建结合面部表情与语音的情绪检测器。让您的 AI 模型跳出单一模态的局限。
4
多模态生成
把创意变为现实!掌握前沿 AI 技术,使用文本提示生成与编辑视觉内容。创建令人惊艳的图像、智能编辑照片,并为图像与文档构建强大的问答系统。借助多模态 AI,将您的创意愿景转化为数字现实。
使用 Hugging Face 的多模态模型
课程完成

