Pular para o conteúdo principal

Curso

Modelos multimodais com Hugging Face

Intermediário4 h

Junte texto, imagens, áudio e vídeo com os modelos de IA mais recentes da Hugging Face e crie novas imagens e vídeos!

Python4 h14 vídeos45 exercícios3,800 XP1,937Declaração de aproveitamento

Crie sua conta gratuita

Continuar com o Google
ou
Ao continuar, você aceita nossos Termos de uso, nosso Política de privacidade e que seus dados sejam armazenados nos EUA.

Amado por alunos em milhares de empresas

Treinando um time?

Teste para empresas

Descrição do curso

Aproveite o poder da IA multimodal

Mergulhe no mundo inovador dos modelos de IA multimodal, onde texto, imagens e voz se juntam para criar aplicativos incríveis. Aprenda a usar o enorme repositório de modelos da Hugging Face que podem ver, ouvir e entender como nunca antes. Se você está analisando conteúdo de mídias sociais, criando assistentes de voz ou desenvolvendo aplicativos de IA de última geração, os modelos multimodais são a sua porta de entrada para lidar com vários tipos de dados de forma integrada.

Domine as técnicas multimodais essenciais

Dá uma olhada em modelos super modernos, tipo o CLIP pra entender imagens e textos, o SpeechT5 pra sintetizar voz e o modelo Qwen2 Vision Language pra análise multimodal de sentimentos. Com exercícios práticos, você vai dominar as técnicas que as principais empresas de IA usam pra criar sistemas multimodais bem sofisticados.

Prepare suas habilidades em IA para o futuro

Este curso vai te dar um kit de ferramentas robusto para lidar com tarefas de IA multimodal. Você vai aprender a processar e juntar diferentes tipos de dados de forma eficaz, ajustar modelos pré-treinados para aplicações personalizadas e avaliar e melhorar o desempenho dos modelos em todos os tipos de dados.

Pré-requisitos

Programa de estudos

Conteúdo do curso

1

Acessando modelos e conjuntos de dados do Hugging Face

2

Modelos unimodais de visão, áudio e texto

3

Modelos multimodais para classificação

Aprenda a juntar informações visuais, textuais e de áudio para ter aplicativos de IA mais legais. Domine técnicas como CLIP para classificação zero-shot, crie analisadores de sentimentos que veem e leem e crie detectores de emoções que combinam expressões faciais com a voz. Leve seus modelos de IA além do pensamento de modalidade única.
Começar capítulo
4

Geração multimodal

Transforme suas ideias em realidade! Domine técnicas de IA de ponta para criar e mexer em conteúdo visual usando comandos de texto. Crie imagens incríveis, edite fotos de forma inteligente e crie sistemas poderosos de perguntas e respostas para imagens e documentos. Transforme sua visão criativa em realidade digital com IA multimodal.
Começar capítulo

Modelos multimodais com Hugging Face

Curso
concluído

Obtenha o certificado de conclusão

Inscreva-se agora

Desenvolva suas habilidades em dados com o DataCamp for Mobile

Continue progredindo em qualquer lugar com nossos cursos e desafios diários de programação de 5 minutos.