Pular para o conteúdo principal

Curso

Modelos multimodais com Hugging Face

Intermediário4 h

Junte texto, imagens, áudio e vídeo com os modelos de IA mais recentes da Hugging Face e crie novas imagens e vídeos!

Python4 h14 vídeos45 exercícios3,800 XP2,131Declaração de conquista

Crie sua conta gratuita

Continuar com o Google
ou
Ao continuar, você aceita nossa Termos de Uso, nossos Política de Privacidade e que seus dados são armazenados nos EUA.

Amado por alunos em milhares de empresas

Treinando uma equipe?

Experimente para Empresas

Descrição do curso

Aproveite o poder da IA multimodal

Mergulhe no mundo inovador dos modelos de IA multimodal, onde texto, imagens e voz se juntam para criar aplicativos incríveis. Aprenda a usar o enorme repositório de modelos da Hugging Face que podem ver, ouvir e entender como nunca antes. Se você está analisando conteúdo de mídias sociais, criando assistentes de voz ou desenvolvendo aplicativos de IA de última geração, os modelos multimodais são a sua porta de entrada para lidar com vários tipos de dados de forma integrada.

Domine as técnicas multimodais essenciais

Dá uma olhada em modelos super modernos, tipo o CLIP pra entender imagens e textos, o SpeechT5 pra sintetizar voz e o modelo Qwen2 Vision Language pra análise multimodal de sentimentos. Com exercícios práticos, você vai dominar as técnicas que as principais empresas de IA usam pra criar sistemas multimodais bem sofisticados.

Prepare suas habilidades em IA para o futuro

Este curso vai te dar um kit de ferramentas robusto para lidar com tarefas de IA multimodal. Você vai aprender a processar e juntar diferentes tipos de dados de forma eficaz, ajustar modelos pré-treinados para aplicações personalizadas e avaliar e melhorar o desempenho dos modelos em todos os tipos de dados.

Pré-requisitos

Programa de estudos

Descrição do curso

1

Acessando modelos e conjuntos de dados do Hugging Face

2

Modelos unimodais de visão, áudio e texto

3

Modelos multimodais para classificação

Aprenda a juntar informações visuais, textuais e de áudio para ter aplicativos de IA mais legais. Domine técnicas como CLIP para classificação zero-shot, crie analisadores de sentimentos que veem e leem e crie detectores de emoções que combinam expressões faciais com a voz. Leve seus modelos de IA além do pensamento de modalidade única.
Iniciar capítulo
4

Geração multimodal

Transforme suas ideias em realidade! Domine técnicas de IA de ponta para criar e mexer em conteúdo visual usando comandos de texto. Crie imagens incríveis, edite fotos de forma inteligente e crie sistemas poderosos de perguntas e respostas para imagens e documentos. Transforme sua visão criativa em realidade digital com IA multimodal.
Iniciar capítulo

Modelos multimodais com Hugging Face

Curso
concluído

Obtenha um certificado de conclusão

Inscreva-se agora

Desenvolva suas habilidades em dados com o DataCamp para Mobile

Progrida onde estiver com nossos cursos no celular e desafios diários de programação de 5 minutos.