Depois de fazer esses cursos, sinto-me confiante para criar visualizações e painéis profissionais
Descrição do curso
Aproveite o poder da IA multimodal
Mergulhe no mundo inovador dos modelos de IA multimodal, onde texto, imagens e voz se juntam para criar aplicativos incríveis. Aprenda a usar o enorme repositório de modelos da Hugging Face que podem ver, ouvir e entender como nunca antes. Se você está analisando conteúdo de mídias sociais, criando assistentes de voz ou desenvolvendo aplicativos de IA de última geração, os modelos multimodais são a sua porta de entrada para lidar com vários tipos de dados de forma integrada.Domine as técnicas multimodais essenciais
Dá uma olhada em modelos super modernos, tipo o CLIP pra entender imagens e textos, o SpeechT5 pra sintetizar voz e o modelo Qwen2 Vision Language pra análise multimodal de sentimentos. Com exercícios práticos, você vai dominar as técnicas que as principais empresas de IA usam pra criar sistemas multimodais bem sofisticados.Prepare suas habilidades em IA para o futuro
Este curso vai te dar um kit de ferramentas robusto para lidar com tarefas de IA multimodal. Você vai aprender a processar e juntar diferentes tipos de dados de forma eficaz, ajustar modelos pré-treinados para aplicações personalizadas e avaliar e melhorar o desempenho dos modelos em todos os tipos de dados.Pré-requisitos
Programa de estudos
Conteúdo do curso
1
Acessando modelos e conjuntos de dados do Hugging Face
Dá uma olhada no hub de modelos do Hugging Face, transforma texto bruto, áudio e dados visuais em formatos que a IA curte. Aprenda a encontrar os modelos mais recentes e populares para tarefas como geração de texto e aproveite o poder dos pipelines pré-construídos.
- Navegação pelo modelo Hugging Face50 XP
- Quantos modelos!?100 XP
- Encontrando o modelo de texto para imagem mais popular100 XP
- Pré-processamento de diferentes modalidades50 XP
- Tokenização de texto100 XP
- Pré-processamento de imagens100 XP
- Pré-processamento de áudio100 XP
- Tarefas e avaliações do pipeline50 XP
- Geração de legendas de pipeline100 XP
- Passando argumentos nomeados100 XP
- Avaliação do modelo em um conjunto de dados personalizado100 XP
2
Modelos unimodais de visão, áudio e texto
Aprenda a dominar modalidades individuais com modelos de última geração. Mergulhe na visão computacional para classificação e segmentação de imagens, explore o reconhecimento de voz e a síntese de texto para voz e aprenda técnicas eficazes de ajuste fino. Desenvolva habilidades práticas com modelos pré-treinados da biblioteca de transformadores da Hugging Face.
3
Modelos multimodais para classificação
Aprenda a juntar informações visuais, textuais e de áudio para ter aplicativos de IA mais legais. Domine técnicas como CLIP para classificação zero-shot, crie analisadores de sentimentos que veem e leem e crie detectores de emoções que combinam expressões faciais com a voz. Leve seus modelos de IA além do pensamento de modalidade única.
4
Geração multimodal
Transforme suas ideias em realidade! Domine técnicas de IA de ponta para criar e mexer em conteúdo visual usando comandos de texto. Crie imagens incríveis, edite fotos de forma inteligente e crie sistemas poderosos de perguntas e respostas para imagens e documentos. Transforme sua visão criativa em realidade digital com IA multimodal.
Modelos multimodais com Hugging Face
Curso
concluído

