Ir al contenido principal

Curso

Modelos multimodales con Hugging Face

Intermedio4 h

Combina texto, imágenes, audio y vídeo con los últimos modelos de IA de Hugging Face y genera nuevas imágenes y vídeos.

Python4 h14 vídeos45 ejercicios3,800 XP1,937Certificado de logro

Crea tu cuenta gratis

Continuar con Google
o
Al continuar, aceptas nuestros los Términos de uso, nuestro la Política de privacidad y que tus datos se almacenan en EE. UU.

Les encanta a estudiantes de miles de empresas

¿Formando a un equipo?

Prueba para empresas

Descripción del curso

Aprovecha el poder de la IA multimodal

Sumérgete en el innovador mundo de los modelos de IA multimodal, donde el texto, las imágenes y el habla se combinan para crear potentes aplicaciones. Descubre cómo aprovechar el amplio repositorio de modelos de Hugging Face, que pueden ver, oír y comprender como nunca antes. Tanto si estás analizando contenido de redes sociales, creando asistentes de voz o desarrollando aplicaciones de IA de última generación, los modelos multimodales son la clave para gestionar diferentes tipos de datos de forma fluida.

Domina las técnicas multimodales esenciales

Explora modelos de última generación como CLIP para la comprensión de imágenes y texto, SpeechT5 para la síntesis de voz y el modelo Qwen2 Vision Language para el análisis multimodal de sentimientos. A través de ejercicios prácticos, dominarás las técnicas utilizadas por las principales empresas de IA para crear sofisticados sistemas multimodales.

Prepara tus habilidades en IA para el futuro

Este curso te proporcionará un sólido conjunto de herramientas para gestionar tareas de IA multimodal. Aprenderás a procesar y combinar diferentes modalidades de datos de forma eficaz, ajustar modelos preentrenados para aplicaciones personalizadas y evaluar y mejorar el rendimiento de los modelos en todas las modalidades.

Requisitos previos

Programa de formación

Contenido del curso

1

Acceso a los modelos y conjuntos de datos de Hugging Face

2

Modelos unimodales de visión, audio y texto

3

Modelos multimodales para la clasificación

Aprende a fusionar información visual, textual y de audio para crear aplicaciones de IA más completas. Domina técnicas como CLIP para la clasificación sin entrenamiento previo, crea analizadores de sentimientos que ven y leen, y crea detectores de emociones que combinan expresiones faciales con la voz. Lleva tus modelos de IA más allá del pensamiento unimododal.
Empezar capítulo
4

Generación multimodal

¡Transforma tus ideas en realidad! Domina técnicas de IA de vanguardia para generar y manipular contenido visual utilizando indicaciones de texto. Crea imágenes impresionantes, edita fotos de forma inteligente y crea potentes sistemas de preguntas y respuestas para imágenes y documentos. Convierte tu visión creativa en realidad digital con IA multimodal.
Empezar capítulo

Modelos multimodales con Hugging Face

Curso
completado

Obtén el certificado de logro

Inscríbete ahora

Desarrolla tus habilidades con la aplicación móvil de DataCamp

Progresa sobre la marcha con nuestros cursos móviles y desafíos diarios de 5 minutos.