Después de hacer estos cursos, me siento seguro creando visualizaciones y cuadros de mando profesionales
Descripción del curso
Aprovecha el poder de la IA multimodal
Sumérgete en el innovador mundo de los modelos de IA multimodal, donde el texto, las imágenes y el habla se combinan para crear potentes aplicaciones. Descubre cómo aprovechar el amplio repositorio de modelos de Hugging Face, que pueden ver, oír y comprender como nunca antes. Tanto si estás analizando contenido de redes sociales, creando asistentes de voz o desarrollando aplicaciones de IA de última generación, los modelos multimodales son la clave para gestionar diferentes tipos de datos de forma fluida.Domina las técnicas multimodales esenciales
Explora modelos de última generación como CLIP para la comprensión de imágenes y texto, SpeechT5 para la síntesis de voz y el modelo Qwen2 Vision Language para el análisis multimodal de sentimientos. A través de ejercicios prácticos, dominarás las técnicas utilizadas por las principales empresas de IA para crear sofisticados sistemas multimodales.Prepara tus habilidades en IA para el futuro
Este curso te proporcionará un sólido conjunto de herramientas para gestionar tareas de IA multimodal. Aprenderás a procesar y combinar diferentes modalidades de datos de forma eficaz, ajustar modelos preentrenados para aplicaciones personalizadas y evaluar y mejorar el rendimiento de los modelos en todas las modalidades.Requisitos previos
Programa de formación
Contenido del curso
1
Acceso a los modelos y conjuntos de datos de Hugging Face
Navega por el centro de modelos de Hugging Face y transforma texto sin procesar, audio y datos visuales en formatos compatibles con la IA. Aprende a encontrar los modelos más populares y recientes para tareas como la generación de texto y aprovecha la potencia de los procesos predefinidos.
- Navegación por el modelo Hugging Face50 XP
- ¿Cuántos modelos?100 XP
- Encontrar el modelo de texto a imagen más popular100 XP
- Preprocesamiento de diferentes modalidades50 XP
- Tokenización de texto100 XP
- Preprocesamiento de imágenes100 XP
- Preprocesamiento de audio100 XP
- Tareas y evaluaciones de la canalización50 XP
- Generación de leyendas de tuberías100 XP
- Pasar argumentos con nombre100 XP
- Evaluación del modelo en un conjunto de datos personalizado100 XP
2
Modelos unimodales de visión, audio y texto
Aprende a dominar modalidades individuales con modelos de última generación. Sumérgete en la visión artificial para la clasificación y segmentación de imágenes, explora el reconocimiento de voz y la síntesis de texto a voz, y aprende técnicas eficaces de ajuste fino. Desarrolla habilidades prácticas con modelos preentrenados de la biblioteca de transformadores de Hugging Face.
3
Modelos multimodales para la clasificación
Aprende a fusionar información visual, textual y de audio para crear aplicaciones de IA más completas. Domina técnicas como CLIP para la clasificación sin entrenamiento previo, crea analizadores de sentimientos que ven y leen, y crea detectores de emociones que combinan expresiones faciales con la voz. Lleva tus modelos de IA más allá del pensamiento unimododal.
4
Generación multimodal
¡Transforma tus ideas en realidad! Domina técnicas de IA de vanguardia para generar y manipular contenido visual utilizando indicaciones de texto. Crea imágenes impresionantes, edita fotos de forma inteligente y crea potentes sistemas de preguntas y respuestas para imágenes y documentos. Convierte tu visión creativa en realidad digital con IA multimodal.
Modelos multimodales con Hugging Face
Curso
completado

