Vai al contenuto principale

Corso

Modelli multi-modali con Hugging Face

Intermedio4 h

Metti insieme testo, immagini, audio e video con gli ultimi modelli di intelligenza artificiale di Hugging Face e crea nuove immagini e video!

Python4 h14 video45 esercizi3,800 XP2,133Attestato di completamento

Crea il tuo account gratuito

Continua con Google
oppure
Continuando, accetti la nostra Termini di utilizzo, i nostri Informativa sulla privacy e il fatto che i tuoi dati sono archiviati negli USA.

Scelto dagli studenti di migliaia di aziende

Descrizione del corso

Sfrutta la potenza dell'intelligenza artificiale multimodale

Entra nel mondo all'avanguardia dei modelli di IA multimodali, dove testo, immagini e voce si uniscono per creare app davvero potenti. Scopri come usare il grande archivio di modelli di Hugging Face che possono vedere, sentire e capire come mai prima d'ora. Che tu stia analizzando i contenuti dei social media, sviluppando assistenti vocali o creando app di intelligenza artificiale di nuova generazione, i modelli multimodali sono la chiave per gestire diversi tipi di dati senza problemi.

Padroneggia le tecniche multimodali essenziali

Scopri modelli all'avanguardia come CLIP per capire immagini e testo, SpeechT5 per sintetizzare la voce e il modello Qwen2 Vision Language per l'analisi multimodale del sentiment. Grazie a esercizi pratici, imparerai le tecniche che usano le aziende leader nel campo dell'intelligenza artificiale per creare sistemi multimodali super sofisticati.

Prepara le tue competenze nell'intelligenza artificiale per il futuro

Questo corso ti darà un kit di strumenti affidabile per gestire attività di intelligenza artificiale multimodali. Imparerai a gestire e mettere insieme diversi tipi di dati in modo efficace, a sistemare modelli già pronti per applicazioni personalizzate e a valutare e migliorare le prestazioni dei modelli in tutti i tipi di dati.

Prerequisiti

Programma

Struttura del corso

1

Accesso a modelli e dataset di Hugging Face

2

Modelli unimodali per visione, audio e testo

3

Modelli multi-modali per la classificazione

Impara a fondere informazioni visive, testuali e audio per applicazioni di AI più ricche. Padroneggia tecniche come CLIP per la classificazione zero-shot, crea analizzatori di sentiment che vedono e leggono e sviluppa rilevatori di emozioni che combinano espressioni facciali e voce. Porta i tuoi modelli di AI oltre il pensiero a singola modalità.
Inizia il capitolo
4

Generazione multi-modale

Trasforma le idee in realtà! Padroneggia tecniche di AI all'avanguardia per generare e manipolare contenuti visivi usando prompt testuali. Crea immagini sorprendenti, modifica le foto in modo intelligente e sviluppa potenti sistemi di domanda-risposta per immagini e documenti. Trasforma la tua visione creativa in realtà digitale con l'AI multi-modale.
Inizia il capitolo

Modelli multi-modali con Hugging Face

Corso
completato

Ottieni Attestato di conseguimento

Iscriviti ora

Sviluppa le tue competenze sui dati con DataCamp for Mobile

Fai progressi ovunque tu sia con i nostri corsi mobile e le sfide di programmazione quotidiane da 5 minuti.