After doing these courses, I feel confident creating professional visualizations and dashboards
Descrizione del corso
Sfrutta la potenza dell'intelligenza artificiale multimodale
Entra nel mondo all'avanguardia dei modelli di IA multimodali, dove testo, immagini e voce si uniscono per creare app davvero potenti. Scopri come usare il grande archivio di modelli di Hugging Face che possono vedere, sentire e capire come mai prima d'ora. Che tu stia analizzando i contenuti dei social media, sviluppando assistenti vocali o creando app di intelligenza artificiale di nuova generazione, i modelli multimodali sono la chiave per gestire diversi tipi di dati senza problemi.Padroneggia le tecniche multimodali essenziali
Scopri modelli all'avanguardia come CLIP per capire immagini e testo, SpeechT5 per sintetizzare la voce e il modello Qwen2 Vision Language per l'analisi multimodale del sentiment. Grazie a esercizi pratici, imparerai le tecniche che usano le aziende leader nel campo dell'intelligenza artificiale per creare sistemi multimodali super sofisticati.Prepara le tue competenze nell'intelligenza artificiale per il futuro
Questo corso ti darà un kit di strumenti affidabile per gestire attività di intelligenza artificiale multimodali. Imparerai a gestire e mettere insieme diversi tipi di dati in modo efficace, a sistemare modelli già pronti per applicazioni personalizzate e a valutare e migliorare le prestazioni dei modelli in tutti i tipi di dati.Prerequisiti
Curriculum
Programma del corso
1
Accesso a modelli e dataset di Hugging Face
Esplora l'hub dei modelli di Hugging Face e trasforma testo, audio e dati visivi grezzi in formati adatti all'AI. Scopri come trovare i modelli più recenti e popolari per attività come la generazione di testo e sfrutta la potenza delle pipeline predefinite.
- Navigare tra i modelli su Hugging Face50 XP
- Quanti modelli!?100 XP
- Trovare il modello text-to-image più popolare100 XP
- Preprocessing di diverse modalità50 XP
- Tokenizzazione del testo100 XP
- Preprocessing delle immagini100 XP
- Preprocessing dell'audio100 XP
- Attività delle pipeline e valutazioni50 XP
- Generazione di didascalie con pipeline100 XP
- Passare argomenti con nome100 XP
- Valutazione del modello su un insieme di dati personalizzato100 XP
2
Modelli unimodali per visione, audio e testo
Impara a padroneggiare le singole modalità con modelli all'avanguardia. Approfondisci la computer vision per classificazione e segmentazione di immagini, esplora il riconoscimento vocale e la sintesi text-to-speech, e scopri tecniche efficaci di fine-tuning. Sviluppa competenze pratiche con modelli pre-addestrati dalla libreria transformers di Hugging Face.
3
Modelli multi-modali per la classificazione
Impara a fondere informazioni visive, testuali e audio per applicazioni di AI più ricche. Padroneggia tecniche come CLIP per la classificazione zero-shot, crea analizzatori di sentiment che vedono e leggono e sviluppa rilevatori di emozioni che combinano espressioni facciali e voce. Porta i tuoi modelli di AI oltre il pensiero a singola modalità.
4
Generazione multi-modale
Trasforma le idee in realtà! Padroneggia tecniche di AI all'avanguardia per generare e manipolare contenuti visivi usando prompt testuali. Crea immagini sorprendenti, modifica le foto in modo intelligente e sviluppa potenti sistemi di domanda-risposta per immagini e documenti. Trasforma la tua visione creativa in realtà digitale con l'AI multi-modale.
Modelli multi-modali con Hugging Face
Corso
completato

