Vai al contenuto principale

Guida a GPT-4o: come funziona, casi d’uso, prezzi, benchmark

Scopri GPT-4o di OpenAI, un modello di IA multimodale che elabora testo, audio e dati visivi, e come si confronta con GPT-4 Turbo in vari casi d’uso.
Aggiornato 31 ago 2026  · 8 min leggi

Esplora con l'AI

ChatGPTClaudePerplexity

OpenAI ha annunciato il suo nuovo large language model, GPT-4o, il successore di GPT-4 Turbo. Continua a leggere per scoprire capacità, prestazioni e come potresti usarlo.

Che cos’è GPT-4o di OpenAI?

GPT-4o è l’ultimo LLM di OpenAI. La "o" in GPT-4o sta per "omni"—latino per "tutto"—e indica che questo nuovo modello può accettare prompt che mixano testo, audio, immagini e video. In precedenza, l’interfaccia di ChatGPT usava modelli separati per i diversi tipi di contenuto.

Per esempio, parlando con ChatGPT in Modalità Voce, il tuo parlato veniva convertito in testo con Whisper, veniva generita una risposta testuale con GPT-4 Turbo, e quella risposta veniva poi trasformata in audio con TTS.

GPT-4o vs GPT-4 Turbo

Un confronto su come GPT-4 Turbo e GPT-4o elaborano l’input vocale

Allo stesso modo, lavorare con le immagini in ChatGPT richiedeva un mix di GPT-4 Turbo e DALL-E 3.

Avere un unico modello per media diversi promette maggiore velocità e qualità dei risultati, un’interfaccia più semplice e nuovi casi d’uso.

Che cos’è GPT-4o mini?

GPT-4o Mini è una versione più snella e veloce di GPT-4o, pensata per gestire compiti con un’attenzione maggiore a velocità ed efficienza. Deriva dal modello più grande GPT-4o tramite un processo chiamato distillazione.

Pur mantenendo gran parte della capacità del modello originale di elaborare input multimodali—testo, audio e immagini—GPT-4o mini è ottimizzato per applicazioni leggere in cui tempi di risposta rapidi sono cruciali.

È particolarmente utile per sviluppatori che cercano una soluzione conveniente per coding, debugging e interazioni in tempo reale che non richiedono tutta la potenza computazionale di GPT-4o.

Puoi leggere altri dettagli in questo articolo su GPT-4o mini.

In cosa GPT-4o è diverso da GPT-4 Turbo?

L’approccio all-in-one consente a GPT-4o di superare diversi limiti delle precedenti funzionalità vocali.

1. Il tono di voce è ora considerato, facilitando risposte con emozioni

Con il precedente sistema OpenAI che combinava Whisper, GPT-4 Turbo e TTS in una pipeline, il motore di ragionamento, GPT-4, aveva accesso solo alle parole pronunciate. Questo significava che elementi come tono di voce, rumori di fondo e riconoscimento di voci di più parlanti venivano scartati. Di conseguenza, GPT-4 Turbo non poteva realmente esprimere risposte con diverse emozioni o stili di parlato.

Grazie a un unico modello che può ragionare su testo e audio, queste ricche informazioni audio possono essere usate per fornire risposte di qualità superiore con una maggiore varietà di stili di parlato.

Nel seguente esempio fornito da OpenAI, GPT-4o produce un output sarcastico.

2. Latenza inferiore per conversazioni in tempo reale

La pipeline a tre modelli esistente comportava un piccolo ritardo ("latenza") tra quando parlavi con ChatGPT e quando ricevevi una risposta.

OpenAI ha condiviso che la latenza media della Modalità Voce è di 2,8 secondi per GPT-3.5 e 5,4 secondi per GPT-4. Al contrario, la latenza media per GPT-4o è di 0,32 secondi, nove volte più veloce di GPT-3.5 e 17 volte più veloce di GPT-4.

Questa latenza ridotta è vicina ai tempi medi di risposta umani (0,21 secondi) ed è importante per i casi d’uso conversazionali, in cui c’è molto botta e risposta tra umano e IA, e i vuoti tra le risposte si sommano.

Questa funzione ricorda il lancio di Instant da parte di Google nel 2010, l’auto-completamento delle ricerche. Pur non richiedendo molto tempo, risparmiare un paio di secondi a ogni utilizzo migliora l’esperienza del prodotto.

Un caso d’uso che diventa più praticabile con la minore latenza di GPT-4o è la traduzione in tempo reale del parlato. OpenAI ha presentato il caso di due colleghi, uno anglofono e l’altro ispanofono, che comunicano facendo tradurre la conversazione a GPT-4o.

3. Visione integrata per descrivere un feed della fotocamera

Oltre all’integrazione voce-testo, GPT-4o include funzionalità per immagini e video. Ciò significa che, se gli dai accesso a uno schermo, può descrivere cosa viene mostrato, rispondere a domande sull’immagine a schermo o fungere da co-pilota per il tuo lavoro.

In un video di OpenAI con Sal Khan di Khan Academy, GPT-4o aiuta con i compiti di matematica del figlio di Sal.

Oltre a lavorare con uno schermo, se dai a GPT-4o accesso a una fotocamera, magari del tuo smartphone, può descrivere ciò che vede.

Una demo più lunga presentata da OpenAI combina tutte queste funzionalità. Due smartphone con GPT-4o tengono una conversazione. Un GPT ha accesso alle fotocamere degli smartphone e descrive quello che vede a un altro GPT che non può vedere.

Il risultato è una conversazione a tre tra un umano e due IA. Il video include anche una sezione in cui le IA cantano, cosa non possibile con i modelli precedenti.

4. Migliore tokenizzazione per alfabeti non latini: più velocità e convenienza

Una fase del workflow di un LLM è la conversione del testo del prompt in token. Sono unità di testo che il modello può comprendere.

In inglese, un token è tipicamente una parola o un segno di punteggiatura, anche se alcune parole possono essere suddivise in più token. In media, tre parole inglesi occupano circa quattro token.

Se una lingua può essere rappresentata nel modello con meno token, servono meno calcoli e aumenta la velocità di generazione del testo.

Inoltre, poiché OpenAI addebita l’uso della sua API per token in input o output, meno token significano un prezzo più basso per gli utenti dell’API.

GPT-4o ha un modello di tokenizzazione migliorato che riduce il numero di token necessari per testo. Il miglioramento è soprattutto evidente nelle lingue che non usano l’alfabeto latino.

Per esempio, le lingue indiane in particolare ne hanno beneficiato, con hindi, marathi, tamil, telugu e gujarati che mostrano riduzioni dei token da 2,9 a 4,4 volte. L’arabo ha mostrato una riduzione di 2x, e le lingue dell’Asia orientale come cinese, giapponese, coreano e vietnamita hanno mostrato riduzioni tra 1,4x e 1,7x.

5. Distribuzione anche sul piano gratuito

Con la strategia di prezzo esistente di OpenAI per ChatGPT, gli utenti dovevano pagare per accedere al miglior modello: GPT-4 Turbo era disponibile solo nei piani a pagamento Plus ed Enterprise.

Questo sta cambiando: OpenAI promette di rendere GPT-4o disponibile anche sul piano gratuito. Gli utenti Plus avranno un numero di messaggi pari a cinque volte quelli del piano gratuito.

Il rollout sarà graduale, con accesso al red team (tester che cercano di mandare in crisi il modello per trovare problemi) a partire da subito e ulteriori utenti che ottengono l’accesso nel tempo.

6. Lancio dell’app desktop di ChatGPT

Sebbene non sia necessariamente un aggiornamento esclusivo di GPT-4o, OpenAI ha annunciato anche il rilascio dell’app desktop di ChatGPT. I miglioramenti in latenza e multimodalità citati sopra, insieme al rilascio dell’app, probabilmente cambieranno il nostro modo di lavorare con ChatGPT. Per esempio, OpenAI ha mostrato una demo di un workflow di coding aumentato usando la voce e l’app desktop di ChatGPT. Scorri giù nella sezione dei casi d’uso per vedere quell’esempio in azione!

Come funziona GPT-4o?

Molti tipi di contenuto, una sola rete neurale

I dettagli su come funziona GPT-4o sono ancora scarsi. L’unica informazione fornita da OpenAI nell’annuncio è che GPT-4o è un’unica rete neurale addestrata su input di testo, visione e audio.

Questo nuovo approccio differisce dalla tecnica precedente di avere modelli separati addestrati su diversi tipi di dati.

Tuttavia, GPT-4o non è il primo modello ad adottare un approccio multimodale. Nel 2022, TenCent Lab ha creato SkillNet, un modello che combinava caratteristiche dei transformer LLM con tecniche di visione artificiale per migliorare la capacità di riconoscere i caratteri cinesi.

Nel 2023, un team di ETH Zurich, MIT e Stanford University ha creato WhisBERT, una variazione della serie di modelli BERT. Pur non essendo il primo, GPT-4o è decisamente più ambizioso e potente di questi tentativi precedenti.

GPT-4o è un cambiamento radicale rispetto a GPT-4 Turbo?

Quanto siano radicali i cambiamenti nell’architettura di GPT-4o rispetto a GPT-4 Turbo dipende da chi chiedi, il team di ingegneria o quello marketing di OpenAI. Ad aprile, un bot chiamato "im-also-a-good-gpt2-chatbot" è apparso sulla Chatbot Arena di LMSYS, una classifica delle migliori IA generative. Quell’IA misteriosa è stata poi rivelata come GPT-4o.

La parte "gpt2" del nome è importante. Da non confondere con GPT-2, predecessore di GPT-3.5 e GPT-4, il suffisso "2" è stato ampiamente interpretato come indicativo di un’architettura completamente nuova per la serie di modelli GPT.

A quanto pare, qualcuno nel team di ricerca o ingegneria di OpenAI ritiene che combinare testo, visione e audio in un unico modello sia un cambiamento abbastanza grande da giustificare il primo incremento del numero di versione in sei anni.

D’altra parte, il team marketing ha optato per un cambiamento di nome relativamente modesto, continuando la convenzione "GPT-4".

Prestazioni di GPT-4o rispetto ad altri modelli

OpenAI ha pubblicato valori di benchmark di GPT-4o rispetto a diversi altri modelli di fascia alta.

  • GPT-4 Turbo
  • GPT-4 (rilascio iniziale)
  • Claude 3 Opus
  • Gemini Pro 1.5
  • Gemini Ultra 1.0
  • Llama 3 400B

Di questi, per il confronto contano davvero solo tre modelli. GPT-4 Turbo, Claude 3 Opus e Gemini Pro 1.5 si sono contesi negli ultimi mesi il primo posto nella classifica di LMSYS Chatbot Arena.

Llama 3 400B potrebbe essere un concorrente in futuro, ma non è ancora pronto. Qui quindi presentiamo solo i risultati per questi tre modelli e GPT-4o.

Sono stati usati i risultati di sei benchmark.

  • Massive Multitask Language Understanding (MMLU). Compiti su matematica di base, storia degli Stati Uniti, informatica, diritto e altro. Per ottenere alta accuratezza, i modelli devono possedere ampia conoscenza del mondo e capacità di problem solving.
  • Graduate-Level Google-Proof Q&A (GPQA). Domande a scelta multipla scritte da esperti di biologia, fisica e chimica. Le domande sono di alta qualità ed estremamente difficili: esperti con o in procinto di ottenere un dottorato raggiungono il 74% di accuratezza.
  • MATH. Problemi di matematica per scuole medie e superiori.
  • HumanEval. Test della correttezza funzionale del codice, usato per verificare la generazione di codice.
  • Multilingual Grade School Math (MSGM). Problemi di matematica per la scuola primaria, tradotti in dieci lingue, incluse lingue sottorappresentate come bengalese e swahili.
  • Discrete Reasoning Over Paragraphs (DROP). Domande che richiedono la comprensione di interi paragrafi. Per esempio, sommando, contando o ordinando valori distribuiti su più frasi.

Benchmark di prestazioni di GPT-4o vs altri modelli

Prestazioni di GPT-4o, GPT-4 Turbo, Gemini Pro 1.5 e Claude 3 Opus su sei benchmark per LLM. I punteggi di ciascun benchmark vanno da 0 a 100. Ricreato da dati forniti da OpenAI. Nessun dato fornito per Gemini Pro 1.5 per il benchmark GPQA.

GPT-4o ottiene il punteggio più alto in quattro benchmark, anche se è superato da Claude 3 Opus nel benchmark MSGM e da GPT-4 Turbo nel benchmark DROP. Nel complesso, le prestazioni sono notevoli e mostrano il potenziale del nuovo approccio all’addestramento multimodale.

Se guardi da vicino i numeri di GPT-4o rispetto a GPT-4 Turbo, noterai che gli incrementi di prestazioni sono solo di pochi punti percentuali.

Un aumento notevole a un anno di distanza, ma lontano dai salti drastici visti da GPT-1 a GPT-2 o da GPT-2 a GPT-3.

Essere meglio del 10% nel ragionamento sul testo di anno in anno probabilmente sarà la nuova normalità. I frutti più facili sono stati colti, e continuare con grandi balzi nel ragionamento testuale è difficile.

D’altra parte, questi benchmark per LLM non catturano le prestazioni dell’IA su problemi multimodali. Il concetto è così nuovo che non abbiamo ancora buoni modi per misurare quanto un modello sia valido su testo, audio e visione.

Nel complesso, le prestazioni di GPT-4o sono impressionanti e mostrano il potenziale del nuovo approccio all’addestramento multimodale.

Quali sono i casi d’uso di GPT-4o?

1. GPT-4o per analisi dei dati e attività di coding

I modelli GPT recenti e i loro derivati, come GitHub Copilot, sono già in grado di fornire assistenza nel codice, inclusa la scrittura e la spiegazione/correzione degli errori. Le capacità multimodali di GPT-4o aprono opportunità interessanti.

In un video promozionale con la CTO di OpenAI Mira Murati, due ricercatori di OpenAI, Mark Chen e Barret Zoph, hanno mostrato come usare GPT-4o per lavorare con del codice Python.

Il codice viene condiviso con GPT come testo e si usa l’interazione vocale per farsi spiegare il codice. In seguito, dopo averlo eseguito, la funzione di visione di GPT-4o viene usata per spiegare il grafico.

In generale, mostrare a ChatGPT il tuo schermo e porre una domanda a voce potrebbe essere un workflow più semplice rispetto a salvare il grafico come immagine, caricarlo su ChatGPT e poi digitare una domanda.

2. GPT-4o per traduzione in tempo reale

Preparati a portare GPT-4o in vacanza. Le capacità vocali a bassa latenza di GPT-4o rendono possibile la traduzione in tempo reale (se hai dati in roaming nel tuo piano!). Questo significa che viaggiare in paesi in cui non parli la lingua diventa molto più semplice.

3. Roleplay con GPT-4o

ChatGPT è già stato utile per scenari di roleplay, che tu stia preparando un colloquio per il lavoro dei sogni nei dati o stia formando il tuo team commerciale a vendere meglio il prodotto.

Finora ha funzionato al meglio per roleplay solo testuali, il che non è ideale per questi casi d’uso. Le capacità vocali migliorate rendono ora praticabile il roleplay parlato.

4. GPT-4o per assistere utenti ipovedenti

La capacità di GPT-4o di comprendere input video da una fotocamera e descrivere verbalmente la scena potrebbe essere una funzione indispensabile per le persone ipovedenti. È essenzialmente la descrizione audio che hanno le TV, ma per la vita reale.

Prova pratica con GPT-4o

Ho avuto accesso ad alcune delle nuove funzionalità di GPT-4o subito dopo l’annuncio (purtroppo, niente chat vocale per ora) e sono rimasto colpito da molte delle sue risposte. Le risposte sembrano più rapide e coerenti, e sembra capire meglio le mie richieste rispetto a prima. Non è stato perfetto, però.

Ecco alcuni esempi delle interazioni che ho avuto con ChatGPT-4o:

Attività di analisi dati

Per prima cosa, usando la chat vocale, ho chiesto se avesse idee su come analizzare le prestazioni della squadra di calcio che tifo, il grande Leeds United. Oltre a varie opzioni, mi ha fornito del codice Python di esempio:

import pandas as pd

# Sample data for Leeds United's match results
data = {
    'Match': ['Match1', 'Match2', 'Match3', 'Match4', 'Match5'],
    'Result': ['Win', 'Draw', 'Loss', 'Win', 'Win'],
    'Goals Scored': [2, 1, 0, 3, 2]
}

# Create a DataFrame
df = pd.DataFrame(data)

# Summarize match results
summary = df['Result'].value_counts()
total_goals = df['Goals Scored'].sum()
average_goals = df['Goals Scored'].mean()

# Display summary
print("Match Results Summary:")
print(summary)
print("\nTotal Goals Scored:", total_goals)
print("Average Goals Per Match:", round(average_goals, 2))

Generazione di codice con GPT-4o

Tuttavia, approfondendo questa linea di pensiero, le cose sono un po’ deragliate. Ho chiesto prima dei dati reali da usare: ha cercato sul web e trovato due buone fonti, ma ha riportato male le statistiche. Il Leeds ha giocato 46 partite nella stagione regolare, segnando 81 goal con una differenza reti di +38, non le 40 partite che ha indicato nella risposta.

Ho poi chiesto a ChatGPT di visualizzare i goal segnati contro ciascuna squadra:

Visualizzazione dati con GPT-4o

Di nuovo, qui ha svolto il compito a metà. Ha creato una visualizzazione come richiesto, che in superficie sembra a posto. Ma in realtà, molti dati sono inventati e imprecisi (squadre che compaiono due volte, goal non conteggiati e squadre non nella stessa divisione del Leeds).

A onor del vero, immagino che le prestazioni sarebbero state migliori se avessi fornito io un dataset completo, ma vorrei che lo dichiarasse invece di inventare risposte con sicurezza.

Analisi di immagini

Poi ho chiesto a GPT-4o di analizzare la foto di una mia pianta. Non ho ancora accesso alla visione integrata, quindi ho dovuto scattare una foto e chiedere a ChatGPT che pianta fosse:

Analisi immagini con GPT-4o

Non è un brutto tentativo, anche se non del tutto accurato. Pur essendo un bonsai, si tratta di un Ilex crenata e non di una Carmona retusa. Comunque, le due specie sono simili: errore comprensibile e ho apprezzato i consigli aggiuntivi sulla cura della pianta.

Generazione di immagini

Infine, ho voluto provare le capacità d’immagine del nuovo modello. Ho prima mostrato una foto della mia tartaruga, Darwin, e gli ho chiesto di parlarmi del mio amico:

Analisi immagini con GPT-4o 2

Di nuovo, vicino ma non perfetto. Darwin è in realtà una tartaruga di Horsfield e non di Hermann, ma si somigliano molto. Ho poi chiesto a ChatGPT-4o di prendere l’immagine originale e ricrearla nello stile di Hokusai. Ecco il risultato:

Generazione immagini con GPT-4o

Un risultato piuttosto buono, anche se non somiglia molto all’immagine originale, ma direi che ci sta. Ci ha messo anche un po’ a generarla.

Nel complesso, però, sono rimasto colpito dalla reattività del nuovo modello e da quanto bene abbia compreso le mie richieste. È lontano dall’essere impeccabile e a volte allucina con sicurezza, ma non vedo l’ora di provare la voce migliorata e la visione integrata.

Limitazioni e rischi di GPT-4o

La regolamentazione dell’IA generativa è ancora agli inizi; il Regolamento IA dell’UE è l’unico quadro giuridico rilevante finora. Ciò significa che le aziende che creano IA devono prendere in autonomia alcune decisioni su cosa sia un’IA sicura.

OpenAI ha un framework di preparedness che usa per determinare se un nuovo modello è idoneo al rilascio pubblico.

Il framework testa quattro aree di preoccupazione.

  • Cybersecurity. L’IA può aumentare la produttività dei cybercriminali e aiutare a creare exploit?
  • BCRN. L’IA può aiutare esperti a creare minacce biologiche, chimiche, radiologiche o nucleari?
  • Persuasione. L’IA può creare contenuti (potenzialmente interattivi) che persuadono le persone a cambiare idea?
  • Autonomia del modello. L’IA può agire come un agente, eseguendo azioni con altro software?

Ogni area è valutata come Bassa, Media, Alta o Critica, e il punteggio del modello è il più alto tra le quattro categorie.

OpenAI promette di non rilasciare un modello di preoccupazione critica, anche se è un livello di sicurezza relativamente basso: secondo le sue definizioni, una preoccupazione critica corrisponde a qualcosa che stravolgerebbe la civiltà umana. GPT-4o evita comodamente questo scenario, ottenendo una preoccupazione Media.

Output imperfetti

Come per tutte le IA generative, il modello non si comporta sempre come previsto. La visione artificiale non è perfetta, quindi le interpretazioni di un’immagine o di un video non sono garantite.

Allo stesso modo, le trascrizioni del parlato raramente sono corrette al 100%, soprattutto se il parlante ha un accento marcato o usa termini tecnici.

OpenAI ha fornito un video di alcuni fuori onda in cui GPT-4o non ha funzionato come previsto.

In particolare, la traduzione tra due lingue non inglesi è stata uno dei casi in cui ha fallito. Altri problemi includevano un tono di voce inadeguato (condiscendente) e il parlare nella lingua sbagliata.

Rischio accelerato di deepfake audio

L’annuncio di OpenAI osserva che "Riconosciamo che le modalità audio di GPT-4o presentano una varietà di rischi nuovi". Per molti versi, GPT-4o può accelerare l’aumento delle truffe con chiamate deepfake, in cui l’IA impersona celebrità, politici e amici e familiari delle persone. È un problema che peggiorerà prima di essere risolto, e GPT-4o ha il potere di rendere queste chiamate ancora più convincenti.

Per mitigare questo rischio, l’output audio è disponibile solo con una selezione di voci preimpostate.

Presumibilmente, truffatori tecnicamente preparati possono usare GPT-4o per generare testo e poi usare un proprio modello di text-to-speech, anche se non è chiaro se otterrebbero comunque i vantaggi di latenza e tono di voce che GPT-4o offre.

Data di rilascio di GPT-4o

Al 19 luglio 2024, molte funzionalità di GPT-4o sono state distribuite gradualmente. Le capacità di testo e immagini sono state aggiunte per molti utenti sui piani Plus e gratuito. Questo include l’accesso a ChatGPT da browser mobile. Allo stesso modo, le funzionalità di testo e visione di GPT-4o sono già disponibili tramite API.

Queste funzionalità di GPT-4o sono ampiamente disponibili sulle app mobili iOS e Android. Tuttavia, stiamo ancora aspettando la nuova Modalità Voce, che verrà aggiornata per usare GPT-4o, l’API aggiungerà capacità audio e video per GPT-4o, e il nuovo modello sarà disponibile su Desktop Mac. L’accesso a quest’ultimo viene anch’esso distribuito gradualmente agli utenti Plus, e un’app desktop per Windows è prevista più avanti nel corso dell’anno.

Di seguito un riepilogo delle date di rilascio di GPT-4o:

  • Annuncio di GPT-4o: 13 maggio 2024
  • Rollout delle capacità di testo e immagini di GPT-4o: A partire dal 13 maggio 2024
  • Disponibilità di GPT-4o nel livello gratuito e per utenti Plus: A partire dal 13 maggio 2024
  • Accesso API per GPT-4o (testo e visione): A partire dal 13 maggio 2024
  • Disponibilità di GPT-4o su desktop Mac per utenti Plus: Prossime settimane (dal 13 maggio 2024)
  • Nuova versione della Modalità Voce con GPT-4o in alpha: Prossime settimane/mesi (dopo il 13 maggio 2024)
  • Supporto API per capacità audio e video: Prossime settimane/mesi (dopo il 13 maggio 2024)
  • GPT-4o mini: 18 luglio 2024

Tuttavia, dopo le polemiche causate dalla demo delle nuove funzionalità vocali, sembra che OpenAI stia adottando cautela nel rilascio. Secondo il loro blog aggiornato, 'Nelle prossime settimane e mesi, lavoreremo sull’infrastruttura tecnica, sull’usabilità tramite post-training e sulla sicurezza necessarie per rilasciare le altre modalità. Ad esempio, al lancio, le uscite audio saranno limitate a una selezione di voci preimpostate e rispetteranno le nostre politiche di sicurezza esistenti.' 

Quanto costa GPT-4o?

Pur essendo più veloce di GPT-4 Turbo e con migliori capacità di visione, GPT-4o costerà circa il 50% in meno del suo predecessore. Secondo il sito di OpenAI, l’uso del modello costerà 5 $ per milione di token in input e 15 $ per milione di token in output.

Come posso accedere a GPT-4o nella versione web di ChatGPT?

L’interfaccia utente di ChatGPT è cambiata. Tutti i messaggi in ChatGPT usano di default GPT-4o e il modello può essere cambiato in GPT-3.5 tramite un toggle sotto la risposta.

Cosa significa GPT-4o per il futuro?

Ci sono due visioni su dove dovrebbe andare l’IA. Una dice che l’IA dovrebbe diventare sempre più potente e capace di svolgere una gamma più ampia di compiti. L’altra dice che l’IA dovrebbe migliorare nel risolvere compiti specifici al costo più basso possibile.

La missione di OpenAI di creare un’intelligenza artificiale generale (AGI), insieme al suo modello di business, la colloca saldamente nel primo campo. GPT-4o è un altro passo verso quell’obiettivo di un’IA sempre più potente.

Questa è la prima generazione di un’architettura di modello completamente nuova per OpenAI. Ciò significa che l’azienda ha molto da imparare e ottimizzare nei prossimi mesi.

Nel breve termine, aspettati nuovi tipi di stranezze e allucinazioni; nel lungo termine, aspettati miglioramenti in prestazioni, sia in termini di velocità che di qualità dell’output.

Il tempismo di GPT-4o è interessante. Proprio mentre i giganti tech hanno capito che Siri, Alexa e Google Assistant non sono gli strumenti redditizi che speravano, OpenAI punta a rendere l’IA di nuovo loquace. Nel migliore dei casi, questo porterà una serie di nuovi casi d’uso per l’IA generativa. Quantomeno, ora puoi impostare un timer nella lingua che preferisci.

Conclusione

GPT-4o rappresenta un ulteriore avanzamento nell’IA generativa, unendo elaborazione di testo, audio e visione in un unico modello efficiente. Questa innovazione promette risposte più rapide, interazioni più ricche e una gamma più ampia di applicazioni, dalla traduzione in tempo reale a un’analisi dati potenziata e a una migliore accessibilità per gli ipovedenti.

Pur con limitazioni e rischi iniziali, come potenziali abusi in truffe deepfake e la necessità di ulteriori ottimizzazioni, GPT-4o è un altro passo verso l’obiettivo di OpenAI di un’AGI. Man mano che diventa più accessibile, GPT-4o potrebbe cambiare il modo in cui interagiamo con l’IA, integrandosi nelle attività quotidiane e professionali.

Con costi inferiori e capacità migliorate, GPT-4o è pronto a fissare un nuovo standard nel settore dell’IA, ampliando le possibilità per gli utenti in vari ambiti.

Il futuro dell’IA è entusiasmante, e ora è un ottimo momento per iniziare a capire come funziona questa tecnologia. Se sei alle prime armi, inizia con il nostro percorso di competenze AI Fundamentals, che copre nozioni pratiche su ChatGPT, large language model, IA generativa e altro. Puoi anche approfondire come lavorare con l’API di OpenAI nel nostro corso pratico, o esplorare il catalogo completo dei corsi di IA.


Richie Cotton's photo
Author
Richie Cotton
LinkedIn

Richie aiuta persone e organizzazioni a migliorare nell'uso dei dati e dell'IA. È un data scientist da prima che si chiamasse data science, e ha scritto due libri e creato molti corsi su DataCamp sull’argomento. È host del podcast DataFramed e gestisce il programma di webinar di DataCamp.

Chatta con AI Richie su ogni episodio di DataFramed - tutti i campioni dei dati sono i benvenuti!

FAQ

GPT-4o può gestire conversazioni multilingue?

Sì, GPT-4o può gestire conversazioni multilingue, fornendo traduzioni in tempo reale tra lingue grazie alle sue capacità vocali a bassa latenza. Tuttavia, nella dimostrazione ci sono stati alcuni errori nell’elaborazione delle traduzioni. 

GPT-4o supporta tutte le lingue allo stesso modo?

Sebbene GPT-4o abbia una tokenizzazione migliorata per alfabeti non latini, le prestazioni possono variare tra le lingue, soprattutto per quelle meno rappresentate nei dati di training.

Come gestisce GPT-4o il rumore di fondo nell’input audio?

GPT-4o può considerare i rumori di fondo quando elabora l’input audio, portando potenzialmente a risposte più contestualmente consapevoli.

GPT-4o è in grado di generare contenuti video?

No, GPT-4o può analizzare e descrivere contenuti video ma non può generare nuovi video. Sora di OpenAI è il modello che può generare video. 

GPT-4o può imitare voci specifiche?

No, GPT-4o usa una selezione di voci preimpostate per l’output audio per mitigare rischi come le truffe deepfake.

Quanto sono sicuri i dati inseriti in GPT-4o?

OpenAI segue rigorose misure di sicurezza, ma gli utenti dovrebbero sempre essere cauti ed evitare di condividere informazioni sensibili.

GPT-4o può essere integrato in applicazioni esistenti?

Sì, GPT-4o può essere integrato in varie applicazioni tramite la OpenAI API, abilitando funzionalità avanzate su diverse piattaforme.

Dai un’occhiata al nostro corso Working with the OpenAI API per iniziare a sviluppare applicazioni basate su IA.

Quando dovrei usare GPT-4o Mini invece di GPT-4o?

GPT-4o Mini è ideale per compiti che privilegiano velocità ed efficienza rispetto a ragionamento complesso o interazioni multimodali. È adatto per attività di coding semplici, debugging o risposte rapide in applicazioni leggere, offrendo un’alternativa conveniente per progetti che non richiedono tutta la potenza di GPT-4o.

Quali sono le differenze tra GPT-4o e il modello o1?

GPT-4o è progettato per compiti multimodali, gestendo in modo efficiente input testuali, audio e visivi. Il modello o1, invece, punta sul ragionamento avanzato e la risoluzione di problemi complessi, eccellendo in campi come coding e scienza. Mentre GPT-4o offre versatilità e velocità, il modello o1 privilegia un’elaborazione profonda e logica per compiti di ragionamento intricato.

Argomenti
Intelligenza artificiale
OpenAI
ChatGPT

Impara a creare strumenti di IA con OpenAI oggi stesso!

Corso

Lavorare con l'API di OpenAI

3 h
170.2K
Inizia a sviluppare applicazioni AI con l’API OpenAI. Scopri le funzionalità alla base di applicazioni AI popolari come ChatGPT.
Vedi dettagliRight Arrow
Inizia Il Corso
Mostra altroRight Arrow
Correlato

blog

Tokenizzazione nel NLP: come funziona, sfide e casi d'uso

Guida al preprocessing NLP nel machine learning. Copriamo spaCy, i transformer di Hugging Face e come funziona la tokenizzazione in casi d'uso reali.
Abid Ali Awan's photo

Abid Ali Awan

10 min

blog

I 15 migliori server MCP remoti che ogni AI builder dovrebbe conoscere nel 2026

Scopri i 15 migliori server MCP remoti che stanno trasformando lo sviluppo AI nel 2026. Scopri come migliorano automazione, ragionamento, sicurezza e velocità dei workflow.
Abid Ali Awan's photo

Abid Ali Awan

15 min

blog

Che cos'è Snowflake? Guida per principianti alla piattaforma dati cloud

Esplora le basi di Snowflake, la piattaforma dati cloud. Scopri la sua architettura, le sue funzionalità e come integrarla nelle tue pipeline di dati.
Tim Lu's photo

Tim Lu

12 min

Mostra AltroMostra Altro