course
OpenAI a anunțat cel mai nou model de limbaj de mari dimensiuni, GPT-4o, succesorul lui GPT-4 Turbo. Citește mai departe pentru a descoperi capabilitățile, performanța și modurile în care l-ai putea folosi.
Ce este GPT-4o de la OpenAI?
GPT-4o este cel mai nou LLM de la OpenAI. Litera „o” din GPT-4o vine de la „omni” — latină pentru „toate” — referindu-se la faptul că acest nou model poate accepta prompturi care sunt un amestec de text, audio, imagini și video. Anterior, interfața ChatGPT folosea modele separate pentru diferite tipuri de conținut.
De exemplu, când vorbeai cu ChatGPT prin Voice Mode, vorbirea îți era transformată în text cu Whisper, un răspuns în text era generat cu GPT-4 Turbo, iar acel răspuns în text era convertit în vorbire cu TTS.

O comparație a modului în care GPT-4 Turbo și GPT-4o procesează intrarea vocală
În mod similar, lucrul cu imagini în ChatGPT implica un mix de GPT-4 Turbo și DALL-E 3.
A avea un singur model pentru diferite tipuri de media promite viteză sporită și calitate mai bună a rezultatelor, o interfață mai simplă și câteva cazuri de utilizare noi.
Ce este GPT-4o mini?
GPT-4o Mini este o versiune mai suplă și mai rapidă a lui GPT-4o, concepută să gestioneze sarcini cu accent mai mare pe viteză și eficiență. Este derivat din modelul mai mare GPT-4o printr-un proces numit distilare.
Deși păstrează mare parte din capacitatea modelului original de a procesa intrări multimodale — text, audio și imagini — GPT-4o mini este optimizat pentru aplicații ușoare, unde timpul de răspuns mai rapid este esențial.
Este deosebit de util pentru dezvoltatori care au nevoie de o soluție rentabilă pentru programare, depanare și interacțiuni în timp real care nu necesită toată puterea de calcul a lui GPT-4o.
Poți citi mai multe detalii în acest articol despre GPT-4o mini.
Ce face GPT-4o diferit față de GPT-4 Turbo?
Abordarea cu un model all-in-one înseamnă că GPT-4o depășește mai multe limitări ale capabilităților anterioare de interacțiune vocală.
1. Tonul vocii este acum luat în considerare, facilitând răspunsuri emoționale
Cu sistemul anterior al OpenAI, care combina Whisper, GPT-4 Turbo și TTS într-o linie de procesare, motorul de raționament, GPT-4, avea acces doar la cuvintele rostite. Această metodă însemna că elemente precum tonul vocii, zgomotele de fundal și recunoașterea vocilor din partea mai multor vorbitori erau pur și simplu ignorate. Astfel, GPT-4 Turbo nu putea cu adevărat să exprime răspunsuri cu emoții diferite sau stiluri de vorbire variate.
Având un singur model care poate raționa atât despre text, cât și despre audio, această bogăție de informații audio poate fi utilizată pentru a oferi răspunsuri de calitate superioară, cu o varietate mai mare de stiluri de vorbire.
În următorul exemplu oferit de OpenAI, GPT-4o oferă un output sarcastic.
2. Latența redusă permite conversații în timp real
Linia de procesare cu trei modele existentă însemna că exista o mică întârziere („latență”) între momentul în care vorbeai cu ChatGPT și primirea unui răspuns.
OpenAI a împărtășit că latența medie a Voice Mode este de 2,8 secunde pentru GPT-3.5 și 5,4 secunde pentru GPT-4. Prin contrast, latența medie pentru GPT-4o este de 0,32 secunde, de nouă ori mai rapid decât GPT-3.5 și de 17 ori mai rapid decât GPT-4.
Această latență redusă este aproape de timpii medii de răspuns umani (0,21 secunde) și este importantă pentru cazurile conversaționale, unde există mult du-te-vino între om și AI, iar pauzele dintre răspunsuri se adună.
Această funcționalitate amintește de momentul când Google a lansat Instant, completarea automată pentru interogările de căutare, în 2010. Deși căutarea nu durează mult, posibilitatea de a economisi câteva secunde de fiecare dată când o folosești îmbunătățește experiența produsului.
Un caz de utilizare care devine mai viabil odată cu latența redusă a lui GPT-4o este traducerea în timp real a vorbirii. OpenAI a prezentat un caz în care doi colegi, unul vorbitor de engleză și celălalt de spaniolă, comunică având GPT-4o care le traduce conversația.
3. Viziune integrată care permite descrieri ale fluxului camerei
Pe lângă integrarea vocii și a textului, GPT-4o are incluse și funcții pentru imagini și video. Asta înseamnă că, dacă îi oferi acces la un ecran de computer, poate descrie ceea ce e afișat pe ecran, răspunde la întrebări despre imaginea de pe ecran sau acționa ca un co-pilot pentru munca ta.
Într-un videoclip de la OpenAI cu Sal Khan de la Khan Academy, GPT-4o îl ajută pe fiul lui Sal la tema de matematică.
Dincolo de lucrul cu un ecran, dacă îi oferi lui GPT-4o acces la o cameră, poate cea de pe smartphone-ul tău, poate descrie ceea ce vede.
Un demo mai lung prezentat de OpenAI combină toate aceste funcții. Două smartphone-uri care rulează GPT-4o poartă o conversație. Un GPT are acces la camerele smartphone-ului și descrie ceea ce poate vedea către un alt GPT care nu poate vedea.
Rezultatul este o conversație în trei între un om și două AI-uri. Videoclipul include, de asemenea, o secțiune în care AI-urile cântă, ceva ce nu era posibil cu modelele anterioare.
4. Tokenizare mai bună pentru alfabete non-latine oferă viteză mai mare și valoare pentru bani
Un pas în fluxul de lucru al LLM este transformarea textului din prompt în tokeni. Aceștia sunt unități de text pe care modelul le poate înțelege.
În engleză, un token este de obicei un cuvânt sau un semn de punctuație, deși unele cuvinte pot fi împărțite în mai mulți tokeni. În medie, trei cuvinte în engleză ocupă aproximativ patru tokeni.
Dacă limba poate fi reprezentată în model cu mai puțini tokeni, este nevoie de mai puține calcule, iar viteza de generare a textului crește.
Mai mult, deoarece OpenAI taxează pentru API-ul său per token de intrare sau ieșire, mai puțini tokeni înseamnă un preț mai mic pentru utilizatorii API-ului.
GPT-4o are un model de tokenizare îmbunătățit care duce la necesarul a mai puțini tokeni per text. Îmbunătățirea este mai vizibilă în limbile care nu folosesc alfabetul latin.
De exemplu, limbile indiene, în special, au beneficiat, cu hindi, marathi, tamil, telugu și gujarati prezentând reduceri ale tokenilor de 2,9 până la 4,4 ori. Araba a arătat o reducere de 2x a tokenilor, iar limbile din Asia de Est precum chineza, japoneza, coreeana și vietnameza au arătat reduceri între 1,4x și 1,7x.
5. Lansare și pentru planul gratuit
Cu strategia de prețuri existentă a OpenAI pentru ChatGPT, utilizatorii trebuiau să plătească pentru a accesa cel mai bun model: GPT-4 Turbo a fost disponibil doar pe planurile plătite Plus și Enterprise.
Acest lucru se schimbă, OpenAI promițând să facă GPT-4o disponibil și pe planul gratuit. Utilizatorii Plus vor primi de cinci ori mai multe mesaje decât utilizatorii de pe planul gratuit.
Implementarea va fi graduală, cu acces pentru red team (testeri care încearcă să spargă modelul pentru a găsi probleme) începând imediat și cu tot mai mulți utilizatori care vor primi acces în timp.
6. Lansarea aplicației desktop ChatGPT
Deși nu este neapărat o actualizare exclusivă pentru GPT-4o, OpenAI a anunțat și lansarea aplicației desktop ChatGPT. Actualizările de latență și multimodalitate menționate mai sus, alături de lansarea aplicației, înseamnă că modul în care lucrăm cu ChatGPT este probabil să se schimbe. De exemplu, OpenAI a arătat un demo al unui flux de lucru de programare augmentată folosind vocea și aplicația desktop ChatGPT. Derulează în secțiunea de cazuri de utilizare pentru a vedea acel exemplu în acțiune!
Cum funcționează GPT-4o?
Multe tipuri de conținut, o singură rețea neuronală
Detaliile despre modul în care funcționează GPT-4o sunt încă puține. Singurul detaliu pe care OpenAI l-a oferit în anunț este că GPT-4o este o singură rețea neuronală care a fost antrenată pe intrări de text, vizuale și audio.
Această nouă abordare diferă de tehnica anterioară de a avea modele separate antrenate pe tipuri de date diferite.
Totuși, GPT-4o nu este primul model care adoptă o abordare multimodală. În 2022, TenCent Lab a creat SkillNet, un model care a combinat caracteristici de transformere LLM cu tehnici de viziune computerizată pentru a îmbunătăți capacitatea de a recunoaște caractere chinezești.
În 2023, o echipă de la ETH Zurich, MIT și Universitatea Stanford a creat WhisBERT, o variație a seriei de modele BERT. Deși nu este primul, GPT-4o este considerabil mai ambițios și mai puternic decât oricare dintre aceste încercări anterioare.
Este GPT-4o o schimbare radicală față de GPT-4 Turbo?
Cât de radicale sunt schimbările în arhitectura lui GPT-4o comparativ cu GPT-4 Turbo depinde dacă întrebi echipele de inginerie sau de marketing ale OpenAI. În aprilie, un bot numit „im-also-a-good-gpt2-chatbot” a apărut pe Chatbot Arena al LMSYS, un clasament pentru cele mai bune AI generative. Acel AI misterios s-a dovedit acum a fi GPT-4o.
Partea "gpt2" din nume este importantă. Să nu fie confundată cu GPT-2, un predecesor al GPT-3.5 și GPT-4, terminația „2” a fost pe scară largă considerată a însemna o arhitectură complet nouă pentru seria de modele GPT.
Evident, cineva din echipa de cercetare sau inginerie a OpenAI consideră că îmbinarea tipurilor de conținut text, vizual și audio într-un singur model este o schimbare suficient de mare pentru a justifica prima creștere de versiune din ultimii șase ani.
Pe de altă parte, echipa de marketing a optat pentru o schimbare de denumire relativ modestă, continuând convenția „GPT-4”.
Performanța GPT-4o vs alte modele
OpenAI a publicat cifre de benchmark pentru GPT-4o comparativ cu mai multe alte modele high-end.
- GPT-4 Turbo
- GPT-4 (versiunea inițială)
- Claude 3 Opus
- Gemini Pro 1.5
- Gemini Ultra 1.0
- Llama 3 400B
Dintre acestea, doar trei modele contează cu adevărat pentru comparație. GPT-4 Turbo, Claude 3 Opus și Gemini Pro 1.5 s-au luptat în ultimele luni pentru primul loc pe clasamentul LMSYS Chatbot Arena.
Llama 3 400B ar putea fi un candidat în viitor, dar nu este încă finalizat. Prin urmare, aici prezentăm doar rezultatele pentru aceste trei modele și GPT-4o.
Au fost folosite rezultatele a șase benchmarkuri.
- Massive Multitask Language Understanding (MMLU). Sarcini despre matematică elementară, istoria SUA, informatică, drept și altele. Pentru a atinge acuratețe mare la acest test, modelele trebuie să posede cunoștințe vaste despre lume și abilitate de rezolvare a problemelor.
- Graduate-Level Google-Proof Q&A (GPQA). Întrebări cu variante de răspuns scrise de experți în biologie, fizică și chimie. Întrebările sunt de înaltă calitate și extrem de dificile: experții care au sau urmează un doctorat în domeniile corespunzătoare ating o acuratețe de 74%.
- MATH. Probleme de matematică pentru gimnaziu și liceu.
- HumanEval. Un test al corectitudinii funcționale a codului, folosit pentru verificarea generării de cod.
- Multilingual Grade School Math (MSGM). Probleme de matematică pentru clasele primare, traduse în zece limbi, inclusiv limbi slab reprezentate precum bengaleza și swahili.
- Discrete Reasoning Over Paragraphs (DROP). Întrebări care necesită înțelegerea paragrafelor complete. De exemplu, prin adunarea, numărarea sau sortarea valorilor răspândite pe mai multe propoziții.

Performanța GPT-4o, GPT-4 Turbo, Gemini Pro 1.5 și Claude 3 Opus pe șase benchmarkuri LLM. Scorurile pentru fiecare benchmark variază între 0 și 100. Reprodus din date furnizate de OpenAI. Nu au fost furnizate date pentru Gemini Pro 1.5 la benchmarkul GPQA.
GPT-4o obține scorul de top în patru dintre benchmarkuri, deși este depășit de Claude 3 Opus în benchmarkul MSGM și de GPT-4 Turbo în benchmarkul DROP. Per ansamblu, această performanță este impresionantă și arată promisiune pentru noua abordare a antrenării multimodale.
Dacă te uiți atent la cifrele GPT-4o comparativ cu GPT-4 Turbo, vei vedea că creșterile de performanță sunt de doar câteva puncte procentuale.
Este un salt impresionant la un an distanță, dar e departe de salturile dramatice de performanță de la GPT-1 la GPT-2 sau de la GPT-2 la GPT-3.
Să fii cu 10% mai bun la raționarea pe text de la un an la altul este probabil noua normalitate. Fructele la îndemână au fost deja culese și este pur și simplu dificil să continui cu salturi mari în raționarea pe text.
Pe de altă parte, ceea ce aceste benchmarkuri LLM nu surprind este performanța AI-ului pe probleme multimodale. Conceptul este atât de nou încât nu avem încă modalități bune de a măsura cât de bun este un model pe text, audio și viziune.
Per ansamblu, performanța lui GPT-4o este impresionantă și arată promisiune pentru noua abordare a antrenării multimodale.
Care sunt cazurile de utilizare pentru GPT-4o?
1. GPT-4o pentru analiză de date și sarcini de programare
Modelele GPT recente și derivatele lor, precum GitHub Copilot, sunt deja capabile să ofere asistență la scrierea de cod, inclusiv scriere de cod și explicarea și remedierea erorilor. Capabilitățile multimodale ale lui GPT-4o permit câteva oportunități interesante.
Într-un videoclip promoțional prezentat de CTO-ul OpenAI Mira Murati, doi cercetători OpenAI, Mark Chen și Barret Zoph, au demonstrat folosirea GPT-4o pentru a lucra cu niște cod Python.
Codul este partajat cu GPT ca text, iar funcția de interacțiune vocală este folosită pentru a-l face pe GPT să explice codul. Ulterior, după rularea codului, capabilitatea de viziune a lui GPT-4o este folosită pentru a explica graficul.
Per ansamblu, să-i arăți ecranul lui ChatGPT și să pui o întrebare vorbind este un flux de lucru potențial mai simplu decât să salvezi un grafic ca fișier imagine, să-l încarci în ChatGPT, apoi să tastezi o întrebare.
2. GPT-4o pentru traducere în timp real
Pregătește-te să iei GPT-4o în vacanță. Capabilitățile de vorbire cu latență redusă ale lui GPT-4o înseamnă că traducerea în timp real este acum posibilă (dacă ai roaming de date în abonamentul tău!). Asta înseamnă că a călători în țări în care nu vorbești limba tocmai a devenit mult mai ușor.
3. Roleplay cu GPT-4o
ChatGPT a fost deja un instrument util pentru scenarii de joc de rol, fie că te pregătești pentru un interviu pentru jobul de vis în domeniul datelor sau îți antrenezi echipa de vânzări să-ți vândă produsul mai bine.
Până acum, a funcționat cel mai bine pentru jocuri de rol doar în text, ceea ce nu este ideal pentru aceste cazuri. Capabilitățile de vorbire îmbunătățite înseamnă că jocul de rol vorbit este acum o opțiune viabilă.
4. GPT-4o pentru asistarea utilizatorilor cu deficiențe de vedere
Capacitatea lui GPT-4o de a înțelege intrări video de la o cameră și de a descrie verbal scena ar putea fi o funcție esențială pentru persoanele cu deficiențe de vedere. Este, practic, funcția de audio-descriere pe care o au televizoarele, dar pentru viața reală.
Hands-on cu GPT-4o
Am avut acces la unele dintre noile funcții ale lui GPT-4o imediat după anunț (din păcate, încă fără chat vocal) și am fost impresionat de multe dintre răspunsurile sale. Răspunsurile par mai rapide și mai consecvente și pare să-mi înțeleagă cererile mai bine decât înainte. Asta nu înseamnă că a fost perfect, totuși.
Iată câteva exemple de interacțiuni pe care le-am avut cu ChatGPT-4o:
Sarcină de analiză de date
Mai întâi, folosind chatul vocal, am întrebat dacă are idei despre cum să analizez performanța echipei de fotbal pe care o susțin, puternicul Leeds United. Pe lângă oferirea mai multor opțiuni, mi-a dat și niște cod Python de exemplu:
import pandas as pd
# Sample data for Leeds United's match results
data = {
'Match': ['Match1', 'Match2', 'Match3', 'Match4', 'Match5'],
'Result': ['Win', 'Draw', 'Loss', 'Win', 'Win'],
'Goals Scored': [2, 1, 0, 3, 2]
}
# Create a DataFrame
df = pd.DataFrame(data)
# Summarize match results
summary = df['Result'].value_counts()
total_goals = df['Goals Scored'].sum()
average_goals = df['Goals Scored'].mean()
# Display summary
print("Match Results Summary:")
print(summary)
print("\nTotal Goals Scored:", total_goals)
print("Average Goals Per Match:", round(average_goals, 2))

Totuși, când am aprofundat acest fir al gândirii, lucrurile au început să o ia puțin razna. Mai întâi am cerut niște date reale de folosit — a căutat pe web și a găsit două surse bune, dar a raportat greșit statisticile. Leeds a jucat 46 de meciuri în sezonul regulat, marcând 81, cu un golaveraj de plus 38, spre deosebire de cele 40 de meciuri jucate pe care le-a menționat în răspunsul său.
Apoi i-am cerut lui ChatGPT să vizualizeze golurile marcate împotriva fiecărei echipe:

Din nou, aici a îndeplinit sarcina doar pe jumătate. A creat o vizualizare așa cum am cerut, care la suprafață arată bine. Dar, în realitate, o mulțime de date sunt inventate și inexacte (echipe care apar de două ori, goluri necontabilizate și echipe care nu sunt în aceeași ligă cu Leeds).
În mod corect, îmi imaginez că performanța ar fi fost mai bună dacă aș fi furnizat eu însumi un set complet de date, dar mi-aș fi dorit să spună asta în loc să inventeze cu încredere răspunsuri.
Analiza imaginii
În continuare, am rugat GPT-4o să analizeze o poză a uneia dintre plantele mele. Încă nu am acces la funcția de viziune integrată, așa că a trebuit să fac o poză și să întreb ChatGPT ce plantă este:

Nu e un efort rău, deși nu e chiar exact. Deși este un bonsai, este un Ilex crenata, nu o Carmona retusa. Totuși, cele două arată destul de similar, așa că e o greșeală ușor de făcut, iar eu am apreciat contextul suplimentar despre cum să am grijă de plantă.
Generarea de imagini
În cele din urmă, am vrut să testez capabilitățile de imagine ale noului model. Mai întâi i-am arătat o poză cu țestoasa mea, Darwin, și l-am rugat să-mi spună despre prietenul meu:

Din nou, este aproape, dar nu perfect. Darwin este de fapt o țestoasă Horsefield, nu de Hermann, dar arată foarte asemănător. Apoi i-am cerut lui ChatGPT-4o să ia imaginea originală și să o recreeze în stilul lui Hokusai. Iată rezultatul:

Un efort destul de bun, deși nu există multă asemănare reală cu imaginea originală, dar cred că e de înțeles. A durat și ceva timp să genereze această imagine.
Per ansamblu, totuși, am fost impresionat de receptivitatea noului model și de cât de bine mi-a înțeles cererile. Este departe de a fi fără cusur și încă are halucinații sigure pe sine uneori, dar abia aștept să mă joc cu vorbirea îmbunătățită și viziunea integrată.
Limitări și riscuri ale GPT-4o
Reglementarea pentru AI generativ este încă în faze incipiente; AI Act al UE este singurul cadru legal notabil de până acum. Asta înseamnă că firmele care creează AI trebuie să ia unele decizii proprii despre ce înseamnă AI sigur.
OpenAI are un cadru de pregătire pe care îl folosește pentru a determina dacă un nou model este potrivit pentru a fi lansat publicului.
Cadrul testează patru arii de îngrijorare.
- Cybersecurity. Poate AI să crească productivitatea infractorilor cibernetici și să ajute la crearea de exploituri?
- BCRN. Poate AI să asiste experții în crearea de amenințări biologice, chimice, radiologice sau nucleare?
- Persuasiune. Poate AI să creeze conținut (potențial interactiv) care să convingă oamenii să-și schimbe convingerile?
- Autonomia modelului. Poate AI să acționeze ca un agent, efectuând acțiuni cu alt software?
Fiecare zonă de îngrijorare este notată cu Scăzut, Mediu, Ridicat sau Critic, iar scorul modelului este cel mai înalt dintre calificativele celor patru categorii.
OpenAI promite să nu lanseze un model care este de îngrijorare critică, deși acesta este un prag de siguranță relativ scăzut: conform definițiilor sale, o îngrijorare critică corespunde cu ceva care ar răsturna civilizația umană. GPT-4o evită confortabil acest lucru, obținând calificativul Îngrijorare medie.
Output imperfect
Ca în cazul tuturor AI-urilor generative, modelul nu se comportă întotdeauna conform intenției. Viziunea computerizată nu este perfectă, așa că interpretările unei imagini sau ale unui videoclip nu sunt garantat corecte.
De asemenea, transcrierile vorbirii sunt rareori 100% corecte, în special dacă vorbitorul are un accent puternic sau sunt folosite cuvinte tehnice.
OpenAI a furnizat un videoclip cu unele duble în care GPT-4o nu a funcționat conform intenției.
În mod notabil, traducerea între două limbi non-engleze a fost unul dintre cazurile în care a eșuat. Alte probleme au inclus ton nepotrivit al vocii (condescendent) și vorbirea în limba greșită.
Risc accelerat de deepfake-uri audio
Anunțul OpenAI notează că „Recunoaștem că modalitățile audio ale GPT-4o prezintă o varietate de riscuri noi”. În multe privințe, GPT-4o poate accelera apariția apelurilor de tip scam deepfake, unde AI îi imită pe celebrități, politicieni și pe prietenii și familia oamenilor. Aceasta este o problemă care se va agrava înainte de a fi rezolvată, iar GPT-4o are puterea de a face apelurile de tip scam deepfake și mai convingătoare.
Pentru a atenua acest risc, ieșirea audio este disponibilă doar într-o selecție de voci presetate.
Probabil că escrocii pricepuți tehnic pot folosi GPT-4o pentru a genera ieșire text și apoi pot folosi propriul lor model text-to-speech, deși nu este clar dacă ar obține în continuare beneficiile de latență și ton ale vocii pe care le oferă GPT-4o.
Data lansării GPT-4o
Începând cu 19 iulie 2024, multe funcții ale lui GPT-4o au fost lansate treptat. Capabilitățile de text și imagine sunt adăugate pentru mulți utilizatori pe planurile Plus și gratuite. Asta include ChatGPT accesat pe browsere mobile. De asemenea, funcțiile de text și viziune ale lui GPT-4o sunt deja disponibile prin API.
Aceste funcții ale lui GPT-4o sunt în mare parte disponibile pe aplicațiile mobile iOS și Android. Totuși, încă așteptăm noul Voice Mode, care va fi actualizat să folosească GPT-4o, API-ul va adăuga capabilități audio și video pentru GPT-4o, iar noul model va fi disponibil pe Desktop Mac. Accesul la acesta este, de asemenea, lansat treptat pentru utilizatorii Plus, iar o aplicație desktop pentru Windows este planificată pentru mai târziu în acest an.
Mai jos este un rezumat al datelor de lansare pentru GPT-4o:
- Anunțul GPT-4o: 13 mai 2024
- Lansarea capabilităților de text și imagine GPT-4o: Începând cu 13 mai 2024
- Disponibilitatea GPT-4o în nivelul gratuit și pentru utilizatorii Plus: Începând cu 13 mai 2024
- Acces API pentru GPT-4o (text și viziune): Începând cu 13 mai 2024
- Disponibilitatea GPT-4o pe desktop Mac pentru utilizatorii Plus: În săptămânile următoare (începând cu 13 mai 2024)
- Noua versiune a Voice Mode cu GPT-4o în alpha: În săptămânile/lunile următoare (după 13 mai 2024)
- Suport API pentru capabilități audio și video: În săptămânile/lunile următoare (după 13 mai 2024)
- GPT-4o mini: 18 iulie 2024
Totuși, după controversa cauzată de demo-ul noilor capabilități vocale, se pare că OpenAI este precaut cu privire la lansare. Conform blogului lor actualizat, 'În următoarele săptămâni și luni, vom lucra la infrastructura tehnică, la uzabilitate prin post-antrenare și la siguranța necesară pentru a lansa celelalte modalități. De exemplu, la lansare, ieșirile audio vor fi limitate la o selecție de voci presetate și vor respecta politicile noastre de siguranță existente.'
Cât costă GPT-4o?
Deși este mai rapid decât GPT-4 Turbo și are capabilități de viziune mai bune, GPT-4o va fi cu aproximativ 50% mai ieftin decât predecesorul său. Conform site-ului OpenAI, folosirea modelului va costa 5 USD per milion de tokeni pentru input și 15 USD per milion de tokeni pentru output.
Cum pot accesa GPT-4o în versiunea web a ChatGPT?
Interfața utilizator pentru ChatGPT s-a schimbat. Toate mesajele din ChatGPT folosesc implicit GPT-4o, iar modelul poate fi schimbat la GPT-3.5 folosind un comutator aflat sub răspuns.
Ce înseamnă GPT-4o pentru viitor?
Există două curente de gândire despre direcția în care ar trebui să meargă AI. Unul este că AI ar trebui să devină din ce în ce mai puternică și capabilă să îndeplinească o gamă mai largă de sarcini. Celălalt este că AI ar trebui să devină mai bună la rezolvarea sarcinilor specifice cât mai ieftin posibil.
Misiunea OpenAI de a crea inteligență generală artificială (AGI), precum și modelul său de afaceri, îl plasează ferm în prima tabără. GPT-4o este un alt pas către acel obiectiv al unei AI din ce în ce mai puternice.
Aceasta este prima generație a unei arhitecturi de model complet noi pentru OpenAI. Asta înseamnă că firma are multe de învățat și optimizat în lunile următoare.
Pe termen scurt, așteaptă-te la noi tipuri de ciudățenii și halucinații, iar pe termen lung, la îmbunătățiri de performanță, atât în ceea ce privește viteza, cât și calitatea outputului.
Momentul GPT-4o este interesant. Exact când giganții tech au realizat că Siri, Alexa și Google Assistant nu sunt acele generatoare de venituri pe care le sperau cândva, OpenAI speră să facă AI-ul din nou vorbăreț. În cel mai bun caz, acest lucru va aduce o serie de noi cazuri de utilizare pentru AI generativ. Cel puțin, acum poți seta un cronometru în orice limbă dorești.
Concluzie
GPT-4o reprezintă un progres suplimentar în AI generativă, combinând procesarea textului, a audio-ului și a imaginilor într-un singur model eficient. Această inovație promite răspunsuri mai rapide, interacțiuni mai bogate și o gamă mai largă de aplicații, de la traducere în timp real la analiză de date îmbunătățită și accesibilitate sporită pentru persoanele cu deficiențe de vedere.
Deși există limitări și riscuri inițiale, cum ar fi potențialul de abuz în scam-urile deepfake și nevoia de optimizare suplimentară, GPT-4o este un alt pas către obiectivul OpenAI de inteligență generală artificială. Pe măsură ce devine mai accesibil, GPT-4o ar putea schimba modul în care interacționăm cu AI, integrându-se în sarcinile zilnice și profesionale.
Cu costul mai mic și capabilitățile îmbunătățite, GPT-4o este pregătit să stabilească un nou standard în industria AI, extinzând posibilitățile pentru utilizatori din diverse domenii.
Viitorul AI este interesant, iar acum este un moment la fel de bun ca oricare altul pentru a începe să înveți cum funcționează această tehnologie. Dacă ești nou în domeniu, începe cu parcursul de competențe AI Fundamentals, care acoperă cunoștințe aplicabile pe subiecte precum ChatGPT, modele mari de limbaj, AI generativă și altele. Poți afla mai multe și despre lucrul cu OpenAI API în cursul nostru practic sau poți consulta catalogul complet de cursuri AI.
Întrebări frecvente
Poate GPT-4o să gestioneze conversații multilingve?
Da, GPT-4o poate gestiona conversații multilingve, oferind traducere în timp real între limbi datorită capabilităților sale de vorbire cu latență redusă. Totuși, în demonstrație au existat unele erori la procesarea traducerilor.
Suportă GPT-4o toate limbile la fel de bine?
Deși GPT-4o are o tokenizare îmbunătățită pentru alfabetele non-latine, performanța poate varia între diferite limbi, în special pentru cele mai puțin reprezentate în datele de antrenare.
Cum gestionează GPT-4o zgomotul de fundal în intrarea audio?
GPT-4o poate lua în considerare zgomotul de fundal la procesarea intrării audio, ceea ce poate duce la răspunsuri mai conștiente de context.
Este GPT-4o capabil să genereze conținut video?
Nu, GPT-4o poate analiza și descrie conținut video, dar nu poate genera conținut video nou. Sora de la OpenAI este modelul care poate genera conținut video.
Poate GPT-4o să imite voci specifice?
Nu, GPT-4o folosește o selecție de voci presetate pentru ieșirea audio pentru a reduce riscurile precum scam-urile deepfake.
Cât de sigure sunt datele introduse în GPT-4o?
OpenAI urmează măsuri stricte de securitate, dar utilizatorii ar trebui întotdeauna să fie precauți și să evite partajarea informațiilor sensibile.
Poate GPT-4o fi integrat în aplicații existente?
Da, GPT-4o poate fi integrat în diverse aplicații prin OpenAI API, permițând funcționalități îmbunătățite pe diferite platforme.
Începe-ți călătoria în dezvoltarea de aplicații alimentate de AI cu cursul nostru Working with the OpenAI API.
Când ar trebui să folosesc GPT-4o Mini în loc de GPT-4o?
GPT-4o Mini este ideal pentru sarcini care prioritizează viteza și eficiența în detrimentul raționamentului complex sau interacțiunilor multimodale. Este potrivit pentru sarcini simple de codare, depanare sau răspunsuri rapide în aplicații ușoare, fiind o alternativă rentabilă pentru proiecte care nu necesită toată puterea lui GPT-4o.
Care sunt diferențele dintre GPT-4o și modelul o1?
GPT-4o este conceput pentru sarcini multimodale, gestionând eficient intrări text, audio și vizuale. Modelul o1, însă, se concentrează pe raționament avansat și rezolvarea problemelor complexe, excelând în domenii precum programarea și științele. În timp ce GPT-4o oferă versatilitate și viteză, modelul o1 prioritizează procesarea profundă și logică pentru sarcini cu raționament complex.