Ga naar hoofdinhoud

GPT-4o-gids: hoe het werkt, use-cases, prijzen, benchmarks

Lees meer over GPT-4o van OpenAI, een multimodaal AI-model dat tekst-, audio- en visuele data verwerkt, en ontdek hoe het zich verhoudt tot GPT-4 Turbo voor verschillende use-cases.
Bijgewerkt 31 aug 2026  · 8 min lezen

Verkennen met AI

ChatGPTClaudePerplexity

OpenAI heeft zijn nieuwste large language model aangekondigd, GPT-4o, de opvolger van GPT-4 Turbo. Lees verder om de mogelijkheden, prestaties en hoe je het kunt gebruiken te ontdekken.

Wat is GPT-4o van OpenAI?

GPT-4o is OpenAI’s nieuwste LLM. De ‘o’ in GPT-4o staat voor "omni"—Latijn voor "alles"—en verwijst naar het feit dat dit nieuwe model prompts accepteert die een mix zijn van tekst, audio, afbeeldingen en video. Voorheen gebruikte de ChatGPT-interface aparte modellen voor verschillende contenttypes.

Als je bijvoorbeeld met ChatGPT sprak via Spraakmodus, werd je spraak naar tekst omgezet met Whisper, werd een tekstantwoord gegenereerd met GPT-4 Turbo, en werd dat tekstantwoord omgezet naar spraak met TTS.

GPT-4o vs GPT-4 Turbo

Een vergelijking van hoe GPT-4 Turbo en GPT-4o spraakinvoer verwerken

Ook voor het werken met afbeeldingen in ChatGPT was een mix van GPT-4 Turbo en DALL-E 3 nodig.

Eén model voor verschillende contentmedia belooft hogere snelheid en kwaliteit van resultaten, een eenvoudiger interface en een paar nieuwe use-cases.

Wat is GPT-4o mini?

GPT-4o Mini is een slankere, snellere versie van GPT-4o, ontworpen om taken af te handelen met meer focus op snelheid en efficiëntie. Het is afgeleid van het grotere GPT-4o-model via een proces dat distillatie wordt genoemd.

Hoewel het veel van het oorspronkelijke vermogen behoudt om multimodale input te verwerken—tekst, audio en afbeeldingen—is GPT-4o mini geoptimaliseerd voor lichtgewicht toepassingen waar snellere responstijden cruciaal zijn.

Het is vooral nuttig voor ontwikkelaars die een kosteneffectieve oplossing nodig hebben voor coderen, debuggen en realtime-interacties die niet het volledige rekenvermogen van GPT-4o vereisen.

Je kunt meer details lezen in dit artikel over GPT-4o mini.

Wat maakt GPT-4o anders dan GPT-4 Turbo?

De alles-in-één-modelbenadering betekent dat GPT-4o meerdere beperkingen van de eerdere spraakinteractiemogelijkheden wegneemt.

1. Toon van de stem wordt nu meegenomen, wat emotionele reacties mogelijk maakt

Met het vorige OpenAI-systeem waarbij Whisper, GPT-4 Turbo en TTS in een pijplijn werden gecombineerd, had de redeneermotor, GPT-4, alleen toegang tot de uitgesproken woorden. Deze methode betekende dat zaken als toon, achtergrondgeluiden en herkenning van meerdere sprekers werden genegeerd. Daardoor kon GPT-4 Turbo geen reacties geven met verschillende emoties of spreekstijlen.

Door één model te hebben dat kan redeneren over tekst en audio, kan deze rijke audio-informatie worden benut om betere reacties te geven met een grotere variatie aan spreekstijlen.

In het volgende voorbeeld van OpenAI geeft GPT-4o sarcastische output.

2. Lagere latentie maakt realtime gesprekken mogelijk

De bestaande pijplijn met drie modellen zorgde voor een kleine vertraging ("latency") tussen het praten tegen ChatGPT en het ontvangen van een reactie.

OpenAI deelde dat de gemiddelde latentie van Spraakmodus 2,8 seconden is voor GPT-3.5 en 5,4 seconden voor GPT-4. Ter vergelijking: de gemiddelde latentie voor GPT-4o is 0,32 seconden, negen keer sneller dan GPT-3.5 en 17 keer sneller dan GPT-4.

Deze verminderde latentie ligt dicht bij de gemiddelde menselijke reactietijd (0,21 seconden) en is belangrijk voor conversatie-use-cases, waar er veel heen-en-weer is tussen mens en AI en de pauzes tussen reacties optellen.

Deze functie doet denken aan Google dat in 2010 Instant lanceerde, de auto-aanvullen-functie voor zoekopdrachten. Zoeken kost niet veel tijd, maar telkens een paar seconden besparen maakt de productervaring beter.

Een use-case die met de verlaagde latentie van GPT-4o levensvatbaarder wordt, is realtime vertaling van spraak. OpenAI liet een use-case zien van twee collega’s, de een Engelstalig en de ander Spaanstalig, die communiceren door GPT-4o hun gesprek te laten vertalen.

3. Geïntegreerde visie maakt beschrijvingen van een camerafeed mogelijk

Naast de integratie van spraak en tekst heeft GPT-4o ook beeld- en videofuncties. Dit betekent dat als je het toegang geeft tot een computerscherm, het kan beschrijven wat er op het scherm staat, vragen kan beantwoorden over de afbeelding op het scherm, of kan fungeren als co-piloot voor je werk.

In een video van OpenAI met Sal Khan van Khan Academy helpt GPT-4o bij het wiskundehuiswerk van de zoon van Sal.

Verder, als je GPT-4o toegang geeft tot een camera, bijvoorbeeld je smartphone, kan het beschrijven wat het ziet.

Een langere demo van OpenAI combineert al deze functies. Twee smartphones met GPT-4o voeren een gesprek. Eén GPT heeft toegang tot de smartphonecamera’s en beschrijft wat het ziet aan een andere GPT die niets kan zien.

Het resultaat is een driegesprek tussen een mens en twee AIs. De video bevat ook een gedeelte waarin de AIs zingen, iets wat met eerdere modellen niet mogelijk was.

4. Betere tokenisatie voor niet-Romaanse alfabetten zorgt voor meer snelheid en waar voor je geld

Een stap in de LLM-werkstroom is wanneer de prompttekst wordt omgezet in tokens. Dit zijn eenheden tekst die het model kan begrijpen.

In het Engels is een token doorgaans één woord of leesteken, hoewel sommige woorden in meerdere tokens kunnen worden opgesplitst. Gemiddeld zijn drie Engelse woorden ongeveer vier tokens.

Als taal met minder tokens in het model kan worden weergegeven, zijn er minder berekeningen nodig en neemt de snelheid van tekstgeneratie toe.

Bovendien, omdat OpenAI voor zijn API per ingevoerde of uitgevoerde token rekent, betekenen minder tokens een lagere prijs voor API-gebruikers.

GPT-4o heeft een verbeterd tokenisatiemodel waardoor er minder tokens per tekst nodig zijn. De verbetering is vooral merkbaar in talen die geen Romeins alfabet gebruiken.

Met name Indiase talen hebben geprofiteerd: Hindi, Marathi, Tamil, Telugu en Gujarati laten allemaal een vermindering in tokens zien van 2,9 tot 4,4 keer. Arabisch liet een 2x-reductie zien en Oost-Aziatische talen als Chinees, Japans, Koreaans en Vietnamees vertoonden reducties tussen 1,4x en 1,7x.

5. Uitrol naar het gratis abonnement

Met OpenAI’s huidige prijsstrategie voor ChatGPT moeten gebruikers betalen om toegang te krijgen tot het beste model: GPT-4 Turbo was alleen beschikbaar in de betaalde Plus- en Enterprise-abonnementen.

Dit verandert: OpenAI belooft GPT-4o ook beschikbaar te maken in het gratis abonnement. Plus-gebruikers krijgen vijf keer zoveel berichten als gebruikers van het gratis abonnement.

De uitrol gebeurt geleidelijk, met red team-toegang (testers die proberen het model te breken om problemen te vinden) die direct start en daarna steeds meer gebruikers toegang krijgen.

6. Lancering van de desktop-app van ChatGPT

Hoewel dit niet per se exclusief is voor GPT-4o, kondigde OpenAI ook de release van de desktop-app van ChatGPT aan. De bovengenoemde verbeteringen in latentie en multimodaliteit, samen met de release van de app, betekenen dat de manier waarop we met ChatGPT werken waarschijnlijk gaat veranderen. OpenAI toonde bijvoorbeeld een demo van een augmented coding-workflow met spraak en de ChatGPT-desktopapp. Scroll omlaag naar de use-cases-sectie om dat voorbeeld in actie te zien!

Hoe werkt GPT-4o?

Veel contenttypes, één neuraal netwerk

Details over hoe GPT-4o werkt, zijn nog schaars. Het enige detail dat OpenAI in zijn aankondiging gaf, is dat GPT-4o één enkel neuraal netwerk is dat is getraind op tekst-, visie- en audio-invoer.

Deze nieuwe aanpak verschilt van de eerdere techniek met aparte modellen die op verschillende datatypes zijn getraind.

GPT-4o is echter niet het eerste model met een multimodale aanpak. In 2022 maakte TenCent Lab SkillNet, een model dat LLM-transformerfuncties combineerde met computervisie om Chinese karakters beter te herkennen.

In 2023 maakte een team van ETH Zürich, MIT en Stanford WhisBERT, een variant op de BERT-serie van large language models. Hoewel niet de eerste, is GPT-4o aanzienlijk ambitieuzer en krachtiger dan beide eerdere pogingen.

Is GPT-4o een radicale verandering ten opzichte van GPT-4 Turbo?

Hoe radicaal de veranderingen zijn in de architectuur van GPT-4o vergeleken met GPT-4 Turbo hangt af van of je OpenAI’s engineering- of marketingteams vraagt. In april verscheen een bot met de naam "im-also-a-good-gpt2-chatbot" op LMSYS’s Chatbot Arena, een ranglijst voor de beste generatieve AIs. Die mysterieuze AI blijkt nu GPT-4o te zijn.

Het "gpt2"-gedeelte van de naam is belangrijk. Niet te verwarren met GPT-2, een voorloper van GPT-3.5 en GPT-4, werd het achtervoegsel "2" algemeen gezien als een compleet nieuwe architectuur voor de GPT-serie modellen.

Blijkbaar vindt iemand bij OpenAI’s research- of engineeringteam dat het combineren van tekst-, visie- en audiotypes in één model een grote genoeg verandering is voor de eerste versienummer-sprong in zes jaar.

Aan de andere kant koos het marketingteam voor een relatief bescheiden naamswijziging en ging door met de "GPT-4"-conventie.

GPT-4o-prestaties vs andere modellen

OpenAI publiceerde benchmarkcijfers van GPT-4o vergeleken met verschillende andere high-end modellen.

  • GPT-4 Turbo
  • GPT-4 (eerste release)
  • Claude 3 Opus
  • Gemini Pro 1.5
  • Gemini Ultra 1.0
  • Llama 3 400B

Van deze modellen doen er eigenlijk maar drie echt ter zake voor vergelijking. GPT-4 Turbo, Claude 3 Opus en Gemini Pro 1.5 streden de afgelopen maanden om de toppositie op de LMSYS Chatbot Arena-ranglijst.

Llama 3 400B kan in de toekomst een kanshebber zijn, maar is nog niet af. Daarom presenteren we hier alleen de resultaten voor deze drie modellen en GPT-4o.

Er zijn zes benchmarks gebruikt.

  • Massive Multitask Language Understanding (MMLU). Taken over onder meer wiskunde op basisschoolniveau, Amerikaanse geschiedenis, informatica en recht. Om hoog te scoren moeten modellen uitgebreide wereldkennis en probleemoplossend vermogen hebben.
  • Graduate-Level Google-Proof Q&A (GPQA). Meerkeuzevragen geschreven door domeinexperts in biologie, natuurkunde en scheikunde. De vragen zijn van hoge kwaliteit en extreem moeilijk: experts met of die een PhD nastreven in de betreffende domeinen halen 74% nauwkeurigheid.
  • MATH. Wiskundeproblemen voor middelbare school.
  • HumanEval. Een test van de functionele correctheid van computercode, gebruikt om codegeneratie te controleren.
  • Multilingual Grade School Math (MSGM). Rekenvragen op basisschoolniveau, vertaald in tien talen, waaronder ondervertegenwoordigde talen zoals Bengaals en Swahili.
  • Discrete Reasoning Over Paragraphs (DROP). Vragen die begrip van volledige alinea’s vereisen. Bijvoorbeeld door waarden op te tellen, te tellen of te sorteren over meerdere zinnen.

GPT-4o prestatiebenchmarks vs andere modellen

Prestaties van GPT-4o, GPT-4 Turbo, Gemini Pro 1.5 en Claude 3 Opus op zes LLM-benchmarks. Scores voor elke benchmark variëren van 0 tot 100. Gereconstrueerd op basis van door OpenAI aangeleverde data. Er zijn geen gegevens verstrekt voor Gemini Pro 1.5 voor de GPQA-benchmark.

GPT-4o haalt de hoogste score in vier van de benchmarks, al wordt het verslagen door Claude 3 Opus in de MSGM-benchmark en door GPT-4 Turbo in de DROP-benchmark. Al met al zijn de prestaties indrukwekkend en beloven ze veel voor de nieuwe multimodale trainingsaanpak.

Als je goed kijkt naar de GPT-4o-cijfers vergeleken met GPT-4 Turbo, zie je dat de prestatieverbeteringen slechts enkele procentpunten zijn.

Het is een indrukwekkende boost een jaar later, maar het is ver verwijderd van de dramatische sprongen van GPT-1 naar GPT-2 of GPT-2 naar GPT-3.

Jaar-op-jaar 10% beter worden in tekstredeneren wordt waarschijnlijk het nieuwe normaal. Het laaghangend fruit is geplukt en grote sprongen in tekstredeneren zijn nu eenmaal lastig.

Wat deze LLM-benchmarks daarentegen niet meten, is de AI-prestatie op multimodale problemen. Het concept is zo nieuw dat we nog geen goede manieren hebben om te meten hoe goed een model is over tekst, audio en visie heen.

Al met al zijn de prestaties van GPT-4o indrukwekkend en tonen ze perspectief voor de nieuwe aanpak van multimodale training.

Wat zijn de use-cases van GPT-4o?

1. GPT-4o voor data-analyse & codetaken

Recente GPT-modellen en hun afgeleiden, zoals GitHub Copilot, kunnen al code-assistentie bieden, waaronder code schrijven en fouten uitleggen en oplossen. De multimodale mogelijkheden van GPT-4o bieden interessante kansen.

In een promotievideo, gehost door OpenAI-CTO Mira Murati, demonstreerden twee OpenAI-onderzoekers, Mark Chen en Barret Zoph, hoe je met GPT-4o aan Python-code werkt.

De code wordt als tekst gedeeld met GPT en de spraakinteractiefunctie wordt gebruikt om GPT de code te laten uitleggen. Later, na het uitvoeren van de code, wordt de visiecapability van GPT-4o gebruikt om de grafiek toe te lichten.

Alles bij elkaar is je scherm aan ChatGPT laten zien en een vraag inspreken mogelijk een eenvoudigere workflow dan een plot als afbeelding opslaan, uploaden naar ChatGPT en dan een vraag typen.

2. GPT-4o voor realtime vertaling

Maak je klaar om GPT-4o mee op vakantie te nemen. De lage-latentie spraakeigenschappen van GPT-4o betekenen dat realtime vertaling nu mogelijk is (als je roamingdata in je mobiele abonnement hebt!). Reizen in landen waar je de taal niet spreekt, is zo een stuk makkelijker geworden.

3. Rollenspel met GPT-4o

ChatGPT was al een handig hulpmiddel voor rollenspelscenario’s, of je je nu voorbereidt op een sollicitatiegesprek voor die droombaan in data of je salesteam traint om je product beter te verkopen.

Tot nu toe werkte het het best voor rollenspellen met alleen tekst, wat niet ideaal is voor die use-cases. De verbeterde spraakmogelijkheden betekenen dat gesproken rollenspel nu een haalbare optie is.

4. GPT-4o als hulp voor slechtziende gebruikers

Het vermogen van GPT-4o om video-invoer van een camera te begrijpen en de scène mondeling te beschrijven, kan een onmisbare functie zijn voor mensen met een visuele beperking. Het is in feite de audiobeschrijvingsfunctie die tv’s hebben, maar dan voor het echte leven.

Hands-on met GPT-4o

Ik heb sinds kort na de aankondiging toegang tot enkele van GPT-4o’s nieuwe functies (helaas nog geen voice chat), en ik ben onder de indruk van veel van de outputs. Reacties lijken sneller en consistenter, en het lijkt mijn verzoeken beter te begrijpen dan voorheen. Dat wil niet zeggen dat het perfect is.

Hier zijn enkele voorbeelden van mijn interacties met ChatGPT-4o:

Data-analysetaak

Eerst vroeg ik via voice chat of het ideeën had om de prestaties te analyseren van de voetbalclub die ik steun, het machtige Leeds United. Naast verschillende opties gaf het me voorbeeldcode in Python:

import pandas as pd

# Sample data for Leeds United's match results
data = {
    'Match': ['Match1', 'Match2', 'Match3', 'Match4', 'Match5'],
    'Result': ['Win', 'Draw', 'Loss', 'Win', 'Win'],
    'Goals Scored': [2, 1, 0, 3, 2]
}

# Create a DataFrame
df = pd.DataFrame(data)

# Summarize match results
summary = df['Result'].value_counts()
total_goals = df['Goals Scored'].sum()
average_goals = df['Goals Scored'].mean()

# Display summary
print("Match Results Summary:")
print(summary)
print("\nTotal Goals Scored:", total_goals)
print("Average Goals Per Match:", round(average_goals, 2))

GPT-4o codegeneratie

Maar toen ik deze gedachtegang verder uitpluisde, ging het wat mis. Ik vroeg eerst om echte data om te gebruiken—het zocht op het web en vond twee goede bronnen, maar rapporteerde de statistieken verkeerd. Leeds speelde 46 wedstrijden in het reguliere seizoen, scoorde 81 keer met een doelsaldo van plus 38, in plaats van de 40 wedstrijden die het in zijn reactie noemde.

Daarna vroeg ik ChatGPT om de gemaakte doelpunten per tegenstander te visualiseren:

GPT-4o datavisualisatie

Opnieuw is de taak hier half voltooid. Het heeft een visualisatie gemaakt zoals gevraagd, die er op het eerste gezicht prima uitziet. Maar in werkelijkheid is veel van de data verzonnen en onjuist (teams die dubbel voorkomen, doelpunten die niet zijn meegeteld en teams die niet in dezelfde divisie als Leeds spelen).

Eerlijk is eerlijk: de prestaties waren beter geweest als ik zelf een volledige dataset had aangeleverd, maar ik zou willen dat het dat zei in plaats van zelfverzekerd antwoorden te verzinnen.

Beeldanalyse

Vervolgens vroeg ik GPT-4o om een foto van een van mijn planten te analyseren. Ik heb nog geen toegang tot de geïntegreerde visie-functie, dus ik moest een foto maken en ChatGPT vragen welke plant het was:

GPT-4o beeldanalyse

Dit is geen slecht resultaat, al is het niet helemaal accuraat. Hoewel het een bonsaiboom is, is het een Ilex crenata in plaats van een Carmona retusa. Toch lijken de twee erg op elkaar, dus het is een begrijpelijke vergissing en ik waardeerde de extra context over verzorging.

Beeldgeneratie

Tot slot wilde ik de beeldmogelijkheden van het nieuwe model testen. Ik liet eerst een foto zien van mijn schildpad, Darwin, en vroeg het om me iets te vertellen over mijn vriend:

GPT-4o beeldanalyse 2

Opnieuw: dichtbij, maar niet perfect. Darwin is eigenlijk een steppe- (Horsefield) schildpad en geen Hermanns, maar ze lijken sterk op elkaar. Daarna vroeg ik ChatGPT-4o om de originele afbeelding te nemen en deze te recreëren in de stijl van Hokusai. Dit is het resultaat:

GPT-4o beeldgeneratie

Best goed gelukt, al lijkt het niet heel veel op het origineel, maar dat is op zich begrijpelijk. Het duurde ook even om deze te genereren.

Al met al was ik onder de indruk van de reactiesnelheid van het nieuwe model en hoe goed het mijn verzoeken begreep. Het is verre van foutloos en hallucineert soms nog steeds zelfverzekerd, maar ik kan niet wachten om met de verbeterde spraak en geïntegreerde visie aan de slag te gaan.

Beperkingen & risico’s van GPT-4o

Regelgeving voor generatieve AI staat nog in de kinderschoenen; de EU AI Act is tot nu toe het enige noemenswaardige juridische kader. Dat betekent dat bedrijven die AI maken zelf beslissingen moeten nemen over wat veilige AI is.

OpenAI heeft een preparedness-framework dat het gebruikt om te bepalen of een nieuw model geschikt is voor publieke release.

Het framework test vier zorggebieden.

  • Cybersecurity. Kan AI de productiviteit van cybercriminelen verhogen en helpen bij het maken van exploits?
  • BCRN. Kan de AI experts helpen bij het creëren van biologische, chemische, radiologische of nucleaire dreigingen?
  • Overtuiging. Kan de AI (mogelijk interactieve) content creëren die mensen aanzet hun overtuigingen te veranderen?
  • Modelautonomie. Kan de AI als agent handelen, acties uitvoeren met andere software?

Elk zorggebied wordt beoordeeld als Laag, Medium, Hoog of Kritiek, en de score van het model is de hoogste beoordeling over de vier categorieën heen.

OpenAI belooft geen model vrij te geven dat kritisch zorgwekkend is, al is dit een relatief lage veiligheidsdrempel: volgens hun definities komt een kritieke zorg overeen met iets dat de menselijke beschaving zou ontwrichten. GPT-4o ontwijkt dit ruimschoots en scoort Medium zorg.

Onvolmaakte output

Zoals bij alle generatieve AIs gedraagt het model zich niet altijd zoals bedoeld. Computervisie is niet perfect, dus interpretaties van een afbeelding of video zijn niet gegarandeerd correct.

Ook transcripties van spraak zijn zelden 100% juist, zeker als de spreker een sterk accent heeft of er technische woorden worden gebruikt.

OpenAI gaf een video met bloopers waarin GPT-4o niet werkte zoals bedoeld.

Met name vertaling tussen twee niet-Engelse talen was een van de gevallen waar het misging. Andere problemen waren een ongeschikte toon (neerbuigend) en spreken in de verkeerde taal.

Versneld risico op audio-deepfakes

De aankondiging van OpenAI merkt op dat "We erkennen dat de audiomodaliteiten van GPT-4o allerlei nieuwe risico’s met zich meebrengen." In veel opzichten kan GPT-4o de opkomst van deepfake-oplichtingsgesprekken versnellen, waarbij AI beroemdheden, politici en vrienden en familie van mensen nadoet. Dit is een probleem dat waarschijnlijk erger wordt voordat het wordt opgelost, en GPT-4o kan zulke deepfake-oproepen nog overtuigender maken.

Om dit risico te beperken, is audio-output alleen beschikbaar in een selectie van vooraf ingestelde stemmen.

Vermoedelijk kunnen technisch onderlegde fraudeurs GPT-4o gebruiken om tekstoutput te genereren en vervolgens hun eigen tekst-naar-spraakmodel gebruiken, al is onduidelijk of ze dan nog steeds profiteren van de latentie- en stemtoonvoordelen die GPT-4o biedt.

Release-datum van GPT-4o

Vanaf 19 juli 2024 zijn veel functies van GPT-4o geleidelijk uitgerold. De tekst- en afbeeldingsmogelijkheden zijn toegevoegd voor veel gebruikers met Plus- en gratis abonnementen. Dit omvat ChatGPT via mobiele browsers. Evenzo zijn de tekst- en visiefuncties van GPT-4o al beschikbaar via de API.

Deze functies van GPT-4o zijn breed beschikbaar op iOS- en Android-mobiele apps. We wachten echter nog op de nieuwe Spraakmodus, die wordt geüpdatet om GPT-4o te gebruiken; de API zal audio- en videomogelijkheden voor GPT-4o toevoegen; en het nieuwe model zal beschikbaar zijn op Mac Desktop. Toegang tot dat laatste wordt ook geleidelijk uitgerold naar Plus-gebruikers, en een Windows-desktopapp is gepland voor later dit jaar.

Hieronder volgt een samenvatting van de release-data van GPT-4o:

  • Aankondiging van GPT-4o: 13 mei 2024
  • Uitrol van GPT-4o-tekst- en afbeeldingsmogelijkheden: Vanaf 13 mei 2024
  • Beschikbaarheid van GPT-4o in gratis tier en voor Plus-gebruikers: Vanaf 13 mei 2024
  • API-toegang voor GPT-4o (tekst en visie): Vanaf 13 mei 2024
  • Beschikbaarheid van GPT-4o op Mac-desktop voor Plus-gebruikers: Komende weken (vanaf 13 mei 2024)
  • Nieuwe versie van Spraakmodus met GPT-4o in alpha: Komende weken/maanden (na 13 mei 2024)
  • API-ondersteuning voor audio- en videomogelijkheden: Komende weken/maanden (na 13 mei 2024)
  • GPT-4o mini: 18 juli 2024

Na de controverse rond de demo van de nieuwe spraakmogelijkheden lijkt OpenAI echter voorzichtig met de release. Volgens hun bijgewerkte blog 'In de komende weken en maanden werken we aan de technische infrastructuur, bruikbaarheid via post-training en veiligheid die nodig zijn om de andere modaliteiten uit te brengen. Zo worden audio-outputs bij de lancering beperkt tot een selectie van vooraf ingestelde stemmen en houden we ons aan onze bestaande veiligheidsrichtlijnen.' 

Wat kost GPT-4o?

Ondanks dat het sneller is dan GPT-4 Turbo en betere visiemogelijkheden heeft, zal GPT-4o ongeveer 50% goedkoper zijn dan zijn voorganger. Volgens de website van OpenAI kost het gebruik van het model $5 per miljoen tokens voor input en $15 per miljoen tokens voor output.

Hoe krijg ik toegang tot GPT-4o in de webversie van ChatGPT?

De gebruikersinterface van ChatGPT is veranderd. Alle berichten in ChatGPT gebruiken standaard GPT-4o, en je kunt het model wijzigen naar GPT-3.5 met een schakelaar onder de reactie.

Wat betekent GPT-4o voor de toekomst?

Er zijn grofweg twee denkrichtingen over waar AI naartoe moet. De een is dat AI steeds krachtiger moet worden en een breder scala aan taken moet kunnen uitvoeren. De ander is dat AI specifieke taken zo goedkoop mogelijk beter moet oplossen.

OpenAI’s missie om artificial general intelligence (AGI) te creëren, evenals het bedrijfsmodel, plaatsen het stevig in het eerste kamp. GPT-4o is opnieuw een stap richting dat doel van steeds krachtigere AI.

Dit is de eerste generatie van een volledig nieuwe modelarchitectuur voor OpenAI. Dat betekent dat er de komende maanden veel te leren en te optimaliseren valt voor het bedrijf.

Op korte termijn kun je nieuwe soorten eigenaardigheden en hallucinaties verwachten, en op lange termijn prestatieverbeteringen, zowel qua snelheid als outputkwaliteit.

De timing van GPT-4o is interessant. Net nu de techgiganten zich realiseren dat Siri, Alexa en Google Assistant niet de geldmachines zijn die ze ooit hoopten, probeert OpenAI AI weer spraakzaam te maken. In het beste geval levert dit een reeks nieuwe use-cases voor generatieve AI op. Op z’n minst kun je nu in welke taal dan ook een timer zetten.

Conclusie

GPT-4o betekent verdere vooruitgang in generatieve AI, met de combinatie van tekst-, audio- en visuele verwerking in één efficiënt model. Deze innovatie belooft snellere reacties, rijkere interacties en een breder scala aan toepassingen, van realtime vertaling tot verbeterde data-analyse en betere toegankelijkheid voor slechtzienden.

Hoewel er aanvankelijke beperkingen en risico’s zijn, zoals mogelijk misbruik in deepfake-oplichting en de noodzaak van verdere optimalisatie, is GPT-4o opnieuw een stap richting OpenAI’s doel van artificial general intelligence. Naarmate het toegankelijker wordt, kan GPT-4o de manier veranderen waarop we met AI omgaan en integreren in dagelijkse en professionele taken.

Met de lagere kosten en uitgebreide mogelijkheden lijkt GPT-4o een nieuwe standaard te zetten in de AI-industrie en de mogelijkheden voor gebruikers in diverse domeinen te vergroten.

De toekomst van AI is spannend, en dit is een goed moment om te leren hoe deze technologie werkt. Ben je nieuw in het vak, begin dan met onze AI Fundamentals skill track, met praktische kennis over onderwerpen als ChatGPT, large language models, generatieve AI en meer. Je kunt ook meer leren over werken met de OpenAI API in onze hands-on cursus, of bekijk onze volledige catalogus met AI-cursussen.


Richie Cotton's photo
Author
Richie Cotton
LinkedIn

Richie helpt individuen en organisaties om beter met data en AI te werken. Hij is al data scientist sinds voordat het zo heette, en heeft twee boeken geschreven en veel DataCamp-cursussen over dit onderwerp gemaakt. Hij is host van de DataFramed-podcast en leidt het webinarprogramma van DataCamp.

Chat met AI Richie over elke aflevering van DataFramed - alle datahelden zijn welkom!

Veelgestelde vragen

Kan GPT-4o meertalige gesprekken aan?

Ja, GPT-4o kan meertalige gesprekken aan en realtime vertalen tussen talen dankzij de lage latentie van spraak. In de demo waren er echter enkele fouten bij het verwerken van vertalingen. 

Ondersteunt GPT-4o alle talen even goed?

Hoewel GPT-4o verbeterde tokenisatie heeft voor niet-Romaanse alfabetten, kan de prestatie per taal variëren, vooral voor talen die minder vertegenwoordigd zijn in de trainingdata.

Hoe gaat GPT-4o om met achtergrondgeluid in audio-invoer?

GPT-4o kan achtergrondgeluid meenemen bij het verwerken van audio-invoer, wat kan leiden tot contextueel beter passende reacties.

Kan GPT-4o videocontent genereren?

Nee, GPT-4o kan videocontent analyseren en beschrijven, maar geen nieuwe video genereren. OpenAI’s Sora is het model dat videocontent kan genereren. 

Kan GPT-4o specifieke stemmen nabootsen?

Nee, GPT-4o gebruikt een selectie vooraf ingestelde stemmen voor audio-output om risico’s zoals deepfake-oplichting te beperken.

Hoe veilig zijn de gegevens die in GPT-4o worden ingevoerd?

OpenAI hanteert strenge beveiligingsmaatregelen, maar gebruikers moeten altijd voorzichtig zijn en geen gevoelige informatie delen.

Kan GPT-4o worden geïntegreerd in bestaande applicaties?

Ja, GPT-4o kan worden geïntegreerd in verschillende applicaties via de OpenAI API, zodat je op verschillende platforms extra functionaliteit kunt toevoegen.

Bekijk onze cursus Working with the OpenAI API om je reis te starten met het ontwikkelen van AI-toepassingen.

Wanneer moet ik GPT-4o Mini gebruiken in plaats van GPT-4o?

GPT-4o Mini is ideaal voor taken waarbij snelheid en efficiëntie prioriteit hebben boven complexe redenering of multimodale interacties. Het is zeer geschikt voor eenvoudige codetaken, debuggen of snelle reacties in lichtgewicht toepassingen, en daarmee een kosteneffectief alternatief voor projecten die niet de volledige kracht van GPT-4o nodig hebben.

Wat zijn de verschillen tussen GPT-4o en het o1-model?

GPT-4o is ontworpen voor multimodale taken en verwerkt tekst-, audio- en visuele input efficiënt. Het o1-model richt zich echter op geavanceerde redenering en complexe probleemoplossing, en blinkt uit in domeinen zoals coderen en wetenschap. Hoewel GPT-4o uitblinkt in veelzijdigheid en snelheid, geeft het o1-model prioriteit aan diepe, logische verwerking voor ingewikkelde redeneertaken.

Onderwerpen
Kunstmatige intelligentie
OpenAI
ChatGPT

Leer vandaag nog AI-tools bouwen met OpenAI!

Cursus

Werken met de OpenAI API

3 Hr
170.2K
Begin je reis met het ontwikkelen van AI-gestuurde applicaties met de OpenAI API. Leer over de functionaliteit achter populaire AI-toepassingen zoals ChatGPT.
Bekijk detailsRight Arrow
Begin Met De Cursus
Meer zienRight Arrow
Gerelateerd

blog

AI vanaf nul leren in 2026: een complete gids van de experts

Ontdek alles wat je moet weten om in 2026 AI te leren, van tips om te beginnen tot handige resources en inzichten van industrie-experts.
Adel Nehme's photo

Adel Nehme

15 min

Meer ZienMeer Zien