Cursus
Begrijp de Transformer-architectuur, waaronder self-attention, het encoder-decoderontwerp en multi-head attention, en hoe dit modellen zoals de GPT-modellen van OpenAI aandrijft.
TL;DR
- Transformers zijn neurale netwerkarchitecturen die zelf-attention gebruiken om sequentiële data parallel te verwerken, waardoor terugkoppeling (recurrency) overbodig wordt
- Belangrijke componenten: input-embeddings, positionele codering, multi-head self-attention, feedforwardnetwerken en layer-normalization met residual connections
- Encoder-decoderstructuur: encoders creëren gecontextualiseerde representaties; decoders genereren outputsequenties autoregressief
- Moderne varianten: GPT-5, Claude, Llama en Gemini voor taal; Vision Transformers (ViT) voor beelden; multimodale modellen voor gecombineerde input
- Efficiëntie-innovaties: Flash Attention, Rotary Position Embeddings (RoPE) en lineaire attention-varianten pakken de knelpuntkwadratische complexiteit aan
Het deep-learningveld maakt een seismische verschuiving door dankzij de opkomst en snelle evolutie van Transformer-modellen.
Deze baanbrekende architecturen hebben niet alleen de standaard in Natural Language Processing (NLP) herdefinieerd, maar ook tal van facetten van kunstmatige intelligentie op z'n kop gezet.
Gekenmerkt door hun unieke attention-mechanismen en parallelle verwerkingsmogelijkheden, staan Transformer-modellen symbool voor de innovatieve sprongen in het begrijpen en genereren van mensentaal met voorheen onhaalbare nauwkeurigheid en efficiëntie.
Voor het eerst verschenen in 2017 in het artikel “Attention is all you need” van Google, vormt de transformerarchitectuur het hart van baanbrekende modellen zoals ChatGPT en heeft ze een nieuwe golf van enthousiasme in de AI-gemeenschap aangewakkerd. Ze waren cruciaal voor de geavanceerde taalmodellen van OpenAI en speelden een sleutelrol in AlphaStar van DeepMind.
In dit transformerende AI-tijdperk kan het belang van Transformer-modellen voor aankomende data scientists en NLP-beoefenaars niet overschat worden.
Als een van de kerngebieden achter de laatste technologische doorbraken, wil dit artikel de geheimen achter deze modellen ontrafelen.
Wat Zijn Transformers?
Transformers zijn oorspronkelijk ontwikkeld om het probleem van sequentietransductie, ofwel neurale machinale vertaling, op te lossen. Dat betekent dat ze bedoeld zijn voor elke taak die een inputsequentie omzet naar een outputsequentie. Daarom heten ze “Transformers”.
Maar laten we bij het begin beginnen.
Wat Zijn Transformermodellen?
Een transformermodel is een neuraal netwerk dat de context van sequentiële data leert en daaruit nieuwe data genereert.
Simpel gezegd:
Een transformer is een type AI-model dat leert om mensachtige tekst te begrijpen en te genereren door patronen in grote hoeveelheden tekstdata te analyseren.
Transformers zijn de huidige state-of-the-art in NLP en worden gezien als de evolutie van de encoder-decoderarchitectuur. Maar waar die architectuur vooral leunt op Recurrent Neural Networks (RNN's) om sequentiële informatie te extraheren, missen Transformers deze recurrency volledig.
Hoe doen ze dat dan?
Ze zijn specifiek ontworpen om context en betekenis te begrijpen door de relatie tussen verschillende elementen te analyseren, en steunen daarbij bijna volledig op een wiskundige techniek genaamd attention.

Afbeelding door de auteur.
Historische Context
Afkomstig uit een onderzoekspaper van Google uit 2017, zijn transformermodellen een van de meest recente en invloedrijke ontwikkelingen binnen machine learning. Het eerste Transformermodel werd uitgelegd in de invloedrijke paper "Attention is All You Need".
Dit vernieuwende concept was niet alleen een theoretische vooruitgang, maar kreeg ook praktische implementatie, met name in TensorFlows Tensor2Tensor-pakket. Daarnaast droeg de Harvard NLP-groep bij met een geannoteerde gids bij de paper, aangevuld met een PyTorch-implementatie. Meer over hoe je een Transformer from scratch implementeert lees je in onze aparte tutorial.
Hun introductie zorgde voor een grote opleving in het veld, vaak “Transformer AI” genoemd. Dit revolutionaire model legde de basis voor latere doorbraken in grote taalmodellen, waaronder BERT. In 2018 werd dit al gezien als een kantelpunt in NLP.
In 2020 kondigden onderzoekers bij OpenAI GPT-3 aan. Binnen enkele weken bleek de veelzijdigheid van GPT-3 uit toepassingen als gedichten, programma’s, liedjes, websites en meer, wat de verbeelding van gebruikers wereldwijd prikkelde. Toen deze verschuiving zichtbaar werd, publiceerden Stanford-wetenschappers in 2021 een paper waarin ze deze innovatien “foundation models” noemden, waarmee ze hun cruciale rol in het hervormen van AI onderstreepten.
Hoewel propriëtaire modellen de vroege publieke aandacht trokken, zorgde een parallelle open-sourcerevolutie voor snelle democratisering van transformertechnologie. Platforms zoals Hugging Face werden essentiële hubs om modellen te delen, maar het landschap veranderde fundamenteel in 2023 met de release van Meta’s Llama-familie. Dit ontketende een “open-weights”-beweging, die bewees dat ontwikkelaars niet langer afhankelijk hoefden te zijn van gesloten bedrijfs-ecosystemen om state-of-the-art AI te bouwen.
In 2024 en 2025 versnelde de open-sourceontwikkeling sterk. Modellen zoals Meta’s enorme Llama 3.1 en vervolgende Llama 4-series, naast zeer efficiënte architecturen van startups zoals Mistral en krachtige redeneermodellen van DeepSeek, bewezen dat open beschikbare modellen konden evenaren, en soms overtreffen, wat propriëtaire giganten presteerden.
Ondertussen bleven closed-source modellen complexe capaciteiten ontwikkelen. GPT-4 in 2023 introduceerde multimodale mogelijkheden, en GPT-4o in 2024 verenigde tekst-, visuele en audioprocessing in één model.
Eind 2024 markeerde opnieuw een fundamentele wending in de industrie met modellen zoals OpenAI’s o1-serie en DeepSeek’s open R1, die een interne ‘chain-of-thought’ introduceerden om complexe logica en wiskunde te doorgronden voordat ze antwoorden.
Tegen eind 2025 en in 2026 verschoof het landschap volledig van conversatie-assistenten naar autonome systemen met de lancering van de GPT-5-familie, die geavanceerde meerstapsplanning, langetermijngeheugen en robuuste agent-workflows naar enterprise-infrastructuur bracht.
De verschuiving van RNN-modellen zoals LSTM naar Transformers voor NLP-problemen
Ten tijde van de introductie van het Transformermodel waren Recurrent Neural Networks (RNN’s) de voorkeursaanpak voor sequentiële data, die wordt gekenmerkt door een specifieke volgorde in de input.
RNN’s werken vergelijkbaar met een feedforward neuraal netwerk, maar verwerken de input sequentieel, één element per keer.
Transformers zijn geïnspireerd op de encoder-decoderarchitectuur uit RNN’s. Maar in plaats van recurrency te gebruiken, is het Transformermodel volledig gebaseerd op het Attention-mechanisme.
Naast prestatieverbeteringen ten opzichte van RNN’s, hebben Transformers een nieuwe architectuur geboden om vele andere taken op te lossen, zoals samenvatten van tekst, beeldonderschriften genereren en spraakherkenning.
Wat zijn de belangrijkste problemen van RNN’s? Ze zijn vrij ineffectief voor NLP-taken om twee hoofdredenen:
- Ze verwerken de inputdata sequentieel, één voor één. Zo’n recurrent proces benut moderne grafische processors (GPU’s), ontworpen voor parallelle berekening, niet, en maakt het trainen van zulke modellen dus vrij traag.
- Ze worden ineffectief wanneer elementen ver van elkaar staan. Omdat informatie bij elke stap wordt doorgegeven, geldt: hoe langer de keten, hoe groter de kans dat informatie onderweg verloren gaat.
De verschuiving van RNN’s zoals LSTM naar Transformers in NLP wordt gedreven door deze twee problemen en het vermogen van Transformers om ze allebei aan te pakken via verbeteringen in het Attention-mechanisme:
- Aandacht besteden aan specifieke woorden, ongeacht hoe ver ze uit elkaar staan.
- De verwerkingssnelheid verhogen.
Zo werden Transformers de natuurlijke verbetering van RNN’s.
Laten we nu bekijken hoe transformers werken.
De Transformer-architectuur
Overzicht
Oorspronkelijk bedacht voor sequentietransductie of neurale machinale vertaling, blinken transformers uit in het omzetten van inputsequenties naar outputsequenties. Het is het eerste transductiemodel dat volledig op self-attention vertrouwt om representaties van input en output te berekenen, zonder sequence-aligned RNN’s of convolutie. De kern van de Transformerarchitectuur is dat ze het encoder-decoder-model behoudt.
Als we een Transformer voor taalvertaling als een simpele black box zien, neemt die een zin in één taal, bijvoorbeeld Engels, als input en geeft de vertaling in het Engels als output.

Afbeelding door de auteur.
Als we iets dieper gaan, zien we dat deze black box uit twee hoofdonderdelen bestaat:
- De encoder krijgt onze input binnen en geeft een matrixrepresentatie van die input. Bijvoorbeeld de Engelse zin “How are you?”
- De decoder neemt die gecodeerde representatie en genereert iteratief een output. In ons voorbeeld de vertaalde zin “¿Cómo estás?”

Afbeelding door de auteur. Globale structuur van Encoder-Decoder.
Zowel de encoder als de decoder zijn in feite een stapel met meerdere lagen (hetzelfde aantal voor elk). Alle encoders hebben dezelfde structuur; de input gaat erin en wordt doorgegeven aan de volgende. Alle decoders hebben ook dezelfde structuur en krijgen de input van de laatste encoder en de vorige decoder.
De oorspronkelijke architectuur bestond uit 6 encoders en 6 decoders, maar we kunnen zoveel lagen repliceren als we willen. Laten we dus N lagen van elk aannemen.

Afbeelding door de auteur. Globale structuur van Encoder-Decoder. Meerdere lagen.
Nu we een algemeen idee hebben van de totale Transformerarchitectuur, richten we ons op zowel Encoders als Decoders om hun workflow beter te begrijpen:
De Workflow van de Encoder
De encoder is een fundamenteel onderdeel van de Transformerarchitectuur. De primaire functie van de encoder is het omzetten van inputtokens naar gecontextualiseerde representaties. In tegenstelling tot eerdere modellen die tokens onafhankelijk verwerkten, legt de Transformer-encoder de context van elk token vast ten opzichte van de hele sequentie.
De structuur is als volgt opgebouwd:

Afbeelding door de auteur. Globale structuur van Encoders.
Laten we de workflow opdelen in de meest basale stappen:
STAP 1 - Input-embeddings
Embedding gebeurt alleen in de onderste encoder. De encoder start door inputtokens — woorden of subwoorden — te converteren naar vectoren via embedding-lagen. Deze embeddings vangen de semantische betekenis van de tokens en zetten ze om in numerieke vectoren.
Alle encoders ontvangen een lijst met vectoren, elk van grootte 512 (vaste grootte). In de onderste encoder zijn dat de woordembeddings, maar in andere encoders is dat de output van de encoder die er direct onder zit.

Afbeelding door de auteur. Workflow van de encoder. Input-embedding.
STAP 2 - Positionele Codering
Omdat Transformers geen recurrency hebben zoals RNN’s, gebruiken ze positionele coderingen die aan de input-embeddings worden toegevoegd om informatie te geven over de positie van elk token in de sequentie. Zo begrijpen ze de positie van elk woord binnen de zin.
Daarvoor stelden de onderzoekers voor om een combinatie van verschillende sinus- en cosinusfuncties te gebruiken om positionele vectoren te creëren, zodat deze positionele encoder voor zinnen van elke lengte gebruikt kan worden.
In deze aanpak wordt elke dimensie weergegeven door unieke frequenties en verschuivingen van de golf, met waarden van -1 tot 1, die effectief elke positie representeren.

Afbeelding door de auteur. Workflow van de encoder. Positionele codering.
STAP 3 - Stapel Encoderlagen
De Transformer-encoder bestaat uit een stapel identieke lagen (6 in het originele model).
De encoderlaag transformeert alle inputsequenties naar een continue, abstracte representatie die de geleerde informatie uit de hele sequentie bevat. Deze laag bestaat uit twee submodules:
- Een multi-head attentionmechanisme.
- Een volledig verbonden netwerk.
Daarnaast bevat hij residual connections rond elke sublaag, gevolgd door layer-normalization.

Afbeelding door de auteur. Workflow van de encoder. Stapel Encoderlagen
STAP 3.1 Multi-head Self-Attention-mechanisme
In de encoder gebruikt multi-head attention een speciaal attentionmechanisme, self-attention. Dit stelt het model in staat om elk woord in de input te relateren aan andere woorden. In een voorbeeld kan het model bijvoorbeeld “are” leren koppelen aan “you”.
Dit mechanisme laat de encoder zich richten op verschillende delen van de inputsequentie terwijl elk token wordt verwerkt. Het berekent attention-scores op basis van:
- Een query is een vector die een specifiek woord of token uit de inputsequentie representeert in het attentionmechanisme.
- Een key is ook een vector in het attentionmechanisme, overeenkomend met elk woord of token in de inputsequentie.
- Elke value is gekoppeld aan een key en wordt gebruikt om de output van de attentionlaag te construeren. Als een query en een key goed overeenkomen — oftewel een hoge attention-score hebben — wordt de overeenkomstige value benadrukt in de output.
Deze eerste self-attentionmodule stelt het model in staat contextuele informatie uit de hele sequentie te vangen. In plaats van één enkele attentionfunctie uit te voeren, worden queries, keys en values h keer lineair geprojecteerd. Op elk van deze geprojecteerde versies wordt het attentionmechanisme parallel uitgevoerd, wat h-dimensionale outputwaarden oplevert.
De gedetailleerde architectuur verloopt als volgt:

Matrixvermenigvuldiging (MatMul) - Dotproduct van Query en Key
Zodra de query-, key- en valuevectoren door een lineaire laag zijn geleid, wordt een dotproduct-matrixvermenigvuldiging uitgevoerd tussen de queries en keys, wat resulteert in een scorematrix.
De scorematrix bepaalt in welke mate elk woord aandacht moet besteden aan andere woorden. Elk woord krijgt dus een score ten opzichte van andere woorden binnen dezelfde tijdstap. Een hogere score betekent meer focus.
Dit proces mapt de queries effectief op hun corresponderende keys.

Afbeelding door de auteur. Workflow van de encoder. Attention-mechanisme - Matrixvermenigvuldiging.
De grootte van attention-scores verkleinen
De scores worden vervolgens geschaald door ze te delen door de vierkantswortel van de dimensie van de query- en keyvectoren. Deze stap zorgt voor stabielere gradiënten, omdat de vermenigvuldiging van waarden anders te grote effecten kan hebben.

Afbeelding door de auteur. Workflow van de encoder. De attention-scores verkleinen.
Softmax toepassen op de aangepaste scores
Vervolgens wordt een softmaxfunctie toegepast op de aangepaste scores om de attentiongewichten te verkrijgen. Dit levert waarschijnlijkheden op tussen 0 en 1. De softmaxfunctie benadrukt hogere scores en verzwakt lagere scores, waardoor het model effectiever kan bepalen welke woorden meer aandacht verdienen.

Afbeelding door de auteur. Workflow van de encoder. Softmax aangepaste scores.
Softmax-resultaten combineren met de valuevector
De volgende stap van het attentionmechanisme is dat de gewichten uit de softmaxfunctie worden vermenigvuldigd met de valuevector, wat resulteert in een outputvector.
In dit proces blijven alleen de woorden met hoge softmaxscores behouden. Deze outputvector gaat ten slotte door een lineaire laag voor verdere verwerking.

Afbeelding door de auteur. Workflow van de encoder. Softmax-resultaten combineren met de valuevector.
En daarmee krijgen we eindelijk de output van het Attention-mechanisme!
Waarom heet het dan Multi-Head Attention?
Onthoud dat we vóór dit hele proces onze queries, keys en values h keer opsplitsen. Dit proces, bekend als self-attention, gebeurt afzonderlijk in elk van deze kleinere stadia of ‘heads’. Elke head werkt onafhankelijk en produceert een outputvector.
Dit ensemble gaat door een laatste lineaire laag, als een filter dat hun gezamenlijke prestaties verfijnt. De kracht zit hier in de diversiteit van wat elke head leert, wat de encoder verrijkt met een robuust en veelzijdig begrip.
Voor een dieper begrip van het attentionmechanisme, zie onze tutorial over multi-head attention in Transformers.
STAP 3.2 Normalisatie en Residual Connections
Elke sublaag in een encoderlaag wordt gevolgd door een normalisatiestap. Ook wordt de output van elke sublaag bij de input opgeteld (residual connection) om het probleem van verdwijnende gradiënten te beperken, wat diepere modellen mogelijk maakt. Dit proces wordt ook herhaald na het feedforwardnetwerk.

Afbeelding door de auteur. Workflow van de encoder. Normalisatie en residual connection na Multi-Head Attention.
STAP 3.3 Feedforward Neuraal Netwerk
De reis van de genormaliseerde residual output gaat verder door een pointwise feedforwardnetwerk, een cruciale fase voor extra verfijning.
Zie dit netwerk als een duo van lineaire lagen, met daartussen een ReLU-activatie als brug. Na verwerking volgt een vertrouwd pad: de output wordt teruggekoppeld en samengevoegd met de input van het pointwise feedforwardnetwerk.
Daarna volgt opnieuw normalisatie, zodat alles goed is afgestemd voor de volgende stappen.

Afbeelding door de auteur. Workflow van de encoder. Feedforward Neurale Netwerk-subblaag.
STAP 4 - Output van de Encoder
De output van de laatste encoderlaag is een set vectoren die elk de inputsequentie representeren met een rijk contextueel begrip. Deze output wordt vervolgens gebruikt als input voor de decoder in een Transformermodel.
Deze zorgvuldige codering effent het pad voor de decoder en helpt die om bij het decoderen op de juiste woorden in de input te letten.
Zie het als een toren die je kunt opbouwen met N encoderlagen. Elke laag in die stapel krijgt de kans om andere facetten van attention te verkennen en te leren. Dat diversifieert het begrip en kan de voorspellende capaciteiten van het transformernetwerk aanzienlijk versterken.
De Workflow van de Decoder
De rol van de decoder draait om het samenstellen van tekstsequenties. Net als de encoder is de decoder uitgerust met vergelijkbare sublagen. Hij heeft twee multi-head attentionlagen, een pointwise feedforwardlaag en bevat zowel residual connections als layer-normalization na elke sublaag.

Afbeelding door de auteur. Globale structuur van Encoders.
Deze componenten werken vergelijkbaar met de lagen van de encoder, maar met een twist: elke multi-head attentionlaag in de decoder heeft een eigen missie.
Het laatste deel van het decoderproces omvat een lineaire laag, die als classifier fungeert, gevolgd door een softmaxfunctie om de waarschijnlijkheden van verschillende woorden te berekenen.
De Transformer-decoder heeft een structuur die specifiek is ontworpen om deze output te genereren door de gecodeerde informatie stap voor stap te decoderen.
Belangrijk is dat de decoder autoregressief werkt en het proces start met een starttoken. Hij gebruikt slim een lijst van eerder gegenereerde outputs als input, samen met de outputs van de encoder die rijk zijn aan attention-informatie uit de oorspronkelijke input.
Deze sequentiële dans van decoderen gaat door tot de decoder een token genereert dat het einde van de output aangeeft.
STAP 1 - Output-embeddings
Aan de startlijn van de decoder lijkt het proces op dat van de encoder. Hier gaat de input eerst door een embedding-laag
STAP 2 - Positionele Codering
Na de embedding gaat de input, net als bij de encoder, door de positionele coderingslaag. Deze volgorde is ontworpen om positionele embeddings te produceren.
Deze positionele embeddings worden vervolgens doorgegeven aan de eerste multi-head attentionlaag van de decoder, waar de attention-scores specifiek voor de input van de decoder zorgvuldig worden berekend.
STAP 3 - Stapel Decoderlagen
De decoder bestaat uit een stapel identieke lagen (6 in het originele model). Elke laag heeft drie hoofdsubcomponenten:
STAP 3.1 Gemaskeerd Self-Attention-mechanisme
Dit lijkt op het self-attentionmechanisme in de encoder, maar met een cruciaal verschil: het voorkomt dat posities aandacht besteden aan latere posities, wat betekent dat elk woord in de sequentie niet wordt beïnvloed door toekomstige tokens.
Als bijvoorbeeld de attention-scores voor het woord "are" worden berekend, is het belangrijk dat "are" geen glimp opvangt van "you", een later woord in de sequentie.

Afbeelding door de auteur. Workflow van de decoder. Eerste Multi-Head Attention-masker.
Deze masking zorgt ervoor dat de voorspellingen voor een bepaalde positie alleen mogen afhangen van bekende outputs op eerdere posities.
STAP 3.2 - Encoder-Decoder Multi-Head Attention of Cross-Attention
In de tweede multi-head attentionlaag van de decoder zien we een unieke wisselwerking tussen de componenten van de encoder en de decoder. Hier nemen de outputs van de encoder de rollen van zowel queries als keys op zich, terwijl de outputs van de eerste multi-head attentionlaag van de decoder als values dienen.
Deze opzet stemt de input van de encoder effectief af op die van de decoder, waardoor de decoder de meest relevante delen van de encoderinput kan identificeren en benadrukken.
Daarna wordt de output van deze tweede multi-head attentionlaag verfijnd via een pointwise feedforwardlaag voor verdere verwerking.

Afbeelding door de auteur. Workflow van de decoder. Encoder-Decoder Attention.
In deze sublaag komen de queries uit de vorige decoderlaag, en de keys en values uit de output van de encoder. Zo kan elke positie in de decoder aandacht hebben voor alle posities in de inputsequentie en informatie uit de encoder integreren met de informatie in de decoder.
STAP 3.3 Feedforward Neuraal Netwerk
Net als bij de encoder bevat elke decoderlaag een volledig verbonden feedforwardnetwerk, dat per positie apart en identiek wordt toegepast.
STAP 4 Lineaire Classifier en Softmax voor het Genereren van Outputwaarschijnlijkheden
De reis van data door het transformermodel eindigt met een laatste lineaire laag, die fungeert als classifier.
De grootte van deze classifier komt overeen met het totale aantal klassen (het aantal woorden in de woordenschat). In een scenario met 1000 verschillende klassen die 1000 verschillende woorden vertegenwoordigen, is de output van de classifier bijvoorbeeld een array met 1000 elementen.
Deze output gaat vervolgens naar een softmaxlaag, die die omzet in waarschijnlijkheden tussen 0 en 1. De hoogste van deze waarschijnlijkheden is cruciaal; de corresponderende index wijst direct naar het woord dat het model voorspelt als het volgende in de sequentie.

Afbeelding door de auteur. Workflow van de decoder. Uiteindelijk resultaat van de Transformer.
Normalisatie en Residual Connections
Elke sublaag (gemaskeerde self-attention, encoder-decoder attention, feedforwardnetwerk) wordt gevolgd door een normalisatiestap en heeft een residual connection eromheen.
Output van de Decoder
De output van de laatste laag wordt omgezet naar een voorspelde sequentie, meestal via een lineaire laag gevolgd door softmax om waarschijnlijkheden over de vocabulaire te genereren.
De decoder voegt in zijn operationele flow de nieuw gegenereerde output toe aan zijn groeiende lijst met inputs en gaat dan verder met decoderen. Deze cyclus herhaalt zich totdat het model een specifiek token voorspelt dat voltooiing aangeeft.
Het token met de hoogste voorspelde waarschijnlijkheid wordt toegewezen als de afsluitende klasse, vaak weergegeven door het end-token.
Onthoud opnieuw dat de decoder niet beperkt is tot één laag. Hij kan uit N lagen bestaan, die elk voortbouwen op de input van de encoder en de voorgaande lagen. Deze gelaagde architectuur laat het model zijn focus diversifiëren en verschillende attention-patronen uit zijn heads halen.
Zo’n meerlagige aanpak kan het voorspellend vermogen van het model aanzienlijk verbeteren, doordat het een verfijnder begrip van verschillende attention-combinaties ontwikkelt.
De uiteindelijke architectuur ziet er zo uit (uit de originele paper):

Afbeelding door de auteur. Originele structuur van Transformers.
Om deze architectuur beter te begrijpen, raad ik aan om een Transformer from scratch te bouwen met deze tutorial om een transformer met PyTorch te bouwen.
Transformermodellen in de Praktijk
BERT
Met de open-source release van BERT in 2018 zette Google NLP op zijn kop dankzij bidirectionele training, waardoor het model contextrijkere voorspellingen kan doen over wat het volgende woord moet zijn.
Door context van beide kanten van een woord te begrijpen, overtrof BERT eerdere modellen bij taken als vraag-antwoord en het begrijpen van dubbelzinnige taal. De kern gebruikt Transformers, waarbij elk output- en inputelement dynamisch wordt verbonden.
BERT, voorgetraind op Wikipedia, blonk uit in diverse NLP-taken, wat Google ertoe aanzette het te integreren in de zoekmachine voor natuurlijkere queries. Deze innovatie ontketende een wedloop om geavanceerde taalmodellen te ontwikkelen en tilde het veld van complexe taalbegrip aanzienlijk naar een hoger niveau.
Wil je meer weten over BERT, bekijk dan ons aparte artikel dat het BERT-model introduceert.
LaMDA
LaMDA (Language Model for Dialogue Applications) is een Transformer-gebaseerd model van Google, specifiek ontworpen voor conversatietaken en gelanceerd tijdens de Google I/O-keynote van 2021. Het is ontworpen om natuurlijkere en contextueel relevantere reacties te genereren en zo gebruikersinteracties in diverse toepassingen te verbeteren.
Het ontwerp van LaMDA stelt het in staat om een breed scala aan onderwerpen en gebruikersintenties te begrijpen en te beantwoorden, waardoor het ideaal is voor chatbots, virtuele assistenten en andere interactieve AI-systemen waar een dynamisch gesprek centraal staat.
Deze focus op conversatiebegrip en -respons maakt LaMDA tot een belangrijke stap voorwaarts in natuurlijke taalverwerking en AI-gedreven communicatie.
Als je LaMDA-modellen verder wilt begrijpen, krijg je meer inzicht met ons artikel over LaMDA.
GPT en ChatGPT
GPT en ChatGPT, ontwikkeld door OpenAI, zijn geavanceerde generatieve modellen die bekendstaan om hun vermogen om samenhangende en contextueel relevante tekst te produceren. GPT-1 was het eerste model, gelanceerd in juni 2018, en GPT-3, een van de meest impactvolle modellen, kwam twee jaar later in 2020.
Deze modellen beheersen een breed scala aan taken, waaronder contentcreatie, conversatie, vertaling en meer. De architectuur van GPT laat het tekst genereren die sterk op menselijk schrijven lijkt, wat het nuttig maakt voor creatieve schrijfhulp, klantenondersteuning en zelfs codeassistentie. ChatGPT, een variant geoptimaliseerd voor conversaties, blinkt uit in mensachtige dialogen, wat het zeer geschikt maakt voor chatbots en virtuele assistenten.
Claude
Claude, ontwikkeld door Anthropic, is een familie van Transformer-gebaseerde AI-assistenten met focus op veiligheid en behulpzaamheid. Claude gebruikt Constitutional AI (CAI), een trainingsaanpak waarbij het model wordt geleid door principes om behulpzame, onschadelijke en eerlijke antwoorden te geven.
Claude 3 (uitgebracht in 2024) introduceerde drie modelniveaus — Haiku, Sonnet en Opus — met verschillende afwegingen tussen snelheid en capaciteit. De modellen blinken uit in genuanceerd redeneren, het volgen van complexe instructies en het behouden van context over lange gesprekken (tot 200K tokens).
In 2025 en 2026 lanceerde Anthropic de Claude 4-modellen, waarvan de meest recente, Opus 4.6 en Sonnet 4.6, vele LLM-benchmarks aanvoerden.
Andere Variaties
Het landschap van foundation-modellen, met name transformermodellen, breidt zich snel uit. Een studie identificeerde meer dan 50 belangrijke transformermodellen, terwijl de Stanford-groep er 30 evalueerde, met erkenning voor de snelle groei van het veld. NLP Cloud, een innovatieve startup in NVIDIA’s Inception-programma, gebruikt commercieel zo’n 25 grote taalmodellen voor sectoren als luchtvaart en apotheken.
Er is een groeiende trend om deze modellen open-source te maken, met platforms zoals de modelhub van Hugging Face als voorloper. Bovendien zijn talloze Transformer-gebaseerde modellen ontwikkeld, elk gespecialiseerd voor verschillende NLP-taken, wat de veelzijdigheid en efficiëntie van het model in uiteenlopende toepassingen laat zien.
Je kunt meer leren over alle bestaande Foundation Models in een apart artikel, dat uitlegt wat ze zijn en welke het meest gebruikt worden.
Moderne Transformervarianten
Sinds de oorspronkelijke architectuur uit 2017 hebben Transformers zich sterk ontwikkeld om beperkingen aan te pakken en uit te breiden naar nieuwe domeinen.
Vision Transformers (ViT)
Vision Transformers passen het self-attentionmechanisme toe op beelden door ze op te delen in patches en elke patch als een token te behandelen. Deze aanpak is zeer effectief gebleken voor beeldclassificatie, objectdetectie en beeldgeneratie, en overtreft vaak traditionele CNN’s op grote datasets.
Multimodale Transformers
Moderne modellen zoals GPT-5, Gemini 3 en Llama 4 verwerken meerdere inputtypen (tekst, beelden, audio, video) binnen één architectuur. Deze multimodale Transformers gebruiken uniforme embedding-ruimtes en cross-attentionmechanismen om gelijktijdig over verschillende modaliteiten te redeneren.
Efficiënte Transformers
De kwadratische complexiteit van self-attention beperkt de contextlengte. Diverse innovaties pakken dit aan:
- Flash Attention: Optimaliseert geheugen-toegangspatronen om GPU-geheugengebruik te verlagen en training 2–4x te versnellen
- Rotary Position Embeddings (RoPE): Encodeert positie-informatie via rotatiematrices, wat betere extrapolatie naar langere sequenties mogelijk maakt
- Lineaire attention-varianten: Linformer, Performer en Longformer reduceren complexiteit tot O(n) voor zeer lange documenten
- Mixture of Experts (MoE): Activeert slechts een subset van parameters per token, zodat grotere modellen met vergelijkbare rekekosten mogelijk zijn
Benchmarks en Prestaties
Het benchmarken en evalueren van de prestaties van Transformermodellen in NLP vraagt om een systematische aanpak om effectiviteit en efficiëntie te beoordelen.
Afhankelijk van de aard van de taak zijn er verschillende manieren en middelen om dit te doen:
Machinale Vertaling
Bij machinale vertaling kun je gebruikmaken van standaarddatasets zoals WMT (Workshop on Machine Translation), waar MT-systemen een waaier aan taalkoppels tegenkomen, elk met eigen uitdagingen.
Metrieken zoals BLEU, METEOR, TER en chrF dienen als kompas en sturen ons naar nauwkeurigheid en vloeiendheid.
Daarnaast zorgt testen over diverse domeinen zoals nieuws, literatuur en technische teksten voor de aanpasbaarheid en veelzijdigheid van een MT-systeem — een echte polyglot in de digitale wereld.
QA-benchmarks
Om QA-modellen te evalueren, gebruiken we speciale verzamelingen met vragen en antwoorden, zoals SQuAD (Stanford Question Answering Dataset), Natural Questions of TriviaQA.
Elk is als een ander spel met eigen regels. SQuAD draait bijvoorbeeld om antwoorden vinden in een gegeven tekst, terwijl andere meer lijken op een quiz met vragen van overal.
Om te zien hoe goed deze programma’s het doen, gebruiken we scores zoals Precision, Recall, F1 en soms zelfs exact match-scores.
NLI-benchmarks
Bij Natural Language Inference (NLI) gebruiken we speciale datasets zoals SNLI (Stanford Natural Language Inference), MultiNLI en ANLI.
Dit zijn als grote bibliotheken met taalvariaties en lastige gevallen, waarmee we zien hoe goed computers verschillende soorten zinnen begrijpen. We kijken vooral naar de nauwkeurigheid bij het bepalen of uitspraken overeenkomen, tegenspreken of niet gerelateerd zijn.
Het is ook belangrijk te bekijken hoe de computer lastige taalverschijnselen aanpakt, zoals verwijzingen naar eerder genoemde zaken, of het begrijpen van ‘niet’, ‘alle’ en ‘sommige’.
Vergelijking met Andere Architecturen
In de wereld van neurale netwerken worden doorgaans twee prominente structuren vergeleken met Transformers. Elk biedt eigen voordelen en uitdagingen, afgestemd op specifieke soorten dataverwerking. RNN’s, die al meerdere keren in dit artikel voorbij kwamen, en Convolutionele Lagen.
Recurrente Lagen
Recurrente lagen, een hoeksteen van Recurrent Neural Networks (RNN’s), blinken uit in het verwerken van sequentiële data. De kracht van deze architectuur ligt in sequentiële operaties, cruciaal voor taken zoals taalverwerking of tijdreeksanalyse. In een recurrente laag wordt de output van een vorige stap teruggevoerd als input voor de volgende stap. Dit lusmechanisme laat het netwerk eerdere informatie onthouden, wat essentieel is voor contextbegrip in een sequentie.
Zoals we al bespraken, heeft deze sequentiële verwerking twee belangrijke implicaties:
- Ze kunnen leiden tot langere trainingstijden omdat elke stap afhangt van de vorige, wat parallelle verwerking lastig maakt.
- Ze worstelen vaak met langetermijnafhankelijkheden door het probleem van verdwijnende gradiënten, waardoor het netwerk minder effectief leert van punten die ver uit elkaar liggen in de sequentie.
Transformermodellen verschillen aanzienlijk van architecturen met recurrente lagen omdat ze geen recurrency hebben. Zoals eerder gezien, pakt de Attention-laag van de Transformer beide problemen aan, waardoor ze de natuurlijke evolutie zijn van RNN’s voor NLP-toepassingen.
Convolutionele Lagen
Convolutionele lagen, de bouwstenen van Convolutional Neural Networks (CNN’s), staan bekend om hun efficiëntie in het verwerken van ruimtelijke data zoals beelden.
Deze lagen gebruiken kernels (filters) die over inputdata scannen om features te extraheren. De breedte van deze kernels is aanpasbaar, zodat het netwerk zich kan richten op kleine of grote kenmerken, afhankelijk van de taak.
Hoewel convolutionele lagen uitstekend ruimtelijke hiërarchieën en patronen vangen, hebben ze moeite met langetermijnafhankelijkheden. Ze houden niet inherent rekening met sequentiële informatie en zijn daarom minder geschikt voor taken die de volgorde of context van een sequentie vereisen.
Daarom zijn CNN’s en Transformers geschikt voor verschillende soorten data en taken. CNN’s domineren computer vision dankzij hun efficiëntie in ruimtelijke informatie, terwijl Transformers de voorkeurskeuze zijn voor complexe sequentietaken, vooral in NLP, door hun vermogen om lange-afstandsafhankelijkheden te begrijpen.
Nadelen en Beperkingen van Transformers
Ondanks hun succes hebben Transformers noemenswaardige beperkingen:
- Kwadratische complexiteit: Self-attention schaalt als O(n²) met sequentielengte, wat zeer lange contexten rekenintensief maakt
- Geheugenvereisten: Grote modellen vragen veel GPU-geheugen, wat implementatieopties beperkt
- Databehoefte voor training: Transformers hebben doorgaans enorme datasets nodig om sterke prestaties te halen
- Gebrek aan expliciet redeneren: Hoewel sterke patroonherkenners, voeren Transformers geen symbolisch redeneren uit en kunnen ze feiten hallucineren
- Beperkingen van positionele codering: Standaard positionele coderingen generaliseren slecht naar sequentielengtes die niet tijdens training zijn gezien
Onderzoek blijft deze beperkingen aanpakken met architectuurinnovaties zoals Flash Attention, mixture-of-experts en retrieval-augmented generation (RAG).
Conclusie
Kortom, Transformers zijn uitgegroeid tot een monumentale doorbraak in kunstmatige intelligentie en natuurlijke taalverwerking (NLP).
Door sequentiële data effectief te beheren via hun unieke self-attentionmechanisme, hebben deze modellen traditionele RNN’s overtroffen. Hun vermogen om lange sequenties efficiënter af te handelen en verwerking te paralleliseren, versnelt training aanzienlijk.
Pionierende modellen zoals Google’s BERT en de GPT-serie van OpenAI illustreren de transformerende impact van Transformers op zoekmachines en het genereren van mensachtige tekst.
Daardoor zijn ze onmisbaar geworden in moderne machine learning, ze verleggen de grenzen van AI en openen nieuwe wegen voor technologische vooruitgang.
Wil je je verdiepen in Transformers en hun praktische gebruik, dan is ons artikel over Transformers en Hugging Face een perfect begin! Je kunt ook leren hoe je een Transformer bouwt met PyTorch met onze diepgaande gids.
Josep is een freelance Data Scientist die zich richt op Europese projecten, met expertise in dataopslag, -verwerking, geavanceerde analyses en impactvolle data storytelling.
Als docent geeft hij Big Data in de masteropleiding aan de Universiteit van Navarra en deelt hij inzichten via artikelen op platforms als Medium, KDNuggets en DataCamp. Josep schrijft ook over Data en Tech in zijn nieuwsbrief Databites (databites.tech).
Hij heeft een bachelor in Engineering Physics van de Polytechnische Universiteit van Catalonië en een master in Intelligent Interactive Systems van de Pompeu Fabra-universiteit.

