Leerpad
Een AI-engineer bouwt en implementeert AI-systemen in productieomgevingen. Ze zetten modellen zoals LLM’s om in betrouwbare toepassingen die bedrijfswaarde leveren.
De rol verschilt wezenlijk van die van een data scientist, die zich primair richt op data-analyse en exploratieve modellering, en uiteraard van een machinelearning-onderzoeker, die zich uiteindelijk richt op theoretische vooruitgang en nieuwe algoritmes.
Sollicitaties voor AI-engineers geven daarom prioriteit aan praktisch systeemdenken boven pure theorie of statistische modellering. In dit artikel behandel ik vragen over LLM’s, kernconcepten van AI, systeementwerp, deployment en MLOps, codering en implementatie, en realistische scenario’s.
Sollicitatievragen voor beginnende AI-engineers
Deze basisvragen peilen of je de fundamentele woordenschat en onderscheidingen begrijpt die bepalen hoe AI-systemen worden gebouwd en besproken.
Wat is het verschil tussen een AI-model en een machinelearningmodel?
Een AI-model is elk systeem dat taken uitvoert die voornamelijk menselijke intelligentie vereisen, inclusief sommige regelgebaseerde of symbolische benaderingen. Een machinelearningmodel daarentegen is een subset die patronen direct leert uit de aangeleverde data.
In productietermen werken AI-engineers meestal met ML-modellen, vooral LLM’s, maar ze moeten ook niet-ML-componenten integreren, zoals rule engines of knowledge graphs, wanneer dat nodig is voor een zeer betrouwbaar resultaat.
Wat is een LLM?
Een large language model is, zoals de naam al aangeeft, een groot, op transformers gebaseerd neuraal netwerk dat is getraind op enorme tekstcorpora om coherent tekst te genereren. In productiesystemen dienen LLM’s als het redeneermotor achter chatbots, samenvatters en agents.
Wat is tokenization?
Tokenization zet ruwe tekst om in numerieke tokens die het model kan verwerken. Het beïnvloedt direct de kosten, de contextlengte en hoe het model tekst fundamenteel waarneemt. Met andere woorden: tekstsegmenten krijgen numerieke identifiers, tokens genoemd, zodat de tekst klaar is om aan het model te worden gevoerd. Productiesystemen gebruiken subword-tokenizers zoals BPE en monitoren het aantal tokens om API-kosten en latency te beheersen.
Wat is een prompt?
Een prompt is de invoertekst die aan het LLM wordt gegeven om een output te produceren. Het is doorgaans een geengineerd artefact dat instructies bevat, soms voorbeelden, en volledige context om de aanpasbaarheid van het LLM te maximaliseren.
Wat is het verschil tussen inferentie en training?
Training werkt de modelgewichten bij, terwijl inferentie outputs genereert uit een getraind model. AI-engineers richten zich vooral op het optimaliseren en opschalen van de inferentie.
Wat is een API-gebaseerd AI-systeem?
Het verbruikt voorgetrainde modellen via een cloud-endpoint zoals OpenAI of Anthropic om de infrastructuurlast te verminderen, terwijl nog steeds prompts en kosten beheerd moeten worden.
Wat is het verschil tussen fine-tuning en prompten?
Prompten verandert het gedrag tijdens de inferentie. Fine-tuning werkt echter de modelgewichten bij; dat is trager maar leidt doorgaans tot meer aangepaste large language models. Hierdoor is prompten voor de meeste productie-use-cases sneller en goedkoper.
Wat is retrieval-augmented generation (RAG)?
RAG haalt relevante documenten op uit een door jou aangewezen kennisbank en voegt die toe aan de prompt. Het LLM gebruikt die extra geverifieerde data om betrouwbaardere informatie te voorspellen en hallucinaties te verminderen.
Kernconcepten voor AI-engineers: sollicitatievragen
Naast definities willen interviewers zien dat je de mechanismen achter embeddings, evaluatie en de hardnekkige uitdaging van hallucinaties begrijpt.
Wat zijn embeddings en hoe worden ze gebruikt?
Embeddings zijn dichte vectorrepresentaties die semantische betekenissen begrijpen. Ze helpen bij semantisch zoeken en retrieval in vector-databases. Je kunt een embedding zien als een tabel die de numerieke input neemt en die een hoog-dimensionale vector toewijst in een andere, representatievere ruimte.
Hoe evalueer je een large language model-systeem?
Combineer geautomatiseerde metrics, zoals betrouwbaarheid en relevantie, met menselijke review en business-KPI’s. In productie hebben we in feite een continue evaluatiepijplijn nodig.
Waardoor ontstaan hallucinaties in LLM’s?
Hiaten in de trainingsdata en de overmatige zekerheid van next-tokenvoorspelling kunnen het model dwingen tokens te voorspellen zonder voldoende gronding; dat staat bekend als hallucinatie.
Hoe verminder je hallucinaties?
RAG is een van de meest betrouwbare en efficiënte methoden, omdat het gronding biedt tegen betrouwbare bronnen die jij aanlevert. In combinatie met gestructureerde outputformaten, self-consistency-checks en factchecking reduceert het hallucinaties verder.
LLM- en Generatieve AI-sollicitatievragen
Dit onderdeel gaat in op de architectuur en het gedrag van de modellen zelf, van attention-mechanismen tot promptontwerp.
Hoe werken transformers op hoofdlijnen?
Ze verwerken parallel met self-attention in plaats van herhaling. Moderne large language models zijn alleen-decoder en voorspellen tokens autoregressief.
Wat is attention?
Attention berekent gewogen relevantie tussen tokens om langeafstandsafhankelijkheden mogelijk te maken, ongeacht hun positie.
Wat is een contextvenster?
Het maximale aantal tokens dat het model in één inferentieaanroep kan verwerken. Het beperkt promptontwerp en het beheer van gespreksgeschiedenis.
Wat is de temperatuur bij generatie?
Die bepaalt de willekeur bij sampling: lagere waarden leveren meer deterministische output, hogere waarden vergroten de creativiteit. In productiesystemen wordt dit per use-case afgestemd om betrouwbaarheid en variatie te balanceren.
Wat is prompt engineering?
Het systematisch ontwerpen, testen, verifiëren, afstemmen en itereren van prompts om het best mogelijke, betrouwbare gedrag te bereiken. Prompts worden in productie samen met code geversioneerd en zijn sterk modelafhankelijk in plaats van een generieke template.
Wat zijn systeem-prompts versus gebruikersprompts?
Systeem-prompts definiëren de rol, beperkingen en het outputformaat van het gesprek, terwijl gebruikersprompts de specifieke vraag zelf bevatten.
Wat is tool use of function calling?
Het stelt het large language model in staat externe tools die jij initieert aan te roepen, zoals API’s en databases, en de aanroepen correct te formatteren. Dit is het kernidee achter meerstaps-agents.
Hoe verbetert chain-of-thought prompting de prestaties?
Het instrueert het model om eerst tussenliggende redeneerstappen te genereren voordat het eindantwoord komt, zodat de nauwkeurigheid bij complexe taken toeneemt.
Sollicitatievragen over systeementwerp voor AI-engineers
Vragen over systeementwerp testen of je LLM-kennis kunt vertalen naar end-to-end-architecturen die echte gebruikers en echte beperkingen aankunnen.
Ontwerp een chatbot met een LLM.
Frontend, gespreksgeheugen, promptorkestratie, LLM API-call, outputvalidatie, logging, rate limiting en kostentracking.
Ontwerp een documentsysteem voor zoeken met embeddings.
Documenten inladen en chunken → embedden → opslaan in een vector-database met metadata → query-embedding → semantisch (of hybride) zoeken → gerankte resultaten.
Ontwerp een RAG-pijplijn.
Inladen en chunken → embedden en opslaan → query-time retrieval met reranking → promptaugmentatie → LLM-generatie → post-processing en citaties.
Hoe zou je inferentie met hoog verkeer afhandelen?
Gebruik queuing, batching, quantization, horizontale schaalvergroting, promptcaching en load balancing, en voldoe aan latency-SLA’s.
Hoe zou je de latency in een AI-systeem verlagen?
Pas promptcompressie, caching, kleinere of gedistilleerde modellen, speculative decoding en hardwareversnelling toe.
Hoe zou je outputs evalueren en monitoren?
Log verzoeken/reacties, voer geautomatiseerde kwaliteitscores uit, steekproef voor menselijke review, volg businessmetrics en stel degradatie-alerts in.
Vragen over deployment en MLOps voor AI-engineers
Zodra een systeem is ontworpen, willen interviewers weten dat je het ook daadwerkelijk kunt shippen, monitoren en betrouwbaar draaiende houden.
Hoe implementeer je een applicatie op basis van een LLM?
Containerizen met FastAPI, integreren via SDK’s of self-hosted servers zoals vLLM, orkestreren met Kubernetes of serverless, en CI/CD gebruiken voor prompts en code.
Hoe ga je om met modelversiebeheer?
Versioneer prompts, embeddingmodellen en fine-tuned adapters met LangChain Hub, MLflow of Hugging Face.
Hoe monitor je modelprestaties in productie?
Volg latency, throughput, kosten, foutpercentages en outputkwaliteit met Prometheus, Grafana en LLM-evaluators.
Wat is model drift in AI-systemen?
Degradatie veroorzaakt door veranderingen in inputdistributie, gebruikersgedrag of databronnen. Het uit zich als afnemende relevantie of toenemende hallucinaties.
Hoe schaal je inferentie op?
Pas continuous batching toe, quantization zoals 4/8-bit, modelparallelisme en engines zoals vLLM of TGI.
Welke tools worden gebruikt voor AI-deployment?
Docker/Kubernetes, vLLM of Text Generation Inference, vector-databases zoals Pinecone of Weaviate, LangSmith en cloudplatforms zoals AWS Bedrock, Azure OpenAI of GCP Vertex AI.
Scenariogebaseerde sollicitatievragen voor AI-engineers
Deze vragen simuleren echte productie-incidenten om te zien hoe je redeneert over debugging en mitigatie onder druk.
Je LLM-chatbot geeft onjuiste antwoorden. Wat doe je?
Ik zou de prompts en geschiedenis inspecteren om de RAG-gronding te versterken, outputvalidatie toevoegen en feedbackloops met gebruikers implementeren.
De latency neemt plots toe. Hoe debug je dit?
Ik zou het tokenvolume, de rate limits, het netwerk, de wachtrijen en de endpointgezondheid profileren met end-to-end-traces.
De kosten schieten omhoog in productie. Wat is je aanpak?
Analyseer het tokenverbruik, voeg caching toe, verkort prompts, routeer naar goedkopere modellen en stel geautomatiseerde budgetalerts in.
Gebruikers melden hallucinaties. Hoe zou je dat mitigeren?
Voeg bronvermeldingen toe, dwing gestructureerde output met validatie af en introduceer zelfkritiekstappen.
Je RAG-systeem geeft irrelevante resultaten. Wat is er mis?
Controleer het chunken, de embeddingkwaliteit, metadatafilters, overeenkomst-drempels en retrieval-reranking.
Verschillen in sollicitaties: AI-engineer vs. machinelearning-engineer
AI-engineers focussen op LLM’s, prompt engineering, RAG, API-orkestratie en toepassingen voor eindgebruikers, terwijl machinelearning-engineers zich richten op modeltraining, datapijplijnen en optimalisatie.
Je kunt AI-engineers zien als software-engineers die gespecialiseerd zijn in het bouwen van functionele AI-toepassingen, terwijl machinelearning-engineers zich meer richten op het onderzoeken en ontwikkelen van de onderliggende modellen.
Sollicitaties testen AI-kandidaten doorgaans op systeemintegratie en productiebetrouwbaarheid.
Veelgemaakte fouten in sollicitaties voor AI-engineers
Zelfs sterke kandidaten kunnen struikelen door in een paar terugkerende valkuilen te trappen die wijzen op een gebrek aan productie-ervaring.
- Te veel focus op theorie in plaats van op de daadwerkelijke productie-workflows.
- LLM’s behandelen als black boxes zonder in te gaan op prompts of faalmodi.
- Systeemtrade-offs negeren zoals latency versus nauwkeurigheid versus kosten.
- Monitoring- en iteratiepraktijken weglaten.
- Geen concrete voorbeelden hebben uit uitgerolde projecten.
Hoe je je voorbereidt op sollicitaties voor AI-engineers
Een gerichte voorbereiding moet praktische vaardigheden opbouwen naast de conceptuele kennis die hierboven is behandeld.
- Bouw en deploy twee end-to-end LLM-projecten, zoals een RAG-chatbot en een document intelligence-applicatie.
- Oefen de volledige walkthrough van systeementwerp, van input tot gemonitorde output.
- Doe praktische ervaring op met Docker, Kubernetes, vLLM, LangChain/LlamaIndex en vector-databases.
- Beheers API-integratie, gestructureerde parsing en tracing.
- Onderhoud actieve projecten en probeer de productiegerichte AI-engineeringupdates te volgen.
Conclusie
AI-engineering draait om het bouwen van betrouwbare systemen. De meest voorkomende sollicitaties testen probleemoplossing in de echte wereld, van architectuur tot deployment tot systeemdenken.
Goede hands-on productie-ervaring is hier de sterkste onderscheidende factor. Richt je op het leveren van meetbare waarde, en je valt op als sterke kandidaat.
Ik werk aan versnelde AI-systemen die edge-intelligentie mogelijk maken met gefedereerde ML-pijplijnen op gedecentraliseerde data en gedistribueerde workloads. Mijn werk richt zich op Large Models, spraakverwerking, computervisie, reinforcement learning en geavanceerde ML-topologieën.
FAQ's
Hoe technisch zijn sollicitaties voor AI-engineers?
Ze testen praktische vaardigheden in LLM’s, systeementwerp, RAG en deployment, in plaats van diepe theorie of LeetCode-algoritmes.
Heb ik ervaring met specifieke tools nodig?
Ja. Focus op LangChain/LlamaIndex, vector-databases, vLLM, Docker en cloud-LLM-API’s.
Hoe belangrijk is prompt engineering?
Cruciaal. Interviewers verwachten een discussie over systeem-prompts, tool calling en promptiteratie in echte applicaties.
Welke projecten moet ik bouwen ter voorbereiding?
End-to-end RAG-chatbots en documentsystemen voor zoeken met openbare API’s en vectorstores.
Verschillen sollicitaties voor beginners en seniors?
Ja. Beginners krijgen fundamentals; seniors behandelen systeemschaalvergroting, MLOps-trade-offs en productiemonitoring.

