Synthetic data: trainingsdata genereren met AI

Expert • Les 10

Synthetic data: trainingsdata genereren met AI

Gelabelde trainingsdata is duur en schaars. Synthetic data, gegenereerd door AI of simulaties, biedt een schaalbare oplossing voor domein-specifieke fine-tuning, data augmentatie en privacy-bewust trainen. De kwaliteitscontrole is cruciaal.

Methoden voor tekst-synthese

Voor taalmodeltraining wordt synthetische data gegenereerd via een sterkere teacher-model dat vraag-antwoordparen, instructieparen of redeneerketens produceert. Phi-1 en Phi-2 zijn getraind op kwalitatief hoogwaardige synthetische code en tekst (“textbook-quality”), met indrukwekkende resultaten voor modelgrootte. Self-instruct is een methode waarbij een model instructiedata genereert op basis van een kleine seed-set.

Data augmentatie

Data augmentatie vult echte data aan met variaties: parafraseren (zelfde betekenis, andere formulering), backtranslatie (vertaal naar andere taal en terug), counterfactual augmentation (kleine feitelijke wijzigingen om robustheid te trainen). Bij beeldmodellen zijn rotatie, bijsnijden en kleurwijziging standaard; voor tekst is augmentatie subtieler en vereist semantische verificatie.

Kwaliteitscontrole en model collapse

Model collapse is het fenomeen waarbij een model getraind op zijn eigen output steeds generischer wordt en de diversiteit van echte data verliest. Preventie vereist: menging van synthetische en echte data, diversiteitsmetriken bijhouden, en validatie door een apart beoordelingsmodel of menselijke annotators. Filter-pipelines (zoals perplexiteitsfiltering) verwijderen lage-kwaliteit gegenereerde samples.

Privacy-toepassingen

Synthetische data kan medische of financiële trainingsdata vervangen waarbij privacygevoelige echte data niet gebruikt mag worden. Differential privacy-technieken gecombineerd met synthetische generatie bieden formele privacygaranties. Evalueer altijd of de synthetische distributie de echte distributie voldoende approximeert voor de doeltoepassing.

EU AI Act en GDPR: compliance voor AI-systemen

Expert • Les 9

EU AI Act en GDPR: compliance voor AI-systemen

De EU AI Act (2024) is de eerste uitgebreide AI-regulering ter wereld. Gecombineerd met bestaande GDPR-vereisten legt het significante verplichtingen op aan aanbieders en gebruikers van AI in de EU. Compliance vereist begrip van beide regimes.

Risicoklassen in de AI Act

De AI Act deelt AI-systemen in vier risicoklassen: verboden (social scoring door overheden, manipulatieve systemen), hoog risico (kritische infrastructuur, biometrische identificatie, beslissingsondersteuning bij sollicitaties en krediet), beperkt risico (deepfakes, chatbots: transparantievereisten) en minimaal risico (spamfilters, games). High-risk systemen vereisen conformiteitsbeoordelingen, risicomanagementsystemen en technische documentatie.

GPAI en foundation models

General Purpose AI (GPAI) modellen zoals GPT-4 en Claude vallen onder specifieke verplichtingen: technische documentatie, auteursrechtbeleid, energieverbruikrapportage. GPAI-modellen met systeemrisico (boven een compute-drempel van 10^25 FLOP) hebben aanvullende verplichtingen waaronder adversarial testing en incident reporting aan de EU AI Office.

GDPR-interactie

Wanneer AI persoonsgegevens verwerkt, gelden GDPR-vereisten: rechtmatige verwerkingsgrondslag, doelbinding, dataminimalisatie en rechten van betrokkenen (inzage, rectificatie, verwijdering). Bij geautomatiseerde besluiten met rechtsgevolgen geldt artikel 22 GDPR: betrokkenen hebben recht op menselijke tussenkomst en uitleg. AI-systemen die GDPR schenden kunnen boetes tot 4% van wereldwijde omzet krijgen.

Praktische compliance

Voer een AI-risicoklassificatie uit voor elk systeem. Documenteer trainingsdata, modelarchitectuur en testresultaten. Implementeer logging voor traceerbaarheid. Aanwijs een verantwoordelijke voor AI-governance. Voor high-risk systemen: registreer in de EU AI-database en voer regelmatig audits uit. Stel een incident response plan op voor AI-gerelateerde fouten.

Sparse attention: efficiënte transformers op schaal

Expert • Les 8

Sparse attention: efficiënte transformers op schaal

De standaard self-attention in transformers heeft een rekencomplexiteit van O(n²) ten opzichte van de sequentielengte n. Voor lange contexten van 100k+ tokens wordt dit onbeheersbaar. Sparse attention-methoden reduceren deze complexiteit door niet elk token met elk ander token te laten interageren.

Flash Attention

Flash Attention is geen sparse methode maar een IO-geoptimaliseerde implementatie van standaard attention die de GPU-bandbreedte efficiënt benut door het attention-patroon te berekenen in tiles die in SRAM passen. Flash Attention 2 en 3 zijn de defacto standaard voor efficiënte attention in moderne frameworks. Ze zijn exact (niet approximate) maar significant sneller door betere geheugentoegang.

Sliding window attention

Sliding window attention laat elk token alleen interageren met de w dichtstbijzijnde tokens in plaats van alle tokens. Dit geeft O(n*w) complexiteit. Mistral gebruikt sliding window attention gecombineerd met rolling buffer KV-cache. Het nadeel is dat informatie over lange afstanden minder direct wordt doorgegeven.

Grouped Query Attention (GQA)

GQA reduceert de KV-cache grootte door meerdere query heads te laten delen van dezelfde sleutel- en waarde-projecties. Llama 3 en Mistral gebruiken GQA: in plaats van n_heads K en V matrices zijn er slechts n_kv_groups, typisch 4 tot 8. Dit verlaagt het geheugenverbruik tijdens inference significant zonder grote kwaliteitsimpact.

Linear attention en alternatieven

Linear attention-methoden zoals Performer en RWKV benaderen of vervangen de softmax-attention door een lineaire kernelfunctie, waarmee O(n) complexiteit haalbaar is. Deze benaderingen zijn veelbelovend maar presteren in de praktijk nog altijd iets minder dan standaard attention op taalmodelleringtaken.

Mixture of Experts (MoE): schaalbare modelarchitectuur

Expert • Les 7

Mixture of Experts (MoE): schaalbare modelarchitectuur

Mixture of Experts is een architectuurparadigma waarbij een model bestaat uit meerdere gespecialiseerde subnetwerken (experts), waarvan slechts een subset actief is per token. Dit maakt het mogelijk modellen te schalen zonder evenredige toename in rekenkosten.

Architectuur

In een transformer-gebaseerd MoE-model wordt de feed-forward laag vervangen door N experts (typisch 8-128) plus een router. De router is een klein neuraal netwerk dat per token bepaalt welke top-k experts worden geactiveerd (gewoonlijk k=1 of k=2). Alleen de geactiveerde experts voeren de berekening uit; de overige parameters blijven inactief.

Load balancing

Een kritiek probleem bij MoE is expert collapse: de router leert snel dat enkele experts consistent beter presteren en stuurt vrijwel alle tokens naar die experts, terwijl de rest ongebruikt blijft. Oplossingen zijn auxiliary loss terms die een uniforme verdeling stimuleren (zoals in Switch Transformer) en noise-based load balancing.

Sparse versus dense

Een dense MoE activeert alle experts voor alle tokens (niet efficiënt). Sparse MoE activeert slechts k van N experts. Mixtral 8x7B heeft 8 experts per laag met k=2: elke token activeert effectief 2 van de 8 experts, waardoor het model 47 miljard parameters heeft maar slechts 13 miljard actief per token. Dit geeft de prestaties van een 47B-model bij de rekenkosten van een 13B-model.

Implementatie-uitdagingen

MoE-modellen zijn moeilijker te serven: alle expertgewichten moeten in geheugen staan ook al zijn ze niet actief. Bij gedistribueerde inference vereist expert parallelism zorgvuldige communicatie tussen nodes. Token dropping (wanneer een expert vol zit en tokens overslaat) is een subtiel correctheidsprobleem dat zorgvuldig moet worden beheerd.

De toekomst van AI: reasoning, planning en AGI

Expert • Les 6

De toekomst van AI: reasoning, planning en AGI

AI-ontwikkeling gaat snel. De onderzoeksagenda voor de komende jaren richt zich op betere redenering, autonome planning en de vraag of AGI nabij is.

Reasoning-modellen

Modellen als OpenAI o1, o3 en Claude 3.7 Sonnet zijn getraind om voor het antwoorden een interne redeneerstap (chain-of-thought) te doorlopen. Dit verbetert prestaties op wiskunde, logica en complexe meerstappe-taken aanzienlijk. De trade-off: langere responstijden en hogere kosten.

Planning en world models

Voor complexe taken moeten AI-systemen meerdere stappen vooruit kunnen plannen en consequenties van acties inschatten. Onderzoek richt zich op world models: interne representaties van hoe de wereld werkt. DeepMind werkt hieraan via Gato en Gemini; OpenAI via zijn agentische systemen.

Schaalwetten (scaling laws)

Empirisch onderzoek toont dat modelprestaties voorspelbaar schalen met meer parameters en meer trainingsdata. De Chinchilla-wet (2022) verfijnde dit: kleine modellen op veel data presteren beter dan grote modellen op weinig data. Of schaling onbeperkt doorgaat is een open vraag.

AGI: wanneer en wat?

Er is geen consensus over de definitie van AGI (Artificial General Intelligence). OpenAI definieert het als een systeem dat de meeste economisch waardevolle kenniswerktaken overtreft. Anthropic spreekt van transformatieve AI. Tijdlijnen varieren van 2027 tot ver in de toekomst, afhankelijk van de onderzoeker.

AI-infrastructuur: training, inference en schalen

Expert • Les 5

AI-infrastructuur: training, inference en schalen

Grote AI-modellen vereisen enorme computationele infrastructuur. Inzicht in die infrastructuur is essentieel voor iedereen die AI op schaal wil inzetten.

Training versus inference

Training is het eenmalige (of periodieke) proces waarbij het model zijn gewichten leert. Inference is het gebruik van het getrainde model voor productie. Training is extreem compute-intensief; inference is het grootst in volume en kosten bij schaal.

GPU-architecturen

NVIDIA H100- en A100-GPU-kaarten zijn de standaard voor AI-training. Ze zijn ontworpen voor matrixvermenigvuldigingen, de kernoperatie in neurale netwerken. Google heeft zijn eigen TPU (Tensor Processing Unit) die geoptimaliseerd is voor TensorFlow en JAX. AMD MI300X is een opkomende concurrent.

Quantisatie en compressie

Quantisatie reduceert de precisie van modelgewichten van 32-bit float naar 8-bit of 4-bit integers. Dit maakt modellen 4 tot 8 keer kleiner met beperkt kwaliteitsverlies. llama.cpp en GGUF-formaat maken het mogelijk grote modellen lokaal te draaien op consumenterhardware.

Inference-optimalisatie

Technieken als KV-caching, speculative decoding en continuous batching verbeteren de throughput en verlagen de latentie bij inference. vLLM is een populaire open-source inference-engine die deze technieken combineert.

Multimodale AI: meer dan tekst

Expert • Les 4

Multimodale AI: meer dan tekst

De nieuwste generatie AI-modellen is niet beperkt tot tekst. Ze verwerken afbeeldingen, audio, video en code binnen dezelfde architectuur. Dit heet multimodaliteit.

Vision encoders

Om afbeeldingen te begrijpen, wordt een afbeelding opgesplitst in patches en gecodeerd door een vision encoder (vaak gebaseerd op Vision Transformer, ViT). Die representatie wordt vervolgens gecombineerd met de tekstrepresentatie in het taalmodel.

Modellen die multimodaal zijn

GPT-4o, Claude 3 en Gemini 1.5 Pro verwerken tekst en afbeeldingen. Gemini 1.5 Pro verwerkt ook video en audio. Whisper (OpenAI) is gespecialiseerd in spraak-naar-tekst. Sora (OpenAI) en Veo (Google) genereren video op basis van tekst.

Uitdagingen

Multimodale modellen kunnen hallusineren over afbeeldingen: tekst lezen die er niet staat, objecten missen of relaties verkeerd interpreteren. Evaluatie van visuele begrip is moeilijker dan tekstuele evaluatie vanwege de hogere diversiteit aan invoer.

Toepassingen

Multimodale AI maakt mogelijk: automatische inspectie van productfotos, toegankelijkheidssoftware die afbeeldingen beschrijft voor slechtzienden, medische beeldanalyse, documentverwerking met tabellen en diagrammen, en interactieve productdesigntools.

AI-veiligheid en alignment: het grote probleem

Expert • Les 3

AI-veiligheid en alignment: het grote probleem

Naarmate AI-systemen krachtiger worden, wordt de vraag urgenter: hoe zorgen we dat ze handelen in lijn met menselijke waarden en bedoelingen? Dit is het alignment-probleem.

Wat is misalignment?

Misalignment treedt op als een AI-systeem een doel nastreeft op een manier die niet overeenkomt met wat de ontwerpers bedoelden. Een klassiek voorbeeld: een AI die is opgedragen paperclips te maximaliseren, zet in theorie alle beschikbare materie om naar paperclips. Dit heet een instrumental convergence probleem.

Constitutional AI

Anthropic ontwikkelde Constitutional AI (CAI): een methode waarbij het model zichzelf beoordeelt aan de hand van een set principes (een constitutie). Dit vermindert de noodzaak van menselijke feedback voor elke edge case en maakt het alignment-proces transparanter en schaalbaar.

Interpretability

Mechanistic interpretability onderzoekt wat er intern in een neuraal netwerk gebeurt. Circuits, features en superposition zijn centrale begrippen. Het doel: begrijpen waarom een model iets produceert, niet alleen wat. Anthropic, DeepMind en academische groepen publiceren hier actief onderzoek over.

Existentiele risicos

Organisaties als het Center for AI Safety en Anthropic zelf waarschuwen dat zeer krachtige toekomstige AI existentiele risicos kan inhouden als alignment niet is opgelost. Dit is controversieel: andere onderzoekers achten nabijetermijn schade (bias, fraude, deepfakes) urgenter. Beide zijn legitieme zorgen.

AI-evaluatie: hoe meet je de kwaliteit van een model?

Expert • Les 2

AI-evaluatie: hoe meet je de kwaliteit van een model?

Een model bouwen is een deel van het werk. Het evalueren ervan is minstens zo belangrijk: hoe weet je of het goed genoeg is voor productie?

Automatische benchmarks

Benchmarks zoals MMLU (kennis), HumanEval (code), GSM8K (wiskunde) en HELM vergelijken modellen op gestandaardiseerde taken. Ze geven een snelle vergelijking maar meten niet altijd wat er in productie toe doet.

Task-specifieke evals

Beter is het opstellen van evaluaties die direct meten op jouw specifieke use case. Maak een testset van input-output-paren die representatief zijn voor de echte toepassing. Automatiseer de beoordeling via een LLM-as-judge of exacte matching waar mogelijk.

Human evaluation

Voor subtiele kwaliteitsaspecten zoals tone, coherentie en nuance is menselijke beoordeling nodig. Gebruik pairwise ranking: presenteer beoordelaars twee outputs en vraag welke beter is. Dit is betrouwbaarder dan absolute scores.

Red-teaming

Red-teaming is het systematisch proberen een model te laten falen: onjuiste informatie produceren, veiligheidsfilters omzeilen, of inconsistent gedrag vertonen. Professionele AI-teams doen dit voor elke release. Automatische red-teaming tools genereren aanvalsprompts op schaal.

Fine-tuning: een model trainen op je eigen data

Expert • Les 1

Fine-tuning: een model trainen op je eigen data

Fine-tuning is het verder trainen van een pre-trained model op een specifieke dataset. Het resultaat is een model dat betere prestaties levert op die specifieke taak, stijl of domein.

Wanneer kies je voor fine-tuning?

Fine-tuning is zinvol als je een consistente tone-of-voice nodig hebt (bijv. klantenservice), een specifiek outputformaat altijd correct moet zijn (bijv. JSON-structuren), of als je werkt met domeinspecifieke terminologie die het basismodel niet goed beheerst. Het is geen oplossing voor het ontbreken van actuele kennis: gebruik dan RAG.

Supervised fine-tuning (SFT)

De meest gebruikte methode: je levert paren van input en gewenste output. Het model leert die mapping na te bootsen. Datakwaliteit is bepalend: 500 perfecte voorbeelden zijn beter dan 10.000 middelmatige.

RLHF en RLAIF

Reinforcement Learning from Human Feedback (RLHF) is hoe modellen zoals ChatGPT en Claude zijn getraind om behulpzaam en veilig te zijn. Menselijke beoordelaars rangschikken uitvoer. Een reward model leert die voorkeuren. Daarna wordt het taalmodel geoptimaliseerd via reinforcement learning. RLAIF vervangt menselijke feedback door AI-feedback, wat goedkoper en schaalbaar is.

Parameter-efficient fine-tuning

LoRA (Low-Rank Adaptation) en QLoRA zijn populaire technieken die slechts een fractie van de modelparameters aanpassen. Dit is veel goedkoper dan volledige fine-tuning en werkt verrassend goed. Je kunt zo een 7B-model fine-tunen op een enkele consumentengpu.