Training Data

Term van de dag
Training Data

Training data is de verzameling informatie die gebruikt wordt om een AI-model te trainen. Dit zijn de voorbeelden waarvan het model leert om patronen te herkennen en voorspellingen te maken.

De kwaliteit en hoeveelheid van training data is cruciaal:

1. Hoeveelheid: Meer data leidt meestal tot betere modellen, maar ook tot meer computationele kosten
2. Kwaliteit: Vervuilde of labelfouten in data leiden tot slechte modellen
3. Diversiteit: Data moet representatief zijn voor alle situaties waarin het model gebruikt zal worden
4. Balans: In classificatie moet je voorkomen dat bepaalde klassen veel meer vertegenwoordigd zijn

Large language models worden op miljarden woorden training data getraind, afkomstig van boeken, websites en andere bronnen. Het datasamenstelling proces is ook belangrijk: het filteren, schoonmaken en curateren van training data kan grote effecten hebben op model prestaties.

Voorbeeld: Een spam-filter training data zou zowel legitimate e-mails als echte spam-e-mails moet omvatten. Als je alleen spam gebruikt, leert het model niet wat legitimate is. Als je 99 procent legitimate e-mails hebt en 1 procent spam, zal het model voorkeur geven aan de meerderheid.

📚
Term van de dag archief
Alle AI-termen op één plek. Blader door het volledige archief, gesorteerd op alfabet.

Data Pipeline

Term van de dag
Data Pipeline

Een Data Pipeline is een geautomatiseerde reeks processen die ruwe data verzamelen, transformeren, cleanen en in een bruikbare vorm opslaan. In AI is dit cruciaal voor het verkrijgen van trainingsgegevens.

Goede data pipelines zorgen voor consistent kwaliteitsbeheer, versiebeheer en traceerbaarheid. Ze kunnen batches of streaming-data verwerken.

Voorbeeld: Een data pipeline voor een e-commercesite: data verzamelen van serverloggen, duplicaten verwijderen, valuta converteren, anonimiseren, en opslaan in een datawarehouse voor ML-trainingen.

📚
Term van de dag archief
Alle AI-termen op één plek. Blader door het volledige archief, gesorteerd op alfabet.

Image Segmentation

Term van de dag
Image Segmentation

Image Segmentation is een computer vision-taak waarbij een afbeelding wordt opgedeeld in meerdere regio’s of objecten, waarbij elk pixel wordt toegewezen aan een klasse of object. Dit is meer gedetailleerd dan classificatie, waarbij je weet wat er in een afbeelding staat, maar niet waar.

Segmentatie wordt gebruikt voor medische beeldverwerking, autonome voertuigen, robotica en veel meer. Er zijn semantische segmentatie (per klasse) en instance segmentatie (per object).

Voorbeeld: Een medisch beeld van hersenen segmenteren om tumoren, bloedvaten en gezonde weefsels apart aan te duiden.

📚
Term van de dag archief
Alle AI-termen op één plek. Blader door het volledige archief, gesorteerd op alfabet.

Validation Set

Term van de dag
Validation Set

Een validation set is een subset van je trainingsdata die wordt gebruikt om de prestaties van een AI-model in real-time te monitoren terwijl het wordt getraind. Het is apart van de trainingsdata (waarop het model leert) en apart van de testdata (waarop je uiteindelijk beoordeeld hoe goed het model werkt).

De validation set speelt een cruciale rol in het voorkomen van overfitting. Tijdens training kijk je naar hoe goed het model presteert op de validation set – als het goed blijft werken op data die het niet heeft gezien, is dat een goed teken. Als de validation set plotseling slechter gaat presteren terwijl trainingsgegevens beter worden, is dat een waarschuwing dat het model overfitting krijgt.

Een typische split is 70 procent training, 15 procent validation, 15 procent test. De validation set helpt je om hyperparameters aan te passen en te bepalen wanneer je moet stoppen met trainen.

Voorbeeld: Je traint een afbeeldingsclassificator op 7000 afbeeldingen, valideert op 1500 afbeeldingen, en test op 1500 verschillende afbeeldingen. Als de validation accuracy gaat dalen terwijl trainingsaccuracy stijgt, is dat een teken dat je model overfitting krijgt en je moet stoppen.

📚
Term van de dag archief
Alle AI-termen op één plek. Blader door het volledige archief, gesorteerd op alfabet.

Computer Vision

Term van de dag
Computer Vision

Computer Vision is het AI-vakgebied dat machines leert images en video’s te interpreteren. Het omvat taken zoals objectdetectie, gezichtsherkenning, segmentatie en pose-estimatie.

Deep learning, vooral convolutional neural networks (CNNs), zijn essentieel voor moderne computer vision. Toepassingen variëren van medische beeldvormving tot autonome voertuigen.

Voorbeeld: Een computer vision-systeem analyzeert medische X-rays en detecteert abnormale structuren met bijna menselijke nauwkeurigheid, wat radiologen helpt bij diagnose.

📚
Term van de dag archief
Alle AI-termen op één plek. Blader door het volledige archief, gesorteerd op alfabet.

Tool Use (AI)

Term van de dag
Tool Use (AI)

Tool use in AI verwijst naar het vermogen van een model om externe tools of functies aan te roepen om taken op te lossen. In plaats van alles zelf te doen, kan een AI-model bepalen wanneer een tool nodig is, wat tool te gebruiken, en hoe deze in te voeren.

Voorbeelden van tools die AI-modellen kunnen gebruiken omvatten:

1. Rekenmachines en wiskundige engines
2. Search engines of database queries
3. Browsers om webpagina’s op te halen
4. Code-executors om Python code te runnen
5. APIs voor real-time informatie

Tool use wordt geactiveerd door technieken als function calling in API’s. Een model geeft een gestructureerde output (bijv. JSON) die aangeeft welke tool moet worden gebruikt, de parameters, en wat ermee moet gebeuren. De gebruiker voert dit uit en geeft het resultaat terug aan het model.

Voorbeeld: Een gebruiker vraagt ‘Wat is 123 keer 456?’ In plaats van te gokken, zou een AI-model aangeven dat het de calculator-tool moet gebruiken met parameters 123 en 456. De calculator geeft 55788 terug, en het model antwoordt met het juiste antwoord.

📚
Term van de dag archief
Alle AI-termen op één plek. Blader door het volledige archief, gesorteerd op alfabet.

Hyperparameter Tuning

Term van de dag
Hyperparameter Tuning

Hyperparameter Tuning is het proces van het selecteren van de beste waarden voor hyperparameters – instellingen die u handmatig instelt voordat het model traint. Dit verschilt van parameters, die het model zelf leert.

Hyperparameters zijn dingen zoals learning rate, batch size, aantal lagen in het netwerk, en regularisatiesterkte. Het vinden van optimale waarden is cruciaal voor modelprestatie en vereist systematisch testen.

Voorbeeld: U test learning rates 0.001, 0.01 en 0.1 om te zien welke het snelst het model laat convergeren naar lage loss.

📚
Term van de dag archief
Alle AI-termen op één plek. Blader door het volledige archief, gesorteerd op alfabet.

Chatbot

Term van de dag
Chatbot

Een Chatbot is een computerprogramma dat natuurlijke taalconversatie simuleert. Moderne chatbots gebruiken grote taalmodellen en kunnen complex redeneren, informatie opzoeken en contextbewust reageren.

Chatbots worden ingezet in customer support, educatie, entertainment en meer. Ze besparen kosten en leveren 24/7 ondersteuning, hoewel ze soms onnauwkeurigheid kunnen produceren.

Voorbeeld: Een bedrijfschatbot helpt klanten met veelgestelde vragen, helpt tickets aan te maken, en escaleert complexe problemen naar menselijke agenten.

📚
Term van de dag archief
Alle AI-termen op één plek. Blader door het volledige archief, gesorteerd op alfabet.

Generalization

Term van de dag
Generalization

Generalization is het vermogen van een machine learning-model om goed te presteren op ongeziene gegevens, niet alleen op de trainingsgegevens waarop het is getraind. Een model dat alleen goed werkt op trainingsgegevens wordt overfitted genoemd.

Goed generaliseren is het doel van machine learning: een model trainen dat patronen leert die in werkelijke situaties werken. Dit vereist de juiste balans tussen modelhoe en regularisatie.

Voorbeeld: Een spamfilter getraind op 10.000 emails moet ook nieuw ontvangen spam correct identificeren, niet alleen de trainingsemails opnieuw classificeren.

📚
Term van de dag archief
Alle AI-termen op één plek. Blader door het volledige archief, gesorteerd op alfabet.

CLIP

Term van de dag
CLIP

CLIP (Contrastive Language-Image Pre-training) is een multimodaal AI-model van OpenAI dat tekst en afbeeldingen begrijpt. Het is getraind op miljarden afbeelding-tekstparen van het internet.

CLIP kan afbeeldingen labelen, zoeken op basis van tekstbeschrijvingen, en transfer learning toepassen op nieuwe visuele taken zonder extra training. Het is open source en zeer invloedrijk in computer vision.

Voorbeeld: CLIP kan een afbeelding zien en deze correct labelen als kat slaapt op bank zonder ooit tijdens training dit exact paar te zien. Het begrijpt de semantische relatie tussen woorden en visuele concepten.

📚
Term van de dag archief
Alle AI-termen op één plek. Blader door het volledige archief, gesorteerd op alfabet.