Als developer die webapplicaties bouwt en krachtige API's zoals Claude Pro of DeepSeek via OpenRouter integreert, kom je er al snel achter dat de kwaliteit van je output valt of staat met je prompt. Grote context-windows en geavanceerde RAG-systemen (Retrieval-Augmented Generation) zijn geweldig, maar als de basisprompt hapert, levert zelfs het duurste model matige JSON of incoherente teksten op.
In dit overzichtsartikel behandelen we de drie fundamentele prompting technieken en laten we zien wanneer je welke inzet om API-kosten, latentie en output-kwaliteit perfect in balans te houden.
1. Zero-Shot Prompting
Bij zero-shot prompting geef je het model direct een taak, zonder enige voorbeelden (shots) te geven. Je vertrouwt puur op de getrainde kennis en het vermogen van het model om de instructie te begrijpen.
Wanneer gebruiken?
- Voor simpele taken zoals vertalingen, het samenvatten van een alinea, of basale sentimentanalyse.
- Wanneer latentie (snelheid) cruciaal is en je zo min mogelijk tokens wilt verbruiken.
- In combinatie met zeer intelligente modellen die aan een half woord genoeg hebben.
Voorbeeld
Classificeer het sentiment van de volgende tekst als Positief, Negatief of Neutraal.
Tekst: "De nieuwe vector search implementatie is razendsnel!"
Sentiment:
2. Few-Shot Prompting
Modellen kunnen soms de weg kwijtraken als je een specifiek output-formaat eist (zoals een complexe geneste JSON). Bij few-shot prompting stuur je รฉรฉn (one-shot) of meerdere voorbeelden mee in de context, direct boven de daadwerkelijke vraag. Dit is essentieel voor pattern-matching.
Wanneer gebruiken?
- Wanneer de output strikt moet voldoen aan een specifieke tone-of-voice of een datastructuur.
- Als zero-shot faalt om de subtiliteiten van jouw domein te vangen.
- Wanneer je specifieke randgevallen (edge cases) vooraf wilt ondervangen.
Voorbeeld
Vertaal de technische termen van het Engels naar het Nederlands in informele spreektaal.
Engels: We need to debug the backend pipeline.
Nederlands: We moeten de backend pijplijn even fixen.
Engels: The API latency is too high.
Nederlands: De API is echt te traag nu.
Engels: Optimize the database queries.
Nederlands:
3. Chain-of-Thought (CoT) Prompting
Grote taalmodellen zijn geen rekenmachines; ze voorspellen het volgende woord. Als je ze een complexe logische puzzel geeft zonder ze de ruimte te geven om "hardop na te denken", hallucineren ze vaak het antwoord direct. Chain-of-Thought dwingt het model om het probleem in tussenstappen op te breken ("Laten we dit stap voor stap aanpakken").
Wanneer gebruiken?
- Bij wiskundige problemen, code-architectuur vraagstukken, of complexe logische redeneringen.
- Wanneer je een beslissingsboom moet doorlopen.
- Voor complexe benchmarks waarbij je nauwkeurigheid verkiest boven snelheid en token-kosten.
Voorbeeld
Vraag: Een aquarium van 450 liter heeft elke week een waterwissel van 20% nodig. Je gebruikt een emmer van 15 liter. Hoeveel emmers moet je vullen?
Antwoord: Laten we dit stap voor stap berekenen.
1. Eerst berekenen we wat 20% van 450 liter is. 450 * 0.20 = 90 liter.
2. We hebben emmers van 15 liter.
3. We delen de totale hoeveelheid water door de inhoud van de emmer: 90 / 15 = 6.
Het antwoord is 6 emmers.
Beslistabel: Welke techniek kies je?
| Vereiste / Context | Zero-shot | Few-shot | Chain-of-Thought |
|---|---|---|---|
| Snelheid / Laagste Latency | โ Beste keuze | โ Matig | โ Slecht (veel output tokens) |
| Strikte JSON/Data formatting | โ Onbetrouwbaar | โ Essentieel | โ ๏ธ Mogelijk, in combinatie met few-shot |
| Complexe Logica / Redeneren | โ Hallucineert snel | โ ๏ธ Beperkt | โ Vereist |
| Token-kosten besparen | โ Ja (minste tokens) | โ Nee (kost context) | โ Nee (kost generatie-tokens) |
Praktische Checklist voor Developers
- Begin met Zero-shot: Test je prompt altijd eerst zero-shot. Moderne modellen verrassen je vaak. Waarom tokens verspillen als het niet hoeft?
- Schaal op naar Few-shot bij parsing-errors: Krijg je in je webapplicatie vaak errors omdat de API geen geldige JSON teruggeeft? Voeg 2 tot 3 concrete voorbeelden toe.
- Activeer CoT bij hallucinaties: Als de output qua structuur klopt, maar de inhoudelijk logica faalt, voeg dan de instructie toe om eerst het denkproces uit te schrijven. (Je kunt dit proces verbergen in de backend en alleen de eindconclusie aan je gebruiker tonen).
- Monitor je verbruik: Zeker als je geavanceerde setup draait, tikken CoT generatie-tokens hard aan. Gebruik het gericht.
