Het schrijven van een prompt voor beeldgeneratie is minder een gesprek voeren, en meer het regisseren van een filmscène in één enkele zin. Je moet tegelijkertijd de rol aannemen van regisseur, cameraman, lichttechnicus en setdresser. In dit artikel ontleden we de fundamentele verschillen tussen tekst- en beeldprompts, bespreken we de anatomie van een perfecte beeldprompt en kijken we naar geavanceerde iteratietechnieken.
Het Fundamentele Verschil: Logica versus Esthetiek
Wanneer je werkt met een LLM zoals GPT-4 of Claude, gebruik je natuurlijke taal en structureer je de prompt vaak met specifieke prompt-technieken zoals Chain-of-Thought of Few-Shot. Je geeft het model de ruimte om te redeneren. Beeldgeneratoren werken fundamenteel anders. Hoewel DALL-E 3 veel beter is geworden in het begrijpen van natuurlijke taal, werken modellen als Midjourney en Stable Diffusion voornamelijk op basis van "token weights" en conceptuele associaties in de latent space.
Beeldmodellen scannen je tekst op herkenbare sleutelwoorden (tokens) en zoeken naar de visuele weergave die in hun trainingsdata met die tokens geassocieerd is. Grammatica is vaak ondergeschikt aan de plaatsing van het woord. Woorden aan het begin van de prompt hebben in veel architecturen (zoals CLIP, de tekst-encoder die vaak wordt gebruikt) een zwaarder gewicht dan woorden aan het einde. Om echt te begrijpen hoe deze modellen van ruis naar een afbeelding gaan, kun je meer lezen op ons leerplatform over wat diffusion-modellen precies zijn.
Empirische aanname: Hoewel de exacte weging van tokens in gesloten modellen zoals Midjourney v6 niet publiek is, suggereert uitgebreid community-onderzoek dat de eerste 5 tot 10 woorden in je prompt voor 70% bepalen wat het hoofdonderwerp van de afbeelding wordt. Bewaar details voor latere delen van je prompt.
De Anatomie van een Perfecte Beeldprompt
Een robuuste beeldprompt is opgebouwd uit verschillende lagen. Net als bij een ui begin je bij de kern en voeg je vervolgens schillen van detail toe. Door een vaste structuur aan te houden, vergroot je de voorspelbaarheid van je resultaten aanzienlijk.
1. Het Hoofdonderwerp (Subject & Action)
Dit is de kern van je afbeelding. Wie of wat staat er centraal, en wat doet het? Wees zo specifiek mogelijk. In plaats van "een hond", gebruik je "een golden retriever puppy". In plaats van "een man", zeg je "een oude visser met een verweerd gezicht". Voeg ook de actie toe, zelfs als het een portret is (bijvoorbeeld: "kijkt direct in de camera", of "rent door een veld").
2. Het Medium en de Stijl (Medium & Style)
Zonder specificatie van het medium zal het model gokken op basis van het onderwerp. Definieer exact wat je wilt zien. Is het een polaroidfoto, een olieverfschilderij, een 3D-render (Unreal Engine 5), of een potloodschets? Voeg hier ook stijlelementen aan toe. Denk aan kunststromingen (Cyberpunk, Art Deco, Renaissance) of de stijl van specifieke kunstenaars of regisseurs (mits dit ethisch en binnen de richtlijnen van het model valt).
3. Lichtinval en Sfeer (Lighting & Mood)
Licht maakt of breekt een afbeelding. Developers vergeten deze stap vaak, terwijl fotografen weten dat licht het belangrijkste element is. Gebruik termen zoals:
- Cinematic lighting: Dramatisch, vaak met hoog contrast.
- Volumetric lighting: Lichtstralen die door mist of stof schijnen (ook wel god rays genoemd).
- Golden hour: Zacht, warm licht vlak voor zonsondergang.
- Studio lighting: Hard, helder licht, perfect voor productfotografie.
- Bioluminescence: Gloeiend licht, ideaal voor sci-fi of fantasy.
4. Compositie en Cameratechniek (Framing & Camera)
Als je gaat voor fotorealisme, gebruik dan termen uit de fotografie. Bepaal de uitsnede: Extreme close-up, medium shot, wide angle, drone view of isometric view. Je kunt zelfs specifieke lenzen en filmsoorten simuleren door termen toe te voegen als 35mm lens, f/1.8 aperture (voor een wazige achtergrond/bokeh) of Kodak Portra 400 voor een specifieke kleurenfilm-look.
5. Kwaliteits- en Resolutie-modifiers
Hoewel deze in moderne modellen (zoals Midjourney v6) minder noodzakelijk zijn dan vroeger, kunnen ze nog steeds helpen om het model in een bepaalde richting te duwen. Termen als 8k resolution, highly detailed, masterpiece, sharp focus en award-winning sturen het model naar het deel van de trainingsdata dat als hoge kwaliteit is gelabeld.
Negatieve Prompts: Sturen door Weglating
Naast het vertellen wat je wél wilt, is het vaak cruciaal om het model te vertellen wat je niet wilt. Dit noemen we negatieve prompts (Negative Prompting). Vooral in Stable Diffusion is dit een essentieel onderdeel van de workflow. Het dwingt de wiskundige berekening in de latent space weg van bepaalde concepten.
In Midjourney bereik je dit vaak met de --no parameter aan het einde van je prompt. Als je bijvoorbeeld een straatbeeld genereert maar geen auto's wilt zien, voeg je --no cars toe. Negatieve prompts worden ook veel gebruikt om veelvoorkomende generatiefouten te onderdrukken. Een standaard negatieve prompt in Stable Diffusion ziet er vaak zo uit:
Let op: DALL-E 3 ondersteunt geen directe negatieve prompts via een apart invoerveld, maar vereist dat je in natuurlijke taal specificeert wat weggelaten moet worden (bijv. "Zorg ervoor dat er absoluut geen tekst in de afbeelding staat").
Itereren: Van Eerste Concept naar Meesterwerk
Een perfecte afbeelding ontstaat zelden bij de eerste poging. Waar we bij tekstmodellen itereren via vervolgvragen, vergt beeldgeneratie een andere cyclus. Als je de basistechnieken niet goed toepast, resulteert dit vaak in urenlange frustratie, een van de meest voorkomende prompt-fouten.
- Fixeer de Seed: Elke gegenereerde afbeelding heeft een uniek 'seed'-nummer (de startwaarde van de ruis). Als je iteraties wilt doen die lijken op je vorige resultaat, moet je dit seed-nummer achterhalen en toevoegen aan je volgende prompt. Anders begin je elke keer met een compleet nieuwe compositie.
- Pas Gewichten aan (Prompt Weighting): In veel systemen kun je de nadruk van bepaalde woorden vergroten. In Midjourney doe je dit met `::` (bijv. `cyberpunk::2`), in Stable Diffusion met haakjes (bijv. `(cyberpunk:1.5)`). Dit vertelt het model welk element prioriteit heeft als er conceptuele conflicten zijn.
- Inpainting en Outpainting: Accepteer dat een prompt je voor 90% brengt waar je wilt zijn. Gebruik vervolgens 'inpainting' (alleen een specifiek deel van de afbeelding, zoals een hand, opnieuw genereren) om fouten te herstellen, in plaats van de hele prompt eindeloos te tweaken.
Veelgemaakte Fouten bij Beeldgeneratie
Wanneer we prompts reviewen van nieuwkomers in de community, zien we vaak dezelfde patronen terug die leiden tot suboptimale resultaten:
- De 'Keyword Salad': Het klakkeloos achter elkaar plakken van honderden descriptoren ("masterpiece, best quality, trending on artstation, 4k, 8k, Unreal Engine, octane render, vivid colors..."). Dit verwatert de prompt. Het model raakt de weg kwijt en de focus op het daadwerkelijke onderwerp verdwijnt.
- Tegenstrijdige belichting: Vragen om "cinematic shadow lighting" en tegelijkertijd "bright flat daylight" in dezelfde prompt zetten. Het model moet dan een compromis sluiten dat er vaak onnatuurlijk uitziet.
- Over-specificatie van de achtergrond: Soms beschrijft een gebruiker de achtergrond zo gedetailleerd, dat het model vergeet ruimte en aandacht over te houden voor het hoofdonderwerp. Behandel de achtergrond als ondersteuning, niet als hoofdzaak.
Praktijkvoorbeelden en Prompt-Afbraak
Laten we de theorie in de praktijk brengen met twee voorbeelden die je direct kunt opslaan in je eigen prompt-bibliotheek.
Voorbeeld 1: Fotorealistisch Portret
Waarom dit werkt: De prompt is gestructureerd. Eerst het onderwerp (oudere monteur, kleding, vuil, gereedschap). Daarna de belichting (golden hour, richtingsspecifiek). Tot slot de camera (lens, diafragma voor de wazige achtergrond) en de algehele esthetiek (Kodak film grain).
Voorbeeld 2: Abstract Concept Art
Waarom dit werkt: Hier sturen we sterk op medium (Isometric 3D render). De kleuren en esthetiek (Cyberpunk, neon) worden duidelijk benoemd. De negatieve prompt (--no humans, text) zorgt ervoor dat de architectuur centraal blijft staan en voorkomt de veelvoorkomende fout van gibberish-tekst op uithangborden.
De Oefenroutine voor Developers
Het schrijven van beeldprompts is een vaardigheid die je moet trainen. Net zoals je leert debuggen door veel code te lezen, leer je prompten door gericht te experimenteren. We raden de volgende dagelijkse oefenroutine aan:
- Reverse Engineering: Zoek op platforms zoals Civitai of de Midjourney Gallery een afbeelding die je indrukwekkend vindt. Bestudeer de originele prompt. Welke woorden verrassen je?
- De A/B Test: Neem een simpele prompt (bijv. "een kat op een tafel"). Genereer deze. Voeg nu exact één woord toe voor de belichting (bijv. "volumetric lighting"). Genereer opnieuw. Documenteer het visuele verschil. Dit bouwt je inzicht in token-gedrag op.
- Stijlen Mengen: Combineer twee totaal verschillende esthetieken (bijv. "Darth Vader in de stijl van Vincent van Gogh's Sterrennacht"). Dit helpt je begrijpen hoe het model omgaat met conflicterende conceptuele ruimtes.
Door deze gestructureerde aanpak te volgen, stap je af van het blindelings raden naar sleutelwoorden en evolueer je naar een methodische 'prompt engineer' voor beeldgeneratie. Experimenteer met de opbouw, stuur de output via negatieve prompts en wees bereid om iteratief te werk te gaan. De perfecte afbeelding ligt altijd één kleine prompt-aanpassing verderop.
