Christopher Thanisch
← Wissen
PROMPT20 Minuten Lesezeit·Zuletzt aktualisiert SEP 2026

KI-Bilder ohne Slop — der ultimative KI-Bildgenerierungs-Guide.

Warum KI-Bilder generisch wirken — und wie sieben Schichten aus einem dünnen Prompt ein brauchbares Creative Briefing machen. Mit 22 Marketing-Paaren und 6 Repair-Prompts.

Das lernst du

Warum viele KI-Bilder generisch aussehen, obwohl das Modell deutlich mehr kann
Welche sieben Angaben einen simplen Prompt zu einem Creative Briefing machen
22 konkrete Beispiele für Poster, Menüs, Thumbnails und Ads
Sechs Repair-Prompts — und warum Text und Bild oft getrennt bleiben sollten

Ich generiere inzwischen ziemlich viele Bilder mit KI. Und dabei fällt mir immer wieder dasselbe auf:

Wenn ein Bild nach KI aussieht, ist nicht unbedingt das Modell das Problem. Oft war einfach der Prompt zu dünn.

„Erstelle einen Flyer für meine Gartenparty.“

Damit weiß das Modell zwar, was es machen soll. Aber fast alles andere entscheidet es selbst: Wie sieht die Party aus? Wer soll sich angesprochen fühlen? Editorial oder Event-Plakat? Warmes Abendlicht oder knallige Sommerfarben? Perfekt inszeniert oder eher wie ein Schnappschuss? Wo ist Platz für Text?

Und genau an diesen Stellen entsteht häufig dieser typische KI-Look.

In diesem Guide geht es deshalb nicht darum, noch mehr Begriffe wie „8K“, „cinematic“ oder „masterpiece“ in einen Prompt zu packen. Sondern darum, ein Bild so zu beschreiben, wie man es auch einem Fotografen oder Designer briefen würde.

Dafür nutze ich sieben Schichten:

Subjekt, Zweck, Licht, Komposition, Typografie, Marke und Constraints.

Weiter unten findest du außerdem 22 konkrete Vorher-Nachher-Prompts für Marketing-Assets und sechs Repair-Prompts für Bilder, die schon fast funktionieren.

Alle Prompts sind auf Deutsch formuliert und können direkt übernommen werden. Maße, Hex-Codes und andere Specs habe ich bewusst konkret gelassen.

Das eigentliche Problem mit „AI Slop“

Der Begriff „AI Slop“ wird inzwischen für ziemlich vieles verwendet. Meistens sind damit KI-Inhalte gemeint, die massenhaft produziert wurden und irgendwie billig, generisch oder austauschbar wirken.

Bei Bildern erkennt man diesen Look meistens ziemlich schnell.

Alles ist ein bisschen zu perfekt. Das Licht ist dramatisch, obwohl es keinen Grund dafür gibt. Menschen sehen aus wie Models. Gegenstände stehen sauber arrangiert auf dem Tisch. Oberflächen glänzen. Die Komposition ist auffällig ausgewogen.

Genau diese Tendenz zu sehr sauberen, symmetrischen und geordneten Kompositionen wird inzwischen auch wissenschaftlich als ästhetischer Bias aktueller Bildgeneratoren diskutiert.

Das heißt aber nicht, dass man diesen Look einfach akzeptieren muss.

Ein großer Teil davon entsteht, weil wir dem Modell zu viele Entscheidungen überlassen.

Wenn ich schreibe:

„Flyer für meine Gartenparty am 25.09.2026“

muss das Modell selbst entscheiden, was eine Gartenparty visuell bedeutet. Also landet man schnell bei Lichterketten, perfekt gedeckten Tischen, warmem Sonnenuntergang, lachenden Menschen und irgendeiner dekorativen Serifenschrift.

Nicht unbedingt falsch. Aber eben auch nicht besonders eigenständig.

Deshalb versuche ich inzwischen, beim Prompten vier Dinge nicht mehr zu machen:

Nur das Motiv beschreiben
Begriffe wie „gutes Licht“, „professionell“ oder „8K masterpiece“ stapeln
Dem Modell sämtliche gestalterischen Entscheidungen überlassen
Ein Bild nur auf die klassischen KI-Fehler wie Hände und Zähne prüfen

Gerade der letzte Punkt ist interessanter, als er zunächst klingt.

Der KI-Fehler, auf den kaum jemand achtet

Wenn Leute KI-Bilder prüfen, schauen sie meistens zuerst auf Hände.

Dann auf Zähne. Ohren. Augen. Vielleicht noch Text.

Das ist verständlich, weil genau diese Fehler jahrelang die offensichtlichsten Hinweise auf generierte Bilder waren.

Eine große CHI-Studie von Kamali et al. aus dem Jahr 2025 kommt allerdings zu einem interessanten Ergebnis: Menschen sagen zwar sehr häufig, dass sie auf anatomische Fehler achten. Eine der häufigsten tatsächlichen Fehlerklassen in KI-Bildern ist aber etwas anderes:

Dinge funktionieren einfach nicht.

Ein Gitarrengurt verschwindet plötzlich im Hemd.

Ein Stuhlbein erreicht den Boden nicht.

Eine Halterung hält nichts.

Ein Gegenstand ist mit einem anderen verbunden, obwohl diese Verbindung physikalisch keinen Sinn ergibt.

Das Problem ist: Solche Fehler übersieht man erstaunlich leicht.

Deshalb schaue ich bei einem generierten Bild inzwischen nicht nur darauf, ob die einzelnen Objekte richtig aussehen.

Ich frage mich:

Könnte diese Szene in der Realität tatsächlich so existieren?

Das ist eine überraschend gute Qualitätskontrolle.

Je größer die Szene, desto mehr kann schiefgehen

Bei einem einfachen Portrait hat das Modell relativ wenig zu lösen.

Gesicht. Haare. Haut. Kleidung. Hintergrund.

Bei einem Restaurant-Menü, einer Werbeanzeige oder einem Produktbild sieht das anders aus.

Plötzlich müssen Schatten zusammenpassen. Gegenstände müssen sinnvoll aufeinander stehen. Reflexionen müssen stimmen. Schrift muss lesbar sein. Materialien müssen glaubwürdig reagieren. Perspektiven dürfen sich nicht widersprechen.

Das erklärt auch, warum verschiedene Studien auf sehr unterschiedliche Erkennungsraten für KI-Bilder kommen.

Nightingale und Farid kamen 2022 bei KI-generierten Gesichtern auf gerade einmal 48,2 Prozent Trefferquote. Die Teilnehmer lagen damit praktisch auf Zufallsniveau.

Bei vollständigen KI-Bildern lag die Trefferquote in der CHI-Studie von 2025 dagegen bei 76 Prozent.

Das ist für Marketing interessant, weil wir selten nur ein Gesicht generieren.

Wir generieren Produktbilder, Poster, Social Ads, Speisekarten, Thumbnails oder komplette Szenen.

Und je mehr im Bild passiert, desto mehr Entscheidungen sollte man dem Modell nicht einfach überlassen.

„Gutes Licht“ ist keine Lichtanweisung

Das war für mich einer der größeren Unterschiede zwischen mittelmäßigen und wirklich brauchbaren Prompts.

Früher hätte ich wahrscheinlich so etwas geschrieben:

„cinematic lighting“

oder:

„soft professional lighting“

Das klingt konkret, ist es aber eigentlich nicht.

Woher kommt das Licht?

Von vorne? Von hinten? Von einem Fenster links?

Ist es diffus oder hart?

Welche Farbtemperatur hat es?

Wie stark sind die Schatten?

Gibt es eine zweite Lichtquelle?

Gerade bei realistischen Bildern macht das einen enormen Unterschied.

Der Grund dafür ist relativ simpel: Bildmodelle simulieren keine echte physikalische Szene. Sie bauen nicht erst einen virtuellen Raum mit einer Lichtquelle auf und berechnen daraus das Bild.

Sie erzeugen ein Bild, das statistisch so aussieht, als wäre diese Szene beleuchtet worden.

Deshalb können Licht und Schatten einzeln plausibel aussehen und zusammen trotzdem keinen Sinn ergeben.

Wenn mir Licht wichtig ist, schreibe ich deshalb lieber etwas wie:

„Weiches spätes Nachmittagslicht von links, ca. 4.500 K, diffuse Schatten, kein Gegenlicht, keine künstliche Studiobeleuchtung.“

Das ist deutlich hilfreicher als „beautiful cinematic lighting“.

Bei Schrift würde ich dem Modell nicht unnötig vertrauen

Text in Bildern ist inzwischen deutlich besser geworden.

Trotzdem würde ich bei einem echten Marketing-Asset unterscheiden zwischen:

Text als Bestandteil des Motivs

und

Typografie als Design.

Ein Schild im Hintergrund? Kann das Modell ruhig versuchen.

Eine Headline, die exakt sitzen, richtig umbrechen und zur Marke passen muss?

Die würde ich anschließend selbst setzen.

Denn ein Bildmodell arbeitet nicht wie Figma, Photoshop oder InDesign. Es denkt nicht in Kerning, Baselines, Schriftdateien oder typografischen Rastern.

Wenn das Bild ansonsten perfekt ist, möchte ich es nicht neu generieren müssen, weil aus „Sommerfest“ plötzlich „Sommerfesl“ geworden ist.

Meine Faustregel ist deshalb:

Bild mit KI bauen. Finale Typografie mit einem echten Design-Tool setzen.

Natürlich gibt es Ausnahmen. Wenn Schrift selbst Teil der Bildidee ist, kann man sie direkt generieren. Für reproduzierbare Marketing-Assets würde ich mich aber nicht darauf verlassen.

Warum KI trotzdem immer wieder denselben Look produziert

Selbst mit einem besseren Prompt bleibt noch ein Problem:

Bildmodelle haben einen eigenen ästhetischen Default.

Wenn ich nichts anderes vorgebe, bekomme ich häufig ein Bild, das ziemlich „fertig“ aussehen möchte.

Saubere Komposition. Schöne Beleuchtung. Harmonische Farben. Perfekte Oberflächen. Alles an seinem Platz.

Das klingt zunächst positiv.

Nur ist die echte Welt selten so.

Ein interessantes Editorial-Foto kann gerade deshalb funktionieren, weil ein Glas ungünstig am Rand steht. Weil ein Tischtuch zerknittert ist. Weil der Bildausschnitt nicht perfekt ist. Weil eine Person halb aus dem Frame läuft.

Wenn man realistischere Bilder möchte, muss man solche Dinge teilweise bewusst zurückholen.

Nicht:

„realistic photo of a dinner table“

sondern beispielsweise:

„Dokumentarisch wirkendes Foto eines gedeckten Tisches kurz vor Ankunft der Gäste. Nicht perfekt arrangiert. Ein Glas steht leicht außerhalb der Reihe, das Leinentuch liegt zerknittert auf dem Tisch, einzelne Feigen sind angeschnitten. Keine symmetrische Komposition, keine Stockfoto-Ästhetik.“

Das ist immer noch kein Garant für ein gutes Bild.

Aber das Modell weiß jetzt zumindest, welche Art von Unperfektheit gewollt ist.

Und damit kommen wir zum eigentlichen Framework.

Die sieben Schichten eines guten Bild-Prompts

Ich versuche einen Bild-Prompt inzwischen weniger wie einen Zauberspruch und mehr wie ein kleines Creative Briefing zu schreiben.

Dafür gehe ich sieben Bereiche durch.

Nicht jeder Prompt braucht zu jedem Punkt drei Sätze. Aber wenn ein Ergebnis generisch aussieht, fehlt erstaunlich oft genau einer davon.

SchichtZu wenigBesser
1. Subjekt„Gartenparty“Was genau sehen wir und in welchem Moment?
2. ZweckfehltWo wird das Bild eingesetzt und was soll es leisten?
3. Licht„gutes Licht“Quelle, Richtung, Härte und Farbtemperatur
4. KompositionfehltPerspektive, Bildaufteilung, Negativraum und Fokus
5. Typografie„mit Überschrift“Wortlaut, Position, Größe und Hierarchie
6. Marke„in unseren Farben“Konkrete Palette, Hex-Codes und gewünschter Charakter
7. ConstraintsfehltWas darf ausdrücklich nicht passieren?

Ich würde diese sieben Punkte allerdings nicht als starre Prompt-Formel verstehen.

Es geht nicht darum, jeden Prompt möglichst lang zu machen.

Im Gegenteil: Ein langer Prompt voller irrelevanter Details kann genauso schlecht sein.

Die sieben Schichten helfen vor allem dabei, eine andere Frage zu stellen:

Welche visuellen Entscheidungen sind mir wichtig — und welche davon überlasse ich gerade unbewusst dem Modell?

Das ist für mich der entscheidende Unterschied.

Einmal konkret

Nehmen wir wieder die Gartenparty.

Der einfache Prompt wäre:

„Erstelle einen Flyer für meine Gartenparty am 25.09.2026.“

Damit ist das Motiv grob definiert. Mehr nicht.

Jetzt gehen wir die sieben Schichten durch:

1Subjekt

Ein gedeckter Gartentisch kurz vor Ankunft der Gäste, Weinflasche, unterschiedliche Gläser, Feigen, zerknittertes Leinentuch.

2Zweck

Private Einladung unter Freunden, soll hochwertig wirken, aber auf keinen Fall wie Werbung.

3Licht

Spätsommerabend, warmes natürliches Licht zwischen den Blättern, keine Studiobeleuchtung.

4Komposition

Obere Hälfte ruhig und typografisch nutzbar, Fotografie hauptsächlich in der unteren Hälfte.

5Typografie

Kleine Editorial-Anmutung statt Eventposter.

6Marke

Keine klassische Brand, dafür eine klare visuelle Richtung: European summer dinner, kleine Weinbar, unabhängiges Kulturmagazin.

7Constraints

Keine Menschen, keine Lichterketten, keine Ballons, kein perfektes Tablescaping, kein Canva-Look.

Plötzlich hat das Modell nicht einfach mehr Wörter bekommen.

Es hat Entscheidungen bekommen.

Und genau darum geht es.

Prompt-System zum Mitnehmen

Hol dir den vollständigen Guide als PDF.

Die sieben Schichten, Specs und Repair-Prompts als PDF — plus die wichtigsten Marketing-Paare. Damit du sie nicht noch einmal suchen musst.

22 Vorher-Nachher-Prompts

Im nächsten Abschnitt zeige ich 22 typische Marketing-Anwendungen jeweils zweimal.

Zuerst so, wie man den Prompt wahrscheinlich schnell nebenbei eintippen würde.

Danach als konkretes Creative Briefing.

Dabei geht es nicht darum, die langen Versionen Wort für Wort zu übernehmen. Interessanter ist die Frage, welche zusätzlichen Entscheidungen im zweiten Prompt getroffen werden.

Denn wenn man das einmal verstanden hat, braucht man irgendwann auch keine Prompt-Vorlagen mehr.

Poster und Flyer

1. Gartenparty-Flyer

Slop: Flyer für meine Gartenparty am 25.09.2026

Slop

Flyer aus einem vagen Einzeiler-Prompt

Optimiert

Flyer mit allen sieben Prompt-Schichten
Dasselbe Modell — nur der Prompt unterscheidet sich.
Prompt
Erstelle einen druckfertigen A5-Einladungsflyer für eine private Gartenparty.
Zweck: per Hand und WhatsApp verteilt, in fünf Sekunden klar: was, wann, wo — Freunde sollen zusagen, nicht überlegen.
Szene: flache grafische Komposition mit einem einzelnen Duotone-Fotoelement in der unteren Hälfte.
Motiv: Overhead-Crop eines Holztisches im Garten am späten Nachmittag — angeschnittene Weingläser, eine Schale mit Feigen, weiches Gegenlicht durch Blätter, keine Gesichter sichtbar.
Licht: warmes Spätnachmittagslicht von rechts bei etwa 20 Grad, lange weiche Schatten, goldener Stich 3500K.
Komposition: Bild blutet an der Unterkante über die unteren 45 Prozent, Textblock in der oberen Hälfte, klare horizontale Teilung, großzügige Ränder.
Typografie, exakt wie geschrieben:
„GARTENPARTY“ in fetter kondensierter Versalschrift oben.
Darunter in Regular: „Freitag, 25. September 2026 · ab 17 Uhr“.
Dann eine Zeile kleiner: „Bei uns im Garten — Bring was mit, wenn du magst.“
Farbe: 60 Prozent warmes Off-White #F6F1E8, 30 Prozent Duotone in tiefem Blattgrün #2F4A3A, 10 Prozent Korallen-Akzent #E07A5F nur auf einer dünnen Linie unter der Headline.
Constraints: genau drei Textzeilen, jeweils einmal und korrekt geschrieben. Keine Clipart-Luftballons, keine Stockfoto-Lächelgesichter, keine Logos, keine QR-Codes, keine Adresse im Bild.
Format: 148x210mm bei 300dpi mit 3mm Beschnitt.

2. Gym-Mitgliedschafts-Poster

Slop: Fitnessstudio-Poster mit einer trainierenden Person

Slop

Gym-Poster aus einem vagen Prompt mit Person und Motivations-Sprüchen

Optimiert

Gym-Poster mit leerem Floor, Licht und klarer Typografie
Dasselbe Modell — nur der Prompt unterscheidet sich.
Prompt
Erstelle ein druckfertiges Gym-Mitgliedschaftsplakat im Format 18x24 Zoll.
Zweck: Schaufenster-Recruiting-Poster für den Januar-Intake, Zielgruppe Einsteiger statt bestehende Lifter.
Szene: leerer Functional-Training-Bereich am frühen Morgen, Gummiboden und Rig sichtbar, aber unbesetzt.
Licht: kühles industrielles Deckenlicht bei 5000K plus eine warme praktische Lichtquelle vom Fenster rechts, lange Schatten über den Boden.
Komposition: breiter leerer Boden über die unteren zwei Drittel, Rig-Silhouette am rechten Rand, oberes linkes Viertel frei für Schrift.
Typografie: „STARTE WO DU BIST“ in schwerer Versal-kondensierter Sans, oben links, Off-White. Darunter in leichter Schriftstärke: „Kein Vertrag. Erster Monat gratis.“
Farbe: 60 Prozent Anthrazit #1F2225, 30 Prozent kühles Grau #5A6169, 10 Prozent Signalorange #FF5A1F nur auf der Akzentlinie.
Constraints: keine Personen, keine Equipment-Markennamen, keine Motivations-Stockbilder, kein Lens Flare. Jede Textzeile genau einmal rendern.
Format: 18x24in bei 300dpi, 0.25in Beschnitt.

3. Musik-Event-Poster

Slop: Konzertposter für eine Jazz-Nacht

Slop

Jazz-Nacht-Poster aus einem vagen Prompt mit Bandfoto und vielen Textzeilen

Optimiert

Siebdruck-Poster mit Zwei-Farben-Palette und klarer Typografie
Dasselbe Modell — nur der Prompt unterscheidet sich.
Prompt
Erstelle ein Jazz-Event-Poster im Siebdruck-Stil.
Zweck: Straßen-Paste-up für eine unabhängige Location, muss auf Distanz lesbar sein und mit zwei Sonderfarben druckbar bleiben.
Szene: flache grafische Komposition, keine fotografischen Elemente.
Motiv: abstrakte Kontrabass-Silhouette aus überlappenden geometrischen Formen, leicht links der Mitte.
Komposition: Motiv auf den linken zwei Fünfteln, Schrift gestapelt rechts, großzügiger Rand an allen vier Kanten.
Typografie: „MIDNIGHT BRASS“ in großer kondensierter Versalschrift über das obere Drittel. Unter der Illustration: „Donnerstag, 14. November“ dann „Riverside Hall, 20 Uhr“.
Farbe: nur Zwei-Farben-Palette, tiefes Navy #14213D und warmes Senfgelb #FCA311 auf off-white Papier. Sichtbares Halbtonkorn.
Constraints: keine Verläufe, keine Schlagschatten, keine Foto-Textur. Jede Textzeile genau einmal, korrekt geschrieben.
Stil: Mid-Century-Siebdruck, begrenzte Farbe, flache Farbtrennung.

4. Immobilien-Open-House-Poster

Slop: Immobilien-Poster für ein Haus

Slop

Immobilien-Flyer aus einem vagen Prompt mit vielen Infoblöcken und Thumbnails

Optimiert

Open-House-Poster mit klarer Typografie und einer Hausaufnahme
Dasselbe Modell — nur der Prompt unterscheidet sich.
Prompt
Erstelle ein hochwertiges Open-House-Poster für Immobilien.
Zweck: Schaufensterkarte für eine Premium-Agentur, Qualität signalisieren ohne zu schreien.
Szene: moderne eingeschossige Hausfassade zur goldenen Stunde, vom Vorgarten leicht außermittig fotografiert.
Licht: tiefe warme Sonne von rechts bei etwa 5 Grad Elevation, lange weiche Schatten über den Rasen, warmes Innenlicht durch die Verglasung sichtbar.
Komposition: Haus in den unteren zwei Dritteln, Vertikalen absolut gerade, sauberer Himmel im oberen Drittel für Schrift.
Typografie: „TAG DER OFFENEN TÜR“ in raffinierter gesperrter Versal-Serif, oben mittig, warmes Weiß. Darunter: „Samstag 11–14 Uhr“.
Farbe: gedämpfte Naturpalette, 60 Prozent warme Neutrals, 30 Prozent Himmel-Blaugrau, 10 Prozent Messing-Akzent #B08D57.
Constraints: keine Personen, keine Autos, keine Agentur-Logos, kein übersättigter Himmel, kein HDR-Glow. Architektonische Vertikalen wahr halten.
Format: A2 Hochformat bei 300dpi, CMYK-sicher.

Restaurant-Menüs

Hier fällt Slop am häufigsten auf: viel Text, und er muss stimmen.

5. Café-Menükarte

Slop: eine Café-Speisekarte mit Preisen

Slop

Überladene Café-Menütafel mit Illustrationen und vielen Rubriken

Optimiert

Klare Morgenmenü-Tischkarte mit fünf Gerichten
Dasselbe Modell — nur der Prompt unterscheidet sich.
Prompt
Erstelle ein fotorealistisches Tischkarten-Mockup: gedruckte Café-Menükarte, aufrecht in einem kleinen Holzhalter auf einer abgenutzten Eichenplatte.
Zweck: Tischkarte für ein unabhängiges Brunch-Café — warm und handgemacht, soll aus Sitzdistanz (ca. 50 cm) klar lesbar sein.
Szene: ungestrichener Off-White-Karton 300g/m² mit sichtbarer Baumwollfaser, leichte Biegung der Karte im Halter, weicher Kontaktschatten am Fuß.
Kamera: leichte Dreiviertel-Ansicht von vorne links, Fokus scharf auf der Schriftfläche, Hintergrund weich.
Licht: einzelnes weiches Fensterlicht von links bei 45 Grad, 4200K, sanfter Abfall nach rechts, ein Spekular nur auf der Holzkante des Halters — keine zweiten Schattenrichtungen.
Typografie, exakt wie geschrieben, schwarz auf dem Karton gedruckt:
Überschrift: „MORGENMENÜ“ in gesperrter Versal-Serif, oben zentriert.
Eine einzelne Terrakotta-Linie #C05B3D darunter.
Dann fünf Zeilen linksbündig mit Führungspunkten und rechtsbündigen Preisen:
„Sauerteigtoast········6“
„Gebackene Eier········11“
„Saisonales Granola····9“
„Buttermilk-Pancakes···10“
„Flat White············4“
Komposition: Überschrift im oberen Fünftel, Menüblock in der Mitte, unteres Fünftel bewusst leer. Gleichmäßige Außenränder mindestens 12 mm.
Farbe: Papier #F5EFE4, Tinte #1A1714, Akzent nur die eine Linie #C05B3D.
Constraints: jede Zeile genau einmal, korrekt geschrieben, gleiche Baseline und gleiches Letterspacing. Keine Logos, keine Illustrationen, keine Kaffeeflecken-Dekoration, keine Stockfoto-Optik, keine schwebenden Preise. Halter und Tisch müssen physikalisch stabil wirken.
Stil: echtes Produktfoto, geringe Schärfentiefe, natürliche Unvollkommenheit im Holz, kein HDR.

6. Fine-Dining-Tasting-Menu

Slop: edle Restaurant-Speisekarte

Slop

Überladene Fine-Dining-Karte mit Preisen, Rubriken und Goldrahmen

Optimiert

Minimalistisches Herbst-Tasting ohne Preise
Dasselbe Modell — nur der Prompt unterscheidet sich.
Prompt
Erstelle ein fotorealistisches Fine-Dining-Tasting-Menü als flach liegende Karte auf dem Gedeck.
Zweck: liegt an jedem Platz in einem Tasting-Menu-Restaurant — zurückhaltend, teuer, in drei Sekunden als hochwertig erkennbar.
Szene: schwere ungestrichene Elfenbein-Karte (ca. A5) auf dunklem Leinentischtuch, daneben nur angeschnitten ein mattes Besteckteil — kein Tellerchaos.
Kamera: Top-down leicht außermittig, Karte füllt ca. 55 Prozent der Bildhöhe, Vertikalen der Kartenkanten gerade.
Licht: einzelnes warmes Overhead-Key von oben links, 3000K, enger weicher Lichtpool auf der Karte, tiefer Falloff ins Tischtuch, keine zweiten Lichtquellen, keine Kerzenflecken.
Typografie, exakt wie geschrieben, zentriert, eine Tinte:
„HERBST-TASTING“ in kleiner gesperrter Versalschrift oben mit großzügigem Letterspacing.
Darunter fünf Gangzeilen in Title Case, jeweils eigene Zeile, gleichmäßiger Zeilenabstand:
„Sellerie, Haselnuss, Trüffel“
„Pökel-Forelle, Buttermilch, Dill“
„Reifes Rind, Mark, Zwiebel“
„Brombeere, Sauerampfer, Sahne“
„Petit Fours“
Komposition: extreme Luft — mindestens 25 Prozent der Kartenfläche an jeder Seite leer, Textblock vertikal zentriert.
Farbe: Papier warmes Elfenbein #F3EDE3, Tinte tiefes Anthrazit #2A2826. Keine Akzentfarbe, kein Goldfolie-Effekt.
Constraints: keine Preise, keine Beschreibungen, keine Logos, keine Ornamente, kein Rahmen, keine Wasserzeichen. Jede Zeile genau einmal, konsistentes Letterspacing, keine driftenden Baseline. Karte liegt flach — keine unnatürliche Verbiegung.
Stil: echtes Foto, Low-Key, geringe Schärfentiefe auf dem Tischtuchrand, matte Papiertextur sichtbar.

7. Kreidetafel-Specials

Slop: Kreidetafel-Menü für ein Restaurant

Slop

Überladene Restaurant-Kreidetafel mit vielen Rubriken und Illustrationen

Optimiert

Schlichte Tages-Specials-Tafel mit drei Gerichten
Dasselbe Modell — nur der Prompt unterscheidet sich.
Prompt
Erstelle eine fotorealistische handbeschriftete Kreidetafel mit Tagesgerichten, frontal an einer leicht unebenen Ziegelwand montiert.
Zweck: Tageskarte in einem Nachbarschaftsbistro — soll echt handgeschrieben wirken, nicht wie digitale Fake-Kreide.
Szene: echte Schiefertafel im Holzrahmen, sichtbarer Kreidestaub in den Ecken, schwaches Ghosting von früheren Wischern, leicht unebene Schieferoberfläche, zwei sichtbare Wanddübel oben — physikalisch plausibel befestigt.
Kamera: frontal, Tafel füllt ca. 70 Prozent der Bildhöhe, leichte Perspektive nach unten vermeiden.
Licht: warmes Wolfram-Key von oben links, 2800K, dezenter Glanzstreifen über den Schiefer zeigt die Textur, weicher Schatten des Rahmens auf der Wand nach rechts unten — eine konsistente Schattenrichtung.
Typografie, in gebrochener weißer Kreide, exakt wie geschrieben:
„HEUTIGE SPECIALS“ in handgezogener Versalschrift oben
kleiner handgezogener Unterstrich nur unter der Überschrift
dann drei Gerichte mit Preis rechts:
„Wildpilz-Risotto········16“
„Ofenkabeljau············19“
„Sticky Toffee Pudding····8“
Details: wechselnder Strichdruck, leicht ungerade Zeilen, kleine Kreidesplitter, keine perfekte Gleichmäßigkeit der Buchstaben.
Constraints: kein weiterer Text, keine Kreide-Blumen, keine Smileys, keine Euro-Zeichen-Grafiken, keine stockgleiche „Chalkboard-Font“-Optik. Jeder Preis und jedes Gericht genau einmal und korrekt geschrieben. Rahmen und Halterung müssen halten können.
Stil: echtes Foto, natürliche Unvollkommenheit, sichtbare Kreidetextur, kein Übersättigen der Ziegel.

YouTube-Thumbnails

Offizielle Spec: 3840×2160 bei 16:9, unter 2 MB mobil. YouTube empfiehlt die Drittel-Regel.

8. Tutorial-Thumbnail

Slop: YouTube-Thumbnail über KI mit überraschter Person

Slop

Überladenes KI-Thumbnail mit Roboter, Icons und Pfeilen

Optimiert

Klares Tutorial-Thumbnail mit Screen-Glow und drei Textzeilen
Dasselbe Modell — nur der Prompt unterscheidet sich.
Prompt
Erstelle ein 16:9-YouTube-Thumbnail für ein Software-Tutorial, 3840x2160.
Zweck: muss als 320x180-Pixel-Vorschau auf dem Handy lesbar sein — jedes Element überlebt eine 8x-Verkleinerung. Ein Gefühl in unter einer Sekunde: Überraschung + Erfolg.
Komposition: Person im rechten Drittel (Drittel-Regel), Textblock fest auf den linken zwei Dritteln. Safe Zone: nichts Wichtiges in den unteren 15 Prozent rechts (Dauerstempel) und nichts in den oberen 8 Prozent (YouTube-UI).
Motiv: Person Mitte dreißig, Oberkörper, echter überraschter Ausdruck (kein Fake-Stock-Lächeln), Blick leicht nach unten auf einen aufgeklappten Laptop, dessen Screen Licht nach oben ins Gesicht wirft. Gesicht vollständig sichtbar, keine Hand vor dem Mund.
Licht: starkes Screen-Glow von unten als Key, 6500K; warmes Rim von hinten links trennt Haar und Schulter vom Hintergrund; Hintergrund bleibt dunkel und ruhig.
Typografie, exakt einmal: „ES HAT WIRKLICH GEKLAPPT“ in schwerer kondensierter Versalschrift, drei kurze gestapelte Zeilen links, Gelb #FFD400 mit kräftigem dunklem Outline — Buchstaben so groß, dass sie bei 320px Breite noch lesbar sind.
Farbe: 60 Prozent Navy-Hintergrund #0B1B33, 30 Prozent Person/Haut, 10 Prozent gelbe Schrift.
Constraints: kein zweites Textfeld, keine Logos, keine Rahmen, keine Pfeile, keine roten Kreise, kein „AI“-Badge, kein Lens Flare. Anatomie und Laptop-Scharnier physikalisch plausibel. Text korrekt geschrieben.

9. Listicle-Thumbnail

Slop: Thumbnail für ein Top-10-Video

Slop

Überladenes Top-10-Thumbnail mit Icons, Face und Checklisten

Optimiert

Klares Ranking-Thumbnail mit großer 10 und einem Produkt
Dasselbe Modell — nur der Prompt unterscheidet sich.
Prompt
Erstelle ein 16:9-YouTube-Thumbnail für ein Ranking-Video, 3840x2160.
Zweck: konkurriert in einer vollen Sidebar — eine Zahl und ein Objekt müssen in 0,5 Sekunden sitzen, auch bei 168px Breite.
Komposition: Zifferblock links 40 Prozent, Produkt rechts 50 Prozent, dazwischen klarer Leerraum. Safe Zone unten rechts frei für den Dauerstempel.
Motiv: ein einzelner mattschwarzer Over-Ear-Kopfhörer, leicht angewinkelt, realistisch schwebend mit weichem Kontaktschatten unter dem Bügel — kein zweites Produkt, kein Stand.
Licht: großes weiches Key von oben links, tiefe Schattenseite behalten, dezentes Cyan-Rim #00E5FF nur am rechten Bügelrand; ein kontrolliertes Spekular auf dem Headband.
Typografie, exakt zwei Elemente: „10“ extrem groß, schwere Versalschrift, Off-White, füllt fast die linke Fläche. Darunter deutlich kleiner, Tracking eng: „GETESTET“.
Farbe: 60 Prozent ruhiger Anthrazit-Verlauf #1A1C1F → #0E1012, 30 Prozent Produkt, 10 Prozent Cyan nur als Rim.
Constraints: keine Gesichter, keine Pfeile, keine Logos, keine Sternbursts, kein „TOP“, keine zusätzlichen Zahlen. Beide Texte einmal und korrekt. Kopfhörer-Bügel und Ohrmuscheln müssen als funktionierendes Objekt lesbar sein.

10. Face-led Vlog-Thumbnail

Slop: Vlog-Thumbnail mit meinem Gesicht

Slop

Überladenes Vlog-Thumbnail mit Checkliste, Pfeil und vielen Textzeilen

Optimiert

Klares Face-led Thumbnail mit drei Worten und Rim-Licht
Dasselbe Modell — nur der Prompt unterscheidet sich.
Prompt
Erstelle ein 16:9-YouTube-Thumbnail mit starkem Einzelgesicht, 3840x2160.
Zweck: persönlichkeitsgeführter Kanal — das Gesicht ist die Marke. Ausdruck und drei Worte müssen bei Handy-Vorschau sofort lesbar sein.
Komposition: Gesicht rechts, Crop von der Brustmitte, Augen auf der oberen Drittellinie. Linke Hälfte nur für den Textblock. Safe Zone unten rechts leer.
Motiv: Person, direkter Blick in die Kamera, klar lesbarer Ausdruck echter Ungläubigkeit (Mund leicht offen, Augenbrauen hoch), Haut mit sichtbarer Textur — kein plastic skin.
Licht: helles weiches Key von vorne links auf Augenhöhe; warmes orangenes Rim #FF7A1F von hinten rechts trennt Schulter und Haar vom Hintergrund; kein zweites farbiges Fill.
Typografie, exakt einmal: „ICH LAG FALSCH“ in fetter Versalschrift, drei gestapelte Zeilen links, Off-White mit dezentem dunklem Schatten nur zur Trennung vom Hintergrund.
Farbe: 60 Prozent tiefer Teal-Hintergrund #0F2A2E (kein Lila-Gradient-Klischee), 30 Prozent Haut und Kleidung, 10 Prozent orangenes Rim.
Constraints: beide Augen scharf und frei. Keine Sonnenbrille, keine Hände im Frame, keine Logos, keine Pfeile, kein zweites Textfeld. Anatomie plausibel, Ohren und Haare nicht verschmolzen. Text korrekt geschrieben.

Social Ads

Meta-Feed aktuell oft 4:5 bei 1440×1800. Primary Text eher 50–150 Zeichen.

11. Product-Launch-Ad

Slop: Instagram-Ad für ein Hautpflegeprodukt

Slop

Überladene Skincare-Ad mit Model, Icons und CTA-Button

Optimiert

Minimale Product-Ad mit einer Flasche und einer Tagline
Dasselbe Modell — nur der Prompt unterscheidet sich.
Prompt
Erstelle eine 4:5-Social-Feed-Anzeige (1440x1800) für eine minimalistische Hautpflegemarke.
Zweck: Awareness-Ad für kalte Audience — Premium in unter zwei Sekunden Scrollzeit, ohne zu schreien.
Szene: eine einzelne 30-ml-Serumflasche aus mattiertem Glas mit mattschwarzem Pipettendeckel, stehend auf einem blassen Travertin-Sims vor ruhigem warmem Hintergrund.
Kamera: leichte Dreiviertel-Ansicht, Flasche im unteren rechten Drittel, Silhouette klar, Deckelkante scharf.
Licht: weiches gerichtetes Tageslicht von links in flachem Winkel, 5200K, langer weicher Schatten nach rechts, ein kontrolliertes Highlight die Flaschenkante hinunter — eine Schattenrichtung.
Komposition: obere linke 40 Prozent bewusst leer für Typografie; unterer Rand und Ecken frei von UI-Overlap-Gefühl.
Typografie, exakt einmal: „Weniger, aber besser.“ in leichter Serif, oben links, warmes Anthrazit #2C2825. Kein weiterer Copy.
Farbe: 60 Prozent warmer Sand #E8DCCB, 30 Prozent Travertin, 10 Prozent tiefer Ton #8A5A44 nur als dezenter Sims-Akzent — nicht auf der Schrift.
Constraints: kein Model, keine Hände, keine Wasserspritzer, keine Inhaltsstoff-Bubbles, keine Badges, keine Sternbursts, kein Markenlogo, kein Reflection-Floor. Flasche und Pipette müssen als funktionierendes Objekt wirken. Tagline korrekt geschrieben.
Stil: echtes Commercial-Foto, matte Materialien, kein Hochglanz-HDR.

12. Sale-Promo-Ad

Slop: Sale-Ad mit 50 % Rabatt

Slop

Überladene Sale-Ad mit Model, Icons und Shop-Now-Button

Optimiert

Reine Typo-Sale-Ad mit 50 % Rabatt auf Schwarz
Dasselbe Modell — nur der Prompt unterscheidet sich.
Prompt
Erstelle eine 4:5-Social-Feed-Sale-Anzeige (1440x1800) für eine Fashion-Marke — rein grafisch, keine Fotografie.
Zweck: Retargeting für warme Audiences. Der Rabatt ist das einzige Hero-Element; alles andere ist Lärm.
Komposition: „50 % RABATT“ zentriert in den oberen zwei Dritteln, maximal groß. Darunter eine Unterzeile. Gleichmäßige Ränder mindestens 8 Prozent der kurzen Seite. Kein zentriertes „Design-Chaos“.
Typografie, exakt zwei Elemente:


„50 % RABATT“ in sehr schwerer kondensierter Versalschrift, Off-White, zentriert, enges Tracking.


Darunter deutlich kleiner Regular: „Alles. Endet Sonntag.“
Farbe: 60 Prozent Off-Black #101010, 30 Prozent Off-White-Schrift, 10 Prozent Säuregrün #C8FF00 ausschließlich auf dem Prozentzeichen — sonst nirgends.
Details: flacher Vollton-Hintergrund, keine Verläufe, keine Texturen, keine Schlagschatten hinter der Schrift.
Constraints: keine Produkte, keine Models, kein Konfetti, keine Sternbursts, keine Blitze, keine Countdown-Ringe, keine „SALE“-Sticker zusätzlich. Beide Texte einmal, korrekt geschrieben, Baseline gerade.

13. Testimonial-Ad

Slop: Kundenstimmen-Ad

Slop

Überladene Testimonial-Ad mit Model, Sternen und Trust-Icons

Optimiert

Typografische Testimonial-Ad mit Zitat und Attribution
Dasselbe Modell — nur der Prompt unterscheidet sich.
Prompt
Erstelle eine 4:5-Social-Feed-Testimonial-Anzeige (1440x1800), rein typografisch.
Zweck: Social-Proof-Ad — das Zitat ist der Hero und soll wie eine echte Bewertung wirken, nicht wie Werbe-Copy.
Szene: ruhiger Einfarb-Grund mit sehr subtiler Papierkörnung, keine Fotografie, keine Illustration.
Komposition: Zitat in den mittleren 55–60 Prozent der Fläche, Attribution darunter mit klarer Luft. Ränder an allen vier Seiten mindestens 10 Prozent — großzügig, nicht gequetscht.
Typografie, exakt zwei Elemente:


„Danach habe ich nicht weitergesucht.“ in medium-weight Serif, groß, zentriert über drei Zeilen, tiefe Tinte #1C1A17.


Darunter Kapitälchen: „Sarah K., verifizierte Käuferin“.
Zwischen beiden eine kurze horizontale Linie in gedämpftem Gold #B79355 — nur als Divider, keine Verzierung.
Farbe: 60 Prozent warmes Off-White #F7F3EC, 30 Prozent Tinte, 10 Prozent Gold nur auf der Linie.
Constraints: keine Stern-Icons, keine riesigen Anführungszeichen-Grafiken, keine Produktbilder, keine Logos, kein Avatar-Foto, kein „4,9/5“. Beide Texte einmal, korrekt geschrieben, gleichmäßiges Letterspacing.

Packaging und Produkt

14. Kaffeebeutel-Packaging

Slop: Kaffee-Verpackungsdesign

Slop

Überladenes Kaffeebeutel-Mockup mit Illustrationen, Icons und QR-Code

Optimiert

Schlichter Kraft-Beutel mit ORBIT und Herkunftsangabe
Dasselbe Modell — nur der Prompt unterscheidet sich.
Prompt
Erstelle ein fotorealistisches stehendes Kaffeebeutel-Mockup.
Zweck: Regalpräsenz im Specialty-Grocery, muss auf Armlänge premium wirken und auf halbem Meter lesbar sein.
Szene: matter Kraft-Folienbeutel auf heller Betonfläche vor weichem neutralem Hintergrund.
Licht: weiches großes Key von oben links, sanfter Verlauf über die Beutelfläche, weicher Kontaktschatten am Fuß, keine harten Speculars auf der Mattoberfläche.
Komposition: Beutel zentriert, mittlere 60 Prozent vertikal, symmetrischer Ausschnitt.
Typografie auf dem Beutel, exakt wie geschrieben:
„ORBIT“ in fetter gesperrter Versalschrift im oberen Drittel
„Single Origin“ in Kapitälchen darunter
„Äthiopien Guji  250g“ in kleiner Schrift nahe der Basis
Farbe: 60 Prozent natürliches Kraft #C9A87C, 30 Prozent tiefer Anthrazit-Druck #22201D, 10 Prozent Brandorange #D45D2E auf einer dünnen Linie.
Constraints: gesamter Beuteltext genau einmal, korrekt geschrieben, korrekt der Beutelkrümmung folgend. Keine Barcodes, keine Zertifikats-Badges, kein weiterer Text.
Stil: echtes Foto, kommerzielle Packaging-Fotografie.

15. Kosmetik-Produktfoto

Slop: Produktfoto einer Kosmetikflasche

Slop

Lifestyle-Kosmetikfoto mit Props, Tropfen und Label-Text

Optimiert

Cleanes Hero-Listing-Foto auf Sweep ohne Props
Dasselbe Modell — nur der Prompt unterscheidet sich.
Prompt
Erstelle ein fotorealistisches Hero-Produktfoto für ein E-Commerce-Listing, quadratisches Framing das auf 1:1 gecroppt werden kann.
Zweck: primäres Listing-Bild — Form, Volumen und Finish der Flasche ohne Ambivalenz, vergleichbar mit Amazon/Shopify-Hero-Standards.
Szene: nahtloser blassgrauer Sweep #D8D8D6, Produkt zentriert und aufrecht, kein Horizontbruch.
Motiv: 30-ml-Pipettenflasche aus mattiertem Glas, mattschwarzer Deckel mit sichtbarer Pipettenkappe, leichte Dreiviertel-Drehung nach links (ca. 15–20 Grad), Silhouette klar.
Licht: großes Softbox-Key von oben links (ca. 45 Grad), weißer Bounce rechts hebt die Schattenseite, ein kontrolliertes Spekular nur entlang der linken Glaskante; weicher Kontakt-Schatten unter dem Flaschenfuß — eine Lichtlogik.
Komposition: Produkt nimmt ca. 70 Prozent der Bildhöhe ein, zentriert, gleichmäßiger Rand rundum, kein Anschnitt von Deckel oder Fuß.
Constraints: keine Props, keine Wassertropfen, keine Blütenblätter, keine Inhaltsstoffe verstreut, kein Text, keine Logos, kein Spiegelboden, kein Farbverlauf-Hintergrund. Deckelgewinde und Pipette müssen als funktionierende Teile lesbar sein. Gesamtes Produkt scharf (Focus-Stacking).
Stil: echtes Commercial-Produktfoto, matte Materialien, neutrale Farbtreue, kein Beauty-Glow.

Schilder und Print

16. Messestand-Banner

Slop: Messestand-Banner für eine Tech-Firma

Slop

Kompletter Messestand mit vielen Botschaften und Icons

Optimiert

Schlichtes Roll-up mit einer Headline und Standnummer
Dasselbe Modell — nur der Prompt unterscheidet sich.
Prompt
Erstelle ein Roll-up-Messestand-Banner-Design, 850x2000mm Hochformat, 150dpi, 30mm Beschnitt.

Zweck: in einer vollen Messehalle aus sechs Metern in unter drei Sekunden lesbar — eine Botschaft, nichts anderes.
Komposition (von oben):
• obere 40 Prozent auf Augenhöhe: Headline
• Mitte: eine kurze Standzeile
• untere 35 Prozent bewusst leer (Fußgänger verdecken diesen Bereich)
Typografie, exakt zwei Elemente:
1) „IN TAGEN VERSCHICKEN, NICHT IN QUARTALEN“ in schwerer kondensierter Versalschrift über genau drei Zeilen, Off-White, Versalhöhe mindestens 60mm.
2) Darunter Medium-Gewicht: „Stand D42“.
Farbe: 60 Prozent Indigo #1B1F3B, 30 Prozent Off-White-Schrift, 10 Prozent Lime #B8FF3C nur als eine Unterstreichungslinie unter der Headline.
Details: flache Vollton-Fläche, keine Fotografie, optional eine Diagonaltextur bei maximal 5 Prozent Deckkraft nur im Hintergrund — kein Muster hinter der Schrift.
Constraints: nichts Kritisches unter 600mm vom Fuß. Keine Logos, keine Icons, keine QR-Codes, keine URLs, keine zweiten Headlines. Beide Texte einmal, korrekt geschrieben, gerade Baseline. Muss als Druckfläche wirken, nicht als 3D-Mockup mit Personen davor.

17. Visitenkarte

Slop: Visitenkarten-Design

Slop

Überladene Visitenkarte mit Icons, Slogans und viel Text

Optimiert

Zurückhaltende Meridian-Visitenkarte mit drei Zeilen
Dasselbe Modell — nur der Prompt unterscheidet sich.
Prompt
Erstelle ein fotorealistisches Visitenkarten-Mockup, nur Vorderseite.

Zweck: Architekturbüro — soll Zurückhaltung und Handwerk signalisieren.
Szene: eine einzelne Karte leicht angewinkelt auf einer rohen Betonfläche, direkt von oben fotografiert.
Licht: weiches, gleichmäßiges Tageslicht von links (Kameraseite), sehr dezenter Schatten unter der Kartenkante, der die Kartendicke sichtbar macht.
Typografie, exakt wie geschrieben und linksbündig in der unteren Hälfte:
„MERIDIAN“ in gesperrter Versalschrift oben im Textblock
„Architektur & Interieur“ in kleiner Kursiv darunter
„hello@meridian.studio“ in kleiner Regular an der Basis
Farbe: ungestrichenes warmweißes Papier #F4F1EA, eine einzige Tinte in tiefem Anthrazit #2B2A28. Keine Akzentfarbe.
Details: sichtbare ungestrichene Papiertextur, leicht unregelmäßige Büttenkante, 420 g/m² Stärke an der Ecke erkennbar.
Constraints: kein Logo-Mark, keine Telefonnummer, keine Adresse, kein QR-Code, kein weiterer Text. Jede Zeile genau einmal rendern.
Stil: echtes Foto, Top-down-Produktfotografie.

18. Tri-Fold-Broschüren-Cover

Slop: Broschüren-Cover für ein Wellness-Unternehmen

Slop

Überladenes Wellness-Cover mit Icons und vielen Textzeilen

Optimiert

Schlichtes Cover mit Duotone-Händen und zwei Textzeilen
Dasselbe Modell — nur der Prompt unterscheidet sich.
Prompt
Erstelle eine Tri-Fold-Broschüren-Cover-Fläche, 99x210mm.

Zweck: liegt an der Klinik-Rezeption, muss den Aufschlag auf den ersten Blick verdienen.
Szene: Flat Design mit einem einzelnen Duotone-Fotoelement in der unteren Hälfte.
Motiv: ein Paar Hände offen im Schoß ruhend, beschnitten ohne Gesicht, als warmes Duotone.
Komposition: Schrift in den oberen 45 Prozent, Bild blutet an der Unterkante aus, klare horizontale Teilung.
Typografie: „Raum zum Atmen.“ in leichter Serif, Satzschreibweise, oben links. Kapitälchen darunter: „Sechs-Wochen-Programm“.
Farbe: 60 Prozent warmes Off-White #F6F2EC, 30 Prozent Duotone-Bild in Salbei #7C8B72, 10 Prozent tiefer Wald #2F3D2C auf der Schrift.
Constraints: kein Clipart, keine Icons, keine Logos, keine lächelnden Stockfoto-Gesichter, keine Verläufe. Jedes Textelement einmal.
Format: 99x210mm bei 300dpi mit 3mm Beschnitt, Sicherheitsabstand 3mm innerhalb Trim.

Retail und Promotion

19. Instagram-Carousel-Cover

Slop: Carousel-Cover über Marketing-Tipps

Slop

Überladenes Carousel-Cover mit Desk-Foto, Badges und vielen Textblöcken

Optimiert

Schlichtes Carousel-Cover mit einer Headline und Wischen-Hinweis
Dasselbe Modell — nur der Prompt unterscheidet sich.
Prompt
Erstelle eine 4:5-Instagram-Carousel-Cover-Slide.
Zweck: erste Slide eines Bildungs-Carousels, muss den Scroll stoppen und einen konkreten Payoff versprechen.
Szene: Flat Design auf solidem warmem Grund mit subtiler Papierkörnung, keine Fotografie.
Komposition: Headline in den mittleren 55 Prozent über drei Zeilen, kleiner Swipe-Hinweis unten, breite gleichmäßige Ränder.
Typografie: „5 Fehler, die deine Open Rates killen“ in fetter Serif, Satzschreibweise, zentriert. Unten in Kapitälchen: „Wischen“.
Farbe: 60 Prozent warmes Creme #F4EEE2, 30 Prozent tiefe Tinte #1B1815, 10 Prozent Brandorange #C4541F nur als Linie unter der Headline.
Constraints: genau zwei Textelemente, jeweils einmal und korrekt geschrieben. Keine Icons, keine Pfeile, keine Fotos, keine Logos, kein Profilbild.
Format: 1440x1800.

20. Event-Flyer

Slop: Flyer für ein Food-Festival

Slop

Überladener Food-Festival-Flyer mit Icons, Badges und Dom-Kulisse

Optimiert

Klarer Stadtmarkt-Flyer mit Duotone und drei Textzeilen
Dasselbe Modell — nur der Prompt unterscheidet sich.
Prompt
Erstelle einen druckfertigen A5-Straßenflyer für ein Wochenend-Food-Festival in Deutschland.
Zweck: wird in der Fußgängerzone verteilt — in fünf Sekunden klar was/wann/wo, soll behalten statt weggeworfen werden.
Szene: Flat Design, kein Fotorealismus-Chaos. Obere Hälfte: ein einzelnes Duotone-Fotoelement, untere Hälfte: ruhige Typo-Fläche.
Motiv: Overhead-Crop von zwei Händen, die ein in braunes Packpapier gewickeltes Street-Food-Paket über eine Holztresen-Kante reichen. Keine Gesichter, keine Logos auf dem Papier, Dampf leicht sichtbar. Das Foto als warmes Duotone gerendert.
Licht im Fotoelement: Spätnachmittag, warmes Seitenlicht von rechts, weiche Schatten der Hände auf dem Tresen — eine Schattenrichtung.
Komposition: Bild blutet an der Oberkante über die oberen 48 Prozent. Darunter eine klare horizontale Teilung. Textblock in der unteren Hälfte, linksbündig, großzügige Ränder (mindestens 10 mm innen). Unteres Fünftel bewusst leer.
Typografie, exakt drei Elemente, korrekt geschrieben:


„STADTMARKT“ in schwerer kondensierter Versalschrift, dunkel, groß — Versalhöhe dominant.


Darunter Regular: „Samstag & Sonntag · 11–20 Uhr“


Eine Zeile kleiner: „Markthalle Neun · Berlin“
Farbe: 60 Prozent warmes Off-White Papier #F7F1E6, 30 Prozent Duotone in tiefem Pflaume #4A2545, 10 Prozent Säuregelb #E8DB2F nur als eine dünne horizontale Akzentlinie zwischen Headline und Datum — sonst nirgends.
Papier: ungestrichener Druckstock, leichte Körnung sichtbar, flache Farbtrennung wie Siebdruck-meets-Foto.
Constraints: genau drei Textzeilen, jeweils einmal. Keine Preise, keine Vendor-Logos, kein QR-Code, kein Clipart, keine Food-Icons, keine Flaggen, keine Menschenmengen, keine Stockfoto-Lächelgesichter. Hände und Paket müssen physikalisch plausibel greifen und halten.
Format: 148x210mm bei 300dpi mit 3mm Beschnitt, CMYK-sichere Farben.

21. Produktetikett

Slop: Etikettendesign für eine Hot-Sauce-Flasche

Slop

Überladenes Hot-Sauce-Etikett mit Splash, Icons und viel Text

Optimiert

Schlichtes Ember-Etikett mit drei Zeilen auf der Flasche
Dasselbe Modell — nur der Prompt unterscheidet sich.
Prompt
Erstelle eine fotorealistische Hot-Sauce-Flasche mit umwickeltem Papieretikett.
Zweck: Regalprodukt im Specialty-Food-Store, artisanal statt Massenmarkt.
Szene: klare Glasflasche auf dunklem Schiefer vor weichem dunklem Hintergrund.
Licht: einzelnes hartes Key von rechts erzeugt eine helle Spekularlinie die Glaskante hinunter, tiefer Schatten links, dezentes Rim von hinten definiert die Silhouette.
Typografie auf dem Etikett, exakt wie geschrieben:
„EMBER“ in fetter kondensierter Versalschrift über die Mitte
„Geräucherter Habanero“ in kleiner Kursiv darunter
„150ml“ in kleiner Schrift an der Basis
Details: ungestrichenes Papieretikett mit sichtbarer Fasertextur, leicht unperfekte Applikation mit einer weichen Falte.
Farbe: 60 Prozent tiefer Anthrazit in der Szene, 30 Prozent warmes Creme-Etikett #EFE3CE, 10 Prozent Brandrot #A32C1E auf der Schrift.
Constraints: gesamter Etikettentext genau einmal, korrekt geschrieben, natürlich der Flaschenkrümmung folgend. Kein Barcode, kein Nährwertpanel, keine Zertifikats-Badges.
Stil: echtes Foto, dramatisches Produktlicht.

22. Gutscheinkarte

Slop: Gutschein-Design für einen Salon

Slop

Überladener Salon-Gutschein mit Blattschatten und vielen Textblöcken

Optimiert

Schlichte Gutscheinkarte mit drei Zeilen auf Marmor
Dasselbe Modell — nur der Prompt unterscheidet sich.
Prompt
Erstelle eine fotorealistische gedruckte Gutscheinkarte, flach liegend.
Zweck: wird an der Rezeption eines Friseursalons verkauft, soll wie ein durchdachtes Geschenk wirken statt wie ein Beleg.
Szene: einzelne Karte auf blassem Marmor, von oben fotografiert.
Licht: weiches gleichmäßiges Tageslicht von links, sehr dezenter Schatten entlang der Kartenkante zeigt die Stärke.
Typografie, exakt wie geschrieben und zentriert:
„GUTSCHEIN“ in kleiner gesperrter Versalschrift oben
„Fünfzig Euro“ in großer leichter Serif in der Mitte
„Gültig zwölf Monate ab Kauf“ in sehr kleiner Schrift an der Basis
Farbe: 60 Prozent weiches Blush-Papier #EDDCD6, 30 Prozent tiefer Anthrazit #262220, 10 Prozent gebürstetes Messingfolie #B08D57 nur auf der oberen Zeile.
Details: 350g/m² ungestrichenes Papier mit sichtbarer Textur, Folienlinie fängt das Licht leicht.
Constraints: nur drei Textelemente, jeweils einmal und korrekt geschrieben. Kein Salon-Logo, kein Barcode, kein AGB-Absatz, keine Verzierungen.
Stil: echtes Foto, Top-down, weiches natürliches Licht.

Editing-Layer: Slop reparieren

Oft günstiger als neu zu würfeln. Die Prompts nutzen [angehängtes Bild], weil sie auf einem Upload arbeiten.

23. Plastik-Look entfernen

Repair
Bearbeite [angehängtes Bild] und entferne die künstliche Glätte.
Änderungen: realistische Hauttextur wiederherstellen inklusive sichtbarer Poren und feiner Linien. Natürlichen Mikrokontrast in Stoffwebung und Oberflächenmaterialien zurückbringen. Subtile Asymmetrie im Licht hinzufügen, sodass eine Seite stärker abfällt als die andere.
Constraints: Komposition, Ausschnitt, Pose und Farbpalette exakt beibehalten. Identität, Proportionen und Ausdruck der Person nicht ändern.

24. Übersättigung korrigieren

Repair
Colorgrade [angehängtes Bild] auf professionellen Standard.
Änderungen: globale Sättigung um etwa 20 Prozent reduzieren, Highlights vom Clipping zurückholen, Schwarztöne leicht anheben für filmischen Rolloff, und den Schatten einen dezenten kühlen Stich geben, während Hauttöne neutral bleiben.
Constraints: Komposition, Inhalt und Schärfe nicht verändern. Alle Farben im CMYK-druckbaren Gamut halten. Keinen starken Orange-Teal-Split einführen.

25. Generierten Text durch Freiraum ersetzen

Repair
Bearbeite [angehängtes Bild] und entferne allen Text.
Änderungen: jeden gerenderten Text entfernen und den Raum natürlich mit der umgebenden Oberfläche, Textur und Beleuchtung füllen.
Constraints: Komposition, Motiv, Licht und Farbe exakt beibehalten. Die freigeräumten Flächen sauber und gleichmäßig lassen, damit später echte Schrift darüber gesetzt werden kann.
Wichtigster Edit:

Bild ohne Text generieren oder Text entfernen, dann echte Schrift in Figma, Canva oder InDesign setzen. Das löst das eine Problem, das das Modell strukturell nicht kann.

26. Markenfarben korrekt setzen

Repair
Bearbeite [angehängtes Bild] und passe die Markenfarben exakt an.
Änderungen: primäre Akzentfarbe auf #C05B3D und sekundäre auf #2F3D2C verschieben, nur auf Elemente anwenden, die aktuell Akzentfarbe tragen.
Constraints: alle anderen Farben, Komposition, Licht und Motiv unverändert. Hauttöne und neutrale Grautöne nicht verschieben.

27. Flache Komposition retten

Repair
Bearbeite [angehängtes Bild] und verbessere die Lichtrichtung.
Änderungen: neu beleuchten, sodass das Key-Licht von links bei etwa 45 Grad kommt, sichtbarer Abfall und eine definierte Schattenseite entstehen. Dezentes Rim-Licht an der gegenüberliegenden Kante hinzufügen, um das Motiv vom Hintergrund zu trennen.
Constraints: Motiv, Pose, Komposition, Ausschnitt und Farbpalette identisch lassen. Hintergrundinhalt nicht ändern.

28. Physikalisch unplausible Details korrigieren

Repair
Prüfe [angehängtes Bild] und korrigiere physikalisch unplausible Details.
Änderungen: Objekte reparieren, die so nicht funktionieren könnten — inklusive schlaffer oder schwebender Riemen, Hardware an nichts befestigt, Schatten in inkonsistenten Richtungen und Reflexionen, die nicht zur Szene passen.
Constraints: Gesamtkomposition, Motiv, Lichtrichtung und Farbpalette unverändert. Nur die minimal nötigen Korrekturen für physikalische Plausibilität.

Ein paar Specs, die man direkt in den Prompt schreiben kann

Ein Punkt, den ich lange unterschätzt habe: Ein Bild kann gestalterisch gut sein und trotzdem als Marketing-Asset kaum funktionieren, wenn das Format nicht von Anfang an mitgedacht wurde.

Ein YouTube-Thumbnail hat andere Anforderungen als ein Reel. Ein A2-Poster wiederum braucht nicht einfach nur „mehr Auflösung“, sondern muss als Printprodukt gedacht werden.

Deshalb gebe ich Format und Einsatzzweck inzwischen möglichst direkt im Prompt mit.

AssetSpecQuelle
YouTube-Thumbnail3840×2160, 16:9, unter 2 MB mobilYouTube Help
YouTube Shorts2160×3840, 9:16YouTube Help
Meta / Instagram Feed1440×1800, 4:5, 30 MB max.Meta Ads Guide
Stories und Reels9:16Meta
Print-Auflösung300 dpiPrint-Konvention
Standard-Beschnitt3 mm / 0,125 in pro KantePrint-Konvention
Poster A2420×594 mmISO 216
Textkontrast Minimum4,5:1 normal, 3:1 bei großer SchriftWCAG 2.2

Wichtig ist dabei: Nicht jedes Bildmodell hält Pixelmaße, DPI oder Beschnitt exakt ein. Ich würde solche Angaben deshalb eher als Teil des Briefings verstehen und das finale Asset anschließend trotzdem im richtigen Tool auf das tatsächliche Ausgabeformat bringen.

Noch wichtiger als die reine Auflösung ist oft das Seitenverhältnis und die dafür passende Komposition.

Bei einem 9:16-Reel brauche ich beispielsweise eine komplett andere Bildaufteilung als bei einem 16:9-Thumbnail. Das sollte das Modell wissen, bevor es die Szene baut — nicht erst beim späteren Croppen.

Bei Licht lohnt es sich, konkreter zu werden

„Beautiful lighting“ klingt nach einer Anweisung, lässt dem Modell aber fast alle Entscheidungen offen.

Ich versuche deshalb lieber, eine Licht-Situation zu beschreiben, die es auch in einem echten Shooting geben könnte.

Dafür muss man kein Fotograf sein. Ein paar grundlegende Setups reichen schon:

SetupWas passiert dabei?Gut geeignet für
Three-pointKey Light, Fill Light und Backlight sorgen für klare TrennungCorporate, Interviews, Commercial
RembrandtTypisches Lichtdreieck auf der Schattenseite des GesichtsCharaktervolle, dramatischere Porträts
ButterflyFrontales Licht erzeugt einen symmetrischen Schatten unter der NaseBeauty, Glamour
LoopLeichter Nasenschatten fällt seitlich auf die WangeKlassische Porträts
SplitEine Gesichtshälfte wird beleuchtet, die andere bleibt im SchattenHärtere, dramatische Looks
Rim / KickerLichtkante trennt das Motiv vom HintergrundProdukte, Personen, Thumbnails
Softbox + BounceWeiches, kontrolliertes Licht mit gleichmäßigen ÜbergängenProdukte, Packaging
Backlight 45°Licht kommt schräg von hinten und betont Transparenz und TexturenFood, Drinks

Man muss diese Begriffe nicht zwangsläufig verwenden. Oft funktioniert eine Beschreibung in normaler Sprache genauso gut oder sogar besser.

Statt:

„beautiful golden hour lighting“

würde ich zum Beispiel eher schreiben:

„Tief stehende Abendsonne von rechts hinten, warmes natürliches Licht, lange weiche Schatten, keine zusätzliche Studiobeleuchtung.“

Auch Golden Hour und Blue Hour lassen sich konkreter fassen. Als grobe Orientierung liegt die Golden Hour bei einem Sonnenstand von ungefähr +6 bis −4 Grad, die Blue Hour etwa zwischen −4 und −6 Grad.

Entscheidend ist aber weniger die exakte Zahl als die Frage: Wie soll das Licht in dieser konkreten Szene tatsächlich aussehen?

Die Modelle wollen nicht alle dasselbe

Eine Sache macht das Ganze etwas komplizierter: Es gibt nicht den einen perfekten Prompt-Stil für alle Bildmodelle.

Die Anbieter empfehlen teilweise sogar ziemlich unterschiedliche Vorgehensweisen.

FrageOpenAIGoogleMidjourneyFLUXIdeogram
Prompt-LängeStrukturiert und detailliert„Be hyper-specific“Kurz und einfach funktioniert oft besserKurz starten und nur relevante Details ergänzenUnter ca. 150 Wörter
Negative PromptsIm normalen Prompt formulierenLieber positiv beschreibenUnterstützt --noMeist nicht unterstütztLieber positiv beschreiben
Kamera-SpecsKönnen helfen, sind aber keine GarantieDokumentiertWeniger Fokus daraufKamera, Linse oder Filmstock können konkret angegeben werdenWeniger relevant
SchriftnamenBesser Eigenschaften beschreibenBesser Eigenschaften beschreibenBesser Eigenschaften beschreibenKonkrete Fonts derzeit nicht zuverlässig steuerbar

Das ist auch der Grund, warum ich nicht besonders viel von „dem perfekten Universal-Prompt“ halte.

Ein Prompt, der für FLUX optimiert wurde, muss bei Midjourney nicht automatisch genauso gut funktionieren. FLUX kann beispielsweise mit Angaben wie „Shot on Fujifilm X-T5, 35mm f/1.4“ sinnvoll umgehen. Bei anderen Modellen bringen solche Kameraangaben teilweise deutlich weniger.

Interessanter ist deshalb, die grundsätzlichen Entscheidungen im Prompt beizubehalten und die Formulierung an das jeweilige Modell anzupassen.

Eine Regel von Google finde ich dabei ziemlich universell brauchbar: Dinge, die man nicht haben möchte, wenn möglich als gewünschte Szene formulieren.

Also nicht nur:

„no cars“

sondern beispielsweise:

„an empty, deserted street with no signs of traffic.“

Damit beschreibe ich dem Modell ein Zielbild und nicht nur etwas, das es vermeiden soll.

Was bei mir den größten Unterschied macht

Wenn ich meine eigenen Prompts vergleiche, sind es selten die spektakulären Tricks, die ein Bild deutlich besser machen.

Meistens sind es ziemlich einfache Entscheidungen.

Licht konkret beschreiben. Woher kommt es? Ist es hart oder weich? Warm oder kühl? Natürlich oder künstlich?

Platz bewusst freihalten. Wenn später eine Headline links im Bild stehen soll, schreibe ich das direkt in den Prompt. Sonst setzt das Modell dort mit erstaunlicher Zuverlässigkeit irgendein wichtiges Objekt hin.

Text nicht erzwingen. Wenn die Typografie nicht selbst Teil des Motivs sein muss, generiere ich lieber das Bild und setze die Schrift anschließend.

Farben nicht einfach aufzählen. „Navy, Off-White und Gelb“ lässt offen, wo welche Farbe auftaucht. Besser ist beispielsweise: dunkelblauer Hintergrund, Off-White für die Typografie, Gelb ausschließlich für das zentrale Objekt.

Unperfektheit konkret beschreiben. „Make it realistic“ reicht meistens nicht. Sichtbare Poren, leichter Stoffabrieb, ein nicht ganz symmetrischer Bildaufbau, unregelmäßiger Lichtabfall oder kleine Gebrauchsspuren sind wesentlich konkreter.

Was dagegen erstaunlich wenig bringt:

Möglichst viele Qualitätsbegriffe wie „8K“, „ultra detailed“, „award-winning“ und „masterpiece“ hintereinanderzuschreiben
Einen Prompt immer länger zu machen, ohne tatsächlich neue visuelle Entscheidungen hinzuzufügen
Ausschließlich nach anatomischen Fehlern zu suchen und dabei Physik, Materialien und Objektbeziehungen zu ignorieren

Die Grundregel dahinter ist ziemlich simpel:

Mehr Wörter machen einen Prompt nicht automatisch besser. Mehr relevante Entscheidungen meistens schon.

Und was ist jetzt mit Typografie?

Hier würde ich trotz aller Fortschritte weiterhin pragmatisch bleiben.

Bildmodelle sind inzwischen wesentlich besser darin geworden, Text darzustellen. Das heißt aber noch nicht, dass ich ihnen die finale Typografie einer Anzeige, eines Posters oder eines Produkt-Packagings überlassen würde.

Wenn Schrift exakt sein muss, behandle ich sie als eigenen Arbeitsschritt:

Erst das Bild generieren, dann die Typografie sauber setzen.

Das hat noch einen zweiten Vorteil: Ich kann anschließend Schriftgröße, Laufweite, Zeilenumbrüche, Kontrast und Abstände verändern, ohne wegen einer kleinen Textkorrektur das komplette Motiv neu generieren zu müssen.

Häufige Fragen

Was ist mit „AI Slop“ eigentlich gemeint?

Merriam-Webster beschreibt damit digitale Inhalte geringer Qualität, die üblicherweise mithilfe von KI in größerer Menge produziert werden.

Für mich ist die praktischere Definition im Marketing etwas einfacher: Es sind KI-Inhalte, bei denen die Art Direction fehlt.

Das Motiv ist da, aber kaum jemand hat Entscheidungen zu Licht, Komposition, Marke, Materialität oder Einschränkungen getroffen. Das Ergebnis kann technisch beeindruckend sein und trotzdem austauschbar wirken.

Warum sehen meine Bilder künstlich aus, obwohl die Bildqualität eigentlich gut ist?

Oft liegt es gar nicht an Auflösung oder Detailgrad.

Ich würde zuerst Licht, Materialien und Physik überprüfen: Woher kommt das Licht? Passen die Schatten dazu? Haben Oberflächen eine glaubwürdige Textur? Sind Gegenstände logisch miteinander verbunden?

Ein Bild kann gestochen scharf sein und trotzdem komplett künstlich wirken.

Warum macht KI bei Text immer noch Fehler?

Weil ein Bildmodell Schrift nicht auf dieselbe Weise behandelt wie ein Design- oder Layoutprogramm.

Die Ergebnisse sind deutlich besser geworden, aber für exakte Marketing-Typografie würde ich mich nicht darauf verlassen. Wenn der Wortlaut stimmen muss, ist es meistens schneller und kontrollierbarer, die Schrift anschließend zu setzen.

Wie lang sollte ein guter Bild-Prompt sein?

Das hängt vom Modell ab.

Midjourney kommt häufig mit relativ kurzen Prompts gut zurecht. Google empfiehlt sehr konkrete Beschreibungen. Bei FLUX würde ich mit dem Wesentlichen anfangen und nur Details ergänzen, die das Ergebnis tatsächlich verändern. Ideogram empfiehlt eher kompakte Prompts.

Deshalb würde ich nicht auf Wortzahl optimieren.

Die bessere Frage ist:

Fehlt dem Modell noch eine Information, die für mein gewünschtes Bild wichtig ist?

Wenn nicht, muss der Prompt auch nicht länger werden.

Funktionieren Negative Prompts?

Das hängt ebenfalls vom Modell ab.

Midjourney bietet dafür beispielsweise --no. Bei anderen Modellen funktioniert es besser, die gewünschte Alternative positiv zu beschreiben.

Statt:

„Keine Autos auf der Straße.“

also eher:

„Eine vollständig leere Straße ohne Verkehr, parkende Fahrzeuge oder andere Verkehrsteilnehmer.“

Ich finde diese Variante ohnehin angenehmer, weil sie beschreibt, was ich sehen möchte — und nicht nur, was verschwinden soll.

Schadet es der Reichweite, wenn ich KI-Bilder verwende?

Nicht automatisch.

Plattformen reagieren vor allem auf massenhaft produzierte, repetitive oder wenig originelle Inhalte. YouTube spricht beispielsweise von „inauthentic content“ und nennt dabei auch generische oder wiederverwendete Templates.

Der relevante Unterschied ist deshalb weniger KI oder keine KI, sondern wie das Ergebnis entstanden ist und was man daraus macht.

Ein bewusst gestaltetes Motiv mit eigener Art Direction ist etwas anderes als 200 nahezu identische Bilder aus demselben Prompt zu generieren und automatisiert zu veröffentlichen.

Und genau deshalb lohnt es sich überhaupt, über bessere Prompts zu sprechen.

Der Ablauf

Hak ab, was du erledigt hast:

Deine 2-Minuten-Aufgabe

Welches Asset promptest du als Nächstes mit allen sieben Schichten?

Nimm ein Paar von oben, ersetze Marke und Zweck, schick ab. Ein Durchlauf mit Spec schlägt zehn Würfe ohne.

Dein nächster Schritt

Nimm heute einen Prompt und füll alle sieben Schichten — nicht nur das Motiv.

Solche praxisnahen Systeme schicke ich jede Woche per Newsletter — ein System, ein Tool, ein Prompt. Kurz, konkret, sofort anwendbar.

Passt dazu

Christopher Thanisch

Christopher Thanisch

Ich übersetze KI in brauchbare Systeme für den Arbeitsalltag — Systeme statt Hypes.