Das lernst du
Ich generiere inzwischen ziemlich viele Bilder mit KI. Und dabei fällt mir immer wieder dasselbe auf:
Wenn ein Bild nach KI aussieht, ist nicht unbedingt das Modell das Problem. Oft war einfach der Prompt zu dünn.
„Erstelle einen Flyer für meine Gartenparty.“
Damit weiß das Modell zwar, was es machen soll. Aber fast alles andere entscheidet es selbst: Wie sieht die Party aus? Wer soll sich angesprochen fühlen? Editorial oder Event-Plakat? Warmes Abendlicht oder knallige Sommerfarben? Perfekt inszeniert oder eher wie ein Schnappschuss? Wo ist Platz für Text?
Und genau an diesen Stellen entsteht häufig dieser typische KI-Look.
In diesem Guide geht es deshalb nicht darum, noch mehr Begriffe wie „8K“, „cinematic“ oder „masterpiece“ in einen Prompt zu packen. Sondern darum, ein Bild so zu beschreiben, wie man es auch einem Fotografen oder Designer briefen würde.
Dafür nutze ich sieben Schichten:
Subjekt, Zweck, Licht, Komposition, Typografie, Marke und Constraints.
Weiter unten findest du außerdem 22 konkrete Vorher-Nachher-Prompts für Marketing-Assets und sechs Repair-Prompts für Bilder, die schon fast funktionieren.
Alle Prompts sind auf Deutsch formuliert und können direkt übernommen werden. Maße, Hex-Codes und andere Specs habe ich bewusst konkret gelassen.
Das eigentliche Problem mit „AI Slop“
Der Begriff „AI Slop“ wird inzwischen für ziemlich vieles verwendet. Meistens sind damit KI-Inhalte gemeint, die massenhaft produziert wurden und irgendwie billig, generisch oder austauschbar wirken.
Bei Bildern erkennt man diesen Look meistens ziemlich schnell.
Alles ist ein bisschen zu perfekt. Das Licht ist dramatisch, obwohl es keinen Grund dafür gibt. Menschen sehen aus wie Models. Gegenstände stehen sauber arrangiert auf dem Tisch. Oberflächen glänzen. Die Komposition ist auffällig ausgewogen.
Genau diese Tendenz zu sehr sauberen, symmetrischen und geordneten Kompositionen wird inzwischen auch wissenschaftlich als ästhetischer Bias aktueller Bildgeneratoren diskutiert.
Das heißt aber nicht, dass man diesen Look einfach akzeptieren muss.
Ein großer Teil davon entsteht, weil wir dem Modell zu viele Entscheidungen überlassen.
Wenn ich schreibe:
„Flyer für meine Gartenparty am 25.09.2026“
muss das Modell selbst entscheiden, was eine Gartenparty visuell bedeutet. Also landet man schnell bei Lichterketten, perfekt gedeckten Tischen, warmem Sonnenuntergang, lachenden Menschen und irgendeiner dekorativen Serifenschrift.
Nicht unbedingt falsch. Aber eben auch nicht besonders eigenständig.
Deshalb versuche ich inzwischen, beim Prompten vier Dinge nicht mehr zu machen:
Gerade der letzte Punkt ist interessanter, als er zunächst klingt.
Der KI-Fehler, auf den kaum jemand achtet
Wenn Leute KI-Bilder prüfen, schauen sie meistens zuerst auf Hände.
Dann auf Zähne. Ohren. Augen. Vielleicht noch Text.
Das ist verständlich, weil genau diese Fehler jahrelang die offensichtlichsten Hinweise auf generierte Bilder waren.
Eine große CHI-Studie von Kamali et al. aus dem Jahr 2025 kommt allerdings zu einem interessanten Ergebnis: Menschen sagen zwar sehr häufig, dass sie auf anatomische Fehler achten. Eine der häufigsten tatsächlichen Fehlerklassen in KI-Bildern ist aber etwas anderes:
Dinge funktionieren einfach nicht.
Ein Gitarrengurt verschwindet plötzlich im Hemd.
Ein Stuhlbein erreicht den Boden nicht.
Eine Halterung hält nichts.
Ein Gegenstand ist mit einem anderen verbunden, obwohl diese Verbindung physikalisch keinen Sinn ergibt.
Das Problem ist: Solche Fehler übersieht man erstaunlich leicht.
Deshalb schaue ich bei einem generierten Bild inzwischen nicht nur darauf, ob die einzelnen Objekte richtig aussehen.
Ich frage mich:
Könnte diese Szene in der Realität tatsächlich so existieren?
Das ist eine überraschend gute Qualitätskontrolle.
Je größer die Szene, desto mehr kann schiefgehen
Bei einem einfachen Portrait hat das Modell relativ wenig zu lösen.
Gesicht. Haare. Haut. Kleidung. Hintergrund.
Bei einem Restaurant-Menü, einer Werbeanzeige oder einem Produktbild sieht das anders aus.
Plötzlich müssen Schatten zusammenpassen. Gegenstände müssen sinnvoll aufeinander stehen. Reflexionen müssen stimmen. Schrift muss lesbar sein. Materialien müssen glaubwürdig reagieren. Perspektiven dürfen sich nicht widersprechen.
Das erklärt auch, warum verschiedene Studien auf sehr unterschiedliche Erkennungsraten für KI-Bilder kommen.
Nightingale und Farid kamen 2022 bei KI-generierten Gesichtern auf gerade einmal 48,2 Prozent Trefferquote. Die Teilnehmer lagen damit praktisch auf Zufallsniveau.
Bei vollständigen KI-Bildern lag die Trefferquote in der CHI-Studie von 2025 dagegen bei 76 Prozent.
Das ist für Marketing interessant, weil wir selten nur ein Gesicht generieren.
Wir generieren Produktbilder, Poster, Social Ads, Speisekarten, Thumbnails oder komplette Szenen.
Und je mehr im Bild passiert, desto mehr Entscheidungen sollte man dem Modell nicht einfach überlassen.
„Gutes Licht“ ist keine Lichtanweisung
Das war für mich einer der größeren Unterschiede zwischen mittelmäßigen und wirklich brauchbaren Prompts.
Früher hätte ich wahrscheinlich so etwas geschrieben:
„cinematic lighting“
oder:
„soft professional lighting“
Das klingt konkret, ist es aber eigentlich nicht.
Woher kommt das Licht?
Von vorne? Von hinten? Von einem Fenster links?
Ist es diffus oder hart?
Welche Farbtemperatur hat es?
Wie stark sind die Schatten?
Gibt es eine zweite Lichtquelle?
Gerade bei realistischen Bildern macht das einen enormen Unterschied.
Der Grund dafür ist relativ simpel: Bildmodelle simulieren keine echte physikalische Szene. Sie bauen nicht erst einen virtuellen Raum mit einer Lichtquelle auf und berechnen daraus das Bild.
Sie erzeugen ein Bild, das statistisch so aussieht, als wäre diese Szene beleuchtet worden.
Deshalb können Licht und Schatten einzeln plausibel aussehen und zusammen trotzdem keinen Sinn ergeben.
Wenn mir Licht wichtig ist, schreibe ich deshalb lieber etwas wie:
„Weiches spätes Nachmittagslicht von links, ca. 4.500 K, diffuse Schatten, kein Gegenlicht, keine künstliche Studiobeleuchtung.“
Das ist deutlich hilfreicher als „beautiful cinematic lighting“.
Bei Schrift würde ich dem Modell nicht unnötig vertrauen
Text in Bildern ist inzwischen deutlich besser geworden.
Trotzdem würde ich bei einem echten Marketing-Asset unterscheiden zwischen:
Text als Bestandteil des Motivs
und
Typografie als Design.
Ein Schild im Hintergrund? Kann das Modell ruhig versuchen.
Eine Headline, die exakt sitzen, richtig umbrechen und zur Marke passen muss?
Die würde ich anschließend selbst setzen.
Denn ein Bildmodell arbeitet nicht wie Figma, Photoshop oder InDesign. Es denkt nicht in Kerning, Baselines, Schriftdateien oder typografischen Rastern.
Wenn das Bild ansonsten perfekt ist, möchte ich es nicht neu generieren müssen, weil aus „Sommerfest“ plötzlich „Sommerfesl“ geworden ist.
Meine Faustregel ist deshalb:
Bild mit KI bauen. Finale Typografie mit einem echten Design-Tool setzen.
Natürlich gibt es Ausnahmen. Wenn Schrift selbst Teil der Bildidee ist, kann man sie direkt generieren. Für reproduzierbare Marketing-Assets würde ich mich aber nicht darauf verlassen.
Warum KI trotzdem immer wieder denselben Look produziert
Selbst mit einem besseren Prompt bleibt noch ein Problem:
Bildmodelle haben einen eigenen ästhetischen Default.
Wenn ich nichts anderes vorgebe, bekomme ich häufig ein Bild, das ziemlich „fertig“ aussehen möchte.
Saubere Komposition. Schöne Beleuchtung. Harmonische Farben. Perfekte Oberflächen. Alles an seinem Platz.
Das klingt zunächst positiv.
Nur ist die echte Welt selten so.
Ein interessantes Editorial-Foto kann gerade deshalb funktionieren, weil ein Glas ungünstig am Rand steht. Weil ein Tischtuch zerknittert ist. Weil der Bildausschnitt nicht perfekt ist. Weil eine Person halb aus dem Frame läuft.
Wenn man realistischere Bilder möchte, muss man solche Dinge teilweise bewusst zurückholen.
Nicht:
„realistic photo of a dinner table“
sondern beispielsweise:
„Dokumentarisch wirkendes Foto eines gedeckten Tisches kurz vor Ankunft der Gäste. Nicht perfekt arrangiert. Ein Glas steht leicht außerhalb der Reihe, das Leinentuch liegt zerknittert auf dem Tisch, einzelne Feigen sind angeschnitten. Keine symmetrische Komposition, keine Stockfoto-Ästhetik.“
Das ist immer noch kein Garant für ein gutes Bild.
Aber das Modell weiß jetzt zumindest, welche Art von Unperfektheit gewollt ist.
Und damit kommen wir zum eigentlichen Framework.
Die sieben Schichten eines guten Bild-Prompts
Ich versuche einen Bild-Prompt inzwischen weniger wie einen Zauberspruch und mehr wie ein kleines Creative Briefing zu schreiben.
Dafür gehe ich sieben Bereiche durch.
Nicht jeder Prompt braucht zu jedem Punkt drei Sätze. Aber wenn ein Ergebnis generisch aussieht, fehlt erstaunlich oft genau einer davon.
| Schicht | Zu wenig | Besser |
|---|---|---|
| 1. Subjekt | „Gartenparty“ | Was genau sehen wir und in welchem Moment? |
| 2. Zweck | fehlt | Wo wird das Bild eingesetzt und was soll es leisten? |
| 3. Licht | „gutes Licht“ | Quelle, Richtung, Härte und Farbtemperatur |
| 4. Komposition | fehlt | Perspektive, Bildaufteilung, Negativraum und Fokus |
| 5. Typografie | „mit Überschrift“ | Wortlaut, Position, Größe und Hierarchie |
| 6. Marke | „in unseren Farben“ | Konkrete Palette, Hex-Codes und gewünschter Charakter |
| 7. Constraints | fehlt | Was darf ausdrücklich nicht passieren? |
Ich würde diese sieben Punkte allerdings nicht als starre Prompt-Formel verstehen.
Es geht nicht darum, jeden Prompt möglichst lang zu machen.
Im Gegenteil: Ein langer Prompt voller irrelevanter Details kann genauso schlecht sein.
Die sieben Schichten helfen vor allem dabei, eine andere Frage zu stellen:
Welche visuellen Entscheidungen sind mir wichtig — und welche davon überlasse ich gerade unbewusst dem Modell?
Das ist für mich der entscheidende Unterschied.
Einmal konkret
Nehmen wir wieder die Gartenparty.
Der einfache Prompt wäre:
„Erstelle einen Flyer für meine Gartenparty am 25.09.2026.“
Damit ist das Motiv grob definiert. Mehr nicht.
Jetzt gehen wir die sieben Schichten durch:
Ein gedeckter Gartentisch kurz vor Ankunft der Gäste, Weinflasche, unterschiedliche Gläser, Feigen, zerknittertes Leinentuch.
Private Einladung unter Freunden, soll hochwertig wirken, aber auf keinen Fall wie Werbung.
Spätsommerabend, warmes natürliches Licht zwischen den Blättern, keine Studiobeleuchtung.
Obere Hälfte ruhig und typografisch nutzbar, Fotografie hauptsächlich in der unteren Hälfte.
Kleine Editorial-Anmutung statt Eventposter.
Keine klassische Brand, dafür eine klare visuelle Richtung: European summer dinner, kleine Weinbar, unabhängiges Kulturmagazin.
Keine Menschen, keine Lichterketten, keine Ballons, kein perfektes Tablescaping, kein Canva-Look.
Plötzlich hat das Modell nicht einfach mehr Wörter bekommen.
Es hat Entscheidungen bekommen.
Und genau darum geht es.
Prompt-System zum Mitnehmen
Hol dir den vollständigen Guide als PDF.
Die sieben Schichten, Specs und Repair-Prompts als PDF — plus die wichtigsten Marketing-Paare. Damit du sie nicht noch einmal suchen musst.
22 Vorher-Nachher-Prompts
Im nächsten Abschnitt zeige ich 22 typische Marketing-Anwendungen jeweils zweimal.
Zuerst so, wie man den Prompt wahrscheinlich schnell nebenbei eintippen würde.
Danach als konkretes Creative Briefing.
Dabei geht es nicht darum, die langen Versionen Wort für Wort zu übernehmen. Interessanter ist die Frage, welche zusätzlichen Entscheidungen im zweiten Prompt getroffen werden.
Denn wenn man das einmal verstanden hat, braucht man irgendwann auch keine Prompt-Vorlagen mehr.
Poster und Flyer
1. Gartenparty-Flyer
Slop: Flyer für meine Gartenparty am 25.09.2026
Slop

Optimiert

Erstelle einen druckfertigen A5-Einladungsflyer für eine private Gartenparty. Zweck: per Hand und WhatsApp verteilt, in fünf Sekunden klar: was, wann, wo — Freunde sollen zusagen, nicht überlegen. Szene: flache grafische Komposition mit einem einzelnen Duotone-Fotoelement in der unteren Hälfte. Motiv: Overhead-Crop eines Holztisches im Garten am späten Nachmittag — angeschnittene Weingläser, eine Schale mit Feigen, weiches Gegenlicht durch Blätter, keine Gesichter sichtbar. Licht: warmes Spätnachmittagslicht von rechts bei etwa 20 Grad, lange weiche Schatten, goldener Stich 3500K. Komposition: Bild blutet an der Unterkante über die unteren 45 Prozent, Textblock in der oberen Hälfte, klare horizontale Teilung, großzügige Ränder. Typografie, exakt wie geschrieben: „GARTENPARTY“ in fetter kondensierter Versalschrift oben. Darunter in Regular: „Freitag, 25. September 2026 · ab 17 Uhr“. Dann eine Zeile kleiner: „Bei uns im Garten — Bring was mit, wenn du magst.“ Farbe: 60 Prozent warmes Off-White #F6F1E8, 30 Prozent Duotone in tiefem Blattgrün #2F4A3A, 10 Prozent Korallen-Akzent #E07A5F nur auf einer dünnen Linie unter der Headline. Constraints: genau drei Textzeilen, jeweils einmal und korrekt geschrieben. Keine Clipart-Luftballons, keine Stockfoto-Lächelgesichter, keine Logos, keine QR-Codes, keine Adresse im Bild. Format: 148x210mm bei 300dpi mit 3mm Beschnitt.
2. Gym-Mitgliedschafts-Poster
Slop: Fitnessstudio-Poster mit einer trainierenden Person
Slop

Optimiert

Erstelle ein druckfertiges Gym-Mitgliedschaftsplakat im Format 18x24 Zoll. Zweck: Schaufenster-Recruiting-Poster für den Januar-Intake, Zielgruppe Einsteiger statt bestehende Lifter. Szene: leerer Functional-Training-Bereich am frühen Morgen, Gummiboden und Rig sichtbar, aber unbesetzt. Licht: kühles industrielles Deckenlicht bei 5000K plus eine warme praktische Lichtquelle vom Fenster rechts, lange Schatten über den Boden. Komposition: breiter leerer Boden über die unteren zwei Drittel, Rig-Silhouette am rechten Rand, oberes linkes Viertel frei für Schrift. Typografie: „STARTE WO DU BIST“ in schwerer Versal-kondensierter Sans, oben links, Off-White. Darunter in leichter Schriftstärke: „Kein Vertrag. Erster Monat gratis.“ Farbe: 60 Prozent Anthrazit #1F2225, 30 Prozent kühles Grau #5A6169, 10 Prozent Signalorange #FF5A1F nur auf der Akzentlinie. Constraints: keine Personen, keine Equipment-Markennamen, keine Motivations-Stockbilder, kein Lens Flare. Jede Textzeile genau einmal rendern. Format: 18x24in bei 300dpi, 0.25in Beschnitt.
3. Musik-Event-Poster
Slop: Konzertposter für eine Jazz-Nacht
Slop

Optimiert

Erstelle ein Jazz-Event-Poster im Siebdruck-Stil. Zweck: Straßen-Paste-up für eine unabhängige Location, muss auf Distanz lesbar sein und mit zwei Sonderfarben druckbar bleiben. Szene: flache grafische Komposition, keine fotografischen Elemente. Motiv: abstrakte Kontrabass-Silhouette aus überlappenden geometrischen Formen, leicht links der Mitte. Komposition: Motiv auf den linken zwei Fünfteln, Schrift gestapelt rechts, großzügiger Rand an allen vier Kanten. Typografie: „MIDNIGHT BRASS“ in großer kondensierter Versalschrift über das obere Drittel. Unter der Illustration: „Donnerstag, 14. November“ dann „Riverside Hall, 20 Uhr“. Farbe: nur Zwei-Farben-Palette, tiefes Navy #14213D und warmes Senfgelb #FCA311 auf off-white Papier. Sichtbares Halbtonkorn. Constraints: keine Verläufe, keine Schlagschatten, keine Foto-Textur. Jede Textzeile genau einmal, korrekt geschrieben. Stil: Mid-Century-Siebdruck, begrenzte Farbe, flache Farbtrennung.
4. Immobilien-Open-House-Poster
Slop: Immobilien-Poster für ein Haus
Slop

Optimiert

Erstelle ein hochwertiges Open-House-Poster für Immobilien. Zweck: Schaufensterkarte für eine Premium-Agentur, Qualität signalisieren ohne zu schreien. Szene: moderne eingeschossige Hausfassade zur goldenen Stunde, vom Vorgarten leicht außermittig fotografiert. Licht: tiefe warme Sonne von rechts bei etwa 5 Grad Elevation, lange weiche Schatten über den Rasen, warmes Innenlicht durch die Verglasung sichtbar. Komposition: Haus in den unteren zwei Dritteln, Vertikalen absolut gerade, sauberer Himmel im oberen Drittel für Schrift. Typografie: „TAG DER OFFENEN TÜR“ in raffinierter gesperrter Versal-Serif, oben mittig, warmes Weiß. Darunter: „Samstag 11–14 Uhr“. Farbe: gedämpfte Naturpalette, 60 Prozent warme Neutrals, 30 Prozent Himmel-Blaugrau, 10 Prozent Messing-Akzent #B08D57. Constraints: keine Personen, keine Autos, keine Agentur-Logos, kein übersättigter Himmel, kein HDR-Glow. Architektonische Vertikalen wahr halten. Format: A2 Hochformat bei 300dpi, CMYK-sicher.
Restaurant-Menüs
Hier fällt Slop am häufigsten auf: viel Text, und er muss stimmen.
5. Café-Menükarte
Slop: eine Café-Speisekarte mit Preisen
Slop

Optimiert

Erstelle ein fotorealistisches Tischkarten-Mockup: gedruckte Café-Menükarte, aufrecht in einem kleinen Holzhalter auf einer abgenutzten Eichenplatte. Zweck: Tischkarte für ein unabhängiges Brunch-Café — warm und handgemacht, soll aus Sitzdistanz (ca. 50 cm) klar lesbar sein. Szene: ungestrichener Off-White-Karton 300g/m² mit sichtbarer Baumwollfaser, leichte Biegung der Karte im Halter, weicher Kontaktschatten am Fuß. Kamera: leichte Dreiviertel-Ansicht von vorne links, Fokus scharf auf der Schriftfläche, Hintergrund weich. Licht: einzelnes weiches Fensterlicht von links bei 45 Grad, 4200K, sanfter Abfall nach rechts, ein Spekular nur auf der Holzkante des Halters — keine zweiten Schattenrichtungen. Typografie, exakt wie geschrieben, schwarz auf dem Karton gedruckt: Überschrift: „MORGENMENÜ“ in gesperrter Versal-Serif, oben zentriert. Eine einzelne Terrakotta-Linie #C05B3D darunter. Dann fünf Zeilen linksbündig mit Führungspunkten und rechtsbündigen Preisen: „Sauerteigtoast········6“ „Gebackene Eier········11“ „Saisonales Granola····9“ „Buttermilk-Pancakes···10“ „Flat White············4“ Komposition: Überschrift im oberen Fünftel, Menüblock in der Mitte, unteres Fünftel bewusst leer. Gleichmäßige Außenränder mindestens 12 mm. Farbe: Papier #F5EFE4, Tinte #1A1714, Akzent nur die eine Linie #C05B3D. Constraints: jede Zeile genau einmal, korrekt geschrieben, gleiche Baseline und gleiches Letterspacing. Keine Logos, keine Illustrationen, keine Kaffeeflecken-Dekoration, keine Stockfoto-Optik, keine schwebenden Preise. Halter und Tisch müssen physikalisch stabil wirken. Stil: echtes Produktfoto, geringe Schärfentiefe, natürliche Unvollkommenheit im Holz, kein HDR.
6. Fine-Dining-Tasting-Menu
Slop: edle Restaurant-Speisekarte
Slop

Optimiert

Erstelle ein fotorealistisches Fine-Dining-Tasting-Menü als flach liegende Karte auf dem Gedeck. Zweck: liegt an jedem Platz in einem Tasting-Menu-Restaurant — zurückhaltend, teuer, in drei Sekunden als hochwertig erkennbar. Szene: schwere ungestrichene Elfenbein-Karte (ca. A5) auf dunklem Leinentischtuch, daneben nur angeschnitten ein mattes Besteckteil — kein Tellerchaos. Kamera: Top-down leicht außermittig, Karte füllt ca. 55 Prozent der Bildhöhe, Vertikalen der Kartenkanten gerade. Licht: einzelnes warmes Overhead-Key von oben links, 3000K, enger weicher Lichtpool auf der Karte, tiefer Falloff ins Tischtuch, keine zweiten Lichtquellen, keine Kerzenflecken. Typografie, exakt wie geschrieben, zentriert, eine Tinte: „HERBST-TASTING“ in kleiner gesperrter Versalschrift oben mit großzügigem Letterspacing. Darunter fünf Gangzeilen in Title Case, jeweils eigene Zeile, gleichmäßiger Zeilenabstand: „Sellerie, Haselnuss, Trüffel“ „Pökel-Forelle, Buttermilch, Dill“ „Reifes Rind, Mark, Zwiebel“ „Brombeere, Sauerampfer, Sahne“ „Petit Fours“ Komposition: extreme Luft — mindestens 25 Prozent der Kartenfläche an jeder Seite leer, Textblock vertikal zentriert. Farbe: Papier warmes Elfenbein #F3EDE3, Tinte tiefes Anthrazit #2A2826. Keine Akzentfarbe, kein Goldfolie-Effekt. Constraints: keine Preise, keine Beschreibungen, keine Logos, keine Ornamente, kein Rahmen, keine Wasserzeichen. Jede Zeile genau einmal, konsistentes Letterspacing, keine driftenden Baseline. Karte liegt flach — keine unnatürliche Verbiegung. Stil: echtes Foto, Low-Key, geringe Schärfentiefe auf dem Tischtuchrand, matte Papiertextur sichtbar.
7. Kreidetafel-Specials
Slop: Kreidetafel-Menü für ein Restaurant
Slop

Optimiert

Erstelle eine fotorealistische handbeschriftete Kreidetafel mit Tagesgerichten, frontal an einer leicht unebenen Ziegelwand montiert. Zweck: Tageskarte in einem Nachbarschaftsbistro — soll echt handgeschrieben wirken, nicht wie digitale Fake-Kreide. Szene: echte Schiefertafel im Holzrahmen, sichtbarer Kreidestaub in den Ecken, schwaches Ghosting von früheren Wischern, leicht unebene Schieferoberfläche, zwei sichtbare Wanddübel oben — physikalisch plausibel befestigt. Kamera: frontal, Tafel füllt ca. 70 Prozent der Bildhöhe, leichte Perspektive nach unten vermeiden. Licht: warmes Wolfram-Key von oben links, 2800K, dezenter Glanzstreifen über den Schiefer zeigt die Textur, weicher Schatten des Rahmens auf der Wand nach rechts unten — eine konsistente Schattenrichtung. Typografie, in gebrochener weißer Kreide, exakt wie geschrieben: „HEUTIGE SPECIALS“ in handgezogener Versalschrift oben kleiner handgezogener Unterstrich nur unter der Überschrift dann drei Gerichte mit Preis rechts: „Wildpilz-Risotto········16“ „Ofenkabeljau············19“ „Sticky Toffee Pudding····8“ Details: wechselnder Strichdruck, leicht ungerade Zeilen, kleine Kreidesplitter, keine perfekte Gleichmäßigkeit der Buchstaben. Constraints: kein weiterer Text, keine Kreide-Blumen, keine Smileys, keine Euro-Zeichen-Grafiken, keine stockgleiche „Chalkboard-Font“-Optik. Jeder Preis und jedes Gericht genau einmal und korrekt geschrieben. Rahmen und Halterung müssen halten können. Stil: echtes Foto, natürliche Unvollkommenheit, sichtbare Kreidetextur, kein Übersättigen der Ziegel.
YouTube-Thumbnails
Offizielle Spec: 3840×2160 bei 16:9, unter 2 MB mobil. YouTube empfiehlt die Drittel-Regel.
8. Tutorial-Thumbnail
Slop: YouTube-Thumbnail über KI mit überraschter Person
Slop

Optimiert

Erstelle ein 16:9-YouTube-Thumbnail für ein Software-Tutorial, 3840x2160. Zweck: muss als 320x180-Pixel-Vorschau auf dem Handy lesbar sein — jedes Element überlebt eine 8x-Verkleinerung. Ein Gefühl in unter einer Sekunde: Überraschung + Erfolg. Komposition: Person im rechten Drittel (Drittel-Regel), Textblock fest auf den linken zwei Dritteln. Safe Zone: nichts Wichtiges in den unteren 15 Prozent rechts (Dauerstempel) und nichts in den oberen 8 Prozent (YouTube-UI). Motiv: Person Mitte dreißig, Oberkörper, echter überraschter Ausdruck (kein Fake-Stock-Lächeln), Blick leicht nach unten auf einen aufgeklappten Laptop, dessen Screen Licht nach oben ins Gesicht wirft. Gesicht vollständig sichtbar, keine Hand vor dem Mund. Licht: starkes Screen-Glow von unten als Key, 6500K; warmes Rim von hinten links trennt Haar und Schulter vom Hintergrund; Hintergrund bleibt dunkel und ruhig. Typografie, exakt einmal: „ES HAT WIRKLICH GEKLAPPT“ in schwerer kondensierter Versalschrift, drei kurze gestapelte Zeilen links, Gelb #FFD400 mit kräftigem dunklem Outline — Buchstaben so groß, dass sie bei 320px Breite noch lesbar sind. Farbe: 60 Prozent Navy-Hintergrund #0B1B33, 30 Prozent Person/Haut, 10 Prozent gelbe Schrift. Constraints: kein zweites Textfeld, keine Logos, keine Rahmen, keine Pfeile, keine roten Kreise, kein „AI“-Badge, kein Lens Flare. Anatomie und Laptop-Scharnier physikalisch plausibel. Text korrekt geschrieben.
9. Listicle-Thumbnail
Slop: Thumbnail für ein Top-10-Video
Slop

Optimiert

Erstelle ein 16:9-YouTube-Thumbnail für ein Ranking-Video, 3840x2160. Zweck: konkurriert in einer vollen Sidebar — eine Zahl und ein Objekt müssen in 0,5 Sekunden sitzen, auch bei 168px Breite. Komposition: Zifferblock links 40 Prozent, Produkt rechts 50 Prozent, dazwischen klarer Leerraum. Safe Zone unten rechts frei für den Dauerstempel. Motiv: ein einzelner mattschwarzer Over-Ear-Kopfhörer, leicht angewinkelt, realistisch schwebend mit weichem Kontaktschatten unter dem Bügel — kein zweites Produkt, kein Stand. Licht: großes weiches Key von oben links, tiefe Schattenseite behalten, dezentes Cyan-Rim #00E5FF nur am rechten Bügelrand; ein kontrolliertes Spekular auf dem Headband. Typografie, exakt zwei Elemente: „10“ extrem groß, schwere Versalschrift, Off-White, füllt fast die linke Fläche. Darunter deutlich kleiner, Tracking eng: „GETESTET“. Farbe: 60 Prozent ruhiger Anthrazit-Verlauf #1A1C1F → #0E1012, 30 Prozent Produkt, 10 Prozent Cyan nur als Rim. Constraints: keine Gesichter, keine Pfeile, keine Logos, keine Sternbursts, kein „TOP“, keine zusätzlichen Zahlen. Beide Texte einmal und korrekt. Kopfhörer-Bügel und Ohrmuscheln müssen als funktionierendes Objekt lesbar sein.
10. Face-led Vlog-Thumbnail
Slop: Vlog-Thumbnail mit meinem Gesicht
Slop

Optimiert

Erstelle ein 16:9-YouTube-Thumbnail mit starkem Einzelgesicht, 3840x2160. Zweck: persönlichkeitsgeführter Kanal — das Gesicht ist die Marke. Ausdruck und drei Worte müssen bei Handy-Vorschau sofort lesbar sein. Komposition: Gesicht rechts, Crop von der Brustmitte, Augen auf der oberen Drittellinie. Linke Hälfte nur für den Textblock. Safe Zone unten rechts leer. Motiv: Person, direkter Blick in die Kamera, klar lesbarer Ausdruck echter Ungläubigkeit (Mund leicht offen, Augenbrauen hoch), Haut mit sichtbarer Textur — kein plastic skin. Licht: helles weiches Key von vorne links auf Augenhöhe; warmes orangenes Rim #FF7A1F von hinten rechts trennt Schulter und Haar vom Hintergrund; kein zweites farbiges Fill. Typografie, exakt einmal: „ICH LAG FALSCH“ in fetter Versalschrift, drei gestapelte Zeilen links, Off-White mit dezentem dunklem Schatten nur zur Trennung vom Hintergrund. Farbe: 60 Prozent tiefer Teal-Hintergrund #0F2A2E (kein Lila-Gradient-Klischee), 30 Prozent Haut und Kleidung, 10 Prozent orangenes Rim. Constraints: beide Augen scharf und frei. Keine Sonnenbrille, keine Hände im Frame, keine Logos, keine Pfeile, kein zweites Textfeld. Anatomie plausibel, Ohren und Haare nicht verschmolzen. Text korrekt geschrieben.
Social Ads
Meta-Feed aktuell oft 4:5 bei 1440×1800. Primary Text eher 50–150 Zeichen.
11. Product-Launch-Ad
Slop: Instagram-Ad für ein Hautpflegeprodukt
Slop

Optimiert

Erstelle eine 4:5-Social-Feed-Anzeige (1440x1800) für eine minimalistische Hautpflegemarke. Zweck: Awareness-Ad für kalte Audience — Premium in unter zwei Sekunden Scrollzeit, ohne zu schreien. Szene: eine einzelne 30-ml-Serumflasche aus mattiertem Glas mit mattschwarzem Pipettendeckel, stehend auf einem blassen Travertin-Sims vor ruhigem warmem Hintergrund. Kamera: leichte Dreiviertel-Ansicht, Flasche im unteren rechten Drittel, Silhouette klar, Deckelkante scharf. Licht: weiches gerichtetes Tageslicht von links in flachem Winkel, 5200K, langer weicher Schatten nach rechts, ein kontrolliertes Highlight die Flaschenkante hinunter — eine Schattenrichtung. Komposition: obere linke 40 Prozent bewusst leer für Typografie; unterer Rand und Ecken frei von UI-Overlap-Gefühl. Typografie, exakt einmal: „Weniger, aber besser.“ in leichter Serif, oben links, warmes Anthrazit #2C2825. Kein weiterer Copy. Farbe: 60 Prozent warmer Sand #E8DCCB, 30 Prozent Travertin, 10 Prozent tiefer Ton #8A5A44 nur als dezenter Sims-Akzent — nicht auf der Schrift. Constraints: kein Model, keine Hände, keine Wasserspritzer, keine Inhaltsstoff-Bubbles, keine Badges, keine Sternbursts, kein Markenlogo, kein Reflection-Floor. Flasche und Pipette müssen als funktionierendes Objekt wirken. Tagline korrekt geschrieben. Stil: echtes Commercial-Foto, matte Materialien, kein Hochglanz-HDR.
12. Sale-Promo-Ad
Slop: Sale-Ad mit 50 % Rabatt
Slop

Optimiert

Erstelle eine 4:5-Social-Feed-Sale-Anzeige (1440x1800) für eine Fashion-Marke — rein grafisch, keine Fotografie. Zweck: Retargeting für warme Audiences. Der Rabatt ist das einzige Hero-Element; alles andere ist Lärm. Komposition: „50 % RABATT“ zentriert in den oberen zwei Dritteln, maximal groß. Darunter eine Unterzeile. Gleichmäßige Ränder mindestens 8 Prozent der kurzen Seite. Kein zentriertes „Design-Chaos“. Typografie, exakt zwei Elemente: „50 % RABATT“ in sehr schwerer kondensierter Versalschrift, Off-White, zentriert, enges Tracking. Darunter deutlich kleiner Regular: „Alles. Endet Sonntag.“ Farbe: 60 Prozent Off-Black #101010, 30 Prozent Off-White-Schrift, 10 Prozent Säuregrün #C8FF00 ausschließlich auf dem Prozentzeichen — sonst nirgends. Details: flacher Vollton-Hintergrund, keine Verläufe, keine Texturen, keine Schlagschatten hinter der Schrift. Constraints: keine Produkte, keine Models, kein Konfetti, keine Sternbursts, keine Blitze, keine Countdown-Ringe, keine „SALE“-Sticker zusätzlich. Beide Texte einmal, korrekt geschrieben, Baseline gerade.
13. Testimonial-Ad
Slop: Kundenstimmen-Ad
Slop

Optimiert

Erstelle eine 4:5-Social-Feed-Testimonial-Anzeige (1440x1800), rein typografisch. Zweck: Social-Proof-Ad — das Zitat ist der Hero und soll wie eine echte Bewertung wirken, nicht wie Werbe-Copy. Szene: ruhiger Einfarb-Grund mit sehr subtiler Papierkörnung, keine Fotografie, keine Illustration. Komposition: Zitat in den mittleren 55–60 Prozent der Fläche, Attribution darunter mit klarer Luft. Ränder an allen vier Seiten mindestens 10 Prozent — großzügig, nicht gequetscht. Typografie, exakt zwei Elemente: „Danach habe ich nicht weitergesucht.“ in medium-weight Serif, groß, zentriert über drei Zeilen, tiefe Tinte #1C1A17. Darunter Kapitälchen: „Sarah K., verifizierte Käuferin“. Zwischen beiden eine kurze horizontale Linie in gedämpftem Gold #B79355 — nur als Divider, keine Verzierung. Farbe: 60 Prozent warmes Off-White #F7F3EC, 30 Prozent Tinte, 10 Prozent Gold nur auf der Linie. Constraints: keine Stern-Icons, keine riesigen Anführungszeichen-Grafiken, keine Produktbilder, keine Logos, kein Avatar-Foto, kein „4,9/5“. Beide Texte einmal, korrekt geschrieben, gleichmäßiges Letterspacing.
Packaging und Produkt
14. Kaffeebeutel-Packaging
Slop: Kaffee-Verpackungsdesign
Slop

Optimiert

Erstelle ein fotorealistisches stehendes Kaffeebeutel-Mockup. Zweck: Regalpräsenz im Specialty-Grocery, muss auf Armlänge premium wirken und auf halbem Meter lesbar sein. Szene: matter Kraft-Folienbeutel auf heller Betonfläche vor weichem neutralem Hintergrund. Licht: weiches großes Key von oben links, sanfter Verlauf über die Beutelfläche, weicher Kontaktschatten am Fuß, keine harten Speculars auf der Mattoberfläche. Komposition: Beutel zentriert, mittlere 60 Prozent vertikal, symmetrischer Ausschnitt. Typografie auf dem Beutel, exakt wie geschrieben: „ORBIT“ in fetter gesperrter Versalschrift im oberen Drittel „Single Origin“ in Kapitälchen darunter „Äthiopien Guji 250g“ in kleiner Schrift nahe der Basis Farbe: 60 Prozent natürliches Kraft #C9A87C, 30 Prozent tiefer Anthrazit-Druck #22201D, 10 Prozent Brandorange #D45D2E auf einer dünnen Linie. Constraints: gesamter Beuteltext genau einmal, korrekt geschrieben, korrekt der Beutelkrümmung folgend. Keine Barcodes, keine Zertifikats-Badges, kein weiterer Text. Stil: echtes Foto, kommerzielle Packaging-Fotografie.
15. Kosmetik-Produktfoto
Slop: Produktfoto einer Kosmetikflasche
Slop

Optimiert

Erstelle ein fotorealistisches Hero-Produktfoto für ein E-Commerce-Listing, quadratisches Framing das auf 1:1 gecroppt werden kann. Zweck: primäres Listing-Bild — Form, Volumen und Finish der Flasche ohne Ambivalenz, vergleichbar mit Amazon/Shopify-Hero-Standards. Szene: nahtloser blassgrauer Sweep #D8D8D6, Produkt zentriert und aufrecht, kein Horizontbruch. Motiv: 30-ml-Pipettenflasche aus mattiertem Glas, mattschwarzer Deckel mit sichtbarer Pipettenkappe, leichte Dreiviertel-Drehung nach links (ca. 15–20 Grad), Silhouette klar. Licht: großes Softbox-Key von oben links (ca. 45 Grad), weißer Bounce rechts hebt die Schattenseite, ein kontrolliertes Spekular nur entlang der linken Glaskante; weicher Kontakt-Schatten unter dem Flaschenfuß — eine Lichtlogik. Komposition: Produkt nimmt ca. 70 Prozent der Bildhöhe ein, zentriert, gleichmäßiger Rand rundum, kein Anschnitt von Deckel oder Fuß. Constraints: keine Props, keine Wassertropfen, keine Blütenblätter, keine Inhaltsstoffe verstreut, kein Text, keine Logos, kein Spiegelboden, kein Farbverlauf-Hintergrund. Deckelgewinde und Pipette müssen als funktionierende Teile lesbar sein. Gesamtes Produkt scharf (Focus-Stacking). Stil: echtes Commercial-Produktfoto, matte Materialien, neutrale Farbtreue, kein Beauty-Glow.
Schilder und Print
16. Messestand-Banner
Slop: Messestand-Banner für eine Tech-Firma
Slop

Optimiert

Erstelle ein Roll-up-Messestand-Banner-Design, 850x2000mm Hochformat, 150dpi, 30mm Beschnitt. Zweck: in einer vollen Messehalle aus sechs Metern in unter drei Sekunden lesbar — eine Botschaft, nichts anderes. Komposition (von oben): • obere 40 Prozent auf Augenhöhe: Headline • Mitte: eine kurze Standzeile • untere 35 Prozent bewusst leer (Fußgänger verdecken diesen Bereich) Typografie, exakt zwei Elemente: 1) „IN TAGEN VERSCHICKEN, NICHT IN QUARTALEN“ in schwerer kondensierter Versalschrift über genau drei Zeilen, Off-White, Versalhöhe mindestens 60mm. 2) Darunter Medium-Gewicht: „Stand D42“. Farbe: 60 Prozent Indigo #1B1F3B, 30 Prozent Off-White-Schrift, 10 Prozent Lime #B8FF3C nur als eine Unterstreichungslinie unter der Headline. Details: flache Vollton-Fläche, keine Fotografie, optional eine Diagonaltextur bei maximal 5 Prozent Deckkraft nur im Hintergrund — kein Muster hinter der Schrift. Constraints: nichts Kritisches unter 600mm vom Fuß. Keine Logos, keine Icons, keine QR-Codes, keine URLs, keine zweiten Headlines. Beide Texte einmal, korrekt geschrieben, gerade Baseline. Muss als Druckfläche wirken, nicht als 3D-Mockup mit Personen davor.
17. Visitenkarte
Slop: Visitenkarten-Design
Slop

Optimiert

Erstelle ein fotorealistisches Visitenkarten-Mockup, nur Vorderseite. Zweck: Architekturbüro — soll Zurückhaltung und Handwerk signalisieren. Szene: eine einzelne Karte leicht angewinkelt auf einer rohen Betonfläche, direkt von oben fotografiert. Licht: weiches, gleichmäßiges Tageslicht von links (Kameraseite), sehr dezenter Schatten unter der Kartenkante, der die Kartendicke sichtbar macht. Typografie, exakt wie geschrieben und linksbündig in der unteren Hälfte: „MERIDIAN“ in gesperrter Versalschrift oben im Textblock „Architektur & Interieur“ in kleiner Kursiv darunter „hello@meridian.studio“ in kleiner Regular an der Basis Farbe: ungestrichenes warmweißes Papier #F4F1EA, eine einzige Tinte in tiefem Anthrazit #2B2A28. Keine Akzentfarbe. Details: sichtbare ungestrichene Papiertextur, leicht unregelmäßige Büttenkante, 420 g/m² Stärke an der Ecke erkennbar. Constraints: kein Logo-Mark, keine Telefonnummer, keine Adresse, kein QR-Code, kein weiterer Text. Jede Zeile genau einmal rendern. Stil: echtes Foto, Top-down-Produktfotografie.
18. Tri-Fold-Broschüren-Cover
Slop: Broschüren-Cover für ein Wellness-Unternehmen
Slop

Optimiert

Erstelle eine Tri-Fold-Broschüren-Cover-Fläche, 99x210mm. Zweck: liegt an der Klinik-Rezeption, muss den Aufschlag auf den ersten Blick verdienen. Szene: Flat Design mit einem einzelnen Duotone-Fotoelement in der unteren Hälfte. Motiv: ein Paar Hände offen im Schoß ruhend, beschnitten ohne Gesicht, als warmes Duotone. Komposition: Schrift in den oberen 45 Prozent, Bild blutet an der Unterkante aus, klare horizontale Teilung. Typografie: „Raum zum Atmen.“ in leichter Serif, Satzschreibweise, oben links. Kapitälchen darunter: „Sechs-Wochen-Programm“. Farbe: 60 Prozent warmes Off-White #F6F2EC, 30 Prozent Duotone-Bild in Salbei #7C8B72, 10 Prozent tiefer Wald #2F3D2C auf der Schrift. Constraints: kein Clipart, keine Icons, keine Logos, keine lächelnden Stockfoto-Gesichter, keine Verläufe. Jedes Textelement einmal. Format: 99x210mm bei 300dpi mit 3mm Beschnitt, Sicherheitsabstand 3mm innerhalb Trim.
Retail und Promotion
19. Instagram-Carousel-Cover
Slop: Carousel-Cover über Marketing-Tipps
Slop

Optimiert

Erstelle eine 4:5-Instagram-Carousel-Cover-Slide. Zweck: erste Slide eines Bildungs-Carousels, muss den Scroll stoppen und einen konkreten Payoff versprechen. Szene: Flat Design auf solidem warmem Grund mit subtiler Papierkörnung, keine Fotografie. Komposition: Headline in den mittleren 55 Prozent über drei Zeilen, kleiner Swipe-Hinweis unten, breite gleichmäßige Ränder. Typografie: „5 Fehler, die deine Open Rates killen“ in fetter Serif, Satzschreibweise, zentriert. Unten in Kapitälchen: „Wischen“. Farbe: 60 Prozent warmes Creme #F4EEE2, 30 Prozent tiefe Tinte #1B1815, 10 Prozent Brandorange #C4541F nur als Linie unter der Headline. Constraints: genau zwei Textelemente, jeweils einmal und korrekt geschrieben. Keine Icons, keine Pfeile, keine Fotos, keine Logos, kein Profilbild. Format: 1440x1800.
20. Event-Flyer
Slop: Flyer für ein Food-Festival
Slop

Optimiert

Erstelle einen druckfertigen A5-Straßenflyer für ein Wochenend-Food-Festival in Deutschland. Zweck: wird in der Fußgängerzone verteilt — in fünf Sekunden klar was/wann/wo, soll behalten statt weggeworfen werden. Szene: Flat Design, kein Fotorealismus-Chaos. Obere Hälfte: ein einzelnes Duotone-Fotoelement, untere Hälfte: ruhige Typo-Fläche. Motiv: Overhead-Crop von zwei Händen, die ein in braunes Packpapier gewickeltes Street-Food-Paket über eine Holztresen-Kante reichen. Keine Gesichter, keine Logos auf dem Papier, Dampf leicht sichtbar. Das Foto als warmes Duotone gerendert. Licht im Fotoelement: Spätnachmittag, warmes Seitenlicht von rechts, weiche Schatten der Hände auf dem Tresen — eine Schattenrichtung. Komposition: Bild blutet an der Oberkante über die oberen 48 Prozent. Darunter eine klare horizontale Teilung. Textblock in der unteren Hälfte, linksbündig, großzügige Ränder (mindestens 10 mm innen). Unteres Fünftel bewusst leer. Typografie, exakt drei Elemente, korrekt geschrieben: „STADTMARKT“ in schwerer kondensierter Versalschrift, dunkel, groß — Versalhöhe dominant. Darunter Regular: „Samstag & Sonntag · 11–20 Uhr“ Eine Zeile kleiner: „Markthalle Neun · Berlin“ Farbe: 60 Prozent warmes Off-White Papier #F7F1E6, 30 Prozent Duotone in tiefem Pflaume #4A2545, 10 Prozent Säuregelb #E8DB2F nur als eine dünne horizontale Akzentlinie zwischen Headline und Datum — sonst nirgends. Papier: ungestrichener Druckstock, leichte Körnung sichtbar, flache Farbtrennung wie Siebdruck-meets-Foto. Constraints: genau drei Textzeilen, jeweils einmal. Keine Preise, keine Vendor-Logos, kein QR-Code, kein Clipart, keine Food-Icons, keine Flaggen, keine Menschenmengen, keine Stockfoto-Lächelgesichter. Hände und Paket müssen physikalisch plausibel greifen und halten. Format: 148x210mm bei 300dpi mit 3mm Beschnitt, CMYK-sichere Farben.
21. Produktetikett
Slop: Etikettendesign für eine Hot-Sauce-Flasche
Slop

Optimiert

Erstelle eine fotorealistische Hot-Sauce-Flasche mit umwickeltem Papieretikett. Zweck: Regalprodukt im Specialty-Food-Store, artisanal statt Massenmarkt. Szene: klare Glasflasche auf dunklem Schiefer vor weichem dunklem Hintergrund. Licht: einzelnes hartes Key von rechts erzeugt eine helle Spekularlinie die Glaskante hinunter, tiefer Schatten links, dezentes Rim von hinten definiert die Silhouette. Typografie auf dem Etikett, exakt wie geschrieben: „EMBER“ in fetter kondensierter Versalschrift über die Mitte „Geräucherter Habanero“ in kleiner Kursiv darunter „150ml“ in kleiner Schrift an der Basis Details: ungestrichenes Papieretikett mit sichtbarer Fasertextur, leicht unperfekte Applikation mit einer weichen Falte. Farbe: 60 Prozent tiefer Anthrazit in der Szene, 30 Prozent warmes Creme-Etikett #EFE3CE, 10 Prozent Brandrot #A32C1E auf der Schrift. Constraints: gesamter Etikettentext genau einmal, korrekt geschrieben, natürlich der Flaschenkrümmung folgend. Kein Barcode, kein Nährwertpanel, keine Zertifikats-Badges. Stil: echtes Foto, dramatisches Produktlicht.
22. Gutscheinkarte
Slop: Gutschein-Design für einen Salon
Slop

Optimiert

Erstelle eine fotorealistische gedruckte Gutscheinkarte, flach liegend. Zweck: wird an der Rezeption eines Friseursalons verkauft, soll wie ein durchdachtes Geschenk wirken statt wie ein Beleg. Szene: einzelne Karte auf blassem Marmor, von oben fotografiert. Licht: weiches gleichmäßiges Tageslicht von links, sehr dezenter Schatten entlang der Kartenkante zeigt die Stärke. Typografie, exakt wie geschrieben und zentriert: „GUTSCHEIN“ in kleiner gesperrter Versalschrift oben „Fünfzig Euro“ in großer leichter Serif in der Mitte „Gültig zwölf Monate ab Kauf“ in sehr kleiner Schrift an der Basis Farbe: 60 Prozent weiches Blush-Papier #EDDCD6, 30 Prozent tiefer Anthrazit #262220, 10 Prozent gebürstetes Messingfolie #B08D57 nur auf der oberen Zeile. Details: 350g/m² ungestrichenes Papier mit sichtbarer Textur, Folienlinie fängt das Licht leicht. Constraints: nur drei Textelemente, jeweils einmal und korrekt geschrieben. Kein Salon-Logo, kein Barcode, kein AGB-Absatz, keine Verzierungen. Stil: echtes Foto, Top-down, weiches natürliches Licht.
Editing-Layer: Slop reparieren
Oft günstiger als neu zu würfeln. Die Prompts nutzen [angehängtes Bild], weil sie auf einem Upload arbeiten.
23. Plastik-Look entfernen
Bearbeite [angehängtes Bild] und entferne die künstliche Glätte. Änderungen: realistische Hauttextur wiederherstellen inklusive sichtbarer Poren und feiner Linien. Natürlichen Mikrokontrast in Stoffwebung und Oberflächenmaterialien zurückbringen. Subtile Asymmetrie im Licht hinzufügen, sodass eine Seite stärker abfällt als die andere. Constraints: Komposition, Ausschnitt, Pose und Farbpalette exakt beibehalten. Identität, Proportionen und Ausdruck der Person nicht ändern.
24. Übersättigung korrigieren
Colorgrade [angehängtes Bild] auf professionellen Standard. Änderungen: globale Sättigung um etwa 20 Prozent reduzieren, Highlights vom Clipping zurückholen, Schwarztöne leicht anheben für filmischen Rolloff, und den Schatten einen dezenten kühlen Stich geben, während Hauttöne neutral bleiben. Constraints: Komposition, Inhalt und Schärfe nicht verändern. Alle Farben im CMYK-druckbaren Gamut halten. Keinen starken Orange-Teal-Split einführen.
25. Generierten Text durch Freiraum ersetzen
Bearbeite [angehängtes Bild] und entferne allen Text. Änderungen: jeden gerenderten Text entfernen und den Raum natürlich mit der umgebenden Oberfläche, Textur und Beleuchtung füllen. Constraints: Komposition, Motiv, Licht und Farbe exakt beibehalten. Die freigeräumten Flächen sauber und gleichmäßig lassen, damit später echte Schrift darüber gesetzt werden kann.
Bild ohne Text generieren oder Text entfernen, dann echte Schrift in Figma, Canva oder InDesign setzen. Das löst das eine Problem, das das Modell strukturell nicht kann.
26. Markenfarben korrekt setzen
Bearbeite [angehängtes Bild] und passe die Markenfarben exakt an. Änderungen: primäre Akzentfarbe auf #C05B3D und sekundäre auf #2F3D2C verschieben, nur auf Elemente anwenden, die aktuell Akzentfarbe tragen. Constraints: alle anderen Farben, Komposition, Licht und Motiv unverändert. Hauttöne und neutrale Grautöne nicht verschieben.
27. Flache Komposition retten
Bearbeite [angehängtes Bild] und verbessere die Lichtrichtung. Änderungen: neu beleuchten, sodass das Key-Licht von links bei etwa 45 Grad kommt, sichtbarer Abfall und eine definierte Schattenseite entstehen. Dezentes Rim-Licht an der gegenüberliegenden Kante hinzufügen, um das Motiv vom Hintergrund zu trennen. Constraints: Motiv, Pose, Komposition, Ausschnitt und Farbpalette identisch lassen. Hintergrundinhalt nicht ändern.
28. Physikalisch unplausible Details korrigieren
Prüfe [angehängtes Bild] und korrigiere physikalisch unplausible Details. Änderungen: Objekte reparieren, die so nicht funktionieren könnten — inklusive schlaffer oder schwebender Riemen, Hardware an nichts befestigt, Schatten in inkonsistenten Richtungen und Reflexionen, die nicht zur Szene passen. Constraints: Gesamtkomposition, Motiv, Lichtrichtung und Farbpalette unverändert. Nur die minimal nötigen Korrekturen für physikalische Plausibilität.
Ein paar Specs, die man direkt in den Prompt schreiben kann
Ein Punkt, den ich lange unterschätzt habe: Ein Bild kann gestalterisch gut sein und trotzdem als Marketing-Asset kaum funktionieren, wenn das Format nicht von Anfang an mitgedacht wurde.
Ein YouTube-Thumbnail hat andere Anforderungen als ein Reel. Ein A2-Poster wiederum braucht nicht einfach nur „mehr Auflösung“, sondern muss als Printprodukt gedacht werden.
Deshalb gebe ich Format und Einsatzzweck inzwischen möglichst direkt im Prompt mit.
| Asset | Spec | Quelle |
|---|---|---|
| YouTube-Thumbnail | 3840×2160, 16:9, unter 2 MB mobil | YouTube Help |
| YouTube Shorts | 2160×3840, 9:16 | YouTube Help |
| Meta / Instagram Feed | 1440×1800, 4:5, 30 MB max. | Meta Ads Guide |
| Stories und Reels | 9:16 | Meta |
| Print-Auflösung | 300 dpi | Print-Konvention |
| Standard-Beschnitt | 3 mm / 0,125 in pro Kante | Print-Konvention |
| Poster A2 | 420×594 mm | ISO 216 |
| Textkontrast Minimum | 4,5:1 normal, 3:1 bei großer Schrift | WCAG 2.2 |
Wichtig ist dabei: Nicht jedes Bildmodell hält Pixelmaße, DPI oder Beschnitt exakt ein. Ich würde solche Angaben deshalb eher als Teil des Briefings verstehen und das finale Asset anschließend trotzdem im richtigen Tool auf das tatsächliche Ausgabeformat bringen.
Noch wichtiger als die reine Auflösung ist oft das Seitenverhältnis und die dafür passende Komposition.
Bei einem 9:16-Reel brauche ich beispielsweise eine komplett andere Bildaufteilung als bei einem 16:9-Thumbnail. Das sollte das Modell wissen, bevor es die Szene baut — nicht erst beim späteren Croppen.
Bei Licht lohnt es sich, konkreter zu werden
„Beautiful lighting“ klingt nach einer Anweisung, lässt dem Modell aber fast alle Entscheidungen offen.
Ich versuche deshalb lieber, eine Licht-Situation zu beschreiben, die es auch in einem echten Shooting geben könnte.
Dafür muss man kein Fotograf sein. Ein paar grundlegende Setups reichen schon:
| Setup | Was passiert dabei? | Gut geeignet für |
|---|---|---|
| Three-point | Key Light, Fill Light und Backlight sorgen für klare Trennung | Corporate, Interviews, Commercial |
| Rembrandt | Typisches Lichtdreieck auf der Schattenseite des Gesichts | Charaktervolle, dramatischere Porträts |
| Butterfly | Frontales Licht erzeugt einen symmetrischen Schatten unter der Nase | Beauty, Glamour |
| Loop | Leichter Nasenschatten fällt seitlich auf die Wange | Klassische Porträts |
| Split | Eine Gesichtshälfte wird beleuchtet, die andere bleibt im Schatten | Härtere, dramatische Looks |
| Rim / Kicker | Lichtkante trennt das Motiv vom Hintergrund | Produkte, Personen, Thumbnails |
| Softbox + Bounce | Weiches, kontrolliertes Licht mit gleichmäßigen Übergängen | Produkte, Packaging |
| Backlight 45° | Licht kommt schräg von hinten und betont Transparenz und Texturen | Food, Drinks |
Man muss diese Begriffe nicht zwangsläufig verwenden. Oft funktioniert eine Beschreibung in normaler Sprache genauso gut oder sogar besser.
Statt:
„beautiful golden hour lighting“
würde ich zum Beispiel eher schreiben:
„Tief stehende Abendsonne von rechts hinten, warmes natürliches Licht, lange weiche Schatten, keine zusätzliche Studiobeleuchtung.“
Auch Golden Hour und Blue Hour lassen sich konkreter fassen. Als grobe Orientierung liegt die Golden Hour bei einem Sonnenstand von ungefähr +6 bis −4 Grad, die Blue Hour etwa zwischen −4 und −6 Grad.
Entscheidend ist aber weniger die exakte Zahl als die Frage: Wie soll das Licht in dieser konkreten Szene tatsächlich aussehen?
Die Modelle wollen nicht alle dasselbe
Eine Sache macht das Ganze etwas komplizierter: Es gibt nicht den einen perfekten Prompt-Stil für alle Bildmodelle.
Die Anbieter empfehlen teilweise sogar ziemlich unterschiedliche Vorgehensweisen.
| Frage | OpenAI | Midjourney | FLUX | Ideogram | |
|---|---|---|---|---|---|
| Prompt-Länge | Strukturiert und detailliert | „Be hyper-specific“ | Kurz und einfach funktioniert oft besser | Kurz starten und nur relevante Details ergänzen | Unter ca. 150 Wörter |
| Negative Prompts | Im normalen Prompt formulieren | Lieber positiv beschreiben | Unterstützt --no | Meist nicht unterstützt | Lieber positiv beschreiben |
| Kamera-Specs | Können helfen, sind aber keine Garantie | Dokumentiert | Weniger Fokus darauf | Kamera, Linse oder Filmstock können konkret angegeben werden | Weniger relevant |
| Schriftnamen | Besser Eigenschaften beschreiben | Besser Eigenschaften beschreiben | — | Besser Eigenschaften beschreiben | Konkrete Fonts derzeit nicht zuverlässig steuerbar |
Das ist auch der Grund, warum ich nicht besonders viel von „dem perfekten Universal-Prompt“ halte.
Ein Prompt, der für FLUX optimiert wurde, muss bei Midjourney nicht automatisch genauso gut funktionieren. FLUX kann beispielsweise mit Angaben wie „Shot on Fujifilm X-T5, 35mm f/1.4“ sinnvoll umgehen. Bei anderen Modellen bringen solche Kameraangaben teilweise deutlich weniger.
Interessanter ist deshalb, die grundsätzlichen Entscheidungen im Prompt beizubehalten und die Formulierung an das jeweilige Modell anzupassen.
Eine Regel von Google finde ich dabei ziemlich universell brauchbar: Dinge, die man nicht haben möchte, wenn möglich als gewünschte Szene formulieren.
Also nicht nur:
„no cars“
sondern beispielsweise:
„an empty, deserted street with no signs of traffic.“
Damit beschreibe ich dem Modell ein Zielbild und nicht nur etwas, das es vermeiden soll.
Was bei mir den größten Unterschied macht
Wenn ich meine eigenen Prompts vergleiche, sind es selten die spektakulären Tricks, die ein Bild deutlich besser machen.
Meistens sind es ziemlich einfache Entscheidungen.
Licht konkret beschreiben. Woher kommt es? Ist es hart oder weich? Warm oder kühl? Natürlich oder künstlich?
Platz bewusst freihalten. Wenn später eine Headline links im Bild stehen soll, schreibe ich das direkt in den Prompt. Sonst setzt das Modell dort mit erstaunlicher Zuverlässigkeit irgendein wichtiges Objekt hin.
Text nicht erzwingen. Wenn die Typografie nicht selbst Teil des Motivs sein muss, generiere ich lieber das Bild und setze die Schrift anschließend.
Farben nicht einfach aufzählen. „Navy, Off-White und Gelb“ lässt offen, wo welche Farbe auftaucht. Besser ist beispielsweise: dunkelblauer Hintergrund, Off-White für die Typografie, Gelb ausschließlich für das zentrale Objekt.
Unperfektheit konkret beschreiben. „Make it realistic“ reicht meistens nicht. Sichtbare Poren, leichter Stoffabrieb, ein nicht ganz symmetrischer Bildaufbau, unregelmäßiger Lichtabfall oder kleine Gebrauchsspuren sind wesentlich konkreter.
Was dagegen erstaunlich wenig bringt:
Die Grundregel dahinter ist ziemlich simpel:
Mehr Wörter machen einen Prompt nicht automatisch besser. Mehr relevante Entscheidungen meistens schon.
Und was ist jetzt mit Typografie?
Hier würde ich trotz aller Fortschritte weiterhin pragmatisch bleiben.
Bildmodelle sind inzwischen wesentlich besser darin geworden, Text darzustellen. Das heißt aber noch nicht, dass ich ihnen die finale Typografie einer Anzeige, eines Posters oder eines Produkt-Packagings überlassen würde.
Wenn Schrift exakt sein muss, behandle ich sie als eigenen Arbeitsschritt:
Erst das Bild generieren, dann die Typografie sauber setzen.
Das hat noch einen zweiten Vorteil: Ich kann anschließend Schriftgröße, Laufweite, Zeilenumbrüche, Kontrast und Abstände verändern, ohne wegen einer kleinen Textkorrektur das komplette Motiv neu generieren zu müssen.
Häufige Fragen
Was ist mit „AI Slop“ eigentlich gemeint?
Merriam-Webster beschreibt damit digitale Inhalte geringer Qualität, die üblicherweise mithilfe von KI in größerer Menge produziert werden.
Für mich ist die praktischere Definition im Marketing etwas einfacher: Es sind KI-Inhalte, bei denen die Art Direction fehlt.
Das Motiv ist da, aber kaum jemand hat Entscheidungen zu Licht, Komposition, Marke, Materialität oder Einschränkungen getroffen. Das Ergebnis kann technisch beeindruckend sein und trotzdem austauschbar wirken.
Warum sehen meine Bilder künstlich aus, obwohl die Bildqualität eigentlich gut ist?
Oft liegt es gar nicht an Auflösung oder Detailgrad.
Ich würde zuerst Licht, Materialien und Physik überprüfen: Woher kommt das Licht? Passen die Schatten dazu? Haben Oberflächen eine glaubwürdige Textur? Sind Gegenstände logisch miteinander verbunden?
Ein Bild kann gestochen scharf sein und trotzdem komplett künstlich wirken.
Warum macht KI bei Text immer noch Fehler?
Weil ein Bildmodell Schrift nicht auf dieselbe Weise behandelt wie ein Design- oder Layoutprogramm.
Die Ergebnisse sind deutlich besser geworden, aber für exakte Marketing-Typografie würde ich mich nicht darauf verlassen. Wenn der Wortlaut stimmen muss, ist es meistens schneller und kontrollierbarer, die Schrift anschließend zu setzen.
Wie lang sollte ein guter Bild-Prompt sein?
Das hängt vom Modell ab.
Midjourney kommt häufig mit relativ kurzen Prompts gut zurecht. Google empfiehlt sehr konkrete Beschreibungen. Bei FLUX würde ich mit dem Wesentlichen anfangen und nur Details ergänzen, die das Ergebnis tatsächlich verändern. Ideogram empfiehlt eher kompakte Prompts.
Deshalb würde ich nicht auf Wortzahl optimieren.
Die bessere Frage ist:
Fehlt dem Modell noch eine Information, die für mein gewünschtes Bild wichtig ist?
Wenn nicht, muss der Prompt auch nicht länger werden.
Funktionieren Negative Prompts?
Das hängt ebenfalls vom Modell ab.
Midjourney bietet dafür beispielsweise --no. Bei anderen Modellen funktioniert es besser, die gewünschte Alternative positiv zu beschreiben.
Statt:
„Keine Autos auf der Straße.“
also eher:
„Eine vollständig leere Straße ohne Verkehr, parkende Fahrzeuge oder andere Verkehrsteilnehmer.“
Ich finde diese Variante ohnehin angenehmer, weil sie beschreibt, was ich sehen möchte — und nicht nur, was verschwinden soll.
Schadet es der Reichweite, wenn ich KI-Bilder verwende?
Nicht automatisch.
Plattformen reagieren vor allem auf massenhaft produzierte, repetitive oder wenig originelle Inhalte. YouTube spricht beispielsweise von „inauthentic content“ und nennt dabei auch generische oder wiederverwendete Templates.
Der relevante Unterschied ist deshalb weniger KI oder keine KI, sondern wie das Ergebnis entstanden ist und was man daraus macht.
Ein bewusst gestaltetes Motiv mit eigener Art Direction ist etwas anderes als 200 nahezu identische Bilder aus demselben Prompt zu generieren und automatisiert zu veröffentlichen.
Und genau deshalb lohnt es sich überhaupt, über bessere Prompts zu sprechen.
Der Ablauf
Hak ab, was du erledigt hast:
Deine 2-Minuten-Aufgabe
Welches Asset promptest du als Nächstes mit allen sieben Schichten?
Nimm ein Paar von oben, ersetze Marke und Zweck, schick ab. Ein Durchlauf mit Spec schlägt zehn Würfe ohne.
Dein nächster Schritt
Nimm heute einen Prompt und füll alle sieben Schichten — nicht nur das Motiv.
Solche praxisnahen Systeme schicke ich jede Woche per Newsletter — ein System, ein Tool, ein Prompt. Kurz, konkret, sofort anwendbar.
Passt dazu

Christopher Thanisch
Ich übersetze KI in brauchbare Systeme für den Arbeitsalltag — Systeme statt Hypes.