Für den Stilvergleich im Beitrag Ein Motiv, fünf Stile brauchten wir dreißig Illustrationen in fünf Stilen, und zwar schnell. Gezeichnet hat sie ein Bildmodell. Hier steht, wie das ablief: welches Werkzeug, wie die Prompts aufgebaut waren, was es gekostet hat und welche Fehler erst beim genauen Hinsehen auffielen.
- 48Bilder erzeugt
- 30davon im Stilvergleich
- ≈ 90 sje Bild
- ≈ 0,20 $je Bild, Listenpreis
Das Werkzeug
Die Bilder stammen aus dem Bildmodell gpt-image-2 von OpenAI, abgerufen über die Programmierschnittstelle und nicht über ein Chatfenster. Ein kleines Skript schickt die Prompts ab, speichert jedes Bild und schreibt dazu Modell, Uhrzeit, Größe und den vollständigen Prompt in eine Protokolldatei. Fünf Bilder laufen gleichzeitig, eines braucht rund anderthalb Minuten. Bestellt war hohe Qualität im Format 4:3 mit 1536 mal 1152 Pixeln.
Gegenüber dem Chat hat das zwei Vorteile: Jeder Stil lässt sich später mit denselben Worten wiederholen, und zu jedem Bild ist belegt, woher es stammt.
Nur Text, keine Vorlage
Als Richtung für einen der Stile gab es ein Beispielbild von einer fremden Website. Das haben wir nicht hochgeladen, sondern in Worten beschrieben: Tuschelinien, Punktraster, eine blaue Schmuckfarbe. Das Modell sollte den Stil treffen und nicht die Bilder eines anderen Unternehmens nachbauen. Auch die vorhandenen Grafiken des Kunden gingen nicht mit; die Motive standen nur als Text im Prompt. Die Schnittstelle bestätigt das: Für alle 48 Bilder meldet sie null Bild-Tokens auf der Eingabeseite.
So ist ein Prompt aufgebaut
Jeder Prompt bestand aus vier Bausteinen. Der Stil stand für alle sechs Bilder eines Stils wörtlich gleich da, nur Motiv und Hintergrund wechselten. Das hält eine Serie zusammen, ohne dass man ein Referenzbild braucht.
- Stil Wie gezeichnet wird: Technik, Strich, Farben und was nicht vorkommen darf. für alle sechs Bilder eines Stils wörtlich gleich
- Motiv Was zu sehen ist: ein Gegenstand oder eine kleine Szene. je Kachel anders
- Hintergrund Die Grundfarbe, passend zur Position im Raster. je Kachel anders
- Gemeinsame Regeln Keine Schrift, Motiv klein und mittig, ein klares Motiv. für alle 48 Bilder gleich
Die gemeinsamen Regeln sparen die meiste Nacharbeit. Keine Schrift, weil Bildmodelle gern Buchstaben erfinden. Motiv klein und mittig, weil die Website dasselbe Bild in zwei Formaten zeigt. Ein Motiv mit wenigen großen Formen, weil die Kachel auf dem Handy nur wenige Zentimeter breit ist.
Ein vollständiger Prompt
So lautete der Prompt für das Bild der Beraterin mit dem Tablet. Er ist englisch, weil die Modelle damit am zuverlässigsten arbeiten.
Hand-drawn editorial ink illustration in a bold, graphic, slightly naive style, like a modern tech brand illustration. Thick, confident, slightly wobbly black ink outlines. Shading and surfaces as coarse, clearly visible pattern fills: large halftone dot screens, diagonal hatching and small checker patterns on clothing and objects; many areas stay white paper. Exactly one spot color, cobalt blue (#2F54EB), as flat fills on a few selected areas such as a vest, sleeves, shoes, screens and accents. No other colors, no gradients, no realistic rendering, no fine detail. Simplified people with dot eyes, simple short hair and simple hands, slightly stylized proportions. The scene stands isolated on the background, only a small patch of hatched floor shadow, no room, no scenery.
Subject: a woman in a blazer holding up a large tablet that shows a picture of a modern shell chair and rows of blank product attribute bars; the real shell chair stands next to her.
Background: plain very light warm grey (#F6F6F4).
Square-cornered 4:3 illustration for the service tiles of a B2B consulting website about product data, ERP and pricing software. Absolutely no text, no letters, no words, no numbers, no logos, no watermark, no signature, no frame, no border. The subject is small in the frame: it fills at most 62 percent of the image height and 70 percent of the width, is centered, and leaves a wide empty band of background above and below, so the image can be cropped to 16:10 without cutting anything. One clear subject, few large shapes, instantly readable at small size. Erster Versuch, zweiter Versuch
Der erste Versuch in diesem Stil war gut gezeichnet, aber zu realistisch und zu groß im Bild. Auf einer Unterseite schneidet die Website die Kacheln im Format 16:10 zu, dabei wären Kopf und Füße der Figur weggefallen. Die Korrektur stand im Prompt: gröbere Raster, einfachere Gesichter und das Motiv auf höchstens 62 Prozent der Bildhöhe.
Erster Versuch
Zweiter Versuch Fünf Fehler, die erst beim Hinsehen auffielen
Im verkleinerten Überblick sahen alle Bilder brauchbar aus. Bei den folgenden fünf änderte sich das, sobald man genauer hinsah.
1. Der Haken sitzt neben dem Kästchen
Der Roboterarm sollte den letzten Punkt der Checkliste abhaken. Er setzte den Haken daneben. In der Kachel fällt das kaum auf, im Ausschnitt sofort. Im zweiten Anlauf beschrieb der Prompt genau, wo die Stiftspitze sitzt.
Vorher
Nachher 2. Die Szene erzählt das Falsche
Für die Kachel mit der Kette halten zwei Kollegen je ein Ende. Gezeichnet ist das einwandfrei, nur liest man es als Tauziehen, also als Streit. Das ist kein Bildfehler, sondern ein Inhaltsfehler, und den findet kein Werkzeug. Die neue Szene zeigt jemanden, der die Kettenglieder mit der Lupe prüft.
Vorher
Nachher 3. Der Stil liegt knapp daneben
Der Kupferstich wirkte in der ersten Fassung eher wie eine Bleistiftzeichnung: große graue Flächen, weiche Schatten. Im Ausschnitt bei voller Größe waren trotzdem Stichlinien zu sehen. Über den Stil entscheidet also die Größe, in der das Bild später steht; Fehler sucht man bei voller Auflösung. Der Prompt verlangt seitdem ausdrücklich sichtbare Linien auf jeder Fläche und schließt graue Flächen aus.
Vorher
Nachher 4. Der Prompt widerspricht sich selbst
Bei der Kette im Kupferstich stand im Motiv „drei Glieder in drei Farben“, im Hintergrund-Baustein dagegen „nur das mittlere Glied golden“. Das Modell hat beides halb befolgt und Blau und Grün hinzugefügt. Im zweiten Versuch stand ausdrücklich „keine anderen Farben“ dabei. Wer Prompts aus Bausteinen zusammensetzt, sollte das fertige Ergebnis einmal ganz lesen.
Vorher
Nachher 5. Richtig gezeichnet, zu blass für die Kachel
Die erste Isometrie war sauber, bestand aber fast nur aus Weiß, Grau und dünnen Linien. Zwischen den kräftigen Kacheln wäre sie untergegangen. Der Prompt verlangt seitdem, dass mindestens ein Drittel der Fläche golden oder blau ist, und stellt jedes Objekt auf eine blaue Platte.
Vorher
Nachher Und was das Modell nicht verschuldet hat
Während der Arbeit entschied der Kunde, eine Kachel nicht mehr als Taschenrechner, sondern als Kette zu zeigen. Vier fertige Bilder waren damit überholt. Außerdem flog ein ganzer Stil aus inhaltlichen Gründen raus, sechs Bilder in weichem 3D (warum, steht im Stilvergleich). Mit den Testbildern und Korrekturen sind es 18 Bilder, die erzeugt, aber nicht verwendet wurden.
Überholt
Aktuell Was es gekostet hat
Abgerechnet wird nach Tokens, der Abrechnungseinheit des Modells. Die Schnittstelle meldet zu jedem Bild, wie viele es waren. Mit dem Listenpreis vom September 2026 ergibt sich:
| Posten | Menge | Preis je Million Tokens | Kosten |
|---|---|---|---|
| Bildausgabe | 312.672 Tokens (6.514 je Bild) | 30 US-Dollar | 9,38 US-Dollar |
| Texteingabe (Prompts) | 14.933 Tokens | 5 US-Dollar | 0,07 US-Dollar |
| Summe für 48 Bilder | rund 9,45 US-Dollar |
Das sind rund 20 Cent je Bild, Listenpreis ohne Steuer. Auf die 30 Bilder im Vergleich entfallen davon rund 5,90 Dollar, auf die 18 verworfenen rund 3,55 Dollar. Über den Stapelbetrieb der Schnittstelle wäre es etwa halb so teuer gewesen; die Bilder kommen dann aber erst im Lauf von bis zu 24 Stunden.
Der größere Posten ist die Arbeitszeit: Stile beschreiben, Ergebnisse prüfen, nachbessern, einbauen. Die Rechnung des Modells ist daneben eine Randnotiz.
Was wir vor jedem Einsatz prüfen
- Stil in Einsatzgröße ansehen, Fehler bei voller Auflösung suchen: Hände, Gesichter, Zeichen, Kanten.
- Die Szene in einem Satz beschreiben. Erzählt sie, was sie soll, oder kann man sie anders lesen?
- Jeden Zuschnitt der Website prüfen, am Rechner und am Handy.
- Alle Bilder einer Serie nebeneinanderlegen: gleiche Farben, gleicher Strich, gleicher Abstand zum Rand?
- Keine Schrift, keine Logos, keine erkennbaren Marken oder echten Personen.
- Herkunft festhalten: Modell, Datum und vollständiger Prompt je Bild. Was die KI-Verordnung von Unternehmen verlangt, fassen wir unter Infos zur KI-Verordnung zusammen.
- Keine fremden Bilder als Vorlage hochladen.
Wann KI-Bilder, wann nicht
Für Illustrationen sind Bildmodelle heute ein brauchbares Werkzeug: Sie liefern in Minuten eine Serie im selben Stil, und ein Stilvergleich wie dieser kostet weniger als ein Mittagessen.
Für alles, was echt sein muss, bleiben sie das falsche Werkzeug: Ihr Team, Ihre Räume, Ihre Produkte, Ihre Referenzen. Wer dort erfundene Bilder zeigt, verspielt das Vertrauen, das die Website aufbauen soll. Wo ein passendes echtes Foto existiert, ist es die erste Wahl.


