Zum Inhalt springen
Digitalcheck

News & Blog

KI-Bilder für die Firmenwebsite:
48 Bilder, rund 9,50 Dollar und fünf Fehler

Werkzeug, Prompts, Kosten und Prüfung: der Weg zu 30 Illustrationen, offen gelegt.

Philipp Kant, Technischer Leiter der Deutschen Stadtmarketing

Philipp KantTechnischer Leiter, Schwerpunkt KI

Veröffentlicht am

Für den Stilvergleich im Beitrag Ein Motiv, fünf Stile brauchten wir dreißig Illustrationen in fünf Stilen, und zwar schnell. Gezeichnet hat sie ein Bildmodell. Hier steht, wie das ablief: welches Werkzeug, wie die Prompts aufgebaut waren, was es gekostet hat und welche Fehler erst beim genauen Hinsehen auffielen.

  • 48Bilder erzeugt
  • 30davon im Stilvergleich
  • ≈ 90 sje Bild
  • ≈ 0,20 $je Bild, Listenpreis

Das Werkzeug

Die Bilder stammen aus dem Bildmodell gpt-image-2 von OpenAI, abgerufen über die Programmierschnittstelle und nicht über ein Chatfenster. Ein kleines Skript schickt die Prompts ab, speichert jedes Bild und schreibt dazu Modell, Uhrzeit, Größe und den vollständigen Prompt in eine Protokolldatei. Fünf Bilder laufen gleichzeitig, eines braucht rund anderthalb Minuten. Bestellt war hohe Qualität im Format 4:3 mit 1536 mal 1152 Pixeln.

Gegenüber dem Chat hat das zwei Vorteile: Jeder Stil lässt sich später mit denselben Worten wiederholen, und zu jedem Bild ist belegt, woher es stammt.

Nur Text, keine Vorlage

Als Richtung für einen der Stile gab es ein Beispielbild von einer fremden Website. Das haben wir nicht hochgeladen, sondern in Worten beschrieben: Tuschelinien, Punktraster, eine blaue Schmuckfarbe. Das Modell sollte den Stil treffen und nicht die Bilder eines anderen Unternehmens nachbauen. Auch die vorhandenen Grafiken des Kunden gingen nicht mit; die Motive standen nur als Text im Prompt. Die Schnittstelle bestätigt das: Für alle 48 Bilder meldet sie null Bild-Tokens auf der Eingabeseite.

So ist ein Prompt aufgebaut

Jeder Prompt bestand aus vier Bausteinen. Der Stil stand für alle sechs Bilder eines Stils wörtlich gleich da, nur Motiv und Hintergrund wechselten. Das hält eine Serie zusammen, ohne dass man ein Referenzbild braucht.

  1. Stil Wie gezeichnet wird: Technik, Strich, Farben und was nicht vorkommen darf. für alle sechs Bilder eines Stils wörtlich gleich
  2. Motiv Was zu sehen ist: ein Gegenstand oder eine kleine Szene. je Kachel anders
  3. Hintergrund Die Grundfarbe, passend zur Position im Raster. je Kachel anders
  4. Gemeinsame Regeln Keine Schrift, Motiv klein und mittig, ein klares Motiv. für alle 48 Bilder gleich

Die gemeinsamen Regeln sparen die meiste Nacharbeit. Keine Schrift, weil Bildmodelle gern Buchstaben erfinden. Motiv klein und mittig, weil die Website dasselbe Bild in zwei Formaten zeigt. Ein Motiv mit wenigen großen Formen, weil die Kachel auf dem Handy nur wenige Zentimeter breit ist.

Ein vollständiger Prompt

So lautete der Prompt für das Bild der Beraterin mit dem Tablet. Er ist englisch, weil die Modelle damit am zuverlässigsten arbeiten.

Beraterin zeigt einen Stuhl auf dem Tablet, daneben der echte Stuhl, gezeichnet in Tusche mit blauen Flächen
Das Ergebnis dieses Prompts.
Hand-drawn editorial ink illustration in a bold, graphic, slightly naive style, like a modern tech brand illustration. Thick, confident, slightly wobbly black ink outlines. Shading and surfaces as coarse, clearly visible pattern fills: large halftone dot screens, diagonal hatching and small checker patterns on clothing and objects; many areas stay white paper. Exactly one spot color, cobalt blue (#2F54EB), as flat fills on a few selected areas such as a vest, sleeves, shoes, screens and accents. No other colors, no gradients, no realistic rendering, no fine detail. Simplified people with dot eyes, simple short hair and simple hands, slightly stylized proportions. The scene stands isolated on the background, only a small patch of hatched floor shadow, no room, no scenery.

Subject: a woman in a blazer holding up a large tablet that shows a picture of a modern shell chair and rows of blank product attribute bars; the real shell chair stands next to her.

Background: plain very light warm grey (#F6F6F4).

Square-cornered 4:3 illustration for the service tiles of a B2B consulting website about product data, ERP and pricing software. Absolutely no text, no letters, no words, no numbers, no logos, no watermark, no signature, no frame, no border. The subject is small in the frame: it fills at most 62 percent of the image height and 70 percent of the width, is centered, and leaves a wide empty band of background above and below, so the image can be cropped to 16:10 without cutting anything. One clear subject, few large shapes, instantly readable at small size.

Erster Versuch, zweiter Versuch

Der erste Versuch in diesem Stil war gut gezeichnet, aber zu realistisch und zu groß im Bild. Auf einer Unterseite schneidet die Website die Kacheln im Format 16:10 zu, dabei wären Kopf und Füße der Figur weggefallen. Die Korrektur stand im Prompt: gröbere Raster, einfachere Gesichter und das Motiv auf höchstens 62 Prozent der Bildhöhe.

Erster Versuch: realistischere Beraterin, groß im Bild Erster Versuch
Der gestrichelte Rahmen zeigt den 16:10-Zuschnitt: Kopf und Füße liegen außerhalb.
Zweiter Versuch: einfacher gezeichnet und kleiner im Bild Zweiter Versuch
Gröber, einfacher und vollständig im Zuschnitt.

Fünf Fehler, die erst beim Hinsehen auffielen

Im verkleinerten Überblick sahen alle Bilder brauchbar aus. Bei den folgenden fünf änderte sich das, sobald man genauer hinsah.

1. Der Haken sitzt neben dem Kästchen

Der Roboterarm sollte den letzten Punkt der Checkliste abhaken. Er setzte den Haken daneben. In der Kachel fällt das kaum auf, im Ausschnitt sofort. Im zweiten Anlauf beschrieb der Prompt genau, wo die Stiftspitze sitzt.

Ausschnitt: Der Haken steht rechts neben dem leeren Kästchen Vorher
Ausschnitt bei voller Auflösung: Das Kästchen bleibt leer.
Ausschnitt: Der Haken sitzt im Kästchen Nachher
Nach der Korrektur: Die Stiftspitze sitzt im Kästchen.

2. Die Szene erzählt das Falsche

Für die Kachel mit der Kette halten zwei Kollegen je ein Ende. Gezeichnet ist das einwandfrei, nur liest man es als Tauziehen, also als Streit. Das ist kein Bildfehler, sondern ein Inhaltsfehler, und den findet kein Werkzeug. Die neue Szene zeigt jemanden, der die Kettenglieder mit der Lupe prüft.

Zwei Personen halten eine Kette zwischen sich Vorher
Sauber gezeichnet, aber es sieht nach Tauziehen aus.
Ein Mann prüft eine hängende Kette mit der Lupe Nachher
Die Kette wird geprüft, nicht umkämpft.

3. Der Stil liegt knapp daneben

Der Kupferstich wirkte in der ersten Fassung eher wie eine Bleistiftzeichnung: große graue Flächen, weiche Schatten. Im Ausschnitt bei voller Größe waren trotzdem Stichlinien zu sehen. Über den Stil entscheidet also die Größe, in der das Bild später steht; Fehler sucht man bei voller Auflösung. Der Prompt verlangt seitdem ausdrücklich sichtbare Linien auf jeder Fläche und schließt graue Flächen aus.

Tablet mit Stuhl, weich schattiert wie mit Bleistift Vorher
Wirkt in Kachelgröße wie Bleistift.
Tablet mit Stuhl in deutlichen Stichlinien Nachher
Deutliche Linien, ein goldenes Feld.

4. Der Prompt widerspricht sich selbst

Bei der Kette im Kupferstich stand im Motiv „drei Glieder in drei Farben“, im Hintergrund-Baustein dagegen „nur das mittlere Glied golden“. Das Modell hat beides halb befolgt und Blau und Grün hinzugefügt. Im zweiten Versuch stand ausdrücklich „keine anderen Farben“ dabei. Wer Prompts aus Bausteinen zusammensetzt, sollte das fertige Ergebnis einmal ganz lesen.

Kette mit einem blaugrauen, einem goldenen und einem grünen Glied Vorher
Blau und Grün, obwohl nur Gold vorgesehen war.
Kette mit zwei hellen Gliedern und einem goldenen in der Mitte Nachher
Zwei helle Glieder, eines in Gold.

5. Richtig gezeichnet, zu blass für die Kachel

Die erste Isometrie war sauber, bestand aber fast nur aus Weiß, Grau und dünnen Linien. Zwischen den kräftigen Kacheln wäre sie untergegangen. Der Prompt verlangt seitdem, dass mindestens ein Drittel der Fläche golden oder blau ist, und stellt jedes Objekt auf eine blaue Platte.

Isometrisches Tablet, überwiegend weiß und grau Vorher
Korrekt, aber zu blass.
Isometrisches Tablet mit blauem Rahmen auf blauer Platte Nachher
Mehr Farbe, eine Platte als Standfläche.

Und was das Modell nicht verschuldet hat

Während der Arbeit entschied der Kunde, eine Kachel nicht mehr als Taschenrechner, sondern als Kette zu zeigen. Vier fertige Bilder waren damit überholt. Außerdem flog ein ganzer Stil aus inhaltlichen Gründen raus, sechs Bilder in weichem 3D (warum, steht im Stilvergleich). Mit den Testbildern und Korrekturen sind es 18 Bilder, die erzeugt, aber nicht verwendet wurden.

Taschenrechner im Risodruck Überholt
Erst der Taschenrechner …
Kette im Risodruck Aktuell
… dann die Kette, nach der Entscheidung des Kunden.

Was es gekostet hat

Abgerechnet wird nach Tokens, der Abrechnungseinheit des Modells. Die Schnittstelle meldet zu jedem Bild, wie viele es waren. Mit dem Listenpreis vom September 2026 ergibt sich:

PostenMengePreis je Million TokensKosten
Bildausgabe312.672 Tokens (6.514 je Bild)30 US-Dollar9,38 US-Dollar
Texteingabe (Prompts)14.933 Tokens5 US-Dollar0,07 US-Dollar
Summe für 48 Bilderrund 9,45 US-Dollar

Das sind rund 20 Cent je Bild, Listenpreis ohne Steuer. Auf die 30 Bilder im Vergleich entfallen davon rund 5,90 Dollar, auf die 18 verworfenen rund 3,55 Dollar. Über den Stapelbetrieb der Schnittstelle wäre es etwa halb so teuer gewesen; die Bilder kommen dann aber erst im Lauf von bis zu 24 Stunden.

Der größere Posten ist die Arbeitszeit: Stile beschreiben, Ergebnisse prüfen, nachbessern, einbauen. Die Rechnung des Modells ist daneben eine Randnotiz.

Was wir vor jedem Einsatz prüfen

  1. Stil in Einsatzgröße ansehen, Fehler bei voller Auflösung suchen: Hände, Gesichter, Zeichen, Kanten.
  2. Die Szene in einem Satz beschreiben. Erzählt sie, was sie soll, oder kann man sie anders lesen?
  3. Jeden Zuschnitt der Website prüfen, am Rechner und am Handy.
  4. Alle Bilder einer Serie nebeneinanderlegen: gleiche Farben, gleicher Strich, gleicher Abstand zum Rand?
  5. Keine Schrift, keine Logos, keine erkennbaren Marken oder echten Personen.
  6. Herkunft festhalten: Modell, Datum und vollständiger Prompt je Bild. Was die KI-Verordnung von Unternehmen verlangt, fassen wir unter Infos zur KI-Verordnung zusammen.
  7. Keine fremden Bilder als Vorlage hochladen.

Wann KI-Bilder, wann nicht

Für Illustrationen sind Bildmodelle heute ein brauchbares Werkzeug: Sie liefern in Minuten eine Serie im selben Stil, und ein Stilvergleich wie dieser kostet weniger als ein Mittagessen.

Für alles, was echt sein muss, bleiben sie das falsche Werkzeug: Ihr Team, Ihre Räume, Ihre Produkte, Ihre Referenzen. Wer dort erfundene Bilder zeigt, verspielt das Vertrauen, das die Website aufbauen soll. Wo ein passendes echtes Foto existiert, ist es die erste Wahl.

Weiterlesen Ein Motiv, fünf Stile: welche Bildsprache passt zu Ihrer Website? Wir haben die sechs Kacheln einer Beratungswebsite in fünf Stilen zeichnen lassen: gleiche Motive, andere Wirkung. Was die Stile über ein Unternehmen sagen, welcher rausflog und welche fünf Fragen vor der Wahl stehen.

Alle Beiträge

Kostenlos · Digitalcheck

Und bei Ihnen im Betrieb?

Schildern Sie uns Ihre Lage in drei Klicks. Wir prüfen persönlich und sagen Ihnen, welcher Schritt zuerst etwas bringt. Ohne Verkaufsdruck.

Ihre Ansprechpartner

  • Matthias Kant, Geschäftsführer der Deutschen Stadtmarketing Matthias KantGeschäftsführer, INQA-CoachDipl.-Wirtsch.-Ing.
  • Philipp Kant, Technischer Leiter der Deutschen Stadtmarketing Philipp KantTechnischer Leiter, Schwerpunkt KIM.Sc. Informatik

+49 2151-986975-0 Lieber direkt sprechen? Rufen Sie an.