DeepSeek V4 Flash Vision ist das neue experimentelle Vision-Modell von DeepSeek. Es betrachtet Bilder und schreibt auf dieser Grundlage Texte: Prompts strukturieren, Storyboards entwerfen, Geschichten skizzieren – aber es erzeugt keine Bilder oder Videos.
Für die Cartoon-Produktion ist es eher ein Planungsassistent für die Vorproduktion. Du gibst ihm ein Referenzbild, es erkennt Figur, Szene und Requisiten und schreibt daraus Inhalte, die Bild-, Video- oder Storybook-Generatoren weiterverarbeiten können.
Für diesen Test haben wir eine echte Charaktergrafik aus dem AI Cartoon Generator verwendet. Wir wollten wissen, ob DeepSeek V4 Flash Vision daraus einen Bild-Prompt, ein Video-Storyboard und ein sechsseitiges Storybook entwickeln kann. Was gut funktioniert hat und wo es hakte, zeigen wir ungefiltert.

Was ist DeepSeek V4 Flash Vision?
DeepSeek hat am 21. August 2026 das Modell deepseek-v4-flash-vision-exp veröffentlicht. Laut offizieller Ankündigung handelt es sich um ein experimentelles multimodales Vision-Modell, das die Textfähigkeiten von V4 Flash um Bildeingabe erweitert.
Zunächst sollten wir einige leicht verwechselbare Bezeichnungen klären:
| Name | Akzeptiert Bilder | Geeignet für |
|---|---|---|
deepseek-v4-flash | Nein | Textgenerierung, Reasoning und Agent-Aufgaben |
deepseek-v4-flash-vision-exp | Ja | Bildverständnis, visuelle Fragen, bildbasierte Textplanung |
| Drittanbieter-V4-Flash-Vision | Implementierungsabhängig | Externes Vision-Modell, Proxy-Schicht oder Community-Bridge |
Das normale deepseek-v4-flash lernt nicht plötzlich Bilder zu verstehen, nur weil die Anfrage ein image_url enthält. Wir haben dasselbe Bild an das normale Flash-Modell geschickt – die API antwortete mit HTTP 400 und This model does not support image. Für Bildverarbeitung muss zwingend das offizielle Vision-Exp-Modell gewählt werden.
Die offizielle Vision-API-Dokumentation von DeepSeek erklärt: Das Modell akzeptiert Bilder und Text, die Ausgabe bleibt Text. Es kann visuelles Material verstehen, aber echte PNGs, Videos oder Buchillustrationen müssen weiterhin von entsprechenden Generatoren erzeugt werden.
So haben wir die drei Kreativaufgaben getestet
Testzeitpunkt war der 22. August 2026. Alle drei Anfragen verwendeten dasselbe 1122 × 1402-PNG, übergeben über eine öffentliche Bild-URL, mit detail auf high. Das Bild stammt aus einem echten Storybook-Workflow dieser Website – nicht von DeepSeek. Wir haben es ausschließlich als Testmaterial für die Bildanalyse verwendet.
Alle drei Anfragen nutzten dieselben Einstellungen:
- Modell:
deepseek-v4-flash-vision-exp - Bilddetail:
high - temperature:
0.2 - thinking:
disabled - Ausgabeformat: gültiges JSON, ohne Markdown-Codeblöcke
| Aufgabe | Eingabe-Tokens | Ausgabe-Tokens | Gesamt-Tokens | Status |
|---|---|---|---|---|
| Bild-Prompt | 483 | 255 | 738 | stop |
| Video-Storyboard (8 Sek.) | 507 | 418 | 925 | stop |
| Sechsseitiges Storybook | 519 | 1116 | 1635 | stop |
Zunächst hatten wir thinking aktiviert – das lief nicht gut. Die Bild-Prompt-Anfrage hatte max_tokens von 1200, aber alle 1200 Ausgabe-Tokens wurden vom Reasoning verbraucht; content blieb leer. Ähnlich beim Storybook: 4374 von 5000 Ausgabe-Tokens gingen ans Reasoning, der Text brach nach der zweiten Seite ab. Nach dem Deaktivieren von thinking lieferten alle drei Aufgaben vollständige Ergebnisse in einem Durchlauf.
Das heißt nicht, dass der Denkmodus schlecht ist – er teilt sich nur das Ausgabekontingent mit dem eigentlichen Text. Für fest formatierte Aufgaben ist langes Reasoning meist unnötig. Falls es doch gebraucht wird, sollte man mehr Ausgabeplatz einplanen und finish_reason prüfen.
Test 1: Bild-Prompt aus dem Referenzbild extrahieren
Die erste Aufgabe: Aus dem Referenzbild einen wiederverwendbaren englischen Text-zu-Bild-Prompt mit 55–90 Wörtern erstellen. Wir verlangten, dass das Modell nur sichtbare Inhalte beschreibt, nichts hinzuerfindet und keinen Stil nennt – der Stil wird auf dieser Website ohnehin separat vom Nutzer gewählt, bevor das Bild generiert wird.
Die zentrale Anfrage lautete:
Study the reference image and write one reusable English text-to-image prompt
that recreates its core story moment without naming a style.
Return observed_subject, observed_setting, generation_prompt,
and negative_constraints. Keep generation_prompt between 55 and 90 words.DeepSeeks generation_prompt lautete:
A small child with brown hair and large green eyes stands on a stone path in a
nighttime garden. They hold a glowing lantern in one hand and a large green leaf
in the other, wearing a light blue hoodie and tan shorts. A flower-covered
archway frames the scene, with a pond of water lilies nearby. A winding trail of
glowing lights leads into the distance under a crescent moon and starry sky,
surrounded by tall purple and pink flowers.Der Prompt umfasst 80 englische Wörter und liegt damit im geforderten Bereich. Er erkennt Kind, braunes Haar, blaues Hoodie, Laterne, Blatt, Steinweg, Teich, Blumenbogen und Mond – und nennt keinen Stil.
Das Modell lieferte außerdem diese negativen Constraints:
No text, no captions, no logos, no watermarks, no modern buildings,
no daytime lighting, no harsh shadows, no other people, no vehicles,
no animals, no rain, no snow.„Kein Text, kein Wasserzeichen, keine anderen Personen“ ist nützlich. „Keine Fahrzeuge, kein Regen, kein Schnee“ widerspricht zwar nicht, war aber weder im Bild noch in der Aufgabe gefordert. Solche überflüssigen Punkte sollte man vor der Verwendung entfernen, statt den Negative Prompt des Modells ungeprüft zu übernehmen.
Wer diese Subjekt- und Szenenbeschreibung weiterverwenden möchte, kann den bereinigten Prompt in den Text-zu-Cartoon-Generator geben und dort Cartoon-, Anime-, Clay- oder Storybook-Stil wählen. So bleiben „Was wird gezeigt“ und „In welchem Stil“ getrennt steuerbar.
Test 2: Ein Standbild wird zum Video-Storyboard
Die zweite Aufgabe: Dasselbe Standbild zu einem 8-Sekunden-Einzel-Shot erweitern, mit Vier-Zeit-Achse, Kamerabewegung, Kontinuitätsregeln, Ton und finalem Video-Prompt. Wir wollten keine komplette Geschichte in acht Sekunden pressen, sondern eine einzige Aktion und einen Gefühlswechsel sichtbar machen.
Die Zeitachse des Modells:
| Zeit | Von DeepSeek generierte Aktion |
|---|---|
| 0–2 Sek. | Kind steht auf dem Steinweg, blickt zum Mond und dem leuchtenden Pfad |
| 2–4 Sek. | Kind macht einen Schritt nach vorn, hebt die Laterne, um den Weg zu erhellen |
| 4–6 Sek. | Kind dreht sich leicht nach rechts, blickt zum Seerosenteich und den Glühwürmchen |
| 6–8 Sek. | Kind lächelt und schwingt die Laterne sanft, warmes Licht fällt auf die Blumen |
Zudem empfahl es:
Slow, smooth dolly-in with a slight tilt-up, maintaining a medium-full shot of
the child.Der finale Video-Prompt umfasst 81 englische Wörter:
A cute chibi child with brown hair and a blue hoodie stands on a stone path in a
magical night garden. She holds a glowing lantern and a large green leaf. The
garden is filled with pink and purple flowers, a pond with water lilies, and a
stone archway. A crescent moon shines in the starry sky. Fireflies and a winding
trail of lights lead into the distance. The child looks around with wonder, her
lantern casting a warm, golden glow.Die Grundrichtung stimmt, der finale Prompt liegt mit 60–100 Wörtern im Rahmen. Bei genauerem Hinsehen fallen jedoch drei Probleme auf:
- Wir hatten genau eine Kamerabewegung verlangt – das Modell lieferte dolly-in und tilt-up.
- In
continuity_lockswurde aus den tan shorts des Originalbilds yellow shorts. - Das Bild lässt das Geschlecht offen, der finale Prompt setzt trotzdem
she.
Auch die Zeitachse enthält zu viele Aktionen: Vorwärtsgehen, Drehen und Laterne schwingen in acht Sekunden. Für die echte Videogenerierung würde ich nur „einen Schritt nach vorn und Laterne heben“ behalten und die Drehung sowie die zweite Kamerabewegung streichen.
Nach diesen Korrekturen lässt sich das Bild im AI-Cartoon-Video-Generator hochladen und mit einer klaren Aktion, einer Kamerabewegung und einfachem Hintergrundton zu einem kurzen Video verarbeiten.
Test 3: Mit einer Charaktergrafik ein sechsseitiges Storybook planen
Die dritte Aufgabe: Eine sechsseitige Geschichte für 5- bis 7-jährige Leser, inklusive Titel, Zusammenfassung, Thema, Figuren, Kontinuität und Cover-Beschreibung. Jede Seiten-Erzählung sollte 35–55 englische Wörter umfassen, und die Figurenliste durfte nur Charaktere enthalten, die tatsächlich im Bild vorkommen und dauerhaft auftreten.
DeepSeek nannte die Geschichte Luna's Lantern Path, Thema ist „Mut und Magie durch ein kleines Licht in der Dunkelheit“. Alle sechs Seiten wurden geschrieben, die Geschichte hat einen klaren Anfang, eine Aufgabe und ein Ende: Luna betritt den Garten, folgt dem Licht zum Teich, hört die Weide um Hilfe bitten, weckt mit der Laterne die Blumen und kehrt nach Hause zurück.
| Seite | Erzählzusammenfassung | Tatsächliche Wörter |
|---|---|---|
| 1 | Luna betritt den Nachtgarten, hebt die Laterne, bereit für ein Abenteuer | 28 |
| 2 | Sie folgt den sternenartig funkelnden Lichtern tiefer in den Garten | 26 |
| 3 | Sie erreicht den Teich und beleuchtet mit der Laterne das Wasser | 26 |
| 4 | Die Weide bittet sie, die schlafenden Blumen zum Blühen zu bringen | 25 |
| 5 | Sie hebt die Laterne und lässt goldenes Licht die Blütenblätter berühren | 24 |
| 6 | Der Garten erstrahlt, sie kehrt mit hellem Herzen nach Hause zurück | 25 |
Die sechs Original-Erzählungen:
1. Luna stepped into the night garden. The moon was a silver smile, and the
flowers were fast asleep. She held her lantern high, ready for a new adventure.
2. A trail of tiny lights danced ahead of her. They looked like fallen stars,
twinkling and winking. Luna giggled and followed them deeper into the garden.
3. The lights stopped by a pond. The water was dark and still. Luna leaned over,
but her lantern's glow made the water sparkle like a mirror.
4. A soft whisper came from the willow tree. 'Little light, the flowers are too
sleepy to wake. Can you help them bloom?' Luna nodded bravely.
5. Luna lifted her lantern high. A warm golden light spilled out, touching every
petal. One by one, the flowers opened their eyes and smiled.
6. The garden was full of light and color. Luna smiled, knowing she had helped.
She walked home, her heart as bright as her little lantern.Die Geschichte wirkt vollständig, aber bei genauer Prüfung zeigen sich mehrere Probleme. Die sechs Erzählungen haben tatsächlich nur 24–28 Wörter – keine einzige erreicht die geforderten 35–55. In der Figurenliste tauchen zudem The Willow Tree und The Fireflies auf, die Weide bekommt sogar einen Dialog – das Originalbild bietet dafür keine ausreichende Grundlage.
Dieses Ergebnis kann also nicht direkt zur Illustrationsgenerierung verwendet werden. In einem Produkt müsste man mindestens Seitenzahl, Wortzahl pro Seite, Figurenherkunft und Bildbeschreibung automatisch prüfen und dann entscheiden, ob das Modell die Erzählungen neu schreibt oder die erfundenen Figuren entfernt werden.
Nach diesen Korrekturen lässt sich die Geschichte in den AI-Storybook-Generator geben, um bearbeitbare Erzählungen, Cover und Seitenillustrationen zu erstellen. Wer zuerst Figuren und Kontinuität festlegt, vermeidet eher, dass die Bilder im Verlauf der Seiten ihren Charakter verändern – anders als wenn man für jede Seite spontan einen neuen Prompt schreibt.
So rufst du die DeepSeek-V4-Flash-Vision-API auf
Die offizielle Dokumentation nennt drei übliche Wege für Bildeingaben: Base64, öffentliche Bild-URLs und die file_id der Files API. Für einen schnellen Test mit einem kleinen Bild reicht Base64; wenn das Bild bereits öffentlich erreichbar ist, übergibst du direkt die URL; bei wiederholter Verwendung desselben Bildes ist die Files API praktischer.
Hier ein vereinfachtes Python-Beispiel:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[
{
"role": "user",
"content": [
{
"type": "text",
"text": "Analysiere das Referenzbild und erstelle einen Video-Prompt für einen einzelnen 8-Sekunden-Shot.",
},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/reference.png",
"detail": "high",
},
},
],
}
],
extra_body={"thinking": {"type": "disabled"}},
)
print(response.choices[0].message.content)Das Bild gehört in die user-Nachricht. detail: "low" reicht für einen groben Überblick; wer Kleidung und kleine Requisiten unterscheiden muss, wählt high oder original. Die genauen Limits für Dateigröße, Bildanzahl und Eingabemethoden stehen in der offiziellen Vision-Dokumentation.
Warum das JSON des Modells trotzdem geprüft werden muss
Alle drei offiziellen Testanfragen lieferten parsebares JSON ohne Markdown-Codeblöcke. In den früheren Testläufen hatte das Modell die Ausgabe jedoch trotz der Anweisung „nur gültiges JSON“ in Codeblöcke gesetzt. Der jetzige Erfolg bedeutet also nicht, dass das Format immer stimmt.
Wer das wirklich in ein Produkt einbaut, sollte mindestens Folgendes prüfen:
- Lässt sich die Ausgabe als JSON parsen?
- Sind die Pflichtfelder vorhanden und typkorrekt?
- Entspricht die Zeitachse oder Seitenzahl den Vorgaben?
- Liegen Erzählungen und finale Prompts im geforderten Wortbereich?
- Bleiben Figurennamen, Kleidung und Schlüsselrequisiten über alle Szenen konsistent?
- Enthält die Ausgabe unerlaubte Stilbegriffe, Untertitel oder Wasserzeichen-Anweisungen?
- Ist
finish_reasongleichstopstattlength?
Für das Strukturieren von Prompts oder das Ausfüllen fester Formate ist langes internes Reasoning meist unnötig. Die offizielle Dokumentation zum Denkmodus hilft bei der Entscheidung, ob thinking aktiviert bleiben sollte. Bei komplexeren Geschichten kann es sinnvoll sein, aber dann braucht es ein höheres Ausgabelimit und eine Strategie für abgeschnittene Texte.
Wann lohnt sich der Einsatz?
Wer bereits eine Charaktergrafik oder Illustration hat und daraus weitere Inhalte entwickeln möchte, für den ist DeepSeek V4 Flash Vision nützlich:
- Vorhandene Charaktergrafik, aus der ein wiederverwendbarer Szenen-Prompt extrahiert werden soll
- Fertige Illustration, für die ein kurzer Bewegungs-Shot geplant werden soll
- Vorhandene Figur und Welt, die zu einer mehrseitigen Kindergeschichte ausgebaut werden sollen
- Strukturierte Extraktion von Figur, Szene und Requisiten aus einem Referenzbild
Wer einfach nur ein Cartoon-Bild erzeugen möchte, muss nicht den Umweg über ein Vision-Modell gehen. Im AI Cartoon Generator reicht es, eine Idee einzugeben oder ein Referenzbild hochzuladen. Erst wenn dasselbe Material wiederholt verwendet, eine Figur konsistent bleiben oder dieselbe Figur zu Video und Storybook weiterentwickelt werden soll, wird dieser Schritt wertvoll.
Häufige Fragen
Unterstützt DeepSeek V4 Flash Bildeingaben?
Das normale deepseek-v4-flash akzeptiert keine Bilder. Für Bildverständnis muss das offizielle Modell deepseek-v4-flash-vision-exp verwendet werden.
Kann DeepSeek V4 Flash Vision direkt Bilder erzeugen?
Nein. Das Modell betrachtet Bilder und schreibt Text. Für echte Bilder sind weiterhin Text-zu-Bild- oder Bildbearbeitungsmodelle nötig.
Ist Vision Exp dasselbe wie die Community-Version von DeepSeek V4 Flash Vision?
Nicht unbedingt. Das offizielle Vision Exp hat eine klare API-ID. Community-Projekte können andere visuelle Encoder, Proxy-Schichten oder eigenständig bereitgestellte Modelle verwenden – Aufruf und Fähigkeiten können abweichen.
Sollte ich Bild-URL, Base64 oder Files API verwenden?
Für gelegentliche Tests mit einem kleinen Bild reicht Base64. Liegt das Bild bereits öffentlich vor, übergibst du die URL. Bei wiederholter Verwendung desselben Bildes oder größeren Dateien ist die Files API sinnvoll.
Warum liefert die API viele Reasoning-Tokens, aber keinen Text?
Denkprozess und endgültiger Text teilen sich max_tokens. Wenn das Reasoning das Kontingent aufbraucht, bleibt der Text leer. Für fest formatierte Aufgaben kann thinking deaktiviert werden; falls es aktiv bleiben soll, erhöhe das Ausgabelimit und achte auf finish_reason.
Kann ich das JSON direkt speichern, nachdem das Modell es geliefert hat?
Direkt speichern ist nicht ratsam. Entferne zuerst mögliche Codeblöcke und prüfe dann JSON-Format, Feldstruktur, Array-Längen, Wortzahlen und Figurenkontinuität.
Fazit: Geeignet für die Vorplanung
Nach diesen drei Tests liegt die Stärke von DeepSeek V4 Flash Vision nicht in der Endproduktion, sondern in der Aufbereitung und Planung vor der eigentlichen Generierung. Mit einer Charaktergrafik erstellt es schnell Bild-Prompts, Video-Storyboards und Storybook-Entwürfe und spart so Zeit beim Sammeln und Strukturieren von Material.
Die Ergebnisse sind jedoch nicht direkt übernehmbar. Der Bild-Prompt war diesmal brauchbar, das Video-Storyboard hatte Fehler bei Kamerabewegung und Kleidung, und das Storybook füllte zwar sechs Seiten, erreichte aber auf keiner Seite die Wortvorgabe und fügte eigenmächtig Figuren hinzu. Ein parsebares JSON bedeutet nur, dass das Format stimmt – nicht, dass der Inhalt korrekt ist.
Praktischer ist der Einsatz so: Das Modell liest das Bild und erstellt Entwürfe, dann übernimmt das jeweilige Generierungswerkzeug Prompt, Storyboard oder Geschichte, und am Ende prüft man Figuren, Kleidung, Aktionen, Wortzahlen und Format. Es beschleunigt die Vorarbeit, ersetzt aber nicht die abschließende Kontrolle.
Weiterlesen: Was ist ein AI-Cartoon-Generator? und AI-Cartoon-Generatoren im Vergleich 2026.

