DeepSeek V4 Flash Vision: prueba en flujos creativos

AI Cartoon Generator TeamAI Cartoon Generator Team
Aug 22, 2026

DeepSeek V4 Flash Vision es el nuevo modelo de visión experimental de DeepSeek. Lee imágenes y escribe texto a partir de ellas: puede organizar prompts, diseñar storyboards o armar una estructura narrativa, pero no genera imágenes ni vídeos directamente.

Para la creación de dibujos animados, funciona mejor como asistente de planificación. Le das una imagen de referencia, reconoce personajes, escenarios y objetos, y luego convierte esa información en contenido que un generador de imágenes, vídeos o Storybooks pueda aprovechar.

En esta prueba usamos una imagen de personaje generada por AI Cartoon Generator para ver si DeepSeek V4 Flash Vision podía convertirla en un prompt de imagen, un guion gráfico de vídeo y un Storybook de seis páginas. Mostramos tanto lo que funcionó como los errores reales, sin corregirlos.

Imagen de prueba para DeepSeek V4 Flash Vision: prompt de imagen, storyboard y Storybook

Qué es DeepSeek V4 Flash Vision

DeepSeek publicó deepseek-v4-flash-vision-exp el 21 de agosto de 2026. Según el anuncio oficial, es un modelo multimodal experimental de comprensión visual que añade entrada de imágenes a las capacidades de texto de V4 Flash.

Primero, aclaremos algunos nombres que pueden confundir:

Nombre¿Acepta imágenes?Para qué sirve
deepseek-v4-flashNoGeneración de texto, razonamiento y agentes
deepseek-v4-flash-vision-expComprensión de imágenes, preguntas visuales y planificación basada en imágenes
Proyectos de terceros con V4 Flash VisionDepende de la implementaciónPueden ser modelos visuales externos, capas proxy o puentes comunitarios

El deepseek-v4-flash normal no empieza a "ver" imágenes solo porque añadas image_url a la petición. Enviamos la misma imagen al Flash normal y la API devolvió HTTP 400 con el mensaje This model does not support image. Para procesar imágenes hay que usar el modelo oficial Vision Exp.

La documentación oficial de Vision API de DeepSeek indica que el modelo acepta imágenes y texto, pero la salida sigue siendo texto. Puede entender material visual, pero la generación real de PNG, vídeo o ilustraciones debe hacerla otro modelo.

Cómo probamos las tres tareas de creación

La prueba se realizó el 22 de agosto de 2026. Las tres peticiones usaron la misma imagen PNG de 1122 × 1402, enviada mediante una URL pública, con detail en high. Esta imagen proviene del flujo real de generación de Storybooks de este sitio; no fue creada por DeepSeek. Solo la usamos para evaluar la capacidad de lectura visual del modelo.

Imagen de personaje en un jardín nocturno usada para probar DeepSeek V4 Flash Vision

Las tres peticiones usaron esta configuración:

  • Modelo: deepseek-v4-flash-vision-exp
  • Detalle de imagen: high
  • temperature: 0.2
  • thinking: disabled
  • Formato de salida: JSON válido, sin cercos de código Markdown
TareaTokens de entradaTokens de salidaTokens totalesEstado final
Prompt de imagen483255738stop
Storyboard (8 seg)507418925stop
Storybook de 6 págs.51911161635stop

Al principio dejamos activado el modo thinking y los resultados no fueron buenos. La petición del prompt de imagen tenía max_tokens de 1200, pero los 1200 tokens de salida se consumieron en razonamiento y el content final quedó vacío. La petición del Storybook tuvo un problema similar: de 5000 tokens de salida, 4374 se usaron en razonamiento y el texto se cortó en la segunda página. Al desactivar thinking, las tres tareas devolvieron resultados completos en una sola llamada.

Esto no significa que el modo thinking sea malo, solo que comparte el presupuesto de tokens con el texto final. Para tareas con formato fijo, normalmente no hace falta que el modelo razone durante mucho tiempo. Si lo necesitas, reserva más espacio de salida y revisa finish_reason.

Prueba 1: extraer un prompt de imagen a partir de una imagen de referencia

La primera tarea consistía en crear un prompt de imagen en inglés de 55 a 90 palabras a partir de la imagen de referencia. Pedimos al modelo que escribiera solo lo que se ve realmente en la imagen, sin suposiciones ni nombres de estilos, porque este sitio añade el estilo elegido por el usuario antes de generar la imagen.

La petición principal fue:

Study the reference image and write one reusable English text-to-image prompt
that recreates its core story moment without naming a style.
Return observed_subject, observed_setting, generation_prompt,
and negative_constraints. Keep generation_prompt between 55 and 90 words.

El generation_prompt que devolvió DeepSeek fue:

A small child with brown hair and large green eyes stands on a stone path in a
nighttime garden. They hold a glowing lantern in one hand and a large green leaf
in the other, wearing a light blue hoodie and tan shorts. A flower-covered
archway frames the scene, with a pond of water lilies nearby. A winding trail of
glowing lights leads into the distance under a crescent moon and starry sky,
surrounded by tall purple and pink flowers.

Este prompt tiene 80 palabras en inglés, dentro del rango de 55 a 90. El modelo identificó al niño, el pelo castaño, la sudadera azul, la linterna, la hoja, el camino de piedra, el estanque, el arco de flores y la luna. Tampoco incluyó el estilo visual en el prompt.

También devolvió estas restricciones negativas:

No text, no captions, no logos, no watermarks, no modern buildings,
no daytime lighting, no harsh shadows, no other people, no vehicles,
no animals, no rain, no snow.

"Sin texto, sin marcas de agua, sin otras personas" es útil. "Sin vehículos, sin lluvia, sin nieve" no contradice la imagen, pero tampoco estaba en la imagen ni en la tarea. Antes de usar esto en producción, conviene eliminar ese tipo de elementos sobrantes en lugar de copiar el negative prompt tal cual.

Si quieres reutilizar esta descripción de sujeto y escenario, puedes llevar el prompt ajustado al generador de texto a dibujos animados y elegir el estilo que prefieras: cartoon, anime, clay o Storybook. Así separas "qué dibujar" de "con qué estilo dibujarlo".

Prueba 2: convertir una imagen en un guion gráfico de vídeo

La segunda tarea consistía en expandir la misma imagen estática en un plano único de 8 segundos, con una línea de tiempo de cuatro segmentos, movimiento de cámara, restricciones de continuidad, sonido y un prompt final de vídeo. No queríamos meter una historia completa en ocho segundos, solo una acción y un cambio de emoción que se pudieran ver con claridad.

La línea de tiempo que generó el modelo fue:

TiempoAcción generada por DeepSeek
0–2 sEl niño está en el camino de piedra, mirando la luna creciente y el sendero de luces
2–4 sEl niño da un paso adelante y levanta la linterna para iluminar el camino
4–6 sEl niño se gira ligeramente a la derecha y mira el estanque de nenúfares y las luciérnagas
6–8 sEl niño sonríe y balancea suavemente la linterna; la luz cálida ilumina las flores

También sugirió este movimiento de cámara:

Slow, smooth dolly-in with a slight tilt-up, maintaining a medium-full shot of
the child.

El prompt final de vídeo tenía 81 palabras en inglés:

A cute chibi child with brown hair and a blue hoodie stands on a stone path in a
magical night garden. She holds a glowing lantern and a large green leaf. The
garden is filled with pink and purple flowers, a pond with water lilies, and a
stone archway. A crescent moon shines in the starry sky. Fireflies and a winding
trail of lights lead into the distance. The child looks around with wonder, her
lantern casting a warm, golden glow.

La dirección general era correcta y el prompt final cumplía el límite de 60 a 100 palabras. Pero al revisar con detalle, aparecieron tres problemas claros:

  1. Pedimos un solo movimiento de cámara, pero el modelo escribió dos: dolly-in y tilt-up.
  2. En continuity_locks, los pantalones cortos color tan de la imagen original aparecen como yellow shorts.
  3. En la imagen no se puede determinar el género del personaje, pero el prompt final usa directamente she.

La línea de tiempo también tiene demasiadas acciones: caminar, girarse y balancear la linterna en ocho segundos. Si realmente fuera a generar un vídeo, yo dejaría solo "dar un paso adelante y levantar la linterna", y eliminaría el giro y el segundo movimiento de cámara.

Después de corregir estos problemas, puedes subir la imagen de referencia del personaje al generador de vídeos de dibujos animados con IA y crear un vídeo corto con una acción clara, un solo movimiento de cámara y un fondo de sonido sencillo.

Prueba 3: planificar un Storybook de seis páginas con una imagen de personaje

La tercera tarea consistía en escribir una historia de seis páginas para lectores de 5 a 7 años, con título, resumen, tema, personajes, continuidad y notas de portada. Cada narración de página debía tener entre 35 y 55 palabras en inglés, y la lista de personajes solo podía incluir a quienes aparecen realmente en la imagen y siguen presentes en la historia.

DeepSeek tituló la historia Luna's Lantern Path, con el tema "el valor y la magia de una pequeña luz en la oscuridad". Las seis páginas están completas, con un inicio, una misión y un final: Luna entra al jardín, sigue las luces hasta el estanque, escucha al sauce pedir ayuda, usa su linterna para despertar las flores y vuelve a casa.

PáginaResumen de la narraciónPalabras reales
1Luna entra al jardín nocturno y levanta su linterna para la aventura28
2Sigue las luces que parpadean como estrellas hacia el interior26
3Llega al estanque y usa la linterna para iluminar el agua26
4El sauce le pide ayuda para despertar las flores dormidas25
5Levanta la linterna y deja que la luz dorada toque los pétalos24
6El jardín se ilumina y ella vuelve a casa con el corazón brillante25

Las narraciones originales de las seis páginas son:

1. Luna stepped into the night garden. The moon was a silver smile, and the
flowers were fast asleep. She held her lantern high, ready for a new adventure.

2. A trail of tiny lights danced ahead of her. They looked like fallen stars,
twinkling and winking. Luna giggled and followed them deeper into the garden.

3. The lights stopped by a pond. The water was dark and still. Luna leaned over,
but her lantern's glow made the water sparkle like a mirror.

4. A soft whisper came from the willow tree. 'Little light, the flowers are too
sleepy to wake. Can you help them bloom?' Luna nodded bravely.

5. Luna lifted her lantern high. A warm golden light spilled out, touching every
petal. One by one, the flowers opened their eyes and smiled.

6. The garden was full of light and color. Luna smiled, knowing she had helped.
She walked home, her heart as bright as her little lantern.

La historia parece completa, pero al revisar punto por punto, hay varios problemas. Las narraciones tienen entre 24 y 28 palabras, y ninguna alcanza el mínimo de 35. La lista de personajes incluye a The Willow Tree y The Fireflies; el sauce incluso tiene diálogo, pero la imagen original no da suficiente información para sostener estos personajes nuevos.

Por eso, este resultado no se puede usar directamente para generar ilustraciones. En un producto real, al menos habría que comprobar automáticamente el número de páginas, las palabras por página, el origen de los personajes y las notas de ilustración, y luego decidir si el modelo debe reescribir las narraciones o eliminar los personajes que aparecen de la nada.

Después de corregir estos problemas, puedes llevar la historia al generador de Storybooks con IA para crear narraciones editables, portada e ilustraciones por página. En lugar de escribir un prompt nuevo para cada página, es mejor fijar primero los personajes y la continuidad, así las ilustraciones no cambian de aspecto a mitad de la historia.

Cómo llamar a la API de DeepSeek V4 Flash Vision

La documentación oficial admite tres formas habituales de enviar imágenes: Base64, URL pública de imagen y file_id de la Files API. Para probar una imagen pequeña de forma puntual, puedes usar Base64. Si la imagen ya tiene una URL pública, envíala directamente. Si vas a reutilizar la misma imagen varias veces, la Files API es más cómoda.

Este es un ejemplo simplificado de llamada en Python:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[
        {
            "role": "user",
            "content": [
                {
                    "type": "text",
                    "text": "Analiza la imagen de referencia y genera un prompt de vídeo de 8 segundos en un solo plano.",
                },
                {
                    "type": "image_url",
                    "image_url": {
                        "url": "https://example.com/reference.png",
                        "detail": "high",
                    },
                },
            ],
        }
    ],
    extra_body={"thinking": {"type": "disabled"}},
)

print(response.choices[0].message.content)

La imagen debe ir en el mensaje user. detail: "low" sirve para una comprensión general. Si necesitas distinguir la ropa del personaje o los objetos pequeños, elige high u original. Los límites de tamaño de archivo, cantidad de imágenes y formato de entrada están en la documentación oficial de Vision.

Por qué hay que validar el JSON que devuelve el modelo

En esta prueba, las tres peticiones formales devolvieron JSON válido y sin cercos de código Markdown. Pero en las pruebas preliminares, aunque pedimos "solo JSON válido", el modelo envolvió el resultado en un cerco de código. Que esta vez haya funcionado no garantiza que el formato siempre sea correcto.

Si vas a integrar esto en un producto, al menos comprueba lo siguiente:

  1. Que el contenido se pueda parsear como JSON
  2. Que los campos obligatorios existan y tengan el tipo correcto
  3. Que la línea de tiempo o el número de páginas del Storybook cumplan lo pedido
  4. Que las narraciones y el prompt final estén dentro del rango de palabras
  5. Que los nombres de personajes, la ropa y los objetos clave mantengan coherencia entre escenas
  6. Que la salida no incluya palabras de estilo, subtítulos o marcas de agua no permitidas
  7. Que finish_reason sea stop y no length

Para organizar prompts o rellenar formatos fijos, normalmente no hace falta un razonamiento interno largo. Puedes consultar la documentación oficial del modo thinking y decidir si lo desactivas según la tarea. Si la historia es compleja, puedes mantenerlo, pero tendrás que aumentar el límite de salida y prepararte para que el texto se corte.

Cuándo merece la pena usarlo

Si ya tienes una imagen de personaje o una ilustración y quieres convertirla en otro formato, DeepSeek V4 Flash Vision puede ser útil:

  • Tienes una imagen de personaje y quieres extraer un prompt de escena reutilizable
  • Tienes una ilustración terminada y quieres diseñar un plano de vídeo corto
  • Tienes un personaje y un mundo definidos y quieres ampliarlos a una historia infantil de varias páginas
  • Necesitas extraer información estructurada de personajes, escenarios y objetos a partir de una imagen de referencia

Si solo quieres generar una imagen de dibujos animados, no hace falta pasar por un modelo de visión. Puedes escribir tu idea o subir una imagen de referencia directamente en AI Cartoon Generator. El modelo de visión aporta más valor cuando quieres reutilizar el mismo material, mantener la coherencia del personaje o convertir un personaje en vídeo y Storybook.

Preguntas frecuentes

¿DeepSeek V4 Flash admite entrada de imágenes?

El deepseek-v4-flash normal no acepta imágenes. Para trabajar con imágenes hay que usar el modelo oficial deepseek-v4-flash-vision-exp.

¿DeepSeek V4 Flash Vision puede generar imágenes directamente?

No. Se encarga de leer imágenes y escribir texto. Para obtener la imagen real, necesitas un modelo de texto a imagen o de edición de imágenes.

¿Vision Exp es el mismo modelo que las versiones comunitarias de DeepSeek V4 Flash Vision?

No necesariamente. El Vision Exp oficial tiene un ID de API claro. Los proyectos comunitarios pueden usar otros codificadores visuales, capas proxy o modelos desplegados de forma independiente, con métodos de llamada y capacidades distintas.

¿Debo usar URL de imagen, Base64 o Files API?

Para probar una imagen pequeña de forma puntual, puedes usar Base64. Si la imagen ya está en una URL pública, envíala directamente. Si vas a reutilizar la misma imagen o el archivo es grande, considera la Files API.

¿Por qué la API devuelve muchos tokens de razonamiento pero sin texto final?

El razonamiento y el texto final comparten max_tokens. Si el razonamiento consume todo el presupuesto, el contenido puede quedar vacío. Para tareas con formato fijo, puedes desactivar thinking. Si lo necesitas, aumenta el límite de salida y revisa finish_reason.

¿Puedo guardar directamente el JSON que devuelve el modelo?

No es recomendable. Primero quita los cercos de código que puedan aparecer y luego revisa el formato JSON, la estructura de campos, la longitud de los arrays, el número de palabras y la coherencia de los personajes.

Conclusión práctica: sirve para planificar, no para generar

Según estas tres pruebas, el lugar natural de DeepSeek V4 Flash Vision no es la generación final, sino la organización y planificación previa. Con una imagen de personaje, el modelo escribe rápido un prompt de imagen, un guion gráfico de vídeo y un borrador de Storybook, y te ahorra tiempo al empezar desde cero.

Pero lo que devuelve no se puede usar tal cual. En esta prueba, el prompt de imagen fue aceptable, el storyboard confundió el movimiento de cámara y la ropa, y el Storybook, aunque completó seis páginas, no alcanzó el mínimo de palabras en ninguna y añadió personajes sin justificación. Un JSON válido solo demuestra que el formato no está roto, no que el contenido sea correcto.

El uso más práctico es dejar que el modelo lea la imagen y haga un borrador, y luego pasar ese prompt, storyboard o historia al generador correspondiente. Después, revisa personajes, ropa, acciones, número de palabras y formato. Acelera el trabajo previo, pero no sustituye la decisión final.

Lecturas relacionadas: ¿Qué es un generador de dibujos animados con IA? y Comparativa de generadores de dibujos animados con IA en 2026.

Lecturas recomendadas