DeepSeek V4 Flash Vision 实测:提示词、视频分镜与 Storybook

AI Cartoon Generator TeamAI Cartoon Generator Team
2026/08/22

DeepSeek V4 Flash Vision 是 DeepSeek 新推出的实验性视觉模型。它会看图,也会根据图片写文字:整理提示词、设计分镜、搭故事框架都可以,但它不会直接生成图片或视频。

对卡通创作来说,它更像一个前期策划助手。你给它一张参考图,它先认出角色、场景和道具,再把这些信息写成图片、视频或 Storybook 生成器能继续使用的内容。

这次我们选了一张由 AI Cartoon Generator 实际生成的角色图,看看 DeepSeek V4 Flash Vision 能不能把它继续发展成生图提示词、视频分镜和六页 Storybook。好用的地方和出错的地方,我们都原样放出来。

DeepSeek V4 Flash Vision 图片提示词、视频分镜和 Storybook 测试素材

DeepSeek V4 Flash Vision 是什么?

DeepSeek 在 2026 年 8 月 21 日发布了 deepseek-v4-flash-vision-exp。根据官方发布公告,它是一个实验性的多模态视觉理解模型,在 V4 Flash 的文本能力上增加了图片输入。

先把几个容易混淆的名称说清楚:

名称是否接受图片适合做什么
deepseek-v4-flash文本生成、推理和 Agent 任务
deepseek-v4-flash-vision-exp图片理解、视觉问答和基于图片的文本规划
第三方 V4 Flash Vision 项目取决于实现可能是外接视觉模型、代理层或社区视觉桥接版本

普通 deepseek-v4-flash 不会因为请求里加了 image_url 就突然会看图。我们把同一张图片发给普通 Flash,API 直接返回 HTTP 400This model does not support image。要处理图片,必须选择官方的 Vision Exp 模型。

DeepSeek 的官方 Vision API 文档说明,该模型接受图片和文字,输出仍然是文字。它可以理解视觉素材,但真正的 PNG、视频或绘本插图仍需交给对应的生成模型完成。

我们如何测试三个创作任务

测试时间是 2026 年 8 月 22 日。三次请求都使用同一张 1122 × 1402 PNG,通过公开图片 URL 传入,detail 设为 high。这张图来自本站真实的 Storybook 生成流程,不是 DeepSeek 生成的;我们只拿它来测试模型的读图能力。

用于 DeepSeek V4 Flash Vision 测试的月光花园角色图

三次请求都使用以下设置:

  • 模型:deepseek-v4-flash-vision-exp
  • 图片细节:high
  • temperature:0.2
  • thinking:disabled
  • 输出要求:有效 JSON,不添加 Markdown 代码围栏
任务输入 tokens输出 tokens总 tokens完成状态
生图提示词483255738stop
视频分镜(8 秒)507418925stop
六页 Storybook51911161635stop

我们一开始保留了 thinking,结果并不顺利。生图提示词请求的 max_tokens 是 1200,1200 个输出 token 全被 reasoning 用完,最后的 content 为空。Storybook 请求也遇到了类似情况:5000 个输出 token 中有 4374 个花在 reasoning 上,正文写到第二页就被截断了。关闭 thinking 后,三个任务都能一次返回完整结果。

这不代表思考模式本身不好,只是它会和最终正文共用输出额度。固定格式的任务通常没必要让模型长时间推理;如果确实需要,就要留出更大的输出空间,并检查 finish_reason

实测一:从参考图提炼生图提示词

第一项任务是从参考图里整理一条 55–90 个英文单词的生图提示词。我们要求模型只写画面里真正看得到的内容,不要猜测,也不要加入风格名称,因为本站会在生成图片前另行加入用户选择的风格。

核心请求是:

Study the reference image and write one reusable English text-to-image prompt
that recreates its core story moment without naming a style.
Return observed_subject, observed_setting, generation_prompt,
and negative_constraints. Keep generation_prompt between 55 and 90 words.

DeepSeek 给出的 generation_prompt 是:

A small child with brown hair and large green eyes stands on a stone path in a
nighttime garden. They hold a glowing lantern in one hand and a large green leaf
in the other, wearing a light blue hoodie and tan shorts. A flower-covered
archway frames the scene, with a pond of water lilies nearby. A winding trail of
glowing lights leads into the distance under a crescent moon and starry sky,
surrounded by tall purple and pink flowers.

这条提示词共 80 个英文单词,符合 55–90 词范围。它识别出了孩子、棕色头发、蓝色连帽衫、灯笼、叶片、石板路、池塘、花拱门和月亮,也没有把画面风格写进提示词。

模型同时返回了下面的负面约束:

No text, no captions, no logos, no watermarks, no modern buildings,
no daytime lighting, no harsh shadows, no other people, no vehicles,
no animals, no rain, no snow.

“无文字、无水印、无其他人物”确实有用;“无车辆、无雨、无雪”虽然不冲突,但原图和任务都没有要求这些内容。正式使用前应该删掉这类多余项,而不是把模型写出的 negative prompt 照单全收。

如果想沿用这种主体与场景描述,可以把整理后的提示词放入文本转卡通生成器,再选择需要的卡通、动漫、黏土或 Storybook 风格。这样能把“画什么”和“用什么风格画”分开控制。

实测二:把一张图片变成视频分镜

第二项任务是把同一张静态图片扩展成一个 8 秒单镜头,并给出四段时间轴、运镜、连续性约束、声音和最终视频提示词。我们不打算在八秒里塞进完整故事,只希望一个动作和一次情绪变化能看清楚。

模型给出的时间轴是:

时间DeepSeek 生成的动作
0–2 秒孩子站在石板路上,望向弯月和延伸的灯光小径
2–4 秒孩子向前走一步,抬高灯笼照亮前路
4–6 秒孩子稍微转向右侧,看向睡莲池和萤火虫
6–8 秒孩子微笑并轻轻摆动灯笼,暖光照亮周围花朵

它还建议使用:

Slow, smooth dolly-in with a slight tilt-up, maintaining a medium-full shot of
the child.

最终视频提示词共 81 个英文单词:

A cute chibi child with brown hair and a blue hoodie stands on a stone path in a
magical night garden. She holds a glowing lantern and a large green leaf. The
garden is filled with pink and purple flowers, a pond with water lilies, and a
stone archway. A crescent moon shines in the starry sky. Fireflies and a winding
trail of lights lead into the distance. The child looks around with wonder, her
lantern casting a warm, golden glow.

大方向没有跑偏,最终提示词也符合 60–100 词的限制。不过细看之后,仍有三个明显问题:

  1. 我们只要求一种运镜,它却同时写了 dolly-in 和 tilt-up。
  2. continuity_locks 把原图的 tan shorts 写成了 yellow shorts。
  3. 原图看不出角色性别,最终提示词却直接用了 she

时间轴里的动作也有点多:向前走、转身、摆动灯笼都挤在八秒里。真要拿去生成视频,我会只保留“向前一步并抬高灯笼”,删掉转身和第二种运镜。

把这些问题改掉后,就可以在AI 卡通视频生成器中上传角色参考图,用一个明确动作、一种运镜和简单的背景声音生成短视频。

实测三:用一张角色图规划六页 Storybook

第三项任务是为 5–7 岁读者写一个六页故事,包括标题、摘要、主题、角色、连续性和封面说明。每页旁白要有 35–55 个英文单词,角色表里也只能放入图片中确实出现、并会持续登场的角色。

DeepSeek 把故事命名为 Luna's Lantern Path,主题是“黑暗中小小光芒带来的勇气和魔法”。六页都写出来了,故事也有完整的起点、任务和结尾:Luna 走进花园,跟随灯光来到池塘,听见柳树求助,用灯笼唤醒花朵,最后回家。

页码旁白摘要实际词数
1Luna 进入夜间花园,举起灯笼准备冒险28
2她跟随像星星一样闪烁的灯光深入花园26
3她来到池塘边,用灯笼照亮水面26
4柳树请求她帮助沉睡的花朵开放25
5她举起灯笼,让金色光芒触碰花瓣24
6花园亮起,她带着明亮的心回家25

六页原始旁白如下:

1. Luna stepped into the night garden. The moon was a silver smile, and the
flowers were fast asleep. She held her lantern high, ready for a new adventure.

2. A trail of tiny lights danced ahead of her. They looked like fallen stars,
twinkling and winking. Luna giggled and followed them deeper into the garden.

3. The lights stopped by a pond. The water was dark and still. Luna leaned over,
but her lantern's glow made the water sparkle like a mirror.

4. A soft whisper came from the willow tree. 'Little light, the flowers are too
sleepy to wake. Can you help them bloom?' Luna nodded bravely.

5. Luna lifted her lantern high. A warm golden light spilled out, touching every
petal. One by one, the flowers opened their eyes and smiled.

6. The garden was full of light and color. Luna smiled, knowing she had helped.
She walked home, her heart as bright as her little lantern.

故事看起来完整,但逐项核对后,问题不少。六页旁白实际只有 24–28 词,没有一页达到要求的 35–55 词。角色表里还多了 The Willow TreeThe Fireflies,柳树甚至有了对白,而原图并不足以支持这些新角色。

所以,这份结果还不能直接拿去生成插图。在产品里,至少要自动检查页数、每页词数、角色来源和画面说明,再决定让模型重写旁白,还是删掉凭空出现的角色。

把这些问题修正后,再把故事放进AI Storybook 生成器,继续制作可编辑旁白、封面和各页插图。比起每一页临时写一条提示词,先把角色设定和连续性定下来,更不容易画着画着就变了样。

如何调用 DeepSeek V4 Flash Vision API

官方文档支持三种常见的图片输入方式:Base64、公开图片 URL,以及 Files API 的 file_id。临时测试一张小图可以用 Base64;图片已经有公开链接,就直接传 URL;同一张图需要反复使用时,Files API 会更方便。

下面是一个简化的 Python 调用示例:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[
        {
            "role": "user",
            "content": [
                {
                    "type": "text",
                    "text": "分析参考图,并生成一个单镜头 8 秒视频提示词。",
                },
                {
                    "type": "image_url",
                    "image_url": {
                        "url": "https://example.com/reference.png",
                        "detail": "high",
                    },
                },
            ],
        }
    ],
    extra_body={"thinking": {"type": "disabled"}},
)

print(response.choices[0].message.content)

图片要放在 user 消息中。detail: "low" 适合只看大致内容;如果要分辨角色服装和小道具,可以选 highoriginal。文件大小、图片数量和输入方式的具体限制,以官方 Vision 文档为准。

为什么还要校验模型返回的 JSON

这次三次正式请求都返回了可以解析的 JSON,也没有加 Markdown 代码围栏。不过在前期试跑中,即使我们写明“只返回有效 JSON”,模型还是给结果套上了代码围栏。所以这次成功,不代表以后每次格式都会正确。

真正接进产品时,至少要检查以下几点:

  1. 返回内容能不能正常解析成 JSON
  2. 必需字段是否存在,类型是否正确
  3. 时间轴或 Storybook 页数是否符合要求
  4. 旁白和最终提示词是否落在字数范围内
  5. 角色名称、服装和关键道具是否跨场景一致
  6. 输出是否夹带不允许的风格词、字幕或水印要求
  7. finish_reason 是否为 stop,而不是 length

整理提示词或填写固定格式时,通常不需要很长的内部推理。可以参考官方思考模式文档,按任务决定是否关闭 thinking。故事逻辑比较复杂时可以保留,但要提高输出上限,也要准备处理正文被截断的情况。

什么时候值得用它?

如果手上已经有角色图或插图,还想把它继续做成其他内容,DeepSeek V4 Flash Vision 会比较有用:

  • 有一张角色图,希望提取可复用的场景提示词
  • 有一张完成插图,希望设计一个简短动态镜头
  • 有一个角色和世界观,希望扩展成多页儿童故事
  • 需要从参考图提取结构化的角色、场景与道具信息

如果只是想生成一张卡通图片,其实没必要先绕到视觉模型。直接在AI Cartoon Generator里输入想法或上传参考图就够了。只有当你想反复使用同一份素材、保持角色一致,或者把一个角色继续做成视频和 Storybook 时,这一步才更有价值。

常见问题

DeepSeek V4 Flash 支持图片输入吗?

普通 deepseek-v4-flash 不接受图片。要看图,需要改用官方模型 ID deepseek-v4-flash-vision-exp

DeepSeek V4 Flash Vision 可以直接生成图片吗?

不可以。它负责看图和写文字。要得到实际图片,仍然要使用文本转图片或图片编辑模型。

Vision Exp 与社区版 DeepSeek V4 Flash Vision 是同一个模型吗?

不一定。官方 Vision Exp 有明确的 API ID。社区项目可能连接了其他视觉编码器、代理层或独立部署的模型,调用方法和实际能力都可能不同。

应该使用图片 URL、Base64 还是 Files API?

偶尔测试一张小图,可以用 Base64;图片已经放在公开地址上,就直接传 URL;同一张图要反复使用,或者文件较大,再考虑 Files API。

为什么 API 有很多 reasoning tokens,却没有正文?

思考过程和最终正文共用 max_tokens。如果推理先把额度用完,正文就可能为空。固定格式的任务可以关闭 thinking;需要保留时,就提高输出上限,并留意 finish_reason

模型返回 JSON 后可以直接保存吗?

不建议直接保存。先去掉可能出现的代码围栏,再检查 JSON 格式、字段结构、数组长度、字数和角色连续性。

实测结论:适合做前期规划

从这三项测试来看,DeepSeek V4 Flash Vision 最合适的位置不是最终生成,而是创作前的整理和规划。给它一张角色图,它能很快写出生图提示词、视频分镜和 Storybook 草稿,省去从空白开始梳理素材的时间。

它给出的内容还不能直接照用。这次的生图提示词基本合格,视频分镜弄错了运镜和服装,Storybook 虽然写满六页,却没有一页达到字数要求,还擅自增加了角色。完整的 JSON 只能说明格式没坏,不能说明内容已经正确。

更实际的用法是先让它读图和起草,再把提示词、分镜或故事交给对应的生成工具,最后检查角色、服装、动作、字数和格式。它能加快前期工作,但不能替代最后的判断。

延伸阅读:什么是 AI 卡通生成器?以及2026 年 AI 卡通生成器对比

推荐阅读