DeepSeek V4 Flash Vision 실사용 테스트

AI Cartoon Generator TeamAI Cartoon Generator Team
Aug 22, 2026

DeepSeek V4 Flash Vision은 DeepSeek가 새로 선보인 실험적 비전 모델입니다. 이미지를 읽고 그에 맞는 텍스트를 작성하는 데 특화되어 있어, 프롬프트 정리, 스토리보드 설계, 스토리 프레임 구성까지 가능합니다. 다만 이미지나 영상을 직접 생성하지는 않습니다.

카툰 제작 관점에서 보면 이 모델은 '사전 기획 어시스턴트'에 가깝습니다. 참조 이미지를 주면 모델이 먼저 캐릭터, 배경, 소품을 파악한 뒤, 이를 이미지·영상·스토리북 생성기가 이어서 사용할 수 있는 콘텐츠로 정리해 줍니다.

이번 테스트에서는 AI Cartoon Generator로 실제 생성한 캐릭터 이미지 한 장을 사용했습니다. DeepSeek V4 Flash Vision이 이 이미지를 바탕으로 이미지 생성 프롬프트, 영상 스토리보드, 6페이지 분량의 스토리북을 얼마나 잘 만들어 내는지 확인했습니다. 잘 된 부분과 틀린 부분 모두 원문 그대로 공개합니다.

DeepSeek V4 Flash Vision 이미지 프롬프트, 영상 스토리보드, 스토리북 테스트용 캐릭터 이미지

DeepSeek V4 Flash Vision이란?

DeepSeek는 2026년 8월 21일 deepseek-v4-flash-vision-exp 모델을 공개했습니다. 공식 출시 공지에 따르면 이 모델은 V4 Flash의 텍스트 능력에 이미지 입력 기능을 추가한 실험적 멀티모달 비전 이해 모델입니다.

혼동하기 쉬운 모델 이름부터 정리하겠습니다.

이름이미지 입력주 용도
deepseek-v4-flash불가텍스트 생성, 추론, 에이전트 작업
deepseek-v4-flash-vision-exp가능이미지 이해, 비전 QA, 이미지 기반 텍스트 기획
서드파티 V4 Flash Vision 프로젝트구현에 따라 다름외부 비전 모델 연결, 프록시 계층, 커뮤니티 비전 브리지 버전일 수 있음

일반 deepseek-v4-flash는 요청에 image_url을 추가한다고 해서 갑자기 이미지를 볼 수 있는 모델이 되지 않습니다. 같은 이미지를 일반 Flash에 보내면 API는 HTTP 400This model does not support image를 반환합니다. 이미지를 처리하려면 반드시 공식 Vision Exp 모델을 선택해야 합니다.

DeepSeek의 공식 Vision API 문서에 따르면 이 모델은 이미지와 텍스트를 입력받고 텍스트를 출력합니다. 시각 자료를 이해할 수는 있지만, 실제 PNG 이미지나 영상, 그림책 삽화는 별도의 생성 모델로 만들어야 합니다.

세 가지 창작 작업 테스트 방법

테스트는 2026년 8월 22일에 진행했습니다. 세 번의 요청 모두 동일한 1122 × 1402 PNG 이미지를 공개 이미지 URL로 전달했고, detailhigh로 설정했습니다. 이 이미지는 본 사이트의 실제 스토리북 생성 과정에서 나온 결과물이며, DeepSeek가 만든 것이 아닙니다. 모델의 이미지 이해 능력을 테스트하기 위한 재료로만 사용했습니다.

DeepSeek V4 Flash Vision 테스트에 사용한 달빛 정원 캐릭터 이미지

세 번의 요청 모두 다음 설정을 사용했습니다.

  • 모델: deepseek-v4-flash-vision-exp
  • 이미지 detail: high
  • temperature: 0.2
  • thinking: disabled
  • 출력 요구사항: 유효한 JSON, Markdown 코드 펜스 없이
작업입력 토큰출력 토큰총 토큰완료 상태
이미지 생성 프롬프트483255738stop
영상 스토리보드(8초)507418925stop
6페이지 스토리북51911161635stop

처음에는 thinking을 켜고 테스트했는데 결과가 좋지 않았습니다. 이미지 생성 프롬프트 요청의 max_tokens는 1200이었는데, 1200개의 출력 토큰이 전부 reasoning에 소진되어 최종 content가 비어 있었습니다. 스토리북 요청도 비슷했습니다. 5000개의 출력 토큰 중 4374개가 reasoning에 사용되면서 본문이 2페이지에서 잘렸습니다. thinking을 끄자 세 작업 모두 한 번에 완전한 결과를 반환했습니다.

이것이 thinking 모드 자체가 나쁘다는 뜻은 아닙니다. 다만 reasoning과 최종 본문이 출력 토큰 한도를 공유한다는 점을 인지해야 합니다. 형식이 고정된 작업은 굳이 길게 추론할 필요가 없습니다. thinking이 꼭 필요하다면 출력 한도를 넉넉히 잡고 finish_reason을 확인해야 합니다.

실사용 테스트 1: 참조 이미지로 이미지 생성 프롬프트 만들기

첫 번째 작업은 참조 이미지에서 55~90개 영어 단어로 된 이미지 생성 프롬프트를 추출하는 것이었습니다. 모델에게 화면에 실제로 보이는 내용만 작성하고, 추측하거나 스타일 이름을 넣지 말라고 요청했습니다. 본 사이트는 이미지 생성 전에 사용자가 선택한 스타일을 별도로 추가하기 때문입니다.

핵심 요청은 다음과 같습니다.

Study the reference image and write one reusable English text-to-image prompt
that recreates its core story moment without naming a style.
Return observed_subject, observed_setting, generation_prompt,
and negative_constraints. Keep generation_prompt between 55 and 90 words.

DeepSeek가 반환한 generation_prompt는 다음과 같습니다.

A small child with brown hair and large green eyes stands on a stone path in a
nighttime garden. They hold a glowing lantern in one hand and a large green leaf
in the other, wearing a light blue hoodie and tan shorts. A flower-covered
archway frames the scene, with a pond of water lilies nearby. A winding trail of
glowing lights leads into the distance under a crescent moon and starry sky,
surrounded by tall purple and pink flowers.

이 프롬프트는 총 80개의 영어 단어로, 55~90단어 범위를 충족합니다. 아이, 갈색 머리, 파란 후드티, 랜턴, 나뭇잎, 돌길, 연못, 꽃 아치, 달을 정확히 인식했고, 화면 스타일을 프롬프트에 넣지도 않았습니다.

모델이 함께 반환한 negative constraints는 다음과 같습니다.

No text, no captions, no logos, no watermarks, no modern buildings,
no daytime lighting, no harsh shadows, no other people, no vehicles,
no animals, no rain, no snow.

'텍스트 없음, 워터마크 없음, 다른 사람 없음'은 실제로 유용합니다. '차량 없음, 비 없음, 눈 없음'은 내용과 충돌하지는 않지만, 원본 이미지나 작업 요청에 없던 항목입니다. 실제 사용 시에는 모델이 만든 negative prompt를 그대로 쓰지 말고 이런 불필요한 항목을 걸러내야 합니다.

이렇게 정리된 주제·배경 설명을 활용하려면 프롬프트를 텍스트를 카툰으로 변환 생성기에 넣고 원하는 카툰, 애니메이션, 클레이, 스토리북 스타일을 선택하면 됩니다. '무엇을 그릴지'와 '어떤 스타일로 그릴지'를 분리해서 제어할 수 있습니다.

실사용 테스트 2: 한 장의 이미지를 영상 스토리보드로 확장하기

두 번째 작업은 같은 정지 이미지를 8초 단일 컷으로 확장하고, 4개 구간의 타임라인, 카메라 움직임, 연속성 제약, 사운드, 최종 영상 프롬프트를 만드는 것이었습니다. 8초 안에 완전한 스토리를 담으려는 것이 아니라, 하나의 동작과 한 번의 감정 변화가 선명하게 보이도록 하는 것이 목표였습니다.

모델이 만든 타임라인은 다음과 같습니다.

시간DeepSeek가 생성한 동작
0–2초아이가 돌길에 서서 초승달과 이어지는 불빛 길을 바라봄
2–4초아이가 한 걸음 앞으로 나가며 랜턴을 들어 앞길을 밝힘
4–6초아이가 오른쪽으로 살짝 돌아 수련 연못과 반딧불이를 바라봄
6–8초아이가 미소 지으며 랜턴을 살며시 흔들어 주변 꽃을 따뜻하게 비춤

또한 다음 카메라 움직임을 제안했습니다.

Slow, smooth dolly-in with a slight tilt-up, maintaining a medium-full shot of
the child.

최종 영상 프롬프트는 81개의 영어 단어입니다.

A cute chibi child with brown hair and a blue hoodie stands on a stone path in a
magical night garden. She holds a glowing lantern and a large green leaf. The
garden is filled with pink and purple flowers, a pond with water lilies, and a
stone archway. A crescent moon shines in the starry sky. Fireflies and a winding
trail of lights lead into the distance. The child looks around with wonder, her
lantern casting a warm, golden glow.

큰 방향은 벗어나지 않았고, 최종 프롬프트도 60~100단어 제한을 충족합니다. 하지만 자세히 살펴보면 세 가지 분명한 문제가 있습니다.

  1. 카메라 움직임은 하나만 요청했는데 dolly-in과 tilt-up을 동시에 넣었습니다.
  2. continuity_locks에서 원본 이미지의 tan shorts를 yellow shorts로 잘못 기록했습니다.
  3. 원본 이미지에서는 캐릭터의 성별을 알 수 없는데, 최종 프롬프트에 she를 사용했습니다.

타임라인의 동작도 너무 많습니다. 앞으로 걷기, 몸 돌리기, 랜턴 흔들기가 8초 안에 모두 들어가 있습니다. 실제 영상 생성에 사용한다면 '한 걸음 앞으로 나가며 랜턴 들어 올리기' 하나만 남기고, 몸 돌리기와 두 번째 카메라 움직임은 삭제하는 것이 좋습니다.

이 문제들을 수정한 뒤에는 AI 카툰 영상 생성기에 캐릭터 참조 이미지를 업로드하고, 명확한 동작 하나, 카메라 움직임 하나, 간단한 배경 사운드로 짧은 영상을 만들 수 있습니다.

실사용 테스트 3: 캐릭터 이미지 한 장으로 6페이지 스토리북 기획하기

세 번째 작업은 57세 독자를 위한 6페이지 분량의 이야기를 만드는 것이었습니다. 제목, 요약, 주제, 캐릭터, 연속성, 표지 설명을 포함해야 했고, 각 페이지 내레이션은 3555개의 영어 단어로 작성해야 했습니다. 캐릭터 목록에는 이미지에 실제로 등장하고 이야기 전체에 계속 등장하는 캐릭터만 넣어야 했습니다.

DeepSeek는 이야기 제목을 Luna's Lantern Path로 정했고, 주제는 '어둠 속 작은 빛이 주는 용기와 마법'입니다. 6페이지 모두 작성되었고, 이야기에는 시작, 임무, 결말이 완전하게 갖춰져 있습니다. Luna가 정원에 들어가 불빛을 따라 연못에 도착하고, 버드나무의 부탁을 듣고, 랜턴으로 꽃을 깨우고, 마지막에 집으로 돌아옵니다.

페이지내레이션 요약실제 단어 수
1Luna가 밤 정원에 들어가 모험을 준비하며 랜턴을 듦28
2그녀가 별처럼 반짝이는 불빛을 따라 정원 깊이 들어감26
3그녀가 연못에 도착해 랜턴으로 수면을 비춤26
4버드나무가 잠든 꽃을 깨워 달라고 부탁함25
5그녀가 랜턴을 들어 올려 황금빛이 꽃잎에 닿게 함24
6정원이 환해지고 그녀는 밝은 마음으로 집에 돌아감25

6페이지 원문 내레이션은 다음과 같습니다.

1. Luna stepped into the night garden. The moon was a silver smile, and the
flowers were fast asleep. She held her lantern high, ready for a new adventure.

2. A trail of tiny lights danced ahead of her. They looked like fallen stars,
twinkling and winking. Luna giggled and followed them deeper into the garden.

3. The lights stopped by a pond. The water was dark and still. Luna leaned over,
but her lantern's glow made the water sparkle like a mirror.

4. A soft whisper came from the willow tree. 'Little light, the flowers are too
sleepy to wake. Can you help them bloom?' Luna nodded bravely.

5. Luna lifted her lantern high. A warm golden light spilled out, touching every
petal. One by one, the flowers opened their eyes and smiled.

6. The garden was full of light and color. Luna smiled, knowing she had helped.
She walked home, her heart as bright as her little lantern.

이야기는 완결성 있어 보이지만, 항목별로 검증하면 문제가 많습니다. 6페이지 내레이션은 실제로 2428단어에 불과해, 요구된 3555단어를 충족한 페이지가 하나도 없습니다. 캐릭터 목록에는 The Willow TreeThe Fireflies가 추가되어 있고, 버드나무는 대사까지 있습니다. 원본 이미지로는 이런 새 캐릭터의 존재를 뒷받침할 수 없습니다.

따라서 이 결과를 바로 삽화 생성에 사용할 수는 없습니다. 실제 제품에서는 페이지 수, 페이지별 단어 수, 캐릭터 출처, 화면 설명을 자동으로 검사한 뒤, 모델에게 내레이션을 다시 쓰게 하거나 갑자기 등장한 캐릭터를 삭제하도록 결정해야 합니다.

이 문제들을 수정한 뒤에는 이야기를 AI 스토리북 생성기에 넣어 내레이션, 표지, 각 페이지 삽화를 편집할 수 있습니다. 매 페이지마다 프롬프트를 즉흥적으로 쓰는 것보다, 캐릭터 설정과 연속성을 먼저 고정해 두는 편이 그림이 중간에 변형되는 것을 막는 데 훨씬 효과적입니다.

DeepSeek V4 Flash Vision API 호출 방법

공식 문서는 세 가지 일반적인 이미지 입력 방식을 지원합니다. Base64, 공개 이미지 URL, Files API의 file_id입니다. 작은 이미지를 임시로 테스트할 때는 Base64를, 이미 공개 링크가 있다면 URL을, 같은 이미지를 반복해서 사용해야 한다면 Files API가 편리합니다.

다음은 간단한 Python 호출 예시입니다.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[
        {
            "role": "user",
            "content": [
                {
                    "type": "text",
                    "text": "참조 이미지를 분석하고 단일 컷 8초 영상 프롬프트를 생성해 주세요.",
                },
                {
                    "type": "image_url",
                    "image_url": {
                        "url": "https://example.com/reference.png",
                        "detail": "high",
                    },
                },
            ],
        }
    ],
    extra_body={"thinking": {"type": "disabled"}},
)

print(response.choices[0].message.content)

이미지는 user 메시지에 넣어야 합니다. detail: "low"는 대략적인 내용만 파악할 때 적합하고, 캐릭터 복장이나 소품을 구분해야 한다면 high 또는 original을 선택할 수 있습니다. 파일 크기, 이미지 개수, 입력 방식별 제한 사항은 공식 Vision 문서를 기준으로 확인하세요.

모델이 반환한 JSON을 검증해야 하는 이유

이번 세 번의 공식 요청은 모두 파싱 가능한 JSON을 반환했고, Markdown 코드 펜스도 없었습니다. 하지만 사전 테스트 단계에서는 '유효한 JSON만 반환하라'고 명시했는데도 모델이 결과물에 코드 펜스를 붙인 경우가 있었습니다. 이번에 성공했다고 해서 앞으로도 항상 형식이 올바르게 나온다는 보장은 없습니다.

실제 제품에 연동할 때는 최소한 다음 항목을 확인해야 합니다.

  1. 반환된 내용이 JSON으로 정상 파싱되는지
  2. 필수 필드가 존재하고 타입이 올바른지
  3. 타임라인이나 스토리북 페이지 수가 요구사항을 충족하는지
  4. 내레이션과 최종 프롬프트가 단어 수 범위 안에 있는지
  5. 캐릭터 이름, 복장, 핵심 소품이 장면을 넘어 일관적인지
  6. 출력에 허용되지 않은 스타일 단어, 자막, 워터마크 요구가 섞여 있는지
  7. finish_reasonlength가 아닌 stop인지

프롬프트를 정리하거나 고정 형식을 채울 때는 긴 내부 추론이 필요하지 않은 경우가 많습니다. 공식 thinking mode 문서를 참고해 작업에 따라 thinking을 끌지 결정하면 됩니다. 이야기 논리가 복잡할 때는 thinking을 유지해도 좋지만, 출력 상한을 높이고 본문이 잘리는 상황에 대비해야 합니다.

언제 사용할 가치가 있을까?

이미 캐릭터 이미지나 삽화를 보유하고 있고, 이를 다른 콘텐츠로 확장하려는 경우 DeepSeek V4 Flash Vision이 유용합니다.

  • 캐릭터 이미지 한 장으로 재사용 가능한 장면 프롬프트를 추출하려는 경우
  • 완성된 삽화 한 장으로 짧은 다이내믹 영상 컷을 설계하려는 경우
  • 캐릭터와 세계관을 바탕으로 여러 페이지 분량의 어린이 이야기를 확장하려는 경우
  • 참조 이미지에서 구조화된 캐릭터, 장면, 소품 정보를 추출하려는 경우

단순히 카툰 이미지 한 장을 생성하려는 목적이라면 비전 모델을 거칠 필요가 없습니다. AI 카툰 생성기에 아이디어를 입력하거나 참조 이미지를 업로드하면 충분합니다. 같은 소재를 반복해서 사용하거나, 캐릭터 일관성을 유지하거나, 한 캐릭터를 영상과 스토리북으로 계속 확장하려는 경우에만 이 단계가 더 가치 있습니다.

자주 묻는 질문

DeepSeek V4 Flash는 이미지 입력을 지원하나요?

일반 deepseek-v4-flash는 이미지를 받지 않습니다. 이미지를 처리하려면 공식 모델 ID인 deepseek-v4-flash-vision-exp를 사용해야 합니다.

DeepSeek V4 Flash Vision이 이미지를 직접 생성할 수 있나요?

아니요. 이 모델은 이미지를 읽고 텍스트를 작성하는 역할을 합니다. 실제 이미지를 얻으려면 별도의 텍스트-이미지 생성 모델이나 이미지 편집 모델을 사용해야 합니다.

Vision Exp와 커뮤니티 버전 DeepSeek V4 Flash Vision은 같은 모델인가요?

아닐 수 있습니다. 공식 Vision Exp는 명확한 API ID를 가진 모델입니다. 커뮤니티 프로젝트는 다른 비전 인코더, 프록시 계층, 독립 배포 모델을 연결한 것일 수 있으며 호출 방식과 실제 성능이 다를 수 있습니다.

이미지 URL, Base64, Files API 중 무엇을 사용해야 하나요?

작은 이미지를 가끔 테스트할 때는 Base64를, 이미 공개 주소에 있다면 URL을, 같은 이미지를 반복 사용하거나 파일이 크다면 Files API를 고려하세요.

API에 reasoning 토큰이 많은데 본문이 없는 이유는 무엇인가요?

thinking 과정과 최종 본문이 max_tokens를 공유합니다. reasoning이 먼저 한도를 소진하면 본문이 비어 있을 수 있습니다. 형식이 고정된 작업은 thinking을 끄고, thinking이 필요하다면 출력 상한을 높이고 finish_reason을 확인하세요.

모델이 반환한 JSON을 바로 저장해도 되나요?

권장하지 않습니다. 먼저 코드 펜스를 제거하고, JSON 형식, 필드 구조, 배열 길이, 단어 수, 캐릭터 연속성을 검증한 뒤 저장하세요.

실사용 테스트 결론: 사전 기획 단계에 적합

세 가지 테스트 결과를 종합하면, DeepSeek V4 Flash Vision이 가장 잘하는 역할은 최종 생성이 아니라 창작 전 단계의 정리와 기획입니다. 캐릭터 이미지 한 장을 주면 이미지 생성 프롬프트, 영상 스토리보드, 스토리북 초안을 빠르게 작성해 주어, 빈 화면에서 시작하는 수고를 덜어 줍니다.

다만 모델이 내놓은 결과를 그대로 사용할 수는 없습니다. 이번 테스트에서 이미지 생성 프롬프트는 대체로 합격점이었지만, 영상 스토리보드는 카메라 움직임과 복장을 잘못 짚었고, 스토리북은 6페이지를 채웠지만 단어 수 요구를 충족한 페이지가 없었으며 캐릭터를 임의로 추가했습니다. JSON이 완전하다는 것은 형식이 깨지지 않았다는 뜻일 뿐, 내용이 올바르다는 뜻은 아닙니다.

더 현실적인 사용법은 모델에게 이미지를 읽고 초안을 작성하게 한 뒤, 프롬프트·스토리보드·이야기를 각각의 생성 도구에 넘기고, 마지막에 캐릭터, 복장, 동작, 단어 수, 형식을 직접 검수하는 것입니다. 이 모델은 사전 작업 속도를 높여 주지만, 최종 판단을 대신할 수는 없습니다.

관련 읽을거리: AI 카툰 생성기란 무엇인가?2026년 AI 카툰 생성기 비교.

추천 글