Uji DeepSeek V4 Flash Vision untuk Alur Kreatif

AI Cartoon Generator TeamAI Cartoon Generator Team
Aug 22, 2026

DeepSeek V4 Flash Vision adalah model vision eksperimental baru dari DeepSeek. Model ini bisa membaca gambar dan menulis teks berdasarkan gambar tersebut: merapikan prompt, merancang storyboard, menyusun kerangka cerita—semua bisa. Tapi model ini tidak bisa menghasilkan gambar atau video secara langsung.

Untuk kebutuhan kartun, model ini lebih cocok sebagai asisten perencanaan awal. Anda memberi satu gambar referensi, model ini mengenali karakter, latar, dan properti, lalu menuliskannya menjadi konten yang bisa dipakai generator gambar, video, atau Storybook.

Kali ini kami memilih satu gambar karakter yang benar-benar dibuat oleh AI Cartoon Generator untuk melihat apakah DeepSeek V4 Flash Vision bisa mengembangkannya menjadi prompt gambar, storyboard video, dan Storybook enam halaman. Bagian yang berhasil dan bagian yang keliru, kami tampilkan apa adanya.

Materi uji DeepSeek V4 Flash Vision untuk prompt gambar, storyboard video, dan Storybook

Apa itu DeepSeek V4 Flash Vision?

DeepSeek merilis deepseek-v4-flash-vision-exp pada 21 Agustus 2026. Menurut pengumuman resmi, ini adalah model pemahaman visual multimodal eksperimental yang menambahkan input gambar ke kemampuan teks V4 Flash.

Ada beberapa nama yang sering tertukar. Mari kita luruskan:

NamaMenerima GambarCocok Untuk
deepseek-v4-flashTidakGenerate teks, penalaran, dan tugas agen
deepseek-v4-flash-vision-expYaPemahaman gambar, visual QA, perencanaan teks berbasis gambar
Proyek V4 Flash Vision pihak ketigaTergantung implementasiBisa berupa model vision eksternal, lapisan proxy, atau jembatan vision komunitas

deepseek-v4-flash biasa tidak tiba-tiba bisa membaca gambar hanya karena request memuat image_url. Kami mengirim gambar yang sama ke Flash biasa, dan API langsung mengembalikan HTTP 400 dengan pesan This model does not support image. Untuk memproses gambar, Anda harus memilih model Vision Exp resmi.

Dokumentasi Vision API resmi DeepSeek menjelaskan bahwa model ini menerima gambar dan teks, tetapi outputnya tetap berupa teks. Model ini bisa memahami materi visual, tetapi PNG, video, atau ilustrasi buku cerita yang sebenarnya tetap harus dibuat oleh model generator yang sesuai.

Cara Kami Menguji Tiga Tugas Kreatif

Pengujian dilakukan pada 22 Agustus 2026. Ketiga request menggunakan PNG 1122 × 1402 yang sama, dikirim melalui URL gambar publik dengan detail disetel ke high. Gambar ini berasal dari alur kerja Storybook asli di situs kami, bukan buatan DeepSeek; kami hanya menggunakannya untuk menguji kemampuan baca gambar model.

Gambar karakter taman malam yang dipakai untuk menguji DeepSeek V4 Flash Vision

Ketiga request menggunakan pengaturan berikut:

  • Model: deepseek-v4-flash-vision-exp
  • Detail gambar: high
  • temperature: 0.2
  • thinking: disabled
  • Syarat output: JSON valid tanpa Markdown code fence
TugasInput tokensOutput tokensTotal tokensStatus
Prompt gambar483255738stop
Storyboard video (8 detik)507418925stop
Storybook enam halaman51911161635stop

Awalnya kami membiarkan thinking aktif, dan hasilnya tidak mulus. Request prompt gambar memakai max_tokens 1200, tapi 1200 token output habis dipakai reasoning, sehingga content akhirnya kosong. Request Storybook juga mengalami hal serupa: 4374 dari 5000 token output habis untuk reasoning, dan teks cerita terpotong di halaman kedua. Setelah thinking dimatikan, ketiga tugas bisa selesai dalam satu kali request.

Ini bukan berarti mode thinking jelek. Hanya saja mode ini berbagi kuota output dengan teks akhir. Untuk tugas berformat tetap, model biasanya tidak perlu berpikir panjang; jika memang perlu, sediakan ruang output yang lebih besar dan periksa finish_reason.

Uji 1: Menyusun Prompt Gambar dari Gambar Referensi

Tugas pertama adalah menyusun satu prompt gambar bahasa Inggris sepanjang 55–90 kata dari gambar referensi. Kami meminta model untuk hanya menulis hal yang benar-benar terlihat di gambar, tidak menebak, dan tidak menambahkan nama gaya, karena situs kami akan menambahkan gaya pilihan pengguna secara terpisah sebelum gambar dibuat.

Permintaan intinya:

Study the reference image and write one reusable English text-to-image prompt
that recreates its core story moment without naming a style.
Return observed_subject, observed_setting, generation_prompt,
and negative_constraints. Keep generation_prompt between 55 and 90 words.

generation_prompt yang diberikan DeepSeek:

A small child with brown hair and large green eyes stands on a stone path in a
nighttime garden. They hold a glowing lantern in one hand and a large green leaf
in the other, wearing a light blue hoodie and tan shorts. A flower-covered
archway frames the scene, with a pond of water lilies nearby. A winding trail of
glowing lights leads into the distance under a crescent moon and starry sky,
surrounded by tall purple and pink flowers.

Prompt ini berjumlah 80 kata bahasa Inggris, sesuai rentang 55–90 kata. Model berhasil mengenali anak, rambut cokelat, hoodie biru, lentera, daun, jalan batu, kolam, lengkungan bunga, dan bulan sabit. Model juga tidak memasukkan gaya visual ke dalam prompt.

Model juga mengembalikan negative constraints berikut:

No text, no captions, no logos, no watermarks, no modern buildings,
no daytime lighting, no harsh shadows, no other people, no vehicles,
no animals, no rain, no snow.

"Tanpa teks, tanpa watermark, tanpa orang lain" memang berguna. "Tanpa kendaraan, tanpa hujan, tanpa salju" tidak bertentangan, tapi gambar asli dan tugas tidak memintanya. Sebaiknya hapus item yang tidak relevan sebelum dipakai, jangan menelan mentah-mentah negative prompt dari model.

Jika ingin memakai deskripsi subjek dan latar seperti ini, Anda bisa memasukkan prompt yang sudah dirapikan ke generator teks-ke-kartun, lalu pilih gaya kartun, anime, clay, atau Storybook yang diinginkan. Dengan begitu, "mau menggambar apa" dan "pakai gaya apa" bisa dikontrol terpisah.

Uji 2: Mengubah Satu Gambar Menjadi Storyboard Video

Tugas kedua adalah mengembangkan satu gambar statis menjadi video single-shot 8 detik, lengkap dengan empat segmen timeline, pergerakan kamera, batasan kontinuitas, audio, dan prompt video akhir. Kami tidak ingin memasukkan cerita utuh ke dalam delapan detik; kami hanya ingin satu aksi dan satu perubahan emosi terlihat jelas.

Timeline yang diberikan model:

WaktuAksi yang ditulis DeepSeek
0–2 dtkAnak berdiri di jalan batu, menatap bulan sabit dan jalur cahaya
2–4 dtkAnak melangkah maju, mengangkat lentera untuk menerangi jalan
4–6 dtkAnak sedikit menoleh ke kanan, melihat kolam bunga lili dan kunang-kunang
6–8 dtkAnak tersenyum dan mengayunkan lentera pelan, cahaya hangat menerangi bunga

Model juga menyarankan:

Slow, smooth dolly-in with a slight tilt-up, maintaining a medium-full shot of
the child.

Prompt video akhir berjumlah 81 kata bahasa Inggris:

A cute chibi child with brown hair and a blue hoodie stands on a stone path in a
magical night garden. She holds a glowing lantern and a large green leaf. The
garden is filled with pink and purple flowers, a pond with water lilies, and a
stone archway. A crescent moon shines in the starry sky. Fireflies and a winding
trail of lights lead into the distance. The child looks around with wonder, her
lantern casting a warm, golden glow.

Arah besarnya tidak melenceng, dan prompt akhir sesuai batas 60–100 kata. Tapi kalau diperiksa lebih teliti, ada tiga masalah jelas:

  1. Kami hanya minta satu gerakan kamera, tapi model menulis dolly-in dan tilt-up sekaligus.
  2. continuity_locks menulis tan shorts dari gambar asli menjadi yellow shorts.
  3. Gambar asli tidak menunjukkan jenis kelamin karakter, tapi prompt akhir langsung memakai she.

Aksi di timeline juga terlalu banyak: melangkah, menoleh, mengayunkan lentera semuanya dipadatkan dalam delapan detik. Kalau benar-benar mau dipakai untuk generate video, saya hanya akan menyisakan "melangkah maju dan mengangkat lentera", lalu menghapus gerakan menoleh dan gerakan kamera kedua.

Setelah masalah ini diperbaiki, Anda bisa mengunggah gambar referensi karakter di generator video kartun AI dan membuat video pendek dengan satu aksi jelas, satu gerakan kamera, dan audio latar sederhana.

Uji 3: Merencanakan Storybook Enam Halaman dari Satu Gambar Karakter

Tugas ketiga adalah menulis cerita enam halaman untuk pembaca usia 5–7 tahun, lengkap dengan judul, ringkasan, tema, karakter, kontinuitas, dan catatan sampul. Narasi setiap halaman harus 35–55 kata bahasa Inggris, dan daftar karakter hanya boleh memuat karakter yang benar-benar muncul di gambar dan akan terus tampil.

DeepSeek menamai cerita ini Luna's Lantern Path, dengan tema "keberanian dan keajaiban dari cahaya kecil di kegelapan". Keenam halaman tertulis lengkap, dan cerita punya awal, tugas, dan akhir yang utuh: Luna masuk ke taman, mengikuti cahaya ke kolam, mendengar pohon willow minta tolong, memakai lentera untuk membangunkan bunga, lalu pulang.

HalamanRingkasan narasiJumlah kata aktual
1Luna masuk ke taman malam, mengangkat lentera siap berpetualang28
2Dia mengikuti cahaya berkelip seperti bintang ke dalam taman26
3Dia tiba di kolam, menyorotkan lentera ke permukaan air26
4Pohon willow memintanya membantu bunga yang tertidur mekar25
5Dia mengangkat lentera, cahaya keemasan menyentuh kelopak24
6Taman menyala, dia pulang dengan hati yang cerah25

Keenam narasi asli:

1. Luna stepped into the night garden. The moon was a silver smile, and the
flowers were fast asleep. She held her lantern high, ready for a new adventure.

2. A trail of tiny lights danced ahead of her. They looked like fallen stars,
twinkling and winking. Luna giggled and followed them deeper into the garden.

3. The lights stopped by a pond. The water was dark and still. Luna leaned over,
but her lantern's glow made the water sparkle like a mirror.

4. A soft whisper came from the willow tree. 'Little light, the flowers are too
sleepy to wake. Can you help them bloom?' Luna nodded bravely.

5. Luna lifted her lantern high. A warm golden light spilled out, touching every
petal. One by one, the flowers opened their eyes and smiled.

6. The garden was full of light and color. Luna smiled, knowing she had helped.
She walked home, her heart as bright as her little lantern.

Cerita terlihat utuh, tapi setelah diperiksa satu per satu, masalahnya cukup banyak. Narasi enam halaman hanya 24–28 kata; tidak ada satu pun yang mencapai syarat 35–55 kata. Daftar karakter juga memuat The Willow Tree dan The Fireflies—pohon willow bahkan punya dialog—padahal gambar asli tidak cukup mendukung karakter baru ini.

Jadi, hasil ini belum bisa langsung dipakai untuk membuat ilustrasi. Di produk sungguhan, minimal harus ada pemeriksaan otomatis untuk jumlah halaman, jumlah kata per halaman, asal-usul karakter, dan deskripsi visual, sebelum memutuskan apakah model perlu menulis ulang narasi atau karakter yang muncul tiba-tiba harus dihapus.

Setelah masalah ini diperbaiki, cerita bisa dimasukkan ke generator Storybook AI untuk membuat narasi yang bisa diedit, sampul, dan ilustrasi per halaman. Dibanding menulis prompt baru setiap halaman, menentukan dulu profil karakter dan kontinuitas akan lebih menjaga konsistensi visual dari awal sampai akhir.

Cara Memanggil API DeepSeek V4 Flash Vision

Dokumentasi resmi mendukung tiga cara umum memasukkan gambar: Base64, URL gambar publik, dan file_id dari Files API. Untuk menguji satu gambar kecil sekali waktu, Base64 sudah cukup; kalau gambar sudah punya tautan publik, langsung kirim URL; kalau gambar yang sama dipakai berulang kali, Files API lebih praktis.

Berikut contoh pemanggilan Python yang disederhanakan:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[
        {
            "role": "user",
            "content": [
                {
                    "type": "text",
                    "text": "Analisis gambar referensi dan buat satu prompt video 8 detik single-shot.",
                },
                {
                    "type": "image_url",
                    "image_url": {
                        "url": "https://example.com/reference.png",
                        "detail": "high",
                    },
                },
            ],
        }
    ],
    extra_body={"thinking": {"type": "disabled"}},
)

print(response.choices[0].message.content)

Gambar harus diletakkan di pesan user. detail: "low" cukup untuk melihat gambaran besar; kalau perlu membedakan pakaian karakter dan properti kecil, pilih high atau original. Batasan ukuran file, jumlah gambar, dan cara input yang spesifik mengikuti dokumentasi Vision resmi.

Mengapa Output JSON Tetap Perlu Divalidasi

Ketiga request resmi kali ini mengembalikan JSON yang bisa diurai dan tanpa Markdown code fence. Tapi saat uji coba awal, meskipun kami menulis "hanya kembalikan JSON valid", model tetap membungkus hasilnya dengan code fence. Jadi keberhasilan kali ini tidak menjamin format akan selalu benar.

Saat benar-benar diintegrasikan ke produk, minimal periksa hal berikut:

  1. Apakah output bisa diurai sebagai JSON
  2. Apakah field wajib ada dan tipe datanya benar
  3. Apakah timeline atau jumlah halaman Storybook sesuai
  4. Apakah narasi dan prompt akhir berada dalam rentang jumlah kata
  5. Apakah nama karakter, pakaian, dan properti penting konsisten antar scene
  6. Apakah output memuat kata gaya, subtitle, atau watermark yang tidak diizinkan
  7. Apakah finish_reason bernilai stop, bukan length

Untuk merapikan prompt atau mengisi format tetap, penalaran internal yang panjang biasanya tidak diperlukan. Anda bisa merujuk dokumentasi thinking mode resmi dan memutuskan apakah thinking perlu dimatikan berdasarkan tugas. Untuk logika cerita yang lebih kompleks, thinking boleh dipertahankan, tapi naikkan batas output dan siapkan penanganan jika teks terpotong.

Kapan Model Ini Layak Dipakai?

Kalau Anda sudah punya gambar karakter atau ilustrasi dan ingin mengembangkannya menjadi konten lain, DeepSeek V4 Flash Vision cukup membantu:

  • Punya satu gambar karakter, ingin mengekstrak prompt scene yang bisa dipakai ulang
  • Punya satu ilustrasi jadi, ingin merancang satu shot video pendek
  • Punya karakter dan dunia cerita, ingin mengembangkannya menjadi cerita anak multi-halaman
  • Perlu mengekstrak informasi terstruktur tentang karakter, latar, dan properti dari gambar referensi

Kalau tujuan Anda hanya membuat satu gambar kartun, sebenarnya tidak perlu memutar lewat model vision. Langsung masukkan ide atau unggah gambar referensi di AI Cartoon Generator saja. Langkah ini baru terasa berguna ketika Anda ingin memakai materi yang sama berulang kali, menjaga konsistensi karakter, atau mengembangkan satu karakter menjadi video dan Storybook.

Pertanyaan yang Sering Diajukan

Apakah DeepSeek V4 Flash mendukung input gambar?

deepseek-v4-flash biasa tidak menerima gambar. Untuk membaca gambar, Anda harus memakai model resmi dengan ID deepseek-v4-flash-vision-exp.

Bisakah DeepSeek V4 Flash Vision menghasilkan gambar secara langsung?

Tidak bisa. Model ini bertugas membaca gambar dan menulis teks. Untuk mendapatkan gambar sungguhan, Anda tetap harus memakai model teks-ke-gambar atau editor gambar.

Apakah Vision Exp sama dengan DeepSeek V4 Flash Vision versi komunitas?

Belum tentu. Vision Exp resmi punya ID API yang jelas. Proyek komunitas bisa saja memakai encoder vision lain, lapisan proxy, atau model yang di-deploy terpisah, sehingga cara panggil dan kemampuannya bisa berbeda.

Sebaiknya pakai URL gambar, Base64, atau Files API?

Untuk menguji satu gambar kecil sekali waktu, pakai Base64; kalau gambar sudah ada di alamat publik, langsung kirim URL; kalau gambar yang sama dipakai berulang atau ukurannya besar, pertimbangkan Files API.

Kenapa API memakai banyak reasoning tokens tapi tidak ada teks hasil?

Proses berpikir dan teks akhir berbagi kuota max_tokens yang sama. Kalau reasoning menghabiskan kuota lebih dulu, teks akhir bisa kosong. Untuk tugas berformat tetap, matikan thinking; kalau perlu dipertahankan, naikkan batas output dan perhatikan finish_reason.

Apakah JSON dari model bisa langsung disimpan?

Tidak disarankan. Buang dulu code fence yang mungkin muncul, lalu periksa format JSON, struktur field, panjang array, jumlah kata, dan konsistensi karakter.

Kesimpulan Uji: Cocok untuk Perencanaan Awal

Dari ketiga uji ini, posisi DeepSeek V4 Flash Vision yang paling pas bukan di tahap generate akhir, melainkan di perencanaan dan perapihan sebelum produksi. Beri satu gambar karakter, model ini bisa cepat menulis prompt gambar, storyboard video, dan draf Storybook, sehingga menghemat waktu menyusun materi dari nol.

Tapi hasilnya belum bisa langsung dipakai apa adanya. Prompt gambar kali ini cukup layak, storyboard video salah menulis gerakan kamera dan warna pakaian, dan Storybook meskipun enam halaman terisi, tidak ada satu halaman pun yang memenuhi syarat jumlah kata, plus karakter tambahan yang muncul tanpa dasar. JSON yang valid hanya membuktikan formatnya tidak rusak, bukan isinya sudah benar.

Cara pakai yang lebih realistis: biarkan model membaca gambar dan membuat draf, lalu serahkan prompt, storyboard, atau cerita ke generator yang sesuai, dan terakhir periksa karakter, pakaian, aksi, jumlah kata, dan format. Model ini mempercepat kerja awal, tapi tidak menggantikan penilaian akhir Anda.

Bacaan lanjutan: Apa itu AI Cartoon Generator? dan Perbandingan AI Cartoon Generator 2026.

Bacaan rekomendasi