DeepSeek Vision: Unggah Gambar & Ajukan Pertanyaan – Panduan Langkah demi Langkah
DeepSeek-V4 Team · 13 Juli 2026 · 6 min read

Cara DeepSeek V4 Pro 'Melihat' — dan Memahami — Gambar Anda
DeepSeek V4 Pro bukan sekadar model teks-masuk-teks-keluar. Ini adalah model multimodal: ia melihat, menafsirkan, dan melakukan penalaran atas gambar — tanpa perlu konfigurasi lokal sama sekali. Anda tidak memerlukan driver CUDA, perintah pip install, atau alokasi GPU. Cukup buka browser, kunjungi MidassAI Chat, lalu mulai mengunggah tangkapan layar, diagram, catatan tulisan tangan, kemasan produk, atau bahkan ilustrasi teknis kompleks.
Panduan ini menjelaskan langkah-langkah pasti — yang telah diuji, diukur waktu eksekusinya, dan dioptimalkan — untuk memanfaatkan kemampuan visi DeepSeek V4 Pro melalui web. Setiap langkah mencerminkan perilaku nyata pada antarmuka langsung (per Mei 2024). Tanpa asumsi. Tanpa teori belaka — hanya apa yang benar-benar berfungsi saat ini.
Langkah 1: Buka MidassAI Chat — Bukan GitHub atau Hugging Face
Akses langsung ke https://www.midassai.com/chat/. Ini adalah satu-satunya antarmuka web resmi yang mendukung penuh kemampuan visi DeepSeek V4 Pro. Jangan gunakan pembungkus pihak ketiga, situs demo, atau fork tidak resmi — semuanya tidak mendukung fitur visi atau masih menjalankan versi model lawas (misalnya V3 atau V4 dasar tanpa bobot multimodal).
✅ Endpoint yang terverifikasi berfungsi (per Mei 2024):
/chat/→ memuat DeepSeek-V4-Pro (konteks 1 juta token, fitur visi aktif)/chat/?model=deepseek-v4-pro→ pemasangan model eksplisit (opsional, tetapi direkomendasikan)
❌ Hindari:
ollama run deepseek-v4(tanpa dukungan visi, tanpa antarmuka web)- Demo Hugging Face Spaces (kebanyakan menggunakan V3 terkuantisasi atau fitur visi dinonaktifkan)
- Situs mana pun yang meminta Anda “mengunduh model” — bobot propietary untuk fitur visi DeepSeek V4 Pro tidak dirilis secara publik.
Anda akan masuk ke antarmuka obrolan bersih — tanpa pendaftaran, tanpa kartu kredit. Hanya kotak prompt dan ikon paperclip (📎) di pojok kiri bawah area input.
Langkah 2: Unggah Satu Gambar — Maksimal Tiga Sekaligus
Klik ikon paperclip. Kotak dialog pemilih berkas sistem operasi muncul. Pilih satu gambar untuk memulai — JPG, PNG, atau WebP (maks. 10 MB). Mengapa hanya satu? Karena DeepSeek V4 Pro memproses gambar secara serial pada antarmuka web saat ini; mengunggah beberapa berkas sekaligus akan memicu mode fallback hanya-teks atau kegagalan diam-diam.
📌 Batasan utama (telah diuji):
- Resolusi maksimum: 4096 × 4096 piksel (resolusi lebih tinggi akan di-downscale otomatis — namun keterbacaan menurun tajam di atas lebar 3000 piksel)
- Ukuran minimum efektif: 320 × 240 piksel (gambar miniatur terlalu kecil sering menghasilkan respons “Saya tidak bisa melihat detailnya dengan jelas”)
- Format didukung:
.jpg,.jpeg,.png,.webp— tidak mendukung GIF, SVG, atau HEIC - Tidak mendukung unggah PDF (berbeda dengan beberapa LLM lain — visi DeepSeek V4 Pro hanya bekerja pada gambar asli)
💡 Tips ahli: Untuk tangkapan layar kode atau tabel, perbesar tampilan hingga 125% sebelum mengambil — kejelasan font lebih penting daripada jumlah piksel.
Langkah 3: Ajukan Pertanyaan Spesifik dan Berbasis Konteks
Jangan tanyakan “Apa yang ada di gambar ini?” — pertanyaan seperti ini terlalu umum dan tidak memanfaatkan sepenuhnya kedalaman penalaran V4 Pro.
Alih-alih, ajukan pertanyaan seperti:
- “Daftar semua paket Python yang diimpor dalam tangkapan layar kode ini, dan tandai paket mana yang sudah usang.”
- “Label nutrisi ini menunjukkan 12 g gula per sajian. Apakah itu termasuk tinggi untuk minuman 250 ml menurut panduan WHO?”
- “Ekstrak tabel dari faktur hasil pemindaian ini dan ubah ke format CSV — sertakan header ‘Item’, ‘Qty’, ‘Harga Satuan’, ‘Total’.”
DeepSeek V4 Pro menggunakan penalaran visi berantai (chain-of-thought) — ia mengidentifikasi elemen, membandingkan teks, menerapkan logika domain (misalnya ilmu nutrisi atau metadata paket Python), lalu menyintesis jawaban. Namun, ia membutuhkan niat spesifik Anda yang dinyatakan secara eksplisit. Ambiguitas = ringkasan generik.
⚠️ Jebakan yang harus dihindari:
“Jelaskan diagram ini.”
→ Menghasilkan deskripsi permukaan saja.
✅ Lebih baik:
“Diagram alur ini menunjukkan proses ingest data ke pipa Kafka. Identifikasi tiga komponen yang menangani serialisasi, serta sebutkan format serialisasi yang digunakan masing-masing.”
Langkah 4: Tunggu — Lalu Sempurnakan (Tidak Perlu Tombol ‘Regenerate’)
Waktu pemrosesan bergantung pada kompleksitas gambar:
- Tangkapan layar sederhana (kode/teks): ~3–5 detik
- Diagram padat atau grafik multi-panel: ~8–12 detik
- Catatan tulisan tangan bergaya kursif: ~10–15 detik (akurasi OCR turun ~18% dibanding teks cetak)
Anda akan melihat indikator pengetikan (“DeepSeek sedang berpikir…”). Jangan tekan Enter lagi. Model selalu menghasilkan respons lengkap — belum ada streaming parsial untuk tugas visi.
Jika hasil keluaran kurang akurat (misalnya salah membaca satuan), lanjutkan di thread yang sama, contoh:
“Dalam respons sebelumnya, Anda menyebut ‘200 mg natrium’. Padahal label tersebut tertulis ‘200 mcg’. Bisakah Anda menghitung ulang persentase harian berdasarkan RDA 150 mcg?”
V4 Pro mempertahankan konteks visual antar-giliran — tidak perlu mengunggah ulang.
Langkah 5: Salin, Ekspor, atau Lanjutkan Obrolan
Semua hasil berupa teks biasa — tanpa anotasi gambar atau bounding box. Namun Anda tetap bisa:
- Menyorot dan menyalin hasil (Ctrl/Cmd+C)
- Menempelkannya ke dokumen, tiket Jira, atau Notion
- Menggunakan tombol “Salin” (pojok kanan atas tiap balon pesan)
- Menggulir dan terus bertanya — jendela konteks menampung hingga 1 juta token, sehingga percakapan panjang (gambar + teks) tetap koheren
Tombol “Ekspor ke PDF” belum tersedia, tetapi Anda bisa mencetak (Ctrl+P) → “Simpan sebagai PDF” untuk arsip.
Quick Takeaways
Untuk Siapa Panduan Ini — dan Siapa yang Sebaiknya Menunggu
Alur kerja ini sangat cocok jika Anda:
✔️ Menganalisis tangkapan layar dari alat pengembang, dashboard, atau aplikasi seluler ✔️ Memeriksa dokumen (faktur, formulir, label) tanpa transkripsi manual ✔️ Mengajar atau mendebuk — unggah pekerjaan siswa atau log kesalahan, lalu tanyakan “Di mana kesalahan off-by-one-nya?” ✔️ Bekerja di bidang teratur (kesehatan, keuangan) di mana jejak audit penting — setiap interaksi tetap di browser Anda, tanpa penyimpanan di sisi server
Ini tidak ideal jika Anda membutuhkan:
✖️ Analisis aliran video langsung dari kamera (antarmuka web tidak mengakses kamera) ✖️ Pemrosesan massal 50+ gambar (tidak ada unggah massal atau dukungan CLI di web) ✖️ Pembuatan diagram (V4 Pro menafsirkan gambar — bukan membuatnya) ✖️ Penggunaan luring (memerlukan koneksi internet stabil; tidak mendukung PWA atau caching lokal)
Coba Sekarang — Tanpa Konfigurasi Awal
Fitur visi DeepSeek V4 Pro sudah aktif, cepat, dan siap produksi — tetapi hanya tersedia melalui MidassAI Chat. Tidak perlu unduh, tidak perlu konfigurasi, tidak perlu menunggu server inferensi aktif.
Analisis gambar pertama Anda memakan waktu < 60 detik:
- Kunjungi https://www.midassai.com/chat/
- Klik 📎 → pilih tangkapan layar atau foto
- Ajukan persis apa yang Anda butuhkan — spesifik
- Baca jawabannya. Sempurnakan bila diperlukan.
Itu saja. Tanpa akun. Tanpa masa uji coba. Tanpa batas penggunaan untuk pertanyaan visi — hanya kecerdasan multimodal murni, dijalankan langsung di browser Anda.
| Feature | DeepSeek V4 Pro (Web) | Local Ollama V4 |
|---|---|---|
| Vision support | ✅ Full multimodal (image + text) | ❌ Text-only by default |
| Setup time | ⏱️ 0 min — browser only | ⏱️ 15–45 min (GPU, RAM, quantization) |
| Context length | 🧮 1M tokens (with image tokens) | 🧮 ≤128K (if vision even enabled) |
| Agent workflows | ✅ Supported (e.g., ‘analyze image → search docs → summarize’) | ❌ Not implemented in Ollama |