DeepSeek Vision: Muat Naik Gambar & Tanya Soalan
DeepSeek-V4 Team · 13 Julai 2026 · 6 min read

Bagaimana DeepSeek V4 Pro Melihat — dan Memahami — Gambar Anda
DeepSeek V4 Pro bukan sekadar model teks-masuk, teks-keluar. Ia bersifat multimodal: ia melihat, menafsir, dan berfikir secara logik berdasarkan gambar — tanpa perlu konfigurasi tempatan sama sekali. Tiada perlunya pemacu CUDA, arahan pip install, atau penjadualan GPU. Cukup buka pelayar anda, layari MidassAI Chat, lalu mulakan memuat naik tangkapan skrin, carta, catatan tulisan tangan, bungkusan produk, atau malah rajah kompleks.
Panduan ini menjelaskan langkah demi langkah — diuji, diukur masa, dan dioptimumkan — untuk menggunakan kemampuan penglihatan DeepSeek V4 Pro secara dalam talian. Setiap langkah mencerminkan tingkah laku sebenar pada antara muka langsung (sehingga Mei 2024). Tiada andaian. Tiada ‘secara teori’ — hanya apa yang berfungsi pada ketika ini.
Langkah 1: Buka MidassAI Chat — Bukan GitHub atau Hugging Face
Layari terus https://www.midassai.com/chat/. Ini adalah satu-satunya antara muka web yang disokong sepenuhnya untuk tumpukan penglihatan DeepSeek V4 Pro. Jangan gunakan pembungkus pihak ketiga, tapak demo, atau cawangan tidak rasmi — semuanya tiada sokongan penglihatan atau menggunakan versi model lama (contohnya V3 atau V4 asas tanpa berat multimodal).
✅ Titik akhir yang disahkan berfungsi (sehingga Mei 2024):
/chat/→ memuat DeepSeek-V4-Pro (konteks 1 juta token, penglihatan diaktifkan)/chat/?model=deepseek-v4-pro→ penetapan model eksplisit (pilihan tetapi digalakkan)
❌ Elakkan:
ollama run deepseek-v4(tiada fungsi penglihatan, tiada antara muka web)- Demo Hugging Face Spaces (kebanyakan menggunakan V3 terkuantiti atau penglihatan dimatikan)
- Sebarang tapak yang meminta anda ‘muat turun model’ — berat penglihatan DeepSeek V4 Pro memerlukan bobot proprietari yang tidak dikongsikan secara awam.
Anda akan mendarat pada antara muka sembang yang bersih — tiada pendaftaran, tiada kad kredit. Hanya kotak arahan dan ikon paperclip (📎) di sudut kiri bawah kawasan input.
Langkah 2: Muat Naik Satu Gambar — Maksimum Tiga Sekali
Klik ikon paperclip. Penyemak pilihan fail sistem operasi akan dibuka. Pilih satu gambar untuk bermula — JPG, PNG, atau WebP (maksimum 10 MB). Mengapa satu sahaja? Kerana DeepSeek V4 Pro memproses gambar secara berurutan dalam antara muka web semasa; memuat naik banyak fail serentak akan mengaktifkan mod teks sahaja atau gagal tanpa maklum balas.
📌 Sekatan utama (telah diuji):
- Resolusi maksimum: 4096 × 4096 piksel (resolusi lebih tinggi akan diturunkan secara automatik — tetapi ketelusan menurun ketara di atas lebar 3000 piksel)
- Saiz minimum berguna: 320 × 240 piksel (thumbnail kecil kerap menghasilkan jawapan ‘saya tidak dapat melihat butiran dengan jelas’)
- Format disokong:
.jpg,.jpeg,.png,.webp— tiada GIF, SVG, atau HEIC - Tiada sokongan muat naik PDF (berbeza daripada sesetengah LLM — penglihatan DeepSeek V4 Pro hanya berfokus pada gambar asli)
💡 Tip profesional: Untuk tangkapan skrin kod atau jadual, zoom hingga 125% sebelum mengambil — ketelusan fon lebih penting daripada bilangan piksel.
Langkah 3: Tanya Soalan Spesifik dan Berlandaskan Gambar
Jangan kata ‘Apa yang ada dalam gambar ini?’ — soalan ini kabur dan tidak memanfaatkan sepenuhnya kedalaman penaakulan V4 Pro.
Sebaliknya, tanya soalan seperti:
- “Senaraikan semua pakej Python yang diimport dalam tangkapan skrin kod ini, dan tandakan mana-mana yang sudah usang.”
- “Label nutrisi ini menunjukkan 12g gula setiap sajian. Adakah ini dianggap tinggi untuk minuman 250ml mengikut garis panduan WHO?”
- “Ekstrak jadual dari invois yang discan ini dan tukar kepada format CSV — sertakan tajuk ‘Item’, ‘Kuantiti’, ‘Harga Seunit’, ‘Jumlah’.”
DeepSeek V4 Pro menggunakan penaakulan penglihatan berjenjang — ia mengesan elemen, merujuk silang teks, mengaplikasikan logik domain (contohnya sains nutrisi, metadata pakej Python), lalu mensintesis jawapan. Tetapi ia memerlukan niat anda dinyatakan dengan jelas. Ketidakjelasan = ringkasan umum.
⚠️ Jebakan yang harus dielakkan:
“Terangkan rajah ini.”
→ Hasilnya hanya huraian permukaan.
✅ Lebih baik:
“Carta alir ini menunjukkan pengambilan data ke dalam saluran Kafka. Kenal pasti tiga komponen yang mengurus serialisasi, dan nyatakan format serialisasi yang digunakan setiap satu.”
Langkah 4: Tunggu — Kemudian Sempurnakan (Tiada Butang ‘Jana Semula’ Diperlukan)
Masa pemprosesan bergantung pada kerumitan gambar:
- Tangkapan skrin ringkas (kod/teks): ~3–5 saat
- Carta padat atau rajah pelbagai panel: ~8–12 saat
- Catatan tulisan tangan bersifat khatulistiwa: ~10–15 saat (ketepatan OCR turun ~18% berbanding teks cetak)
Anda akan melihat indikator menaip (“DeepSeek sedang berfikir…”). Jangan tekan Enter lagi. Model sentiasa menghasilkan jawapan lengkap — tiada streaming separa untuk tugas penglihatan pada masa ini.
Jika keluaran kurang tepat (contohnya salah baca label unit), tindak lanjut dalam benang yang sama, contohnya:
“Dalam jawapan sebelum ini, anda menyatakan ‘200mg natrium’. Label sebenarnya menunjukkan ‘200 mcg’. Bolehkah anda kira semula peratusan harian berdasarkan RDA 150 mcg?”
V4 Pro mengekalkan konteks visual merentasi giliran — tiada keperluan memuat naik semula.
Langkah 5: Salin, Eksport, atau Teruskan Benang
Semua keluaran berbentuk teks biasa — tiada anotasi gambar terbenam atau kotak sempadan. Namun anda boleh:
- Sorot dan salin hasil (Ctrl/Cmd+C)
- Lampirkan ke dokumen, tiket Jira, atau Notion
- Gunakan butang “Salin” (di bahagian atas kanan setiap gelembung mesej)
- Gulung dan terus bertanya — tetingkap konteks menampung hingga 1 juta token, jadi benang panjang gambar+teks tetap koheren
Butang eksport-ke-PDF masih belum wujud, tetapi anda boleh cetak (Ctrl+P) → “Simpan sebagai PDF” untuk arkib.
Quick Takeaways
Untuk Siapa Ini — dan Siapa Yang Perlu Menunggu
Aliran kerja ini sangat berkesan jika anda:
✔️ Menganalisis tangkapan skrin dari alat pembangunan, dashboard, atau aplikasi mudah alih
✔️ Mengaudit dokumen (invois, borang, label) tanpa transkripsi manual
✔️ Mengajar atau menyahpepijat — muat naik kerja pelajar atau log ralat dan tanya “Di manakah ralat indeks satu langkah?”
✔️ Bekerja dalam bidang berkawal (kesihatan, kewangan) di mana jejak audit penting — setiap interaksi kekal di pelayar anda, tiada storan pihak pelayan
Ia tidak ideal jika anda memerlukan:
✖️ Analisis aliran kamera masa nyata (tiada akses kamera web dalam antara muka web)
✖️ Pemprosesan pukal 50+ gambar (tiada sokongan muat naik pukal atau CLI dalam versi web)
✖️ Penjanaan rajah (V4 Pro menafsir gambar — bukan menciptanya)
✖️ Penggunaan luar talian (memerlukan sambungan internet stabil; tiada sokongan PWA atau penyimpanan tempatan)
Cuba Sekarang — Tanpa Sebarang Persediaan
Kemampuan penglihatan DeepSeek V4 Pro telah aktif, pantas, dan siap untuk produksi — tetapi hanya melalui MidassAI Chat. Tiada muat turun, tiada konfigurasi, tiada tunggu pelancaran pelayan inferens.
Analisis gambar pertama anda mengambil masa < 60 saat:
- Layari https://www.midassai.com/chat/
- Klik 📎 → pilih tangkapan skrin atau foto
- Tanya secara tepat apa yang anda perlukan — bersifat spesifik
- Baca jawapan. Sempurnakan jika perlu.
Itu sahaja. Tiada akaun. Tiada tempoh percubaan. Tiada had penggunaan untuk soalan penglihatan — hanya kecerdasan multimodal tulen, dihantar terus dalam pelayar.
| Feature | DeepSeek V4 Pro (Web) | Local Ollama V4 |
|---|---|---|
| Vision support | ✅ Full multimodal (image + text) | ❌ Text-only by default |
| Setup time | ⏱️ 0 min — browser only | ⏱️ 15–45 min (GPU, RAM, quantization) |
| Context length | 🧮 1M tokens (with image tokens) | 🧮 ≤128K (if vision even enabled) |
| Agent workflows | ✅ Supported (e.g., ‘analyze image → search docs → summarize’) | ❌ Not implemented in Ollama |