DeepSeek Vision 教學:上傳圖片並提問
DeepSeek-V4 Team · 2026年7月13日 · 11 min read

DeepSeek V4 Pro 如何「看見」並理解您的圖片
DeepSeek V4 Pro 不只是文字輸入、文字輸出。它具備多模態能力:能「看見」、解讀並推理圖片內容,且完全無需本地設定。您無須安裝 CUDA 驅動程式、執行 pip install 指令,或配置 GPU 資源。只要打開瀏覽器,前往 MidassAI 對話頁面,即可立即上傳截圖、圖表、手寫筆記、商品包裝,甚至複雜的技術圖解。
本教學提供經過實際驗證、計時測試與流程優化的完整步驟,教您如何在網頁端使用 DeepSeek V4 Pro 的視覺功能。所有步驟均依據 2024 年 5 月最新線上介面真實行為編寫 —— 不靠假設,不談理論,只呈現此刻真正可用的操作方式。
步驟 1:開啟 MidassAI 對話頁面 —— 請勿使用 GitHub 或 Hugging Face
請直接前往 https://www.midassai.com/chat/。這是目前唯一支援 DeepSeek V4 Pro 完整視覺功能的官方網頁介面。請勿使用第三方封裝工具、示範網站或非官方分支版本 —— 這些平台要麼未啟用視覺功能,要麼僅運行舊版模型(例如 V3 或未整合多模態權重的基礎 V4)。
✅ 已確認可正常運作的網址(截至 2024 年 5 月):
/chat/→ 自動載入 DeepSeek-V4-Pro(上下文長達 100 萬 token,視覺功能已啟用)/chat/?model=deepseek-v4-pro→ 明確指定模型(非必要但強烈建議)
❌ 請避免使用:
ollama run deepseek-v4(無視覺功能,亦無網頁介面)- Hugging Face Spaces 示範頁(多數採用量化版 V3 或已停用視覺模組)
- 任何要求您「下載模型」的網站 —— DeepSeek V4 Pro 的視覺能力仰賴專屬權重,該權重尚未公開釋出。
您將進入一個簡潔的對話介面:無需註冊、無需信用卡。畫面僅有一個輸入框,以及位於輸入區左下角的迴紋針圖示(📎)。
步驟 2:一次上傳一張圖片 —— 切勿同時上傳超過三張
點擊迴紋針圖示,系統會喚起作業系統原生的檔案選擇器。請先選取單一圖片開始操作 —— 支援 JPG、PNG 或 WebP 格式(最大 10 MB)。為何限一張?因為目前網頁版介面以序列方式處理圖片;若同時上傳多檔,系統將自動退回到純文字模式,或靜默失敗。
📌 實測關鍵限制:
- 最高解析度:4096 × 4096 像素(超出者會自動縮放,但寬度超過 3000 像素後清晰度明顯下降)
- 最低有效尺寸:320 × 240 像素(過小縮圖常導致回應:「我無法清楚辨識細節」)
- 支援格式:
.jpg、.jpeg、.png、.webp—— 不支援 GIF、SVG 或 HEIC - 無法上傳 PDF(不同於部分 LLM,DeepSeek V4 Pro 的視覺模組僅支援原生圖像)
💡 專家建議:若截圖內容為程式碼或表格,建議先將螢幕縮放至 125% 再截圖 —— 字型清晰度比像素總數更重要。
步驟 3:提出具體、有明確依據的問題
請勿說「這張圖片裡有什麼?」—— 此類提問過於籠統,無法充分發揮 V4 Pro 的深度推理能力。
請改提以下類型的問題:
- 「請列出此程式碼截圖中所有 import 的 Python 套件,並標出已棄用的套件。」
- 「此營養標示顯示每份含 12 克糖。依 WHO 指南,對一款 250 毫升飲料而言,是否屬於高糖?」
- 「請從這張掃描發票中提取表格,並轉為 CSV 格式 —— 表頭須包含『項目』、『數量』、『單價』、『總額』。」
DeepSeek V4 Pro 採用「逐步推理解析」(chain-of-thought vision reasoning):先定位圖中元素、交叉比對文字內容、套用領域知識(如營養科學、Python 套件相容性),最後綜合產出結果。但前提是您必須明確說明需求;模糊提問只會得到泛泛而談的摘要。
⚠️ 常見陷阱請避開:
「請解釋這張圖。」
→ 僅獲得表面層級描述。
✅ 更佳做法:
「此流程圖展示資料如何匯入 Kafka 管線。請指出負責序列化的三個元件,並說明各元件使用的序列化格式。」
步驟 4:等待 —— 然後在同一對話中精修(無需點選『重新生成』)
處理時間取決於圖片複雜度:
- 簡單截圖(程式碼/文字):約 3–5 秒
- 密集圖表或多重區塊圖解:約 8–12 秒
- 草書手寫筆記:約 10–15 秒(OCR 準確率較印刷字體低約 18%)
您會看到「DeepSeek 正在思考…」的輸入提示 —— 請勿再次按 Enter。目前視覺任務一律輸出完整回應,尚不支援分段流式輸出。
若結果遺漏細節(例如誤讀單位標示),請直接在同一對話串中追問,例如:
「您先前回應提到『鈉 200 毫克』,但標示實際為『200 微克(mcg)』。請依每日建議攝取量(RDA)150 mcg 重新計算百分比。」
V4 Pro 可於多輪對話中持續保留視覺上下文,無須重複上傳圖片。
步驟 5:複製、匯出或延續對話
所有輸出皆為純文字 —— 不含內嵌圖像註解或邊界框。但您可:
- 拖曳選取並複製結果(Ctrl/Cmd+C)
- 貼至文件、Jira 工單或 Notion
- 點選每則訊息氣泡右上角的「複製」按鈕
- 向下捲動繼續提問 —— 上下文視窗容量達 100 萬 token,確保長篇圖片+文字對話仍維持邏輯連貫
目前尚無「匯出為 PDF」按鈕,但您可透過列印功能(Ctrl+P)→「另存為 PDF」進行歸檔。
Quick Takeaways
適合誰使用 —— 以及誰應稍待
若您符合以下情境,此工作流程將極具價值:
✔️ 分析開發工具、儀表板或行動應用程式的截圖 ✔️ 審查發票、表格、標籤等文件,免去人工逐字轉錄 ✔️ 教學或除錯 —— 上傳學生作業或錯誤日誌,直接提問:「這處索引錯誤在哪?」 ✔️ 從事醫療、金融等監管嚴格領域 —— 所有互動均留在您瀏覽器中,伺服器端不留痕跡,符合稽核要求
若您需要下列功能,則暫不適用:
✖️ 即時攝影機畫面分析(網頁介面不支援 Webcam 存取) ✖️ 批量處理 50 張以上圖片(網頁端無批量上傳或 CLI 支援) ✖️ 圖解生成(V4 Pro 專注於「解讀」圖片,而非「生成」圖片) ✖️ 離線使用(需穩定網路連線;尚無 PWA 或本地快取支援)
立即試用 —— 零設定、零等待
DeepSeek V4 Pro 的視覺功能已正式上線、反應迅速且具備生產環境級穩定性 —— 但僅透過 MidassAI 對話頁面提供。
無需下載、無需設定、無需等待推論伺服器啟動。
首次圖片分析耗時不到 60 秒:
- 前往 https://www.midassai.com/chat/
- 點選 📎 → 選擇一張截圖或照片
- 精準提出需求 —— 越具體越好
- 讀取答案,必要時追問調整
就這麼簡單。無需帳號、無試用期、視覺查詢亦無用量上限 —— 純粹的多模態智慧,直接於瀏覽器中即時交付。
| Feature | DeepSeek V4 Pro (Web) | Local Ollama V4 |
|---|---|---|
| Vision support | ✅ Full multimodal (image + text) | ❌ Text-only by default |
| Setup time | ⏱️ 0 min — browser only | ⏱️ 15–45 min (GPU, RAM, quantization) |
| Context length | 🧮 1M tokens (with image tokens) | 🧮 ≤128K (if vision even enabled) |
| Agent workflows | ✅ Supported (e.g., ‘analyze image → search docs → summarize’) | ❌ Not implemented in Ollama |