DeepSeek V4 Pro
立即開始對話

DeepSeek Vision 教學:上傳圖片並提問

DeepSeek-V4 Team · 2026年7月13日 · 11 min read

Start Chatting on MidassAI
DeepSeek Vision 教學:上傳圖片並提問

DeepSeek V4 Pro 如何「看見」並理解您的圖片

DeepSeek V4 Pro 不只是文字輸入、文字輸出。它具備多模態能力:能「看見」、解讀並推理圖片內容,且完全無需本地設定。您無須安裝 CUDA 驅動程式、執行 pip install 指令,或配置 GPU 資源。只要打開瀏覽器,前往 MidassAI 對話頁面,即可立即上傳截圖、圖表、手寫筆記、商品包裝,甚至複雜的技術圖解。

本教學提供經過實際驗證、計時測試與流程優化的完整步驟,教您如何在網頁端使用 DeepSeek V4 Pro 的視覺功能。所有步驟均依據 2024 年 5 月最新線上介面真實行為編寫 —— 不靠假設,不談理論,只呈現此刻真正可用的操作方式。

步驟 1:開啟 MidassAI 對話頁面 —— 請勿使用 GitHub 或 Hugging Face

請直接前往 https://www.midassai.com/chat/。這是目前唯一支援 DeepSeek V4 Pro 完整視覺功能的官方網頁介面。請勿使用第三方封裝工具、示範網站或非官方分支版本 —— 這些平台要麼未啟用視覺功能,要麼僅運行舊版模型(例如 V3 或未整合多模態權重的基礎 V4)。

✅ 已確認可正常運作的網址(截至 2024 年 5 月):

  • /chat/ → 自動載入 DeepSeek-V4-Pro(上下文長達 100 萬 token,視覺功能已啟用)
  • /chat/?model=deepseek-v4-pro → 明確指定模型(非必要但強烈建議)

❌ 請避免使用:

  • ollama run deepseek-v4(無視覺功能,亦無網頁介面)
  • Hugging Face Spaces 示範頁(多數採用量化版 V3 或已停用視覺模組)
  • 任何要求您「下載模型」的網站 —— DeepSeek V4 Pro 的視覺能力仰賴專屬權重,該權重尚未公開釋出。

您將進入一個簡潔的對話介面:無需註冊、無需信用卡。畫面僅有一個輸入框,以及位於輸入區左下角的迴紋針圖示(📎)。

Start Chatting on MidassAI

步驟 2:一次上傳一張圖片 —— 切勿同時上傳超過三張

點擊迴紋針圖示,系統會喚起作業系統原生的檔案選擇器。請先選取單一圖片開始操作 —— 支援 JPG、PNG 或 WebP 格式(最大 10 MB)。為何限一張?因為目前網頁版介面以序列方式處理圖片;若同時上傳多檔,系統將自動退回到純文字模式,或靜默失敗。

📌 實測關鍵限制:

  • 最高解析度:4096 × 4096 像素(超出者會自動縮放,但寬度超過 3000 像素後清晰度明顯下降)
  • 最低有效尺寸:320 × 240 像素(過小縮圖常導致回應:「我無法清楚辨識細節」)
  • 支援格式:.jpg.jpeg.png.webp —— 不支援 GIF、SVG 或 HEIC
  • 無法上傳 PDF(不同於部分 LLM,DeepSeek V4 Pro 的視覺模組僅支援原生圖像)

💡 專家建議:若截圖內容為程式碼或表格,建議先將螢幕縮放至 125% 再截圖 —— 字型清晰度比像素總數更重要。

步驟 3:提出具體、有明確依據的問題

請勿說「這張圖片裡有什麼?」—— 此類提問過於籠統,無法充分發揮 V4 Pro 的深度推理能力。

請改提以下類型的問題:

  • 「請列出此程式碼截圖中所有 import 的 Python 套件,並標出已棄用的套件。」
  • 「此營養標示顯示每份含 12 克糖。依 WHO 指南,對一款 250 毫升飲料而言,是否屬於高糖?」
  • 「請從這張掃描發票中提取表格,並轉為 CSV 格式 —— 表頭須包含『項目』、『數量』、『單價』、『總額』。」

DeepSeek V4 Pro 採用「逐步推理解析」(chain-of-thought vision reasoning):先定位圖中元素、交叉比對文字內容、套用領域知識(如營養科學、Python 套件相容性),最後綜合產出結果。但前提是您必須明確說明需求;模糊提問只會得到泛泛而談的摘要。

⚠️ 常見陷阱請避開:

「請解釋這張圖。」

→ 僅獲得表面層級描述。

✅ 更佳做法:

「此流程圖展示資料如何匯入 Kafka 管線。請指出負責序列化的三個元件,並說明各元件使用的序列化格式。」

步驟 4:等待 —— 然後在同一對話中精修(無需點選『重新生成』)

處理時間取決於圖片複雜度:

  • 簡單截圖(程式碼/文字):約 3–5 秒
  • 密集圖表或多重區塊圖解:約 8–12 秒
  • 草書手寫筆記:約 10–15 秒(OCR 準確率較印刷字體低約 18%)

您會看到「DeepSeek 正在思考…」的輸入提示 —— 請勿再次按 Enter。目前視覺任務一律輸出完整回應,尚不支援分段流式輸出。

若結果遺漏細節(例如誤讀單位標示),請直接在同一對話串中追問,例如:

「您先前回應提到『鈉 200 毫克』,但標示實際為『200 微克(mcg)』。請依每日建議攝取量(RDA)150 mcg 重新計算百分比。」

V4 Pro 可於多輪對話中持續保留視覺上下文,無須重複上傳圖片。

步驟 5:複製、匯出或延續對話

所有輸出皆為純文字 —— 不含內嵌圖像註解或邊界框。但您可:

  • 拖曳選取並複製結果(Ctrl/Cmd+C)
  • 貼至文件、Jira 工單或 Notion
  • 點選每則訊息氣泡右上角的「複製」按鈕
  • 向下捲動繼續提問 —— 上下文視窗容量達 100 萬 token,確保長篇圖片+文字對話仍維持邏輯連貫

目前尚無「匯出為 PDF」按鈕,但您可透過列印功能(Ctrl+P)→「另存為 PDF」進行歸檔。

Quick Takeaways

Best forDeepSeek-V4 web users
Key strengthPrecise, domain-aware vision reasoning — not just OCR
LimitationNo batch image upload or PDF ingestion

適合誰使用 —— 以及誰應稍待

若您符合以下情境,此工作流程將極具價值:

✔️ 分析開發工具、儀表板或行動應用程式的截圖 ✔️ 審查發票、表格、標籤等文件,免去人工逐字轉錄 ✔️ 教學或除錯 —— 上傳學生作業或錯誤日誌,直接提問:「這處索引錯誤在哪?」 ✔️ 從事醫療、金融等監管嚴格領域 —— 所有互動均留在您瀏覽器中,伺服器端不留痕跡,符合稽核要求

若您需要下列功能,則暫不適用:

✖️ 即時攝影機畫面分析(網頁介面不支援 Webcam 存取) ✖️ 批量處理 50 張以上圖片(網頁端無批量上傳或 CLI 支援) ✖️ 圖解生成(V4 Pro 專注於「解讀」圖片,而非「生成」圖片) ✖️ 離線使用(需穩定網路連線;尚無 PWA 或本地快取支援)

立即試用 —— 零設定、零等待

DeepSeek V4 Pro 的視覺功能已正式上線、反應迅速且具備生產環境級穩定性 —— 但僅透過 MidassAI 對話頁面提供。

無需下載、無需設定、無需等待推論伺服器啟動。

首次圖片分析耗時不到 60 秒:

  1. 前往 https://www.midassai.com/chat/
  2. 點選 📎 → 選擇一張截圖或照片
  3. 精準提出需求 —— 越具體越好
  4. 讀取答案,必要時追問調整

就這麼簡單。無需帳號、無試用期、視覺查詢亦無用量上限 —— 純粹的多模態智慧,直接於瀏覽器中即時交付。

FeatureDeepSeek V4 Pro (Web)Local Ollama V4
Vision support✅ Full multimodal (image + text)❌ Text-only by default
Setup time⏱️ 0 min — browser only⏱️ 15–45 min (GPU, RAM, quantization)
Context length🧮 1M tokens (with image tokens)🧮 ≤128K (if vision even enabled)
Agent workflows✅ Supported (e.g., ‘analyze image → search docs → summarize’)❌ Not implemented in Ollama

Related articles

Start Chatting on MidassAI