DeepSeek Vision: อัปโหลดภาพแล้วถามคำถาม — คู่มือทีละขั้นตอน
DeepSeek-V4 Team · 13 กรกฎาคม 2569 · 3 min read

DeepSeek V4 Pro มองและเข้าใจภาพของคุณอย่างไร
DeepSeek V4 Pro ไม่ใช่โมเดลแบบป้อนข้อความแล้วได้ข้อความกลับมาเท่านั้น มันเป็นโมเดลหลายโหมด (multimodal) ที่ มองเห็น, ตีความ, และ ให้เหตุผล จากภาพ — โดยไม่ต้องตั้งค่าอะไรบนเครื่องคุณเลย คุณไม่จำเป็นต้องติดตั้งไดรเวอร์ CUDA, รันคำสั่ง pip install หรือจัดสรร GPU เลย เพียงเปิดเบราว์เซอร์ ไปที่ MidassAI Chat แล้วเริ่มอัปโหลดภาพหน้าจอ แผนภูมิ โน้ตเขียนด้วยลายมือ บรรจุภัณฑ์สินค้า หรือแม้แต่ไดอะแกรมซับซ้อนได้ทันที
คู่มือนี้อธิบายขั้นตอนทีละข้ออย่างละเอียด — ผ่านการทดสอบจริง วัดเวลา และปรับให้เหมาะสมที่สุด เพื่อใช้ความสามารถด้านภาพของ DeepSeek V4 Pro ผ่านเว็บ ทุกขั้นตอนสะท้อนพฤติกรรมจริงบนอินเทอร์เฟซปัจจุบัน (เมษายน 2024) ไม่มีการสมมุติ ไม่มีคำว่า "ในทางทฤษฎี" — มีแต่สิ่งที่ ใช้งานได้จริงตอนนี้
ขั้นตอนที่ 1: เปิด MidassAI Chat — ไม่ใช่ GitHub หรือ Hugging Face
เข้าไปโดยตรงที่ https://www.midassai.com/chat/ นี่คืออินเทอร์เฟซเว็บเพียงแหล่งเดียวที่รองรับความสามารถด้านภาพแบบเต็มรูปแบบของ DeepSeek V4 Pro ห้ามใช้เว็บไซต์บุคคลที่สาม เว็บทดลอง หรือเวอร์ชันที่ไม่เป็นทางการ — เพราะจะไม่มีฟีเจอร์ด้านภาพ หรือใช้โมเดลรุ่นเก่า (เช่น V3 หรือ V4 พื้นฐานที่ไม่มีน้ำหนักโมเดลหลายโหมด)
✅ ปลายทางที่ยืนยันว่าใช้งานได้ (เมษายน 2024):
/chat/→ โหลด DeepSeek-V4-Pro (บริบท 1 ล้านโทเคน พร้อมเปิดใช้งานด้านภาพ)/chat/?model=deepseek-v4-pro→ ระบุโมเดลโดยตรง (ไม่บังคับ แต่แนะนำ)
❌ ควรหลีกเลี่ยง:
ollama run deepseek-v4(ไม่มีฟีเจอร์ภาพ ไม่มีอินเทอร์เฟซเว็บ)- เว็บทดลองบน Hugging Face Spaces (ส่วนใหญ่ใช้ V3 ที่ถูกบีบอัด หรือปิดฟีเจอร์ภาพ)
- เว็บไซต์ใดๆ ที่ขอให้คุณ "ดาวน์โหลดโมเดล" — น้ำหนักโมเดลด้านภาพของ DeepSeek V4 Pro เป็นลิขสิทธิ์เฉพาะ และไม่ได้เผยแพร่สู่สาธารณะ
คุณจะเห็นอินเทอร์เฟซแชทที่สะอาดตา — ไม่ต้องสมัครสมาชิก ไม่ต้องใส่บัตรเครดิต มีเพียงช่องพิมพ์คำถามกับไอคอนคลิปกระดาษ (📎) ที่มุมล่างซ้ายของพื้นที่พิมพ์
ขั้นตอนที่ 2: อัปโหลดภาพหนึ่งภาพ — ไม่เกินสามภาพต่อครั้ง
คลิกไอคอนคลิปกระดาษ ระบบไฟล์ของระบบปฏิบัติการจะเปิดขึ้นมา ให้เลือก ภาพหนึ่งภาพ เพื่อเริ่มต้น — รูปแบบ JPG, PNG หรือ WebP (สูงสุด 10 MB) ทำไมต้องหนึ่งภาพ? เพราะ DeepSeek V4 Pro ประมวลผลภาพแบบ ตามลำดับ ในอินเทอร์เฟซเว็บปัจจุบัน การอัปโหลดหลายไฟล์พร้อมกันจะทำให้ระบบสลับไปใช้โหมดข้อความเพียงอย่างเดียว หรือล้มเหลวเงียบๆ
📌 ข้อจำกัดสำคัญ (ผ่านการทดสอบ):
- ความละเอียดสูงสุด: 4096 × 4096 พิกเซล (ความละเอียดสูงกว่านั้นจะถูกย่ออัตโนมัติ — แต่ความชัดเจนลดลงอย่างมากหากกว้างเกิน 3000 พิกเซล)
- ขนาดต่ำสุดที่ใช้งานได้: 320 × 240 พิกเซล (ภาพเล็กมากอาจได้คำตอบว่า "มองรายละเอียดไม่ชัด")
- รูปแบบที่รองรับ:
.jpg,.jpeg,.png,.webp— ไม่รองรับ GIF, SVG หรือ HEIC - ไม่รองรับการอัปโหลด PDF (ต่างจาก LLM บางตัว — DeepSeek V4 Pro รองรับภาพเท่านั้น)
💡 เคล็ดลับระดับโปร: สำหรับภาพหน้าจอโค้ดหรือตาราง ให้ขยายหน้าจอเป็น 125% ก่อนจับภาพ — ความชัดของตัวอักษรสำคัญกว่าจำนวนพิกเซล
ขั้นตอนที่ 3: ตั้งคำถามที่เฉพาะเจาะจงและอ้างอิงภาพโดยตรง
อย่าถามว่า "ในภาพนี้มีอะไรบ้าง?" — เพราะคำถามแบบนั้นคลุมเครือเกินไป และไม่ใช้ศักยภาพการให้เหตุผลของ V4 Pro อย่างเต็มที่
แทนที่จะเป็นเช่นนั้น ให้ถามแบบนี้:
- "ระบุชื่อแพ็กเกจ Python ทั้งหมดที่ถูก import ในภาพหน้าจอโค้ดนี้ และระบุว่าแพ็กเกจใดบ้างที่ถูกประกาศว่าล้าสมัยแล้ว"
- "ฉลากโภชนาการนี้ระบุว่าน้ำตาล 12 กรัมต่อหนึ่งหน่วยบริโภค ถือว่าสูงเกินไปหรือไม่ สำหรับเครื่องดื่ม 250 มล. ตามแนวทางของ WHO?"
- "ดึงตารางจากใบแจ้งหนี้ที่สแกนมาแล้วแปลงเป็นรูปแบบ CSV — รวมหัวคอลัมน์ว่า 'รายการ', 'จำนวน', 'ราคาต่อหน่วย', 'รวม'"
DeepSeek V4 Pro ใช้กระบวนการให้เหตุผลด้านภาพแบบ chain-of-thought — คือระบุองค์ประกอบต่างๆ ในภาพ เปรียบเทียบข้อความที่ปรากฏ นำความรู้เฉพาะด้านมาประยุกต์ใช้ (เช่น วิทยาศาสตร์ด้านโภชนาการ หรือข้อมูลเกี่ยวกับแพ็กเกจ Python) แล้วสรุปผลอย่างเป็นระบบ แต่มันต้องการ เจตนาของคุณที่ชัดเจน ความคลุมเครือ = คำตอบแบบทั่วไป
⚠️ ข้อควรระวัง:
"อธิบายไดอะแกรมนี้"
→ ได้คำอธิบายระดับผิวเผิน
✅ ดีกว่า:
"ไดอะแกรมแบบไหลนี้แสดงการรับข้อมูลเข้าสู่ Kafka pipeline โปรดระบุส่วนประกอบสามส่วนที่ทำหน้าที่จัดรูปแบบข้อมูล (serialization) และระบุรูปแบบการจัดรูปแบบที่แต่ละส่วนใช้"
ขั้นตอนที่ 4: รอ — แล้วปรับปรุงผลลัพธ์ (ไม่ต้องกดปุ่ม 'สร้างใหม่')
ระยะเวลาประมวลผลขึ้นอยู่กับความซับซ้อนของภาพ:
- ภาพหน้าจอเรียบง่าย (โค้ด/ข้อความ): ~3–5 วินาที
- แผนภูมิแน่นหรือไดอะแกรมหลายส่วน: ~8–12 วินาที
- โน้ตเขียนด้วยลายมือ (แบบเขียนโค้ง): ~10–15 วินาที (ความแม่นยำของการรู้จำข้อความลดลง ~18% เมื่อเทียบกับตัวพิมพ์)
คุณจะเห็นตัวบ่งชี้ว่ากำลังพิมพ์ (“DeepSeek กำลังคิด…”) — ห้ามกด Enter ซ้ำ โมเดลจะ ตอบกลับอย่างสมบูรณ์ทุกครั้ง — ยังไม่มีระบบสตรีมคำตอบแบบทีละส่วนสำหรับงานด้านภาพ
หากคำตอบขาดความลึก (เช่น อ่านหน่วยผิด) ให้ ถามต่อในหัวข้อเดียวกัน เช่น:
"ในคำตอบก่อนหน้า คุณระบุว่า 'โซเดียม 200 มก.' แต่ฉลากจริงเขียนว่า '200 ไมโครกรัม' โปรดคำนวณเปอร์เซ็นต์ต่อวันใหม่โดยใช้ค่า RDA ที่ 150 ไมโครกรัม"
V4 Pro รักษาบริบทภาพไว้ตลอดการสนทนา — ไม่ต้องอัปโหลดภาพซ้ำ
ขั้นตอนที่ 5: คัดลอก ส่งออก หรือดำเนินการต่อในหัวข้อเดียวกัน
ผลลัพธ์ทั้งหมดอยู่ในรูปแบบข้อความธรรมดา — ไม่มีการแทรกคำอธิบายบนภาพหรือกรอบรอบวัตถุ แต่คุณสามารถ:
- เลือกข้อความแล้วคัดลอก (Ctrl/Cmd+C)
- วางลงในเอกสาร Jira หรือ Notion
- ใช้ปุ่ม "คัดลอก" (มุมขวาบนของแต่ละข้อความ)
- เลื่อนลงแล้วถามต่อไป — หน้าต่างบริบทรองรับได้สูงสุด 1 ล้านโทเคน ดังนั้นการสนทนาที่ยาวทั้งภาพและข้อความยังคงสอดคล้องกัน
ยังไม่มีปุ่ม "ส่งออกเป็น PDF" ในขณะนี้ แต่คุณสามารถพิมพ์ (Ctrl+P) → เลือก "บันทึกเป็น PDF" เพื่อจัดเก็บ
Quick Takeaways
คู่มือนี้เหมาะกับใคร — และใครควรรอ
วิธีนี้เหมาะอย่างยิ่งหากคุณ:
✔️ วิเคราะห์ภาพหน้าจอจากเครื่องมือพัฒนา แดชบอร์ด หรือแอปมือถือ
✔️ ตรวจสอบเอกสาร (ใบแจ้งหนี้ แบบฟอร์ม ฉลาก) โดยไม่ต้องพิมพ์ด้วยตนเอง
✔️ ใช้ในการสอนหรือแก้ไขข้อผิดพลาด — อัปโหลดงานนักเรียนหรือล็อกข้อผิดพลาด แล้วถามว่า "ผิดตำแหน่งหนึ่งตัวที่ไหน?"
✔️ ทำงานในภาคส่วนที่มีกฎระเบียบเข้มงวด (สุขภาพ หรือการเงิน) ซึ่งต้องเก็บบันทึกการตรวจสอบ — ทุกการโต้ตอบอยู่ในเบราว์เซอร์ของคุณ ไม่มีการจัดเก็บข้อมูลฝั่งเซิร์ฟเวอร์
ไม่เหมาะหากคุณต้องการ:
✖️ วิเคราะห์สตรีมวิดีโอจากกล้องจริง (เว็บไคลเอ็นต์ไม่รองรับการเข้าถึงกล้อง)
✖️ ประมวลผลภาพจำนวนมาก (50+ ภาพ) พร้อมกัน (เว็บไม่รองรับการอัปโหลดจำนวนมากหรือการใช้งานผ่าน CLI)
✖️ สร้างไดอะแกรม (V4 Pro ตีความ ภาพได้ — แต่ ไม่สามารถสร้างภาพ ได้)
✖️ ใช้งานแบบออฟไลน์ (ต้องเชื่อมต่ออินเทอร์เน็ตอย่างต่อเนื่อง — ไม่มี PWA หรือการแคชข้อมูลในเครื่อง)
ลองใช้ตอนนี้ — โดยไม่ต้องตั้งค่าใดๆ
ความสามารถด้านภาพของ DeepSeek V4 Pro ใช้งานได้จริง รวดเร็ว และพร้อมใช้งานเชิงพาณิชย์ — แต่ใช้ได้เฉพาะผ่าน MidassAI Chat เท่านั้น ไม่ต้องดาวน์โหลด ไม่ต้องกำหนดค่า ไม่ต้องรอเซิร์ฟเวอร์ประมวลผลเปิดตัว
การวิเคราะห์ภาพครั้งแรกของคุณใช้เวลาไม่ถึง 60 วินาที:
- เข้าไปที่ https://www.midassai.com/chat/
- คลิก 📎 → เลือกภาพหน้าจอหรือรูปถ่าย
- ตั้งคำถาม อย่างตรงประเด็น — ให้ระบุสิ่งที่คุณต้องการอย่างชัดเจน
- อ่านคำตอบ แล้วปรับปรุงหากจำเป็น
แค่นั้นเอง ไม่ต้องสมัครสมาชิก ไม่มีระยะทดลอง ไม่มีข้อจำกัดจำนวนคำถามด้านภาพ — เพียงแต่ปัญญาประดิษฐ์แบบหลายโหมดที่ทรงพลัง ทำงานผ่านเบราว์เซอร์ของคุณ
| Feature | DeepSeek V4 Pro (Web) | Local Ollama V4 |
|---|---|---|
| Vision support | ✅ Full multimodal (image + text) | ❌ Text-only by default |
| Setup time | ⏱️ 0 min — browser only | ⏱️ 15–45 min (GPU, RAM, quantization) |
| Context length | 🧮 1M tokens (with image tokens) | 🧮 ≤128K (if vision even enabled) |
| Agent workflows | ✅ Supported (e.g., ‘analyze image → search docs → summarize’) | ❌ Not implemented in Ollama |