دیپسیک ویژن: آپلود تصاویر و پرسیدن سؤالات — راهنمای گامبهگام
DeepSeek-V4 Team · ۲۲ تیر ۱۴۰۵ · 7 min read

چگونه دیپسیک V4 Pro تصاویر شما را میبیند — و درک میکند
دیپسیک V4 Pro صرفاً ورودی و خروجی متنی نیست. این مدل چندوجهی است: تصاویر را میبیند، تفسیر میکند و بر اساس آنها استدلال میکند — بدون نیاز به هیچ تنظیمات محلی. نیازی به درایورهای CUDA، دستورات pip install یا تخصیص GPU ندارید. کافیست مرورگر خود را باز کنید، به چت MidassAI بروید و شروع به آپلود اسکرینشاتها، نمودارها، یادداشتهای دستنویس، بستهبندی محصولات یا حتی نمودارهای پیچیده کنید.
این راهنما دقیقاً گامهای لازم را — با تست عملی، زمانبندی دقیق و بهینهسازی — برای استفاده از قابلیت بینایی دیپسیک V4 Pro در وب توضیح میدهد. هر گام بر اساس رفتار واقعی رابط کاربری زنده (تا می ۲۰۲۴) تأیید شده است. فرضیهای وجود ندارد؛ فقط آنچه هماکنون کار میکند.
گام ۱: ورود به چت MidassAI — نه GitHub یا Hugging Face
مستقیماً به https://www.midassai.com/chat/ بروید. این تنها رابط وب پشتیبانیشده برای کاملترین قابلیتهای بینایی دیپسیک V4 Pro است. از پوششدهندههای شخص ثالث، سایتهای نمایشی یا نسخههای غیررسمی استفاده نکنید — اینها یا از قابلیت بینایی پشتیبانی نمیکنند یا از نسخههای قدیمیتر مدل (مثل V3 یا V4 پایه بدون وزنهای چندوجهی) استفاده میکنند.
✅ نقاط پایانی تأییدشده (تا می ۲۰۲۴):
/chat/→ بارگذاری دیپسیک-V4-Pro (زمینهی زمینهای ۱ میلیون توکن، بینایی فعال)/chat/?model=deepseek-v4-pro→ تعیین صریح مدل (اختیاری اما توصیهشده)
❌ اجتناب کنید:
ollama run deepseek-v4(بدون قابلیت بینایی، بدون رابط وب)- نمایشیهای Hugging Face Spaces (اغلب از V3 کوانتیزه یا بینایی غیرفعال استفاده میکنند)
- هر سایتی که از شما میخواهد «مدل را دانلود کنید» — وزنهای اختصاصی مورد نیاز بینایی دیپسیک V4 Pro عموماً منتشر نشدهاند.
شما به یک رابط چت تمیز وارد میشوید — بدون نیاز به ثبتنام یا وارد کردن اطلاعات پرداخت. فقط یک کادر ورودی و یک آیکون paperclip (📎) در گوشهی پایین-چپ ناحیه ورودی وجود دارد.
گام ۲: آپلود یک تصویر — نه بیش از سه تصویر بهصورت همزمان
روی آیکون paperclip کلیک کنید. یک انتخابگر فایل ذاتی سیستمعامل باز میشود. برای شروع، یک تصویر را انتخاب کنید — فرمتهای JPG، PNG یا WebP (حداکثر ۱۰ مگابایت). چرا فقط یک تصویر؟ زیرا دیپسیک V4 Pro در رابط وب فعلی تصاویر را بهصورت سریالی پردازش میکند؛ آپلود همزمان چند فایل منجر به بازگشت به حالت متنی فقط یا شکست ساکت میشود.
📌 محدودیتهای کلیدی (با تست تأییدشده):
- حداکثر رزولوشن: ۴۰۹۶ × ۴۰۹۶ پیکسل (رزولوشن بالاتر بهصورت خودکار کاهشیافته — اما وضوح بهشدت بالاتر از عرض ۳۰۰۰ پیکسل افت میکند)
- حداقل اندازه مفید: ۳۲۰ × ۲۴۰ پیکسل (تصاویر بسیار کوچک اغلب پاسخ «نمیتوانم جزئیات را بهخوبی ببینم» را میدهند)
- فرمتهای پشتیبانیشده:
.jpg,.jpeg,.png,.webp— بدون GIF، SVG یا HEIC - آپلود PDF مجاز نیست (برخلاف برخی مدلهای زبانی دیگر — بینایی دیپسیک V4 Pro صرفاً برای تصاویر طراحی شده است)
💡 نکته حرفهای: برای اسکرینشاتهای کد یا جداول، قبل از گرفتن تصویر، زوم را به ۱۲۵٪ افزایش دهید — وضوح فونت اهمیت بیشتری نسبت به تعداد پیکسلها دارد.
گام ۳: پرسیدن سؤالی دقیق و مبتنی بر تصویر
از عبارت «در این تصویر چه چیزی است؟» استفاده نکنید — این سؤال مبهم است و عمق استدلال V4 Pro را بهکار نمیبرد.
بهجای آن، سؤالاتی مانند اینها بپرسید:
- «تمام کتابخانههای پایتونی که در این اسکرینشات کد وارد شدهاند را فهرست کن و کتابخانههای منسوخشده را مشخص کن.»
- «این برچسب تغذیهای نشان میدهد که هر سروینگ ۱۲ گرم قند دارد. آیا این مقدار بر اساس دستورالعملهای سازمان جهانی بهداشت برای نوشیدنی ۲۵۰ میلیلیتری بالا تلقی میشود؟»
- «جدول موجود در این فاکتور اسکنشده را استخراج کن و به فرمت CSV تبدیل کن — سرستونها باید شامل ‘آیتم’، ‘تعداد’، ‘قیمت واحد’ و ‘جمع کل’ باشند.»
دیپسیک V4 Pro از استدلال بینایی مبتنی بر زنجیرهی استدلال استفاده میکند — عناصر را شناسایی میکند، متن را با هم مقایسه میکند، منطق حوزهی مربوطه (مثل علم تغذیه یا متادیتا کتابخانههای پایتون) را اعمال میکند و سپس خروجی را ترکیب میکند. اما برای این کار، قصد شما باید واضح بیان شود. ابهام = خلاصهی کلی و عمومی.
⚠️ خطای رایجی که باید اجتناب کرد:
«این نمودار را توضیح بده.»
→ توصیف سطحی دریافت میکنید.
✅ بهتر است:
«این نمودار جریان، ورود دادهها به خط لوله Kafka را نشان میدهد. سه مؤلفهای را که مسئول سریالسازی هستند شناسایی کن و فرمت سریالسازی هر یک را نام ببر.»
گام ۴: صبر کنید — سپس پاسخ را دقیقتر کنید (دکمهی «تولید مجدد» لازم نیست)
زمان پردازش بستگی به پیچیدگی تصویر دارد:
- اسکرینشات ساده (کد/متن): حدود ۳–۵ ثانیه
- نمودار پرجزئیات یا نمودار چندبخشی: حدود ۸–۱۲ ثانیه
- یادداشت دستنویس با خط روان: حدود ۱۰–۱۵ ثانیه (دقت OCR نسبت به متن چاپی حدود ۱۸٪ کاهش مییابد)
شما نشانگر تایپزنی («دیپسیک در حال فکر کردن…») را مشاهده خواهید کرد — دکمه Enter را دوباره فشار ندهید. مدل همیشه پاسخهای کامل و آماده را تولید میکند — هنوز پشتیبانی از جریاندهی جزئی (streaming) برای وظایف بینایی وجود ندارد.
اگر خروجی جزئیاتی را از قلم انداخت (مثلاً برچسب واحد را اشتباه خواند)، در همان رشته پیام ادامه دهید، مثلاً:
«در پاسخ قبلی شما گفتید ‘۲۰۰ میلیگرم سدیم’. ولی روی برچسب نوشته شده ‘۲۰۰ میکروگرم’. لطفاً درصد روزانه را بر اساس RDA برابر با ۱۵۰ میکروگرم دوباره محاسبه کن.»
V4 Pro زمینهی بصری را در طول تعاملات حفظ میکند — نیازی به آپلود مجدد نیست.
گام ۵: کپی، صادرات یا ادامهی گفتگو
تمام خروجیها بهصورت متن ساده هستند — بدون توضیح تصویری یا جعبههای محدودکننده (bounding boxes). اما میتوانید:
- نتایج را انتخاب و کپی کنید (Ctrl/Cmd+C)
- در اسناد، تیکتهای Jira یا Notion بچسبانید
- از دکمه «کپی» (بالا-راست هر حباب پیام) استفاده کنید
- ادامه دهید و سؤالات بیشتری بپرسید — پنجره زمینه تا ۱ میلیون توکن را حفظ میکند، بنابراین گفتگوهای طولانی حاوی تصویر و متن همچنان منسجم باقی میمانند
دکمهی «صادرات به PDF» هنوز وجود ندارد، اما میتوانید از چاپ (Ctrl+P) → «ذخیره بهعنوان PDF» برای آرشیو استفاده کنید.
Quick Takeaways
این روش برای چه کسانی مناسب است — و چه کسانی باید صبر کنند
این روش در موارد زیر عالی عمل میکند:
✔️ تحلیل اسکرینشاتهای ابزارهای توسعه، داشبوردها یا اپلیکیشنهای موبایل
✔️ بازرسی اسناد (فاکتورها، فرمها، برچسبها) بدون تایپ دستی
✔️ آموزش یا عیبیابی — آپلود کار دانشآموزان یا لاگهای خطا و پرسیدن «خطای off-by-one در کجا است؟»
✔️ فعالیت در حوزههای نظارتی (سلامت، مالی) که ردپای بازرسی اهمیت دارد — تمام تعاملات در مرورگر شما باقی میماند، بدون ذخیرهسازی سمت سرور
اما برای موارد زیر مناسب نیست:
✖️ تحلیل زنده جریان دوربین (دسترسی به وبکم در رابط وب وجود ندارد)
✖️ پردازش دستهای ۵۰+ تصویر (آپلود انبوه یا پشتیبانی CLI در رابط وب وجود ندارد)
✖️ تولید نمودار (V4 Pro تصاویر را تفسیر میکند — نه ایجاد)
✖️ استفاده آفلاین (نیاز به اینترنت پایدار دارد؛ بدون پشتیبانی PWA یا کش محلی)
همین الان امتحان کنید — بدون هیچ تنظیماتی
قابلیت بینایی دیپسیک V4 Pro در دسترس است، سریع و آمادهٔ تولید — اما فقط از طریق چت MidassAI. نیازی به دانلود، پیکربندی یا انتظار برای راهاندازی سرورهای استنتاج نیست.
تحلیل اولیه تصویر شما کمتر از ۶۰ ثانیه طول میکشد:
۱. به https://www.midassai.com/chat/ بروید
۲. روی 📎 کلیک کنید → یک اسکرینشات یا عکس انتخاب کنید
۳. دقیقاً همان چیزی را که نیاز دارید بپرسید — مشخص و دقیق باشید
۴. پاسخ را بخوانید. در صورت لزوم، آن را دقیقتر کنید.
همین! بدون نیاز به ایجاد حساب، بدون دوره آزمایشی، بدون سقف مصرف برای پرسشهای بینایی — فقط هوش چندوجهی خالص، مستقیماً در مرورگر شما.
| Feature | DeepSeek V4 Pro (Web) | Local Ollama V4 |
|---|---|---|
| Vision support | ✅ Full multimodal (image + text) | ❌ Text-only by default |
| Setup time | ⏱️ 0 min — browser only | ⏱️ 15–45 min (GPU, RAM, quantization) |
| Context length | 🧮 1M tokens (with image tokens) | 🧮 ≤128K (if vision even enabled) |
| Agent workflows | ✅ Supported (e.g., ‘analyze image → search docs → summarize’) | ❌ Not implemented in Ollama |