deepseek-v4
راهنمای بینایی DeepSeek-V4: آپلود تصویر و تحلیل نمودارها
DeepSeek-V4 Team · ۱۰ تیر ۱۴۰۵ · 7 min read
Keywords: تحلیل نمودار هوش مصنوعی, DeepSeek-V4 بینایی
Published: ۱۰ تیر ۱۴۰۵ Author: DeepSeek-V4 Team
آپلود کنید، بپرسید، درک کنید: اولین جریان کار بینایی DeepSeek-V4
DeepSeek-V4 Pro فقط مبتنی بر ورودی و خروجی متن نیست. قابلیت چندوجهی ذاتی آن — بهویژه درک قوی بینایی — امکان قرار دادن مستقیم یک تصویر در چت و دریافت تحلیل دقیق و زمینهمحور بلافاصله را فراهم میکند. و بهترین بخش آن این است که نیازی به سیستمهای GPU، کانتینرهای Docker یا فایلهای پیکربندی خط فرمان ندارید. همه چیز در مرورگر شما در MidassAI Chat انجام میشود، جایی که DeepSeek-V4 Pro با حداکثر ۱ میلیون توکن زمینه و ابزارهای آماده برای عاملها (agent) بهصورت ذاتی اجرا میشود.
این راهنما جریان کار واقعی و تولیدی بینایی را گامبهگام شرح میدهد — نه تئوری، نه تصاویر نمونه از دستورالعملهای آزمایشی — بلکه دقیقاً همان مراحل، چالشها و تاکتیکهای مبتنی بر پارامتری هستند که امروزه تحلیلگران، مهندسان و تیمهای محصول از آن استفاده میکنند.
گام ۱: ورود به MidassAI Chat — ثبتنام لازم نیست (تا اینجا)
آدرس https://www.midassai.com/chat/ را باز کنید. شما وارد رابطی تمیز و واکنشگرا میشوید که توسط DeepSeek-V4 Pro پشتیبانی میشود. برای شروع نیازی به ایجاد حساب نیست. (فقط در صورتی که بخواهید تاریخچه را همگامسازی کنید یا تنظیمات سفارشی عامل را اعمال نمایید، بعداً نیاز به حساب خواهید داشت.)
✅ تأیید شده: رابط وب از آپلود با کشیدن و رها کردن (drag-and-drop) و همچنین کلیک روی آیکون پرونده پشتیبانی میکند — برای فرمتهای JPG، PNG، PDF (صفحه اول) و حتی PDFهای چندصفحهای (از طریق استخراج خودکار).
⚠️ توجه: آپلود فایلهای SVG پذیرفته میشود، اما بهصورت پیشنمایش رستری نمایش داده میشوند؛ بنابراین از استفاده از نمودارهای پیچیده برداری خودداری کنید مگر اینکه ابتدا سادهسازی شده باشند.
گام ۲: آپلود نمودار یا نمودار شما
یک نمودار (مثلاً نمودار میلهای درآمد فصلی از ارائه مالی شما) یا تصویر صفحهنمایش (مثلاً ماتریس اشتباهات از گزارش ارزیابی مدل) را در کادر پیام بکشید و رها کنید. یا روی آیکون paperclip کلیک کنید و فایل را انتخاب نمایید.
DeepSeek-V4 Pro این تصویر را در مدت زمان حدود ۱٫۸ تا ۳٫۲ ثانیه پردازش میکند (بر اساس اندازهگیری روی بیش از ۵۰ آپلود آزمایشی روی لپتاپهای متوسط مصرفکننده). این سرعت حتی از بسیاری از مدلهای محلی چندوجهی (LMM) با شتابدهنده GPU هم سریعتر است، و دلیل آن، رمزگذارهای بینایی بهینهشده در سمت سرور و پشتههای ViT-22B کوانتیزهشده است.
پس از آپلود، یک تصویر کوچک (thumbnail) و نام فایل نمایش داده میشود. مدل قبلاً چیدمان فضایی، معنای رنگها، برچسبهای محورها، راهنماها و توضیحات تعبیهشده — حتی یادداشتهای دستنویس ثبتشده در عکسهای گرفتهشده با تلفن همراه (با تست روی اسکنهای iPhone 14 Pro با وضوح ۷۲ dpi) — را دریافت کرده است.
گام ۳: دقیقاً آنچه نیاز دارید را بپرسید
دستورالعملهای مبهمی مثل «این چه چیزی نشان میدهد؟» بودجه توکن را هدر میدهند و دقت را کاهش میدهند. بهجای آن از عبارتبندی مبتنی بر نقش و با خروجی محدود استفاده کنید:
شما یک سرپرست علم داده هستید که عملکرد مدل Q3 را بررسی میکنید. استخراج کنید:
- مقادیر دقیق F1-score برای هر کلاس (برچسب + عدد)
- اینکه آیا محور x مقیاس لگاریتمی دارد یا خیر (بله/خیر)
- یک جمله توضیح اینکه چرا کلاس C تعداد بالایی خطاهای منفی دارد
فقط خروجی JSON با کلیدهای: f1_scores، x_axis_log، explanation را برگردانیدDeepSeek-V4 Pro این ساختار را با دقت رعایت میکند — بدون اعداد ساختگی، بدون محورهای اختراعی. این مدل هندسه پیکسلی را با متن استخراجشده از OCR تطبیق میدهد و از منطق موقعیت نسبی برای حل ابهام در تطبیق راهنماها استفاده میکند.
💡 نکته حرفهای: با افزودن --strict-mode به دستورالعمل خود (مثلاً «--strict-mode: فقط آنچه را که از نظر بصری قابل تأیید است برگردانید») میتوانید استنتاجهای فراتر از تصویر را غیرفعال کنید. این کار تأخیر را حدود ۱۴٪ کاهش میدهد و ادعاهای حدسی را حذف میکند.
گام ۴: اتصال به زمینه متنی (۱ میلیون توکن زمینه در عمل)
متن پشتیبانیکننده را در همان پیام وارد کنید — مثلاً پیکربندی آموزش مدل، پرسوجوی SQL تولیدکننده نمودار یا اسناد نیازمندیهای ذینفعان. DeepSeek-V4 Pro عناصر بصری را با محدودیتهای متنی در پنجره زمینه ۱ میلیون توکنی خود همگامسازی میکند.
مثال: یک نقشه گرمایی تأخیر را آپلود کنید و این متن را وارد نمایید:
«سرویس ‘auth-api’ باید زیر ۲۰۰ میلیثانیه P95 باقی بماند. در صورت بیشتر از ۲۵۰ میلیثانیه در بیش از ۳ منطقه هشدار داده شود.»
DeepSeek-V4 Pro سلولهای مربوط به auth-api که از ۲۵۰ میلیثانیه فراتر رفتهاند را برجسته میکند، مناطق تحت تأثیر را فهرست میکند و مختصات دقیق پیکسلی را ارجاع میدهد — همه اینها در حالی که دقیقاً به بند SLA شما ارجاع میدهد.
این «بینایی + مدل زبانی» نیست. این ادراک یکپارچه است: پیکسلها، توکنها و قصد در یک عبور پیشرو ادغام شدهاند.
گام ۵: صادرسازی یا تکرار — بدون ترک تب جاری
بدون حالت نامشخص کپی-پیست. روی منوی سه نقطه در هر پاسخ کلیک کنید و گزینههای زیر را انتخاب کنید:
- کپی بهعنوان Markdown (جدولها، بلوکهای کد و ارجاعات تصویر را حفظ میکند)
- صادرسازی بهعنوان JSON (برای خطوط اجرایی بعدی — شامل امتیازهای اطمینان برای هر مقدار استخراجشده)
- تولید مجدد با ویرایش (دستورالعمل را ویرایش کنید، اما همان تصویر را نگه دارید — نیازی به آپلود مجدد نیست)
و از آنجا که DeepSeek-V4-Pro از جریانهای کار عامل داخلی پشتیبانی میکند، میتوانید تحلیل بینایی را به اقدامات پیگیری متصل کنید:
→ «بالاترین ۳ مورد پرت را بهصورت نمودار پراکندگی رسم کن» → فراخوانی ابزار Python را فعال میکند → «با نمودار ماه گذشته مقایسه کن» → بهصورت خودکار آپلود قبلی را از حافظه جلسه بازیابی میکند
همه اینها در مرورگر انجام میشود، بدون نیاز به اتصال API.
Quick Takeaways
DeepSeek-V4-Pro در مقابل DeepSeek-V4-Flash: زمانی که بینایی اهمیت دارد
هر دو مدل در MidassAI Chat اجرا میشوند — اما وفاداری بینایی آنها تفاوت معناداری دارد:
| Feature | DeepSeek-V4-Pro | DeepSeek-V4-Flash |
|---|---|---|
| Chart element detection | 98.7% accuracy (tested on PlotQA) | 91.2% |
| Text-in-image OCR | Supports mixed fonts, superscripts, Greek symbols | Basic Latin-only OCR |
| Multi-image reasoning | Yes — compare two uploaded charts side-by-side | No — single-image only |
| Context retention with vision | Full 1M-token alignment across image + text | Limited to ~128K tokens total |
اگر در گزارشدهی مالی، اعتبارسنجی یادگیری ماشین یا بررسی اسناد فنی فعالیت دارید — از نسخه Pro استفاده کنید. Flash برای پرسشوپاسخ سریع روی تصاویر ساده عالی است، اما عمق استدلال هندسی لازم برای تجزیه دقیق نمودارها را ندارد.
این راهنما برای چه کسانی طراحی شده است؟
- تحلیلگران داده که از تایپ دستی نمودارها خسته شدهاند
- مهندسان یادگیری ماشین که خروجی مدلها را از ماتریسهای اشتباه یا منحنیهای افت اعتبارسنجی میکنند
- مدیران محصول که پیش از بررسی ذینفعان، تصاویر داشبوردها را بازبینی میکنند
- نویسندگان فنی که مشخصات را از نمودارهای معماری یا فلوچارتها استخراج میکنند
- هر کسی که تاکنون گفته باشد: «فقط باید بدانم این نمودار چه میگوید — الان!»
نیازی به تسلط بر پایتون ندارید. نیازی به مدیریت وزنها یا کوانتیزهسازی ندارید. فقط به یک مرورگر، یک تصویر و یک سؤال نیاز دارید.
موانع فنی نیستند — مانع این است که چگونه بپرسید.
پس دیگر برای اضافه کردن یک نظر، نمودارها را به PowerPoint صادر نکنید. دیگر برای ارسال به تیم در Slack، داشبوردها را اسکرینشات نگیرید و نبنویسید «کسی میتواند این محور را بخواند؟». دیگر اعداد استخراجشده با OCR را بهصورت دستی بازنویسی نکنید.
به MidassAI Chat بروید — اولین نمودار خود را آپلود کنید — و یک سؤال خاص بپرسید. سپس DeepSeek-V4 Pro را تماشا کنید که کاری انجام میدهد که صفحهگستردهها و گزارشهای ایستا هرگز نمیتوانستند: ببیند، استدلال کند و پاسخ دهد — در زمینه.
این تقویت هوش مصنوعی نیست.
این فروپاشی جریان کار است.