DeepSeek Vision: Afbeeldingen uploaden en vragen stellen
DeepSeek-V4 Team · 13 juli 2026 · 6 min read

Hoe DeepSeek V4 Pro uw afbeeldingen ziet — en begrijpt
DeepSeek V4 Pro is niet alleen tekst-in, tekst-uit. Het is multimodaal: het ziet, interpreteert en redeneert over afbeeldingen — zonder lokale installatie. U hebt geen CUDA-stuurprogramma’s, pip install-opdrachten of GPU-toewijzing nodig. Open gewoon uw browser, ga naar MidassAI Chat, en begin met het uploaden van screenshots, grafieken, handschrift, productverpakkingen of zelfs complexe diagrammen.
Deze handleiding begeleidt u stap voor stap — getest, getimed en geoptimaliseerd — voor het gebruik van DeepSeek V4 Pro’s visuele functionaliteit via de webinterface. Elke stap weerspiegelt het werkelijke gedrag in de live-interface (per mei 2024). Geen aannames. Geen ‘in theorie’ — alleen wat nu direct werkt.
Stap 1: Open MidassAI Chat — niet GitHub of Hugging Face
Ga rechtstreeks naar https://www.midassai.com/chat/. Dit is de enige ondersteunde webinterface voor de volledige visuele functionaliteit van DeepSeek V4 Pro. Gebruik geen derde-partij wrappers, demositess of onofficiële forks — deze ondersteunen geen visuele functies of draaien oudere modelversies (bijv. V3 of basis-V4 zonder multimodale gewichten).
✅ Bevestigd werkende endpoints (per mei 2024):
/chat/→ laadt DeepSeek-V4-Pro (1 miljoen contexttokens, visueel ingeschakeld)/chat/?model=deepseek-v4-pro→ expliciete modelselectie (optioneel, maar aanbevolen)
❌ Vermijd:
ollama run deepseek-v4(geen visuele ondersteuning, geen webinterface)- Hugging Face Spaces-demos (meestal gebaseerd op gequantiseerde V3 of zonder visuele functionaliteit)
- Elke site die u vraagt om ‘het model te downloaden’ — DeepSeek V4 Pro’s visuele capaciteit vereist proprietair gewichtsmateriaal dat niet openbaar beschikbaar is.
U komt terecht op een schone chatinterface — geen registratie, geen creditcard. Alleen een invoerveld en een paperclippictogram (📎) links-onderin het invoergebied.
Stap 2: Upload één afbeelding — niet meer dan drie tegelijk
Klik op de paperclip. Er opent een systeemeigen bestandskiezer. Selecteer één afbeelding om te beginnen — JPG, PNG of WebP (max. 10 MB). Waarom één? Omdat DeepSeek V4 Pro afbeeldingen sequentieel verwerkt in de huidige webinterface; het gelijktijdig uploaden van meerdere bestanden activeert automatisch de tekstmodus of mislukt stilzwijgend.
📌 Belangrijkste beperkingen (getest):
- Maximale resolutie: 4096 × 4096 pixels (hogere resoluties worden automatisch verkleind — leesbaarheid daalt sterk boven 3000 px breedte)
- Minimale nuttige grootte: 320 × 240 px (erg kleine miniaturen leveren vaak ‘Ik zie details niet duidelijk’)
- Ondersteunde formaten:
.jpg,.jpeg,.png,.webp— geen GIF, SVG of HEIC - Geen PDF-upload (in tegenstelling tot sommige andere LLM’s — DeepSeek V4 Pro’s visuele functie werkt uitsluitend met afbeeldingen)
💡 Prof-tips: Voor screenshots van code of tabellen, zoom dan vooraf tot 125% — letterduidelijkheid telt meer dan aantal pixels.
Stap 3: Stel een specifieke, inhoudelijke vraag
Zeg niet ‘Wat staat er op deze afbeelding?’ — dat is vaag en benut de redeneercapaciteit van V4 Pro niet optimaal.
Stel in plaats daarvan vragen zoals:
- ‘Geef een lijst van alle in deze codescreenshot geïmporteerde Python-pakketten, en markeer eventuele verouderde pakketten.’
- ‘Op dit voedingswaardetabel staat 12 g suiker per portie. Wordt dat beschouwd als hoog voor een drank van 250 ml volgens WHO-richtlijnen?’
- ‘Haal de tabel uit deze gescande factuur en converteer die naar CSV-formaat — inclusief koppen ‘Artikel’, ‘Aantal’, ‘Eenheidsprijs’, ‘Totaal’.’
DeepSeek V4 Pro gebruikt een chain-of-thought-visueredenering: het lokaliseert elementen, vergelijkt teksten, past domeinspecifieke logica toe (bijv. voedingswetenschap, Python-pakketmetadata) en synthetiseert het resultaat. Maar het heeft uw intentie duidelijk geformuleerd nodig. Onduidelijkheid = algemene samenvatting.
⚠️ Valkuil om te vermijden:
‘Leg dit diagram uit.’
→ Levert een oppervlakkige beschrijving op.
✅ Beter:
‘Deze stroomdiagram toont gegevensopname in een Kafka-pipeline. Geef de drie componenten aan die verantwoordelijk zijn voor serialisatie, en noem het serialisatieformaat dat elk gebruikt.’
Stap 4: Wacht — en verfijn (geen ‘Opnieuw genereren’-knop nodig)
Verwerkingstijd hangt af van de afbeeldingscomplexiteit:
- Eenvoudige screenshot (code/tekst): ~3–5 sec
- Dichte grafiek of meerdelige diagram: ~8–12 sec
- Handschrift met cursief: ~10–15 sec (OCR-nauwkeurigheid daalt ~18% ten opzichte van gedrukte tekst)
U ziet een typindicator (‘DeepSeek is aan het nadenken…’) — druk niet op Enter. Het model geeft altijd volledige antwoorden — er is nog geen gedeeltelijke streaming bij visuele taken.
Als het antwoord nuances mist (bijv. een eenheid verkeerd gelezen), volg dan in dezelfde conversatie op, bijv.:
‘In uw eerdere antwoord zei u ‘200 mg natrium’. Op het etiket staat echter ‘200 mcg’. Kunt u het dagelijkse percentage opnieuw berekenen op basis van de Aanbevolen Dagelijkse Inname (ADI) van 150 mcg?’
V4 Pro behoudt de visuele context over meerdere berichten — heruploaden is niet nodig.
Stap 5: Kopieer, exporteer of vervolg de conversatie
Alle uitvoer is platte tekst — geen ingebedde afbeeldingsannotaties of begrenzingsvakken. U kunt wel:
- Resultaten selecteren en kopiëren (Ctrl/Cmd+C)
- Plakken in documenten, Jira-tickets of Notion
- De ‘Kopieer’-knop gebruiken (rechtsboven in elke berichtenbubbel)
- Doorscrollen en doorgaan met vragen — het contextvenster ondersteunt tot 1 miljoen tokens, dus lange afbeelding+tekst-conversaties blijven coherent
Er is nog geen ‘Exporteer naar PDF’-knop, maar u kunt afdrukken (Ctrl+P) → ‘Opslaan als PDF’ voor archivering.
Quick Takeaways
Voor wie dit geschikt is — en wie even moet wachten
Deze werkwijze werkt uitstekend als u:
✔️ Screenshots analyseert van ontwikkeltools, dashboards of mobiele apps
✔️ Documenten controleert (facturen, formulieren, etiketten) zonder handmatige transcriptie
✔️ Lesgeeft of fouten opspoort — upload leerlingwerk of foutlogboeken en vraag ‘Waar zit de off-by-one-fout?’
✔️ Werkzaam bent in gereguleerde sectoren (gezondheidszorg, financiën), waar traceerbaarheid belangrijk is — elke interactie blijft in uw browser, zonder serverzijde opslag
Het is niet ideaal als u:
✖️ Realtime-analyse van camerabeelden nodig hebt (geen toegang tot webcam in webinterface)
✖️ Batchverwerking van 50+ afbeeldingen wilt (geen bulkupload of CLI-ondersteuning via web)
✖️ Diagrammen wilt genereren (V4 Pro interpreteert afbeeldingen — het maakt ze niet)
✖️ Offline wilt werken (stabiele internetverbinding vereist; geen PWA of lokale caching)
Probeer het nu — zonder enige voorbereiding
DeepSeek V4 Pro’s visuele functionaliteit is live, snel en productieklaar — maar alleen via MidassAI Chat. Er is geen download, geen configuratie, geen wachten op inference-servers.
Uw eerste afbeeldingsanalyse duurt minder dan 60 seconden:
- Ga naar https://www.midassai.com/chat/
- Klik op 📎 → kies een screenshot of foto
- Stel precies wat u nodig hebt — wees specifiek
- Lees het antwoord. Pas indien nodig aan.
Dat is alles. Geen account. Geen proefperiode. Geen limiet op visuele vragen — puur, multimodaal intelligentie, direct in uw browser.
| Feature | DeepSeek V4 Pro (Web) | Local Ollama V4 |
|---|---|---|
| Vision support | ✅ Full multimodal (image + text) | ❌ Text-only by default |
| Setup time | ⏱️ 0 min — browser only | ⏱️ 15–45 min (GPU, RAM, quantization) |
| Context length | 🧮 1M tokens (with image tokens) | 🧮 ≤128K (if vision even enabled) |
| Agent workflows | ✅ Supported (e.g., ‘analyze image → search docs → summarize’) | ❌ Not implemented in Ollama |