DeepSeek V4 Pro
지금 바로 채팅 시작하기

DeepSeek Vision: 이미지 업로드 후 질문하기 — 단계별 가이드

DeepSeek-V4 Team · 2026년 7월 13일 · 17 min read

Start Chatting on MidassAI
DeepSeek Vision: 이미지 업로드 후 질문하기 — 단계별 가이드

DeepSeek V4 Pro가 어떻게 이미지를 '보며' 이해하는가

DeepSeek V4 Pro는 단순한 텍스트 입력→출력 모델이 아닙니다. 이 모델은 다중모달(multimodal) 기능을 갖추고 있어, 이미지를 보고, 해석하며, 추론까지 수행합니다 — 로컬 설정은 전혀 필요 없습니다. CUDA 드라이버도, pip install 명령어도, GPU 할당도 필요 없습니다. 브라우저만 열고 MidassAI 챗에 접속한 후, 스크린샷, 차트, 손글씨 메모, 제품 포장지, 복잡한 다이어그램 등 원하는 이미지를 바로 업로드하면 됩니다.

이 가이드는 DeepSeek V4 Pro의 시각 기능을 웹에서 실제로 사용하는 정확한 절차를 단계별로 안내합니다. 모든 단계는 실시간 인터페이스(2024년 5월 기준)에서 테스트·측정·최적화된 결과이며, 이론적 설명이 아닌, 지금 당장 작동하는 방법만 담았습니다.

1단계: GitHub나 Hugging Face가 아닌 MidassAI 챗으로 바로 접속하기

https://www.midassai.com/chat/ 으로 직접 이동하세요. 이 주소는 DeepSeek V4 Pro의 완전한 시각 기능을 지원하는 유일한 공식 웹 인터페이스입니다. 타사 래퍼, 데모 사이트, 비공식 포크 버전은 시각 기능을 지원하지 않거나, 구버전 모델(V3 또는 멀티모달 가중치가 없는 기본 V4)을 실행합니다.

✅ 2024년 5월 기준 확인된 정상 작동 엔드포인트:

  • /chat/ → DeepSeek-V4-Pro 로드됨 (100만 토큰 컨텍스트, 시각 기능 활성화)
  • /chat/?model=deepseek-v4-pro → 명시적 모델 고정 (선택 사항이나 권장)

❌ 피해야 할 것:

  • ollama run deepseek-v4 (시각 기능 없음, 웹 UI 없음)
  • Hugging Face Spaces 데모 (대부분 양자화된 V3 또는 비활성화된 시각 기능 사용)
  • "모델 다운로드"를 요청하는 모든 사이트 — DeepSeek V4 Pro의 시각 기능은 공개되지 않은 프로프리어터리 가중치를 요구합니다.

화면에는 회원가입이나 신용카드 정보 없이 바로 사용 가능한 깔끔한 챗 인터페이스가 나타납니다. 입력창 왼쪽 아래에 프롬프트 창과 종이클립 아이콘(📎)만 있습니다.

Start Chatting on MidassAI

2단계: 한 번에 하나의 이미지만 업로드하기 — 세 장 이상 금지

종이클립 아이콘을 클릭하면 운영체제 기본 파일 선택기 창이 열립니다. 시작하려면 하나의 이미지만 선택하세요 — JPG, PNG 또는 WebP 형식(최대 10MB). 왜 하나뿐이어야 할까요? 현재 웹 인터페이스에서는 이미지를 직렬 방식으로 처리하기 때문에, 여러 파일을 동시에 업로드하면 텍스트 전용 모드로 자동 전환되거나 응답 없이 실패할 수 있습니다.

📌 테스트된 주요 제약 조건:

  • 최대 해상도: 4096 × 4096 픽셀 (그 이상은 자동 다운스케일링되지만, 너비 3000px 초과 시 가독성이 급격히 저하됨)
  • 최소 유용 해상도: 320 × 240 픽셀 (너무 작은 축소판은 "세부 사항을 명확히 볼 수 없습니다"라고 응답함)
  • 지원 형식: .jpg, .jpeg, .png, .webpGIF, SVG, HEIC 미지원
  • PDF 업로드 불가 (다른 일부 LLM과 달리, DeepSeek V4 Pro 시각 기능은 순수 이미지 전용임)

💡 전문 팁: 코드나 표 스크린샷의 경우 캡처 전 화면 확대율을 125%로 설정하세요. 픽셀 수보다 글꼴 선명도가 훨씬 중요합니다.

3단계: 구체적이고 근거 있는 질문 던지기

"이 이미지에는 무엇이 있나요?"라고 묻지 마세요 — 이는 모호하고, V4 Pro의 심층 추론 능력을 충분히 활용하지 못합니다.

대신 다음처럼 구체적인 질문을 하세요:

  • "이 코드 스크린샷에서 가져온 모든 Python 패키지를 나열해 주세요. 그리고 사용 중단된 패키지도 표시해 주세요."
  • "이 영양성분 라벨에는 1회 제공량당 설탕 12g이 표시되어 있습니다. WHO 지침에 따르면 250ml 음료 기준으로 이 수치는 높은 편입니까?"
  • "이 스캔된 청구서에서 표를 추출하여 CSV 형식으로 변환해 주세요. 헤더는 '품목', '수량', '단가', '총액'으로 해 주세요."

DeepSeek V4 Pro는 사고 연쇄(chain-of-thought) 기반 시각 추론을 사용합니다 — 요소를 위치 파악하고, 텍스트를 상호 참조하며, 영양학이나 Python 패키지 메타데이터 같은 도메인 지식을 적용한 후, 종합적인 답변을 생성합니다. 하지만 이를 위해서는 사용자의 의도가 명확히 제시되어야 합니다. 애매모호함 = 일반적인 요약 응답.

⚠️ 주의할 함정:

"이 다이어그램을 설명해 주세요."

→ 피상적인 설명만 제공됩니다.

✅ 더 나은 표현:

"이 플로차트는 카프카 파이프라인으로의 데이터 수집 과정을 보여줍니다. 직렬화를 처리하는 세 가지 구성 요소를 식별하고, 각 구성 요소가 사용하는 직렬화 형식을 이름으로 알려주세요."

4단계: 기다린 후 필요한 경우 보완 질문하기 — '다시 생성' 버튼 불필요

처리 시간은 이미지 복잡도에 따라 달라집니다:

  • 간단한 스크린샷(코드/텍스트): 약 3–5초
  • 밀집된 차트 또는 다중 패널 다이어그램: 약 8–12초
  • 붓글씨 손글씨 메모: 약 10–15초 (OCR 정확도가 인쇄 텍스트 대비 약 18% 낮아짐)

"DeepSeek가 생각 중입니다…"라는 타이핑 인디케이터가 표시되면, Enter 키를 다시 누르지 마세요. 시각 작업은 아직 부분 스트리밍 없이 항상 완전한 응답을 한 번에 출력합니다.

응답에서 세부 정보가 누락된 경우(예: 단위 라벨 오인식), 동일한 대화 스레드에서 즉시 보완 질문을 던지세요. 예:

"이전 응답에서 '나트륨 200mg'이라고 하셨는데, 실제 라벨에는 '200 mcg'라고 표기되어 있습니다. RDA가 150 mcg일 때, 일일 섭취 기준치 백분율을 다시 계산해 주실 수 있나요?"

V4 Pro는 대화 전환 간 시각적 맥락을 유지하므로, 이미지 재업로드가 필요 없습니다.

5단계: 결과 복사, 내보내기 또는 대화 이어가기

모든 출력은 순수 텍스트입니다 — 임베디드 이미지 주석이나 경계 상자(bounding box)는 포함되지 않습니다. 하지만 다음과 같은 작업은 가능합니다:

  • 결과를 드래그해서 복사(Ctrl/Cmd+C)
  • 문서, Jira 티켓, Notion 등에 붙여넣기
  • 각 메시지 버블 우측 상단의 "복사" 버튼 사용
  • 스크롤하여 계속 질문하기 — 컨텍스트 창은 최대 100만 토큰을 지원하므로, 긴 이미지+텍스트 대화도 일관성을 유지합니다

아직 PDF 내보내기 버튼은 없지만, 인쇄(Ctrl+P) → "PDF로 저장" 기능을 사용해 보관할 수 있습니다.

Quick Takeaways

Best forDeepSeek-V4 web users
Key strengthPrecise, domain-aware vision reasoning — not just OCR
LimitationNo batch image upload or PDF ingestion

이 기능이 적합한 사용자 — 그리고 잠시 기다려야 하는 사용자

다음과 같은 경우 이 워크플로우가 특히 효과적입니다:

✔️ 개발 도구, 대시보드, 모바일 앱의 스크린샷 분석 ✔️ 손으로 입력하지 않고도 청구서, 서식, 라벨 등 문서 감사 ✔️ 교육 및 디버깅 — 학생 작품이나 오류 로그를 업로드하고 "오프바이원(Off-by-one) 오류는 어디 있나요?"라고 질문 ✔️ 의료, 금융 등 규제 산업 종사자 — 모든 상호작용이 브라우저 내에서 이루어지며, 서버 측 저장 없이 감사 추적이 가능

다음과 같은 경우에는 아직 부적합합니다:

✖️ 실시간 카메라 피드 분석(웹 UI에 웹캠 접근 권한 없음) ✖️ 50장 이상의 이미지 일괄 처리(웹에서는 대량 업로드나 CLI 지원 없음) ✖️ 다이어그램 생성(V4 Pro는 이미지를 해석할 뿐, 생성하지 않음) ✖️ 오프라인 사용(안정적인 인터넷 연결 필요; PWA나 로컬 캐싱 없음)

지금 바로 체험하세요 — 설치나 설정 없이

DeepSeek V4 Pro의 시각 기능은 현재 실시간으로 작동 중이며, 빠르고 프로덕션 수준입니다 — 다만 MidassAI 챗을 통해서만 이용 가능합니다. 다운로드도, 설정도, 추론 서버 구동 대기 시간도 없습니다.

첫 번째 이미지 분석까지 걸리는 시간은 < 60초:

  1. https://www.midassai.com/chat/ 접속
  2. 📎 클릭 → 스크린샷 또는 사진 선택
  3. 정확히 필요한 내용을 구체적으로 질문
  4. 답변을 읽고, 필요 시 보완 질문

끝입니다. 계정도, 체험 기간도, 시각 질의 사용 제한도 없습니다 — 브라우저에서 바로 이용 가능한 순수한 다중모달 지능입니다.

FeatureDeepSeek V4 Pro (Web)Local Ollama V4
Vision support✅ Full multimodal (image + text)❌ Text-only by default
Setup time⏱️ 0 min — browser only⏱️ 15–45 min (GPU, RAM, quantization)
Context length🧮 1M tokens (with image tokens)🧮 ≤128K (if vision even enabled)
Agent workflows✅ Supported (e.g., ‘analyze image → search docs → summarize’)❌ Not implemented in Ollama

Related articles

Start Chatting on MidassAI