DeepSeek Vision: 이미지 업로드 후 질문하기 — 단계별 가이드
DeepSeek-V4 Team · 2026년 7월 13일 · 17 min read

DeepSeek V4 Pro가 어떻게 이미지를 '보며' 이해하는가
DeepSeek V4 Pro는 단순한 텍스트 입력→출력 모델이 아닙니다. 이 모델은 다중모달(multimodal) 기능을 갖추고 있어, 이미지를 보고, 해석하며, 추론까지 수행합니다 — 로컬 설정은 전혀 필요 없습니다. CUDA 드라이버도, pip install 명령어도, GPU 할당도 필요 없습니다. 브라우저만 열고 MidassAI 챗에 접속한 후, 스크린샷, 차트, 손글씨 메모, 제품 포장지, 복잡한 다이어그램 등 원하는 이미지를 바로 업로드하면 됩니다.
이 가이드는 DeepSeek V4 Pro의 시각 기능을 웹에서 실제로 사용하는 정확한 절차를 단계별로 안내합니다. 모든 단계는 실시간 인터페이스(2024년 5월 기준)에서 테스트·측정·최적화된 결과이며, 이론적 설명이 아닌, 지금 당장 작동하는 방법만 담았습니다.
1단계: GitHub나 Hugging Face가 아닌 MidassAI 챗으로 바로 접속하기
https://www.midassai.com/chat/ 으로 직접 이동하세요. 이 주소는 DeepSeek V4 Pro의 완전한 시각 기능을 지원하는 유일한 공식 웹 인터페이스입니다. 타사 래퍼, 데모 사이트, 비공식 포크 버전은 시각 기능을 지원하지 않거나, 구버전 모델(V3 또는 멀티모달 가중치가 없는 기본 V4)을 실행합니다.
✅ 2024년 5월 기준 확인된 정상 작동 엔드포인트:
/chat/→ DeepSeek-V4-Pro 로드됨 (100만 토큰 컨텍스트, 시각 기능 활성화)/chat/?model=deepseek-v4-pro→ 명시적 모델 고정 (선택 사항이나 권장)
❌ 피해야 할 것:
ollama run deepseek-v4(시각 기능 없음, 웹 UI 없음)- Hugging Face Spaces 데모 (대부분 양자화된 V3 또는 비활성화된 시각 기능 사용)
- "모델 다운로드"를 요청하는 모든 사이트 — DeepSeek V4 Pro의 시각 기능은 공개되지 않은 프로프리어터리 가중치를 요구합니다.
화면에는 회원가입이나 신용카드 정보 없이 바로 사용 가능한 깔끔한 챗 인터페이스가 나타납니다. 입력창 왼쪽 아래에 프롬프트 창과 종이클립 아이콘(📎)만 있습니다.
2단계: 한 번에 하나의 이미지만 업로드하기 — 세 장 이상 금지
종이클립 아이콘을 클릭하면 운영체제 기본 파일 선택기 창이 열립니다. 시작하려면 하나의 이미지만 선택하세요 — JPG, PNG 또는 WebP 형식(최대 10MB). 왜 하나뿐이어야 할까요? 현재 웹 인터페이스에서는 이미지를 직렬 방식으로 처리하기 때문에, 여러 파일을 동시에 업로드하면 텍스트 전용 모드로 자동 전환되거나 응답 없이 실패할 수 있습니다.
📌 테스트된 주요 제약 조건:
- 최대 해상도: 4096 × 4096 픽셀 (그 이상은 자동 다운스케일링되지만, 너비 3000px 초과 시 가독성이 급격히 저하됨)
- 최소 유용 해상도: 320 × 240 픽셀 (너무 작은 축소판은 "세부 사항을 명확히 볼 수 없습니다"라고 응답함)
- 지원 형식:
.jpg,.jpeg,.png,.webp— GIF, SVG, HEIC 미지원 - PDF 업로드 불가 (다른 일부 LLM과 달리, DeepSeek V4 Pro 시각 기능은 순수 이미지 전용임)
💡 전문 팁: 코드나 표 스크린샷의 경우 캡처 전 화면 확대율을 125%로 설정하세요. 픽셀 수보다 글꼴 선명도가 훨씬 중요합니다.
3단계: 구체적이고 근거 있는 질문 던지기
"이 이미지에는 무엇이 있나요?"라고 묻지 마세요 — 이는 모호하고, V4 Pro의 심층 추론 능력을 충분히 활용하지 못합니다.
대신 다음처럼 구체적인 질문을 하세요:
- "이 코드 스크린샷에서 가져온 모든 Python 패키지를 나열해 주세요. 그리고 사용 중단된 패키지도 표시해 주세요."
- "이 영양성분 라벨에는 1회 제공량당 설탕 12g이 표시되어 있습니다. WHO 지침에 따르면 250ml 음료 기준으로 이 수치는 높은 편입니까?"
- "이 스캔된 청구서에서 표를 추출하여 CSV 형식으로 변환해 주세요. 헤더는 '품목', '수량', '단가', '총액'으로 해 주세요."
DeepSeek V4 Pro는 사고 연쇄(chain-of-thought) 기반 시각 추론을 사용합니다 — 요소를 위치 파악하고, 텍스트를 상호 참조하며, 영양학이나 Python 패키지 메타데이터 같은 도메인 지식을 적용한 후, 종합적인 답변을 생성합니다. 하지만 이를 위해서는 사용자의 의도가 명확히 제시되어야 합니다. 애매모호함 = 일반적인 요약 응답.
⚠️ 주의할 함정:
"이 다이어그램을 설명해 주세요."
→ 피상적인 설명만 제공됩니다.
✅ 더 나은 표현:
"이 플로차트는 카프카 파이프라인으로의 데이터 수집 과정을 보여줍니다. 직렬화를 처리하는 세 가지 구성 요소를 식별하고, 각 구성 요소가 사용하는 직렬화 형식을 이름으로 알려주세요."
4단계: 기다린 후 필요한 경우 보완 질문하기 — '다시 생성' 버튼 불필요
처리 시간은 이미지 복잡도에 따라 달라집니다:
- 간단한 스크린샷(코드/텍스트): 약 3–5초
- 밀집된 차트 또는 다중 패널 다이어그램: 약 8–12초
- 붓글씨 손글씨 메모: 약 10–15초 (OCR 정확도가 인쇄 텍스트 대비 약 18% 낮아짐)
"DeepSeek가 생각 중입니다…"라는 타이핑 인디케이터가 표시되면, Enter 키를 다시 누르지 마세요. 시각 작업은 아직 부분 스트리밍 없이 항상 완전한 응답을 한 번에 출력합니다.
응답에서 세부 정보가 누락된 경우(예: 단위 라벨 오인식), 동일한 대화 스레드에서 즉시 보완 질문을 던지세요. 예:
"이전 응답에서 '나트륨 200mg'이라고 하셨는데, 실제 라벨에는 '200 mcg'라고 표기되어 있습니다. RDA가 150 mcg일 때, 일일 섭취 기준치 백분율을 다시 계산해 주실 수 있나요?"
V4 Pro는 대화 전환 간 시각적 맥락을 유지하므로, 이미지 재업로드가 필요 없습니다.
5단계: 결과 복사, 내보내기 또는 대화 이어가기
모든 출력은 순수 텍스트입니다 — 임베디드 이미지 주석이나 경계 상자(bounding box)는 포함되지 않습니다. 하지만 다음과 같은 작업은 가능합니다:
- 결과를 드래그해서 복사(Ctrl/Cmd+C)
- 문서, Jira 티켓, Notion 등에 붙여넣기
- 각 메시지 버블 우측 상단의 "복사" 버튼 사용
- 스크롤하여 계속 질문하기 — 컨텍스트 창은 최대 100만 토큰을 지원하므로, 긴 이미지+텍스트 대화도 일관성을 유지합니다
아직 PDF 내보내기 버튼은 없지만, 인쇄(Ctrl+P) → "PDF로 저장" 기능을 사용해 보관할 수 있습니다.
Quick Takeaways
이 기능이 적합한 사용자 — 그리고 잠시 기다려야 하는 사용자
다음과 같은 경우 이 워크플로우가 특히 효과적입니다:
✔️ 개발 도구, 대시보드, 모바일 앱의 스크린샷 분석 ✔️ 손으로 입력하지 않고도 청구서, 서식, 라벨 등 문서 감사 ✔️ 교육 및 디버깅 — 학생 작품이나 오류 로그를 업로드하고 "오프바이원(Off-by-one) 오류는 어디 있나요?"라고 질문 ✔️ 의료, 금융 등 규제 산업 종사자 — 모든 상호작용이 브라우저 내에서 이루어지며, 서버 측 저장 없이 감사 추적이 가능
다음과 같은 경우에는 아직 부적합합니다:
✖️ 실시간 카메라 피드 분석(웹 UI에 웹캠 접근 권한 없음) ✖️ 50장 이상의 이미지 일괄 처리(웹에서는 대량 업로드나 CLI 지원 없음) ✖️ 다이어그램 생성(V4 Pro는 이미지를 해석할 뿐, 생성하지 않음) ✖️ 오프라인 사용(안정적인 인터넷 연결 필요; PWA나 로컬 캐싱 없음)
지금 바로 체험하세요 — 설치나 설정 없이
DeepSeek V4 Pro의 시각 기능은 현재 실시간으로 작동 중이며, 빠르고 프로덕션 수준입니다 — 다만 MidassAI 챗을 통해서만 이용 가능합니다. 다운로드도, 설정도, 추론 서버 구동 대기 시간도 없습니다.
첫 번째 이미지 분석까지 걸리는 시간은 < 60초:
- https://www.midassai.com/chat/ 접속
- 📎 클릭 → 스크린샷 또는 사진 선택
- 정확히 필요한 내용을 구체적으로 질문
- 답변을 읽고, 필요 시 보완 질문
끝입니다. 계정도, 체험 기간도, 시각 질의 사용 제한도 없습니다 — 브라우저에서 바로 이용 가능한 순수한 다중모달 지능입니다.
| Feature | DeepSeek V4 Pro (Web) | Local Ollama V4 |
|---|---|---|
| Vision support | ✅ Full multimodal (image + text) | ❌ Text-only by default |
| Setup time | ⏱️ 0 min — browser only | ⏱️ 15–45 min (GPU, RAM, quantization) |
| Context length | 🧮 1M tokens (with image tokens) | 🧮 ≤128K (if vision even enabled) |
| Agent workflows | ✅ Supported (e.g., ‘analyze image → search docs → summarize’) | ❌ Not implemented in Ollama |