DeepSeek V4 Flash Vision 이미지 인식, 성능·제약 정리

대표 이미지: AI 생성 키 비주얼
DeepSeek V4 Flash Vision 이미지 인식은 공식 API와 공개 모델 카드에서 확인할 수 있습니다. 2026년 9월 8일 기준 모델 이름은 deepseek-v4-flash-vision-exp이며, 이미지와 텍스트를 함께 입력하는 실험 모델입니다. 이 글은 DeepSeek의 모델 카드와 Vision 문서를 기준으로 지원 범위, 공개 성능표, 호출 제약을 살펴봅니다.
- 실험 모델의 공개 범위와 기존 모델의 관계
- 세 가지 이미지 전달 경로와 파일 형식
- 벤치마크 수치를 비교할 때 필요한 조건
- 시각 인식과 에이전트 실행 사이의 책임 경계
- 호출 전에 확인할 크기·해상도·메시지 제한
아래 성능 수치는 개발사가 공개한 모델 카드의 결과입니다. 이번 글에서 추론을 직접 실행하거나 독립 재현한 값은 아닙니다. 공개 자료를 확인한 날짜를 출시일로 해석하지 않으며, 실험 모델의 지원 내용은 바뀔 수 있습니다.
원문: DeepSeek-V4-Flash-Vision-Exp 공식 모델 카드
1. DeepSeek V4 Flash Vision은 어떤 모델인가요?

기존 Flash에 시각 모듈을 더한 실험 모델
모델 카드는 DeepSeek-V4-Flash 구조에 시각 모듈을 통합하고 추가 학습했다고 설명합니다. 이미지 이해 기능을 더한 V4 계열의 첫 실험적 멀티모달 모델로 소개되며, 저장소 라이선스는 MIT로 표기되어 있습니다.
공개 저장소와 호스팅 API는 별개
저장소에는 인코딩과 최소 추론 구현이, 공식 API 문서에는 호출용 모델 이름이 공개되어 있습니다.
2. 이미지 입력은 어떤 방식으로 전달하나요?

직접 첨부·공개 URL·파일 참조
공식 Vision 문서의 Chat Completions 예시는 content를 문자열 하나가 아닌 블록 배열로 구성합니다. 설명할 질문은 text 블록에, 이미지는 해당 전달 방식의 블록에 넣습니다. 여러 이미지와 설명을 보낼 때는 질문이 어느 이미지를 가리키는지도 함께 명시하는 편이 좋습니다.
| 전달 방식 | 사용 필드 | 적합한 경우 |
|---|---|---|
| Base64 직접 첨부 | image_url의 data: URL | 로컬 파일을 한 번 전송 |
| 공개 이미지 URL | image_url의 http(s) URL | 서비스가 접근 가능한 이미지 |
| Files API 참조 | file 블록의 file_id | 동일 이미지를 여러 요청에서 재사용 |
지원 형식과 인코딩 참조의 역할
지원 형식은 JPEG, PNG, GIF, WebP입니다. 확장자나 선언한 MIME 타입만 보지 않고 실제 파일 내용으로 형식을 판별합니다. 파일 이름만 바꿔서 지원 형식으로 만드는 방식은 통하지 않습니다.
로컬 인코딩 참조는 이미지 순서 보존을 설명합니다. 호스팅 API에 보낼 때는 이 로컬 예시 대신 해당 API의 블록 규격을 따릅니다.
3. 공개 성능표의 숫자는 어떻게 읽어야 하나요?

전 항목 상승이나 종합 1위로 요약하기 어렵습니다
아래는 공식 모델 카드에서 선택한 항목입니다. 과제 이름과 지표를 그대로 유지했으며, 서로 다른 벤치마크 점수를 평균 내지 않았습니다.
| 벤치마크 | Vision-Exp | Flash-0731 | 카드의 Opus-4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 83.9 | 82.7 | 85.0 |
| Cybergym | 75.3 | 76.7 | 78.3 |
| DeepSWE | 59.3 | 54.4 | 58.0 |
| Chartography | 64.3 | — | 65.0 |
| ZeroBench (Pass@5) | 35.0 | — | 34.0 |
Cybergym은 기존 Flash보다 낮고 DeepSWE는 높습니다. 대시는 0점이 아니라 비교값 부재를 뜻하므로, 한 행으로 종합 우열을 정할 수 없습니다.
시도 횟수와 실제 업무 조건을 맞춰야 합니다
모델 카드에는 ApexBench의 Pass@1과 ZeroBench의 Pass@5처럼 서로 다른 평가 설정이 함께 등장합니다. 시도 기회가 다른 결과를 같은 한 번의 성공률로 읽으면 안 됩니다. 운영상 권장하는 평가법은 이미지·질문·도구·시도 횟수를 고정하고 정답과 총비용을 따로 기록하는 것입니다.
검색용 벡터가 목적이라면 WeMM-Embedding 로컬 실행 방법: 2B·4B·9B 선택 가이드에서 다룬 임베딩 접근을 구분해 보세요.
4. 이미지 인식은 에이전트 자동화에서 무엇을 바꾸나요?

화면을 읽는 입력 경로가 추가됩니다
Vision 문서는 사진 설명, 스크린샷의 글 읽기, 차트 분석 등을 활용 예로 듭니다. 오류 화면의 문구와 위치를 함께 물을 수 있지만 답은 원본과 대조해야 합니다.
인식 결과가 실행 권한이 되지는 않습니다
이미지를 이해하는 모델을 연결했다고 브라우저 조작 도구나 승인 정책까지 자동으로 생기는 것은 아닙니다. 결제·삭제의 승인자는 별도로 정해야 합니다. 도해의 사람 승인은 권장 설계이며 DeepSeek API 내장 기능이 아닙니다.
웹사이트가 구조화된 도구를 제공하는 접근은 WebMCP란? ChatGPT·Codex가 웹사이트를 쓰는 원리에서 다뤘습니다. 인식 모델과 웹 도구 인터페이스는 다른 구성 요소입니다.
5. 호출 전에 확인할 제한과 오류 조건은 무엇인가요?

파일 크기·전체 요청·해상도는 다른 제한입니다
이미지 개수뿐 아니라 MiB 용량과 픽셀 제한도 함께 만족해야 합니다.
| 항목 | 공식 제한 |
|---|---|
| 요청 본문 | 48 MiB |
| Base64·외부 URL 이미지 한 장 | 32 MiB |
| Files API file_id 이미지 한 장 | 64 MiB |
| 요청당 이미지 개수 | 최대 600장 |
| 전체 이미지 크기 | file_id 이미지 제외 시 64 MiB, 포함 시 최대 200 MiB |
| 한 변의 길이 | 최대 8192px, 이미지 15장 이상이면 4096px |
외부 URL은 최대 8192자이며, 다운로드는 60초 안에 끝나야 합니다. Base64는 인코딩된 데이터가 요청 본문 용량에 포함됩니다. Files API를 쓰면 별도 저장·업로드 할당량도 확인합니다.
detail과 메시지 역할에서 생기는 오해
detail: low는 512×512로 축소하는 설정이고, high는 호환성용으로 original과 같습니다. 현재 auto도 original과 같다고 문서는 설명합니다. 다만 같은 문서의 토큰 처리 절에는 추론 전 자동 리사이즈가 명시되어 있으므로, original을 원본의 모든 픽셀이 그대로 처리된다는 보장으로 읽지 않는 것이 안전합니다.
이미지별 토큰 상한은 공식 문서상 384개이며 이미지마다 독립적으로 계산됩니다. 텍스트·출력 토큰은 별도이며, 작은 글자 판독은 샘플로 확인해야 합니다.
Chat Completions에서는 이미지가 user 메시지에만 허용되고, system·assistant에 넣으면 400 오류가 발생합니다. 비전 모델이 아닌 이름으로 이미지를 보내도 400 오류입니다. Responses API는 input_image 형식을 사용하고 허용 위치에 차이가 있으므로 Chat Completions의 제한을 그대로 일반화하지 않습니다.
6. Q&A와 정리

Q1. 이미지 생성 모델로 사용해도 되나요?
이 글에서 확인한 문서는 이미지 입력과 이해 기능을 다룹니다. 그림을 새로 생성하는 기능까지 제공한다고 해석할 근거는 이 자료에 없습니다.
Q2. 공개 모델의 MIT 라이선스가 API 무료 이용도 뜻하나요?
저장소 라이선스와 호스팅 API 이용 요금은 다른 문제입니다. API 비용을 결정할 때는 별도의 최신 가격표와 이용 조건을 확인해야 합니다.
Q3. 파일을 재사용하면 보관 정책도 해결되나요?
file_id는 이미 업로드한 파일을 다시 참조하는 수단입니다. 보관 기간과 삭제 시점은 별도 정책으로 정하고, 서비스의 파일 관리 규칙과 대조해야 합니다.
Q4. 민감한 화면을 공개 URL로 만들어 보내도 되나요?
전송 편의를 위해 사내 화면을 공개 인터넷에 노출하는 방식은 피하는 편이 좋습니다. 전송 전 마스킹과 승인 범위를 정하고, 직접 첨부를 쓰더라도 외부 서비스로 데이터가 전달된다는 점은 확인해야 합니다.
Q5. 이 글의 성능표를 우리 서비스 평가 보고서에 써도 되나요?
개발사 공개 수치라는 출처와 조건을 명시한 참고 자료로는 활용할 수 있습니다. 자사 서비스의 실제 측정 결과와 같은 열에 구분 없이 섞지는 않는 편이 좋습니다.
실패한 샘플을 포함한 평가 세트를 보존해 모델 변경 뒤 재검사에 활용하세요.
7. 참고 자료

모델 공개 범위와 API 지원
- DeepSeek 공식 모델 카드 — 구조, 개발사 성능표, 저장소 구성, 라이선스
- DeepSeek API: Your First API Call — 지원 모델 식별자와 기본 호출 경로
이미지 제한과 프롬프트 인코딩
- DeepSeek API: Vision — 입력 경로, detail, 토큰, 제한과 오류
- DeepSeek-V4 text and vision encoding — 이미지 레코드 순서와 TXT·JSON 인코딩 예시
'LLM' 카테고리의 다른 글
| MiniCPM5-2B 공개, 로컬 에이전트 성능과 제약 정리 (0) | 2026.09.09 |
|---|---|
| Muse Spark 1.3 성능·가격, 코딩 1위로 봐도 될까? (0) | 2026.09.03 |
| Claude Fable 5.1 마이그레이션: 도구 호출·thinking 변경점 (0) | 2026.09.02 |
| PhoneLLM Alpha 1 공개, 94% 저렴한 음성 모델인가? (0) | 2026.08.30 |
| Claude Team 과학자 무료 플랜, 신청 조건·가격 총정리 (0) | 2026.08.29 |