# DeepSeek-V4-Flash-Vision-Exp 上線多模態 API，支援影像理解與 Files API

> 📖 本站完整內容索引（documentation index）：[llms.txt](/llms.txt)

> 原作者：ModelScope (@ModelScope2022) · 策展與摘要：EasyVibeCoding · 平台：X (Twitter) · 熱度：🔥 · 日期：2026-09-01

> 原始來源：https://x.com/modelscope2022/status/2094421481983734088

## 證據與延伸閱讀

- [DeepSeek-V4-Flash-Vision-Exp 上線多模態 API，支援影像理解與 Files API。](https://api-docs.deepseek.com/news/news260821) — 官方文件 · 最後核對：2026-09-01 · 支持主張：The docs specify JPEG/PNG/GIF/WebP handling, base64, external URL, and file_id inputs, image-token billing and limits; the release note adds mixed Chat Completions, Messages, and Responses support plus open weights and code.
- [DeepSeek-V4-Flash-Vision-Exp — api-docs.deepseek.com](https://api-docs.deepseek.com/guides/vision) — 一手來源 · 最後核對：2026-09-01 · 支持主張：The docs specify JPEG/PNG/GIF/WebP handling, base64, external URL, and file_id inputs, image-token billing and limits; the release note adds mixed Chat Completions, Messages, and Responses support plus open weights and code.

## 中文摘要

DeepSeek-V4-Flash-Vision-Exp 上線多模態 API，支援影像理解與 Files API。

**發布與定位** DeepSeek API Docs 標示 DeepSeek-V4-Flash-Vision-Exp 於 2026 年 8 月 21 日上線；ModelScope 於 8 月 31 日表示，這是 DeepSeek V4 家族首個實驗性多模態模型，採 MIT License。它建立在 DeepSeek-V4-Flash 上，加入新的視覺模組，並開放權重、prompt encoding 與最小化推論程式碼。官方稱其文字能力，包括 Agent、推理與世界知識，對齊 DeepSeek-V4-Flash。

**視覺與 Agent 能力** 模型可在文字之外接收圖片，用於描述影像、讀取螢幕截圖文字、分析圖表，並在結合工具的 Agent 工作流程中使用視覺資訊。DeepSeek 表示，多模態 Agent 評測相較 V4-Flash 有大幅躍升，表現接近 Opus 4.8；ModelScope 則稱它在 Agents’ Last Exam 與 ZeroBench 擊敗 Opus 4.8，在 Chartography 落後 0.7 分。這些比較屬於來源方宣稱，實際結果仍取決於推論設定、工具與評測環境。 

![](https://pub-75d4fe1e4e80421b9ecb1245a7ae0d1a.r2.dev/curated/2333959dbd617be3.jpg)
> DeepSeek-V4-Flash-Vision-Exp 在 Agents' Last Exam（27.3 分）與 ZeroBench (Pass@5)（35.0 分）擊敗 Opus-4.8，在 Chartography（64.3 分）僅落後其 0.7 分，並於 DeepSWE 取得 59.3 分超越 Opus-4.8 的 58.0 分。

**API 與輸入方式** 模型識別字串為 `deepseek-v4-flash-vision-exp`，支援 Chat Completions、Messages 與 Responses API，也能透過 Anthropic API 相容的 `/messages` 端點使用。影像必須放在 `user` 訊息中，支援 JPEG、PNG、GIF、WebP；格式依實際檔案內容判定，不依賴檔名或宣告的 MIME type。使用者可依影像大小與是否重複使用，選擇三種方式：

- 以 base64 data URL 直接嵌入請求，適合本機檔案，但會計入 48 MiB 請求本文上限。
- 提供公開可存取的外部 URL；網址最多 8192 個字元，影像檔案最多 32 MiB，下載必須在 60 秒內完成。
- 先透過 Files API 上傳，再以 `file_id` 參照；適合同一張影像送出多次，也能處理超過 48 MiB 請求本文或 32 MiB 單張影像限制的情況。

**Files API 與影像處理** Files API 已可免費使用；影像上傳一次後，可在後續請求重複引用 `file_id`，減少頻寬與重複上傳。透過 `file_id` 參照的單張影像上限為 64 MiB，且不受 32 MiB 單張檢查限制。`image_url` 可設定 `detail` 為 `low`、`high`、`original` 或 `auto`；`low` 會先縮放至 512×512，以較快、較低成本的方式處理，`high` 等同 `original`，而 `auto` 目前也等同 `original`。

**成本與使用上限** 影像會依尺寸轉換成 token，並與文字 token 一起計費，價格沿用 V4-Flash；每張影像最多計 384 tokens。推論前，低於約 384×384 總像素的影像會放大，較大的影像則縮小，使處理後總像素約等同 800×800，因此 2000×2000 與 5000×5000 影像縮放後可能消耗相同 token。每張影像獨立計算，多張影像不採額外的整體公式。

- 每個請求最多 600 張影像。
- 不含 `file_id` 影像時，請求內影像總大小最多 64 MiB；包含 `file_id` 影像時最多 200 MiB。
- 單邊解析度最多 8192 px；請求含 15 張以上影像時，單邊上限降為 4096 px。
- 只有 `deepseek-v4-flash-vision-exp` 這類 vision model 接受影像；其他模型會回傳 400 錯誤。

**導入注意事項** 官方同步推出 DeepSeek Harness 0.1.1，提供新模型的開箱即用支援。實際部署前，團隊應先依影像是否重用、檔案大小與請求限制選擇傳輸方式，並將影像 token 成本與文字用量一併估算；由於這仍是實驗性模型，其可用性、限制與定價都可能變動，來源中的 benchmark 與 Agent 工作流程成績也必須在具代表性的任務上自行驗證。

## 標籤

新產品, DeepSeek-V4-Flash-Vision-Exp, DeepSeek, ModelScope, Opus 4.8, DeepSeek API Platform
