AITOP100平台获悉,8月21日,DeepSeek 在 API 平台正式上线了实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 。这是 V4 系列首个直接支持图像输入的视觉模型。
同步发布的还有 DeepSeek Harness 0.1.1 (实际版本号为 v0.1.1-rc.1),已内置对新模型的原生支持。另外,Files API 也于同日正式开放。
模型地址:DeepSeek官网

一、模型定位:文本能力持平 V4-Flash,视觉补强
DeepSeek-V4-Flash-Vision-Exp 是一个实验性多模态模型,在纯文本能力上与 DeepSeek-V4-Flash 相当——涵盖 Agent、推理和世界知识等维度。其核心突破在于视觉理解能力的补全:在需要处理视觉信息的 Agent Benchmark 上,新模型相比 V4-Flash 实现了显著跃升,多模态 Agent 能力已接近 Opus-4.8。
模型支持 1M 上下文长度 ,最大输出 384K tokens ,同时兼容 JSON Output、Tool Calls、Responses API 及 Anthropic API 格式。并发限制为 2500。
二、基准测试:多模态 Agent 四项评测 2:2 战平 Opus-4.8
官方公布的基准测试数据显示,在多模态 Agent 评测中,V4-Flash-Vision-Exp 与 Opus-4.8 打成 2 胜 2 负:
| 评测基准 | V4-Flash-Vision-Exp | V4-Flash-0731 | Opus-4.8 |
|---|---|---|---|
| ApexBench (Pass@1) | 36.5 | 26.2 | 39.4 |
| Agents' Last Exam | 27.3 | 25.2 | 25.7 |
| Chartography | 64.3 | — | 65.0 |
| ZeroBench (Pass@5) | 35.0 | — | 34.0 |
在纯文本 Agent 任务方面,新模型同样表现稳健:
- Terminal Bench 2.1 :83.9(V4-Flash 为 82.7)
- DeepSWE :59.3(V4-Flash 为 54.4)
- DSBench-Hard :63.6(V4-Flash 为 59.6)
注 :在 ApexBench 和 Agents' Last Exam 评测中,纯文本模型 DeepSeek-V4-Flash 会忽略其中的多模态元素。

三、多模态 API:三种图像输入方式
DeepSeek-V4-Flash-Vision-Exp 通过标准 OpenAI 兼容的 Chat Completions 格式接受图像输入,支持 JPEG、PNG、GIF 和 WebP 格式,格式由文件实际内容判断,而非文件扩展名或声明的 MIME 类型。提供三种图像输入方式:
1. Base64 编码(内联)
将图像编码为 data: URL 直接嵌入请求,适合本地文件,编码数据计入 48 MiB 请求体限制
2. 外部 URL
传递公开可访问的 HTTP/HTTPS 链接,模型自动下载图像。URL 最长 8192 字符,图像文件最大 32 MiB,下载需在 60 秒内完成
3. Files API(推荐)
通过 Files API 上传图像后使用 file_id 引用,是复用图像或超出内联限制时的最佳方案。通过 Files API 引用的图像最大可达 64 MiB ,且不受 32 MiB 单图限制。
四、Files API:免费文件存储与复用
Files API 于同日正式上线,完全免费使用 。核心功能包括:
- 一次上传,多次引用 :上传图像后通过
file_id在多个请求中复用,无需重复上传,节省请求带宽。 - 上传方式 :通过
multipart/form-data请求向POST /files上传,单个文件最大 64 MiB,上传需在 10 分钟内完成。 - 文件管理 :支持列出文件、查询文件信息、删除文件等操作。
- 有效期设置 :可选设置文件有效期(3600 秒至 2592000 秒,即 1 小时到 30 天),不设置则永久有效。
- 支持格式 :JPEG、PNG、GIF、WebP。
在对话请求中,通过 file 内容块引用返回的 file_id (格式为 file-api-... )即可使用已上传的图像。
五、定价:与 V4-Flash 完全一致
DeepSeek-V4-Flash-Vision-Exp 的 API 定价与纯文本版 DeepSeek-V4-Flash 保持一致。图像按尺寸换算为 Token 后与文本 Token 一并计费,单张图像最多折算 384 个 Token
| 计费项 | 空闲时段 | 高峰时段 |
|---|---|---|
| 输入(缓存命中) | 0.05 元 / 百万 tokens | 0.10 元 / 百万 tokens |
| 输入(缓存未命中) | 1.5 元 / 百万 tokens | 3.0 元 / 百万 tokens |
| 输出 | 4.5 元 / 百万 tokens | 9.0 元 / 百万 tokens |
美元计价同样与 V4-Flash 一致:输入 $0.22/百万 tokens(空闲 $0.22,高峰 $0.44),输出 $0.66/百万 tokens(空闲 $0.66,高峰 $1.32)。高峰时段为北京时间周一至周五 9:00-12:00、14:00-18:00。
六、DeepSeek Harness 0.1.1 同步更新
DeepSeek Harness 于同日发布 v0.1.1-rc.1。核心更新包括:
- DeepSeek 适配器新增对 DeepSeek-V4-Flash-Vision-Exp 多模态视觉理解模型的支持
- 修复输入框 @ 引用编辑时的布局问题、Bubblewrap 沙箱绕过漏洞等
- 优化 Markdown 表格自适应、缓存命中率精度显示及子代理会话导航等体验
💡 总结 :DeepSeek-V4-Flash-Vision-Exp 以与 V4-Flash 相同的价格补全了视觉理解能力,在多模态 Agent 场景中显著缩小了与 Opus-4.8 的差距。配合免费的 Files API,开发者可以在代理框架中更高效地构建结合视觉理解与工具调用的实用工作流。
更多技术细节请参阅官方文档:Vision 指南 | Files API 指南
AITOP100-AI资讯频道将持续关注AI行业新闻资讯消息,带来最新AI内容讯息。
想了解AITOP100平台其它版块的内容,请点击下方超链接查看
AI创作大赛 | AI活动 | AI工具集 | AI资讯专区 | AI小说
AITOP100平台官方交流社群二维码:










