• 首页
  • AI工具集
  • AI资讯
  • AI活动
  • AI社区
  • AI短剧
  • AI创作大赛
  • AI小说
  • AI绘画
    AI视频
    AI对口型
  • AI画布AI画布AI画布
AI 对话

DeepSeek-V4-Flash-Vision-Exp上线:多模态 Agent 能力逼近 Opus-4.8,Files API同步推出

DeepSeek-V4-Flash-Vision-Exp上线:多模态 Agent 能力逼近 Opus-4.8,Files API同步推出
AI TOP100
1天前

AITOP100平台获悉,8月21日,DeepSeek 在 API 平台正式上线了实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 。这是 V4 系列首个直接支持图像输入的视觉模型。

同步发布的还有 DeepSeek Harness 0.1.1 (实际版本号为 v0.1.1-rc.1),已内置对新模型的原生支持。另外,Files API 也于同日正式开放。

模型地址:DeepSeek官网

DeepSeek-V4-Flash-Vision-Exp

一、模型定位:文本能力持平 V4-Flash,视觉补强

DeepSeek-V4-Flash-Vision-Exp 是一个实验性多模态模型,在纯文本能力上与 DeepSeek-V4-Flash 相当——涵盖 Agent、推理和世界知识等维度。其核心突破在于视觉理解能力的补全:在需要处理视觉信息的 Agent Benchmark 上,新模型相比 V4-Flash 实现了显著跃升,多模态 Agent 能力已接近 Opus-4.8。

模型支持 1M 上下文长度 ,最大输出 384K tokens ,同时兼容 JSON Output、Tool Calls、Responses API 及 Anthropic API 格式。并发限制为 2500。

二、基准测试:多模态 Agent 四项评测 2:2 战平 Opus-4.8

官方公布的基准测试数据显示,在多模态 Agent 评测中,V4-Flash-Vision-Exp 与 Opus-4.8 打成 2 胜 2 负:

评测基准 V4-Flash-Vision-Exp V4-Flash-0731 Opus-4.8
ApexBench (Pass@1) 36.5 26.2 39.4
Agents' Last Exam 27.3 25.2 25.7
Chartography 64.3 — 65.0
ZeroBench (Pass@5) 35.0 — 34.0

在纯文本 Agent 任务方面,新模型同样表现稳健:

  • Terminal Bench 2.1 :83.9(V4-Flash 为 82.7)
  • DeepSWE :59.3(V4-Flash 为 54.4)
  • DSBench-Hard :63.6(V4-Flash 为 59.6)
注 :在 ApexBench 和 Agents' Last Exam 评测中,纯文本模型 DeepSeek-V4-Flash 会忽略其中的多模态元素。

DeepSeek-V4-Flash-Vision-Exp

三、多模态 API:三种图像输入方式

DeepSeek-V4-Flash-Vision-Exp 通过标准 OpenAI 兼容的 Chat Completions 格式接受图像输入,支持 JPEG、PNG、GIF 和 WebP 格式,格式由文件实际内容判断,而非文件扩展名或声明的 MIME 类型。提供三种图像输入方式:

1. Base64 编码(内联)

将图像编码为 data: URL 直接嵌入请求,适合本地文件,编码数据计入 48 MiB 请求体限制

2. 外部 URL

传递公开可访问的 HTTP/HTTPS 链接,模型自动下载图像。URL 最长 8192 字符,图像文件最大 32 MiB,下载需在 60 秒内完成

3. Files API(推荐)

通过 Files API 上传图像后使用 file_id 引用,是复用图像或超出内联限制时的最佳方案。通过 Files API 引用的图像最大可达 64 MiB ,且不受 32 MiB 单图限制。

四、Files API:免费文件存储与复用

Files API 于同日正式上线,完全免费使用 。核心功能包括:

  • 一次上传,多次引用 :上传图像后通过 file_id 在多个请求中复用,无需重复上传,节省请求带宽。
  • 上传方式 :通过 multipart/form-data 请求向 POST /files 上传,单个文件最大 64 MiB,上传需在 10 分钟内完成。
  • 文件管理 :支持列出文件、查询文件信息、删除文件等操作。
  • 有效期设置 :可选设置文件有效期(3600 秒至 2592000 秒,即 1 小时到 30 天),不设置则永久有效。
  • 支持格式 :JPEG、PNG、GIF、WebP。

在对话请求中,通过 file 内容块引用返回的 file_id (格式为 file-api-... )即可使用已上传的图像。

五、定价:与 V4-Flash 完全一致

DeepSeek-V4-Flash-Vision-Exp 的 API 定价与纯文本版 DeepSeek-V4-Flash 保持一致。图像按尺寸换算为 Token 后与文本 Token 一并计费,单张图像最多折算 384 个 Token

计费项 空闲时段 高峰时段
输入(缓存命中) 0.05 元 / 百万 tokens 0.10 元 / 百万 tokens
输入(缓存未命中) 1.5 元 / 百万 tokens 3.0 元 / 百万 tokens
输出 4.5 元 / 百万 tokens 9.0 元 / 百万 tokens

美元计价同样与 V4-Flash 一致:输入 $0.22/百万 tokens(空闲 $0.22,高峰 $0.44),输出 $0.66/百万 tokens(空闲 $0.66,高峰 $1.32)。高峰时段为北京时间周一至周五 9:00-12:00、14:00-18:00。

六、DeepSeek Harness 0.1.1 同步更新

DeepSeek Harness 于同日发布 v0.1.1-rc.1。核心更新包括:

  • DeepSeek 适配器新增对 DeepSeek-V4-Flash-Vision-Exp 多模态视觉理解模型的支持
  • 修复输入框 @ 引用编辑时的布局问题、Bubblewrap 沙箱绕过漏洞等
  • 优化 Markdown 表格自适应、缓存命中率精度显示及子代理会话导航等体验
💡 总结 :DeepSeek-V4-Flash-Vision-Exp 以与 V4-Flash 相同的价格补全了视觉理解能力,在多模态 Agent 场景中显著缩小了与 Opus-4.8 的差距。配合免费的 Files API,开发者可以在代理框架中更高效地构建结合视觉理解与工具调用的实用工作流。

更多技术细节请参阅官方文档:Vision 指南 | Files API 指南


AITOP100-AI资讯频道将持续关注AI行业新闻资讯消息,带来最新AI内容讯息。

想了解AITOP100平台其它版块的内容,请点击下方超链接查看

AI创作大赛 | AI活动 | AI工具集 | AI资讯专区 | AI小说

AITOP100平台官方交流社群二维码:

AITOP100平台官方交流社群二维码AITOP100平台官方交流社群二维码

0
0
文章来源:AI TOP100
免责声明:本文不代表本平台立场,且不构成投资建议,请谨慎对待。
全部评论
暂无评论
相关AI工具
  • DeepSeek‌
相关资讯
  • Google发布Gemini3.5 Transcribe:其为迄今为止“最精准”的语音转文本模型

  • DeepSeek-V4-Flash-Vision-Exp上线:多模态 Agent 能力逼近 Opus-4.8,Files API同步推出

  • OpenAI全面开源Codex Harness:AI编程智能体的"发动机",向开发者开放

  • 突破传统RAG天花板,Mistral Agentic Search把复杂文档问答准确率拉到86%

  • Grok Build全量上线网页与移动端:一句话生成可交互应用,还能直接在X平台试玩

热点资讯

每日AI资讯-2026年8月25日

1天前
每日AI资讯-2026年8月25日

每日AI资讯-2026年8月24日

2天前
每日AI资讯-2026年8月24日

每日AI资讯-2026年8月20日

6天前
每日AI资讯-2026年8月20日

每日AI资讯-2026年8月19日

7天前
每日AI资讯-2026年8月19日

每日AI资讯-2026年8月26日

23小时前
每日AI资讯-2026年8月26日
分享
0
0

欢迎来到AI Top100!我们聚合全球500+款AI智能软件,提供最新资讯、热门课程和活动。我们致力于打造最专业的信息平台,让您轻松了解全球AI领域动态,并为您提供优质服务。

合作伙伴
联系我们
加入AITOP100社群
加入社群
AITOP100商务微信
商务微信
相关链接
服务及隐私政策
网站地图
关于我们
粤ICP备2022124843号-2粤公网安备44030002004505广播电视节目制作经营许可证:(粤)字第00712号Copyright © 华强方特(深圳)动漫有限公司 版权所有