• 首页
  • AI工具集
  • AI资讯
  • AI活动
  • AI社区
  • AI短剧
  • AI创作大赛
  • AI小说
  • AI绘画
    AI视频
    AI对口型
  • AI画布AI画布AI画布
AI 对话

千问上线Qwen3.8-Omni-Flash:1M上下文+全模态 Agent,音视频API价格暴降超90%

千问上线Qwen3.8-Omni-Flash:1M上下文+全模态 Agent,音视频API价格暴降超90%
AI TOP100
2小时前

9 月 18 日,阿里千问正式上线新一代原生全模态模型 Qwen3.8-Omni-Flash。该模型支持文本、图像、音频与视频四种输入模态,上下文窗口扩展至 1M Token,并原生支持最长 1 小时连续音视频输入。目前已在千问 AI 平台和阿里云百炼开放体验。

值得注意的是,该模型权重尚未公开,当前仅通过 API 提供服务。

千问上线Qwen3.8-Omni-Flash

一、从“能理解”到“能干活”:核心目标升级

Qwen3.8-Omni-Flash 的核心目标是提升模型在真实生产力场景中的 Agent 能力,推动全模态模型从“理解全模态内容”进一步走向“规划任务、调用工具并完成创作”。

在延续此前编程、文本知识工作与 GUI 操作等通用 Agentic 能力的基础上,这一代模型着重拓展了以音视频为核心的 Agentic 应用,覆盖视频剪辑、MV 创作、影视制作与解说、音视频转图文摘要及音视频对话等需综合处理多模态内容的工作流。用官方的话来说,这是“耳聪目明,办事得力”。

二、性能表现:30 项评测平均提升超 26%

在累计 30 项评测中,Qwen3.8-Omni-Flash 较上一代 Qwen3.5-Omni-Plus 平均得分提升超过 26%。

音视频 Agent 与长程任务

基准测试 提升幅度 说明
WildClawBench-MM +36.5 分 音视频 Agent 综合能力
AgenticVBench +22.3 分 Agentic 视觉理解
UniClawBench 69.6 分 长程任务

基础能力

基准测试 提升幅度
LongAudioSpan(长音频理解) +8.3 分
OmniVideoBench(音视频协同推理) +9.6 分
OmniCap-IF CSR / ISR(视频描述指令跟随) +8.5 / +14.1 分
其中,多说话人会议转录基准 AliMeeting 表现尤为突出:DER(说话人分离错误率)与 cpWER(拼接字符错误率)从上一代的 88.11 / 89.61 骤降至 3.35 / 17.18。
官方表示,通过扩展数据、上下文与 Agentic 环境,该模型的音视频能力接近 Gemini 3.8 Flash,音频能力整体超过后者。

千问上线Qwen3.8-Omni-Flash

三、定价:按“每小时”重新定义多模态成本

Qwen3.8-Omni-Flash 的定价策略是此次发布中最具冲击力的部分:

  • API 每小时音频输入价格降幅超过 98%
  • API 每小时音视频输入价格降幅超过 93%
  • 以 Token 口径计算,百万 Token 图文音视频输入价格降至 0.8 元。
  • 需要说明的是,官方价格计算口径为:音频或音视频每小时价格按 2 分钟素材的输入成本 ×30 估算,音视频采用 720p、1fps 规格。

四、生态配套:Qwen-MM-Plugins 与 Qwen-Live Harness

为支撑长程工作流与实时交互,千问同步扩展了 Qwen-MM-Plugins 并开源 Qwen-Live Harness。

Qwen-MM-Plugins:面向 Agent Harness 的多模态插件套件,可安装至 Claude Code、Codex、Gemini CLI、Qwen Code 等主流 Agent 环境,赋予其图像、音频、长视频处理及视频编辑能力。其中 Video2Note 可将数小时视频内容生成图文对应的 PDF 笔记,Omni Skill Creator 可从操作演示中提炼标准作业流程并转化为可复用的 Agent Skill。

Qwen-Live Harness:更像一个实时调度层。用户可直接与实时全模态模型对话,再将复杂任务交给后台 Agent 持续执行,完成后主动返回结果。

一个值得关注的技术细节是Agentic Understanding 模式带来的效率提升。在 OmniVideoBench 上,该模式下准确率从 63.4 提升至 67.8,同时单次查询的 Token 消耗从 145,736 降至 79,117,降幅约 45.7%。这意味着模型不再从头到尾逐帧处理长视频,而是从问题出发、由粗到细多轮取证,自主决定该看什么听什么。

五、Realtime 版本:首个支持“听声辨位”的全模态大模型

同步推出的 Qwen3.8-Omni-Flash-Realtime 面向持续低延迟交互,支持 WebSocket 和 WebRTC,可在音视频流输入过程中同步完成感知与响应。

其最突出的特点是首个支持“听声辨位”的全模态大模型:融合空间声音与视觉信息,判断声源方向和距离。该版本适用于口语陪练、空间音频感知及智能客服等场景。

六、模型自进化:12小时优化小模型方言识别

此次发布中一个颇具前瞻性的实验是将模型推向研发环节本身。

团队让 Qwen3.8-Omni-Flash 在 12 小时内自主完成评测集选择、数据构建与 4 轮迭代,累计构建 3,413 条训练数据,将 Qwen2.5-Omni-3B 的四川话识别字符错误率从 25.79% 降至 15.30%,相对下降约 40.7%。

千问上线Qwen3.8-Omni-Flash

这一实验展示了前沿模型作为“模型优化器”的潜力——不仅是执行任务的工具,还能参与到模型自身的迭代过程中。

Qwen3.8-Omni-Flash 以 1M 上下文、四模态原生输入、30 项评测平均提升超 26%、音视频 API 价格暴降超 90% 的组合,将全模态模型从“感知”推向了“执行”。与同步推出的 Realtime 版本和开源生态工具一起,这套组合拳标志着音视频正在从模型的感知输入,进一步成为 Agent 理解环境、开展推理并执行任务的核心载体。

更多信息请参阅:

Qwen官方博客:qwen.ai/blog?id=qwen3.8-omni-flash

千问AI平台:qianwenai.com


AITOP100-AI资讯频道将持续关注AI行业新闻资讯消息,带来最新AI内容讯息。

想了解AITOP100平台其它版块的内容,请点击下方超链接查看

AI创作大赛 | AI活动 | AI工具集 | AI资讯专区 | AI小说

AITOP100平台官方交流社群二维码:

AITOP100平台官方交流社群二维码AITOP100平台官方交流社群二维码

0
0
文章来源:AI TOP100
免责声明:本文不代表本平台立场,且不构成投资建议,请谨慎对待。
全部评论
暂无评论
相关AI工具
  • 千问办公
相关资讯
  • 抖音上线声音侵权专属举报入口:AI克隆音色投诉量一个月翻倍

  • 阿里云Wan3.0:30秒长镜头+5条视频参考,AI视频终于能“讲完整故事”了

  • 科大讯飞发布AStudio:让AI从「会回答」,真正走进「工作现场」

  • 云知声发布 U2-Flash:266B 参数只激活 10B,却要「干主力模型的活」

  • AITOP100--AI画布9月再进化:从创作到协作,效率与体验全面升级

热点资讯

每日AI资讯-2026年9月17日

22小时前
每日AI资讯-2026年9月17日

每日AI资讯-2026年9月14日

3天前
每日AI资讯-2026年9月14日

每日AI资讯-2026年9月16日

1天前
每日AI资讯-2026年9月16日

每日AI资讯-2026年9月15日

2天前
每日AI资讯-2026年9月15日

每日AI资讯-2026年9月10日

7天前
每日AI资讯-2026年9月10日
分享
0
0

欢迎来到AI Top100!我们聚合全球500+款AI智能软件,提供最新资讯、热门课程和活动。我们致力于打造最专业的信息平台,让您轻松了解全球AI领域动态,并为您提供优质服务。

合作伙伴
联系我们
加入AITOP100社群
加入社群
AITOP100商务微信
商务微信
相关链接
服务及隐私政策
网站地图
关于我们
粤ICP备2022124843号-2粤公网安备44030002004505广播电视节目制作经营许可证:(粤)字第00712号Copyright © 华强方特(深圳)动漫有限公司 版权所有