• 首页
  • AI工具集
  • AI资讯
  • AI活动
  • AI社区
  • AI短剧
  • AI创作大赛
  • AI小说
  • AI绘画
    AI视频
    AI对口型
  • AI画布AI画布AI画布
AI 对话

千问Qwen3.8-Omni-Flash:这次不只“看懂视频”,而是要把活干完

千问Qwen3.8-Omni-Flash:这次不只“看懂视频”,而是要把活干完
小峰
1小时前


摘要:文本、图像、音频、视频一起理解,1M上下文,再加上任务规划、工具调用和工作流执行。Qwen3.8-Omni-Flash真正值得关注的,不是多模态输入又多了一项,而是音视频开始成为Agent完成任务的工作材料。




过去两年,我们见过太多“能看图、能听音频、能理解视频”的大模型演示。


它们可以告诉你画面里有什么,可以把录音转成文字,也可以概括一段视频。但演示结束后,真正的工作往往才刚开始:会议纪要需要转成待办,视频素材需要剪辑,外语短剧需要翻译、配音、混音,教程视频还要整理成可复用的知识文档。


看懂,不等于干完。


9月18日,千问发布新一代原生全模态模型Qwen3.8-Omni-Flash。官方给出的目标很直接:增强真实生产力场景中的Agent能力,推动全模态模型从“理解内容”走向“规划任务、调用工具并完成创作”。[1]


这句话,才是这次发布的核心。


01|“Omni”真正的变化,是音视频进入任务闭环

Qwen3.8-Omni-Flash支持文本、图片、音频和视频输入,具备1M Token上下文。阿里云百炼文档显示,模型支持思考模式、Function Calling、联网搜索、多通道空间音频和上下文缓存。[2]


这些规格单独拿出来看并不神秘。真正有意思的是,它们被放进同一条工作链里。


以前做一次视频分析,常见流程是先抽帧、再转写、再把文本和关键画面交给大模型,最后由人工接手后续操作。每个环节用不同工具,信息容易丢,成本也难控制。


Qwen3.8-Omni-Flash想做的是:让模型先理解用户目标,再决定该看什么、听什么,找到证据后规划后续步骤,最后调用工具推进任务。


比如一场完整会议,模型不只输出摘要,还可以识别发言人、整理待办、分析项目风险。接入Agent和企业工具后,后续还能发送邮件、创建任务,甚至根据会议要求开始写代码。


这就从“会议转写工具”变成了“会议执行Agent”。

02|面对长视频,它开始学会“挑重点看”

长音视频一直是多模态模型最烧钱的场景之一。


一部两小时的电影、一场长会议、几十段素材,如果模型从头到尾逐帧处理,大量Token会花在与问题无关的内容上。素材越长,这个问题越夸张。


Qwen3.8-Omni-Flash采用的思路更像人:先看问题,再决定应该关注哪些片段。模型通过由粗到细的多轮取证,逐步定位关键画面和声音,不必把所有内容都用同样精度处理。


官方在OmniVideoBench上的实验显示,Agentic Understanding模式把准确率从63.4提高到67.8,同时将单次查询Token消耗从145,736降到79,117,约减少45.7%。[1]


这组数据的价值,不只是“更省”。它说明按需感知并非简单砍掉输入,而是在有限预算里把注意力集中到更相关的证据上,结果反而更准。


对真实业务来说,这比多拿几个跑分更重要。因为视频审核、会议分析、素材检索、培训复盘等任务一旦规模化,成本不是一次调用多少钱,而是每天有多少小时素材需要持续处理。

03|官方把重点放在了四类生产力工作流

从发布案例看,Qwen3.8-Omni-Flash最想进入的并不是聊天场景,而是音视频生产链。


第一类是长会议。 模型联合画面和声音识别多人发言,生成纪要、待办和风险提示,并通过工具继续推进工作。


第二类是视频深度研究。 模型从视频提炼问题,再搜索网页、图片、视频和文档,最终生成围绕视频主题的图文研究报告。


第三类是内容生产。 官方展示了Music2MV、短剧翻译和长电影解说等流程。Agent可以理解节奏、角色和剧情,再协调字幕、配音、剪辑与质检工具。


第四类是知识沉淀。 Video2Note可以把教程视频整理成带代表性画面的PDF笔记;Omni Skill Creator则尝试从操作演示中提炼SOP和可复用Skill。


过去视频是一份需要人观看的素材,现在它有机会变成Agent可以检索、分析、执行和沉淀的工作资产。


04|降价98%,为什么比跑分更值得关注?

官方称,与Qwen3.5-Omni-Plus相比,Qwen3.8-Omni-Flash每小时音频输入API价格下降超过98%,每小时音视频输入价格下降超过93%。在29项评测中,平均分提升超过25%。[1]


先提醒一个细节:这些每小时成本有特定测算口径。官方按2分钟素材输入成本的30倍估算一小时,音视频按照720p、每秒1帧计算。实际账单还会受素材分辨率、采样方式、输出长度、思考模式和缓存命中影响。


所以,不能简单把“下降98%”理解成所有音频任务都会便宜98%。


但方向仍然很明确:全模态Agent要走进生产环境,感知成本必须先降下来。


演示时处理一段三分钟视频,贵一点没有感觉;企业每天处理几千小时会议、客服录音或视频素材时,成本差异会直接决定项目能不能上线。


低成本还会改变产品设计。以前为了省钱,系统只能少看几帧、少听几段,或者把音频和视频拆开处理。现在成本下降,开发者才可能把持续感知、多轮取证和工具执行做成日常功能,而不是偶尔使用的高价能力。

05|别误会:模型本身并不会直接吐出一部成片

这次发布很容易被写成“上传视频,模型自动完成剪辑、配音和成片”。这个说法不够准确。


阿里云百炼文档明确显示,标准版qwen3.8-omni-flash支持文本、图片、音频和视频输入,仅输出文本。[2]


也就是说,它负责的是理解素材、规划任务、生成结构化结果和调用工具。真正的视频剪辑、语音生成、音轨混合与渲染,需要Qwen-MM-Plugins、Qwen-Live Harness或其他外部工具协同完成。


这个边界很重要。它说明所谓“Agentic Delivery”并不是模型单打独斗,而是由模型、Harness、插件、工具和运行环境共同构成。


官方也承认,长音视频在多轮推理中的存储、传输和处理仍然昂贵,现有Agent框架对原生音视频支持不足,从全模态理解到端到端执行的工作流仍处于早期阶段。[1]


所以,能力很亮眼,但还不能把演示效果直接等同于企业生产环境的稳定交付。

06|企业真正该测试什么?

如果团队准备把Qwen3.8-Omni-Flash接入业务,我建议别只上传一段宣传视频问“效果怎么样”,而是用自己的真实任务做五项测试。


第一,证据定位是否准确。它能不能找到决定结论的关键片段,并给出时间点或出处?


第二,多人和噪声场景是否稳定。会议重叠发言、口音、背景噪声、镜头切换,往往比干净评测集难得多。


第三,工具调用是否可靠。参数错误、重复调用、任务中断后能否恢复,直接决定Agent能不能进入生产流程。


第四,完整任务成本是多少。不能只看输入单价,还要计算思考Token、输出、缓存、重试、存储和后续工具费用。


第五,结果能否验收。视频成片、会议待办、字幕翻译和研究报告,都需要明确质量标准,必要时保留人工复核。

结语|多模态的下半场,是交付而不是感知

Qwen3.8-Omni-Flash最值得关注的,不是又支持了四种输入,也不只是1M上下文和一组漂亮评测。


真正的变化是:音频和视频不再只是模型“看过、听过”的内容,而开始成为Agent规划任务、调用工具和交付成果的工作介质。


从会议纪要到待办执行,从教程视频到知识笔记,从短剧翻译到成片质检,全模态能力正在从一个功能点变成一条生产链。


当然,这条路还没走完。模型标准API仅输出文本,复杂交付依赖工具链;官方评测也不等于每个企业场景都能稳定复现。真正上线之前,仍要用自己的素材、流程和验收标准做测试。


但方向已经很清楚:下一轮多模态竞争,不是谁能看见更多、听见更多,而是谁能在成本可控的前提下,把看到和听到的信息变成可执行的结果。


你最希望全模态Agent替你完成哪类工作?欢迎在评论区聊聊。




参考资料

[1] Qwen Team:《Qwen3.8-Omni-Flash: Omni Senses. Agentic Delivery.》,2026-09-18。https://qwen.ai/blog?id=qwen3.8-omni-flash


[2] 阿里云帮助中心:《全模态概述》,更新于2026-09-18。https://help.aliyun.com/zh/model-studio/omni






0
0
文章来源:AI TOP100
免责声明:本文不代表本平台立场,且不构成投资建议,请谨慎对待。
全部评论
暂无评论
相关资讯
  • 每日AI资讯-2026年9月18日

  • 每日AI资讯-2026年9月17日

  • 百家号App更名"百度直播伴侣":上线十年,图文让位给直播

  • 每日AI资讯-2026年9月16日

  • 每日AI资讯-2026年9月15日

热点资讯

每日AI资讯-2026年9月17日

2天前
每日AI资讯-2026年9月17日

每日AI资讯-2026年9月14日

5天前
每日AI资讯-2026年9月14日

每日AI资讯-2026年9月18日

1天前
每日AI资讯-2026年9月18日

每日AI资讯-2026年9月16日

3天前
每日AI资讯-2026年9月16日

每日AI资讯-2026年9月15日

4天前
每日AI资讯-2026年9月15日
分享
0
0

欢迎来到AI Top100!我们聚合全球500+款AI智能软件,提供最新资讯、热门课程和活动。我们致力于打造最专业的信息平台,让您轻松了解全球AI领域动态,并为您提供优质服务。

合作伙伴
联系我们
加入AITOP100社群
加入社群
AITOP100商务微信
商务微信
相关链接
服务及隐私政策
网站地图
关于我们
粤ICP备2022124843号-2粤公网安备44030002004505广播电视节目制作经营许可证:(粤)字第00712号Copyright © 华强方特(深圳)动漫有限公司 版权所有