• 首页
  • AI工具集
  • AI资讯
  • AI活动
  • AI社区
  • AI短剧
  • AI创作大赛
  • AI小说
  • AI绘画
    AI视频
    AI对口型
  • AI画布AI画布AI画布
AI 对话

Meta 发布首个实时音频感知模型 Muse Voice Transcribe:20 多人开会,边说话边分轨转写

Meta 发布首个实时音频感知模型 Muse Voice Transcribe:20 多人开会,边说话边分轨转写
小峰
46分钟前

先说结论:Meta 推出了它的首个实时音频感知模型——Muse Voice Transcribe。这个名字有点绕,但干的事很实在:把"语音转文字"从"录音结束后再处理",变成了"边说边转写,还能同时分清是谁在说话"。

它最亮眼的本事,是能在同一套流程里同时完成三件事:流式自动语音识别(ASR)、说话人分离(把不同发言者分开)、端点检测(判断一句话什么时候说完了)。也就是说,一场 20 多人参与、持续一小时的会议,它能边听边转写,同时把每个人说的话分轨标好——不用等录音结束,也不用再跑一遍"分离说话人"的后处理。

对做会议纪要、通话字幕、客服质检的人来说,这可能是个值得认真看一眼的工具。

一、它到底强在哪

先看几个关键数据,这能帮我们快速定位它的价值。

20 余人分轨转写:能在一段包含 20 多个说话者的录音里,把不同发言者分开,并自动识别"谁在什么时候说完了"。

70 余种语言:训练覆盖 70 多种语言,其中 25 种在发布时完成了验证,还支持中英夹杂这类句内、句间的自然语言切换。

超 1 小时长音频:原生支持超过一小时、20 多人的长音频输入,不用切段、不用后处理。

价格:每 1000 分钟音频 3 美元,折合约每小时 0.18 美元(约 1.2 元人民币)。

榜单:截至 9 月 1 日,在第三方机构 Artificial Analysis 的流式语音转文本排行榜上排第一,官方给的字错率(WER)约 3.1%。

但这里要先说一句客观的:"支持 20 余人"这个数字,本身并不是行业最高。 有媒体比对指出,Speechmatics 实时服务默认支持 50 人、Amazon Transcribe 支持 30 人。所以 Muse 的看点,不在于"人数最多",而在于它把"实时流式转写 + 说话人分离 + 端点检测"这三个过去往往分开做的任务,统一进了一个模型里,而且价格便宜、准确率还排第一。

二、"边说边转写",是怎么做到的

传统语音转写的流程,通常是"录完一整段 → 再交给模型处理"。Muse 走的是"流式"路线:音频以 80 毫秒(约 12.5 赫兹)为一个小块被处理,模型每拿到一块,就决定"继续听下一块"还是"先把文字吐出来"。

这样带来的直接效果,就是延迟低——不用等整段说完,用户边说,文字就边往外冒。适合实时听写、会议记录、通话字幕这类"等不起"的场景。

更有意思的是它处理"准确率 vs 延迟"这对矛盾的方式。理论上,听得越久、上下文越多,转写得越准,但延迟也越高。Muse 用了一个叫自适应延迟(adaptive delay)的机制:不搞"一刀切"的速度,而是针对每个词动态判断——好识别的词,快速出结果;发音含糊、术语多、语境复杂的词,就多听一会儿再判断。

这个权衡,是用强化学习调出来的:把"字错率奖励"和"延迟奖励"乘在一起优化,目标是在速度和准确度之间找到最佳平衡点。对用户来说,感受就是"该快的地方快,该稳的地方稳"。

三、为什么"说话人分离"这次值得单独说

很多人可能觉得,"区分谁在说话"是老功能了。但 Muse 这次的玩法不一样。

过去,说话人分离(Diarization)通常是一个独立的下游步骤:先转写出文字,再另外跑一个模型去判断"这句话是谁说的"。两套系统拼在一起,误差容易在接缝处累积。

Muse 的做法是,把说话人分离直接整合进自回归多模态架构里,和 ASR、端点检测联合训练——通过引入 <|start_of_turn|> 这样的特殊标记来预判说话人切换,用 <|speaker_A-Z|> 标签来区分不同的人。也就是说,它不是在"转写之后"再去猜是谁说的,而是在转写的过程中,就同时把"谁说的"标好了。

这个差别很关键。因为当转录内容要接进下游 AI 系统时,"说了什么"和"是谁说的"必须都对得上。一旦说话人标错,会议纪要、客服分析、合规审计这些工作流就不可靠了。

四、价格,也是它的一张牌

除了技术,Muse 的价格策略也值得一说。

每 1000 分钟 3 美元、约每小时 0.18 美元,这个费率在"带说话人分离"的服务里,处于市场低位。有媒体做了个对比:Deepgram 含说话人分离约每小时 0.47 美元,AssemblyAI 约 0.57 美元,OpenAI 的 GPT Live Transcribe 高达 1.02 美元(而且还没列说话人分离功能)。虽然也有更便宜的(比如 Soniox 每小时 0.12 美元,但它只支持最多 15 人)。

所以 Muse 的定位很清楚:在"能分轨、够准、又便宜"这三件事上,打了一个很有竞争力的组合拳。

五、说点实在的边界

该说的优点说完了,边界也得讲清楚。

一是"20 余人"不是行业最高。 前面说了,Speechmatics、Amazon Transcribe 支持的人数更多。如果你确实有"几十人大型会议"的硬需求,Muse 未必是最合适的那一个。它的优势在于"实时 + 分轨 + 便宜"的综合性价比,而不是"人数天花板"。

二是功能上还有一些部署限制。 有媒体指出,它目前只提供基于"轮次(turn-level)"而非单词级的时间戳,标签也限于会话范围内;默认并发是 8 个流,单会话最长 60 分钟。这对大多数会议、访谈场景够用,但对需要极细粒度时间戳或超高并发的场景,可能不满足。

三是"流式转文本排行榜第一"是 Meta 给出的口径。 具体字错率、说话人分离错误率等数据,建议以第三方独立复测为准。榜单第一是事实,但"第一"背后测的是什么、和谁比,值得看仔细。

六、对普通人意味着什么

我把它收敛成三句话。

对开发者:如果你在搭会议系统、实时助手、客服质检、播客转录这类产品,Muse 值得一试——它把"转写 + 分轨 + 端点检测"打包成了一个 API,省得你去拼多个服务,而且价格友好。

对企业:说话人分离的可靠性,直接决定会议纪要、客服分析、合规审计能不能用。Muse 把分轨做进了模型里,是一个值得评估的信号;但上线前建议用你自己的数据实测一遍准确率。

对普通用户:短期你可能感觉不到它——它不是一款 C 端 App,而是给开发者用的 API。但它背后代表的方向值得留意:语音 AI 正在从"先录音、后处理",走向"边说边懂、边懂边分人"的实时感知。 这个能力成熟后,会议纪要自动分人、通话实时字幕、客服实时质检,都会变得更顺手。

一句话总结:Muse Voice Transcribe 的意义,不在于"支持 20 多人"这个数字本身,而在于它把实时转写、说话人分离、端点检测收进了一个模型,又配了个很有攻击性的价格。语音 AI 的"实时感知"时代,可能就从这里开始加速了。





0
0
文章来源:AI TOP100
免责声明:本文不代表本平台立场,且不构成投资建议,请谨慎对待。
全部评论
暂无评论
相关资讯
  • 每日AI资讯-2026年9月11日

  • 每日AI资讯-2026年9月10日

  • 每日AI资讯-2026年9月09日

  • 每日AI资讯-2026年9月08日

  • 每日AI资讯-2026年9月07日

热点资讯

每日AI资讯-2026年9月04日

8天前
每日AI资讯-2026年9月04日

每日AI资讯-2026年9月10日

2天前
每日AI资讯-2026年9月10日

AITOP100-AI画布「分享优质工作流」激励计划上线,3万积分等你来拿!🚀

6天前
AITOP100-AI画布「分享优质工作流」激励计划上线,3万积分等你来拿!🚀

AITOP100平台2026年9月初AI大赛汇总:7场大赛总奖金257.3万

9天前
AITOP100平台2026年9月初AI大赛汇总:7场大赛总奖金257.3万

每日AI资讯-2026年9月09日

3天前
每日AI资讯-2026年9月09日
分享
0
0

欢迎来到AI Top100!我们聚合全球500+款AI智能软件,提供最新资讯、热门课程和活动。我们致力于打造最专业的信息平台,让您轻松了解全球AI领域动态,并为您提供优质服务。

合作伙伴
联系我们
加入AITOP100社群
加入社群
AITOP100商务微信
商务微信
相关链接
服务及隐私政策
网站地图
关于我们
粤ICP备2022124843号-2粤公网安备44030002004505广播电视节目制作经营许可证:(粤)字第00712号Copyright © 华强方特(深圳)动漫有限公司 版权所有