2026年9月3日,微软宣布推出新一代AI语音转文字模型 MAI-Transcribe-2 。这是微软MAI系列中Transcribe产品线的第二代产品,距离第一代MAI-Transcribe-1于4月2日首发仅过去五个月。微软官方宣称,这是其“最快、最准确、最便宜的AI语音转文字模型”。
在语音转录领域,准确率、速度和成本长期构成一个“不可能三角”——提升任一维度往往意味着牺牲另外两者。MAI-Transcribe-2的核心看点,正是在这三个维度上同时实现了突破。
体验地址: https://playground.microsoft.ai/

一、准确率:FLEURS测试5.2%词错误率,追平强制与自动识别
在涵盖60种语言的多语言基准测试FLEURS中,MAI-Transcribe-2在 强制指定语言 和 自动推断语言 两种模式下,平均词错误率(Word Error Rate, WER)均为5.2% 。
这一成绩使其在FLEURS多语言基准上排名第一。作为对比,同一测试中:
| 模型 | 强制指定语言WER | 自动推断语言WER |
|---|---|---|
| MAI-Transcribe-2 | 5.2% | 5.2% |
| Gemini 3.1 Pro | 5.3% | 5.8% |
| GPT-Transcribe | 10.4% | 10.6% |
| Whisper v3-Large | 22.8% | 23.5% |
值得关注的是,MAI-Transcribe-2在 强制与自动两种模式下WER完全一致 (均为5.2%),而Gemini 3.1 Pro在自动模式下WER上升了0.5个百分点(从5.3%升至5.8%),GPT-Transcribe上升了0.2个百分点。这表明MAI-Transcribe-2的自动语言识别能力并未以牺牲准确率为代价。
在独立评测机构Artificial Analysis的词错误率排行榜上,MAI-Transcribe-2以2.0%的AA-WER排名第二,仅次于阿里Fun-Realtime-ASR-preview的1.7%,领先ElevenLabs Scribe v2的2.2%。
二、速度:比GPT-Transcribe快10倍,领跑准确率-延迟帕累托前沿
速度方面,微软援引Artificial Analysis的评测数据称,MAI-Transcribe-2 比OpenAI的GPT-Transcribe快10倍,比ElevenLabs的Scribe v2快7倍,比Google的Gemini 3.5 Transcribe快5倍 。
微软表示,MAI-Transcribe-2在Artificial Analysis的 准确率-延迟帕累托前沿 (accuracy-latency Pareto frontier)中排名第一,即在同等延迟水平下提供最高的转录准确率,或在同等准确率水平下实现最低的延迟。
尤其值得注意的是,MAI-Transcribe-2在 长音频 场景下的推理速度优势更为明显。对于会议转录、播客处理、客服录音分析等长音频场景,这一特性具有直接的应用价值。
三、成本:限时$0.10/小时,较前代降价72%
定价是MAI-Transcribe-2最具冲击力的维度。该模型上市初期 限时收费0.10美元/小时 (按当前汇率约合0.67元人民币),优惠持续至2026年年底。
这一价格意味着什么?对比来看:
- 相比前代: MAI-Transcribe-1于2026年4月发布时的定价为0.36美元/小时,MAI-Transcribe-2的限时价格降低了约72%。
- 相比竞品: 0.10美元/小时的价格显著低于GPT-Transcribe等主流转录服务的市场定价。
以一个每年处理10万小时音频的企业为例,其年账单将从36,000美元降至10,000美元。
需要提醒的是,0.10美元/小时为限时优惠价 ,微软尚未公布促销结束后的常规价格。
另外,第一代MAI-Transcribe-1支持25种语言,而MAI-Transcribe-2将语言覆盖扩展至60种,单语言的单位成本摊薄效应更为显著。
四、功能:说话人分离、逐词时间戳、可配置转录风格
MAI-Transcribe-2在功能层面也实现了多项升级:
- 说话人分离(Speaker Diarization): 可在同一段录音中区分不同发言者,并将文字归属到对应说话人。这对于会议记录、访谈整理、客服录音分析等场景尤为实用。
- 逐词时间戳(Word-level Timestamps): 为每个词标注精确的时间位置,便于音频检索、导航、编辑和字幕对齐。
- 可配置转录风格: 提供两种输出模式——verbatim模式 保留语气词和口误,面向合规审查与法律分析等需要原始记录的严肃场景;clean模式 自动删除语气词,生成更易读的字幕、笔记和发布文本。
- 关键词偏置(Keyword Biasing): 帮助模型识别领域专用术语、缩写、专有名词等难以从上下文推断的词汇。
- 自动语言识别与代码切换: 支持60种语言,能够自动检测录音所使用的语言,并支持自然混用多种语言的对话(如Hinglish、Spanglish等常见混合语言场景),用户无需预先指定语言。
- 噪声环境鲁棒性: 在嘈杂的实际录音环境中保持转录质量。
五、可用性与定位
目前,开发者可通过 Microsoft Foundry (公开预览)、MAI Playground 和 OpenRouter 调用或试用MAI-Transcribe-2。
MAI-Transcribe-2是微软MAI系列模型的一部分。在2026年Build大会上,微软将MAI-Transcribe-2与MAI-Thinking-1、MAI-Image-2.5、MAI-Voice-2一同列入MAI系列公开预览阵容。这标志着微软正在加速构建从推理、图像生成到语音转录的全栈自研AI模型体系。
小结
MAI-Transcribe-2在 准确率 (FLEURS 5.2% WER)、速度 (比GPT-Transcribe快10倍)和 成本 ($0.10/小时,较前代降72%)三个维度上同时实现了突破,正在打破语音转录领域长期存在的“不可能三角”。
对于开发者来说,这是一次值得关注的生产力工具升级;对于转录服务市场而言,这意味着一场成本结构的重构已经开始。
AITOP100-AI资讯频道将持续关注AI行业新闻资讯消息,带来最新AI内容讯息。
想了解AITOP100平台其它版块的内容,请点击下方超链接查看
AI创作大赛 | AI活动 | AI工具集 | AI资讯专区 | AI小说
AITOP100平台官方交流社群二维码:










