• 首页
  • AI工具集
  • AI资讯
  • AI活动
  • AI社区
  • AI短剧
  • AI创作大赛
  • AI小说
  • AI绘画
    AI视频
    AI对口型
  • AI画布AI画布AI画布
AI 对话

Google发布Gemini3.5 Transcribe:其为迄今为止“最精准”的语音转文本模型

Google发布Gemini3.5 Transcribe:其为迄今为止“最精准”的语音转文本模型
AI TOP100
1天前
AI摘要
当地时间8月26日谷歌发布Gemini 3.5 Transcribe语音转文本模型,定位“理解式转录”,相比上一代多语言能力、词错率、速度均大幅提升,具备智能修正、函数调用、多语言支持等五大核心功能,非流式词错率低至2.6%,目前已落地安卓Gboard、macOS Gemini应用,后续将接入Chrome等产品,开发者可通过对应平台公开预览使用。

使用AI智能大模型技术生成

当地时间8 月 26 日,Google 正式发布 Gemini 3.5 Transcribe,这是 Gemini 音频(Gemini Audio)产品线的最新语音转文本模型。Google 称其为迄今为止“最精准”的语音转文本模型。

模型地址:谷歌Gemini官网 (海外网站需要科学上网)

Google发布Gemini3.5 Transcribe

一、模型定位:从“逐字记录”到“理解式转录”

与传统语音识别模型不同,Gemini 3.5 Transcribe 并非简单地逐字记录,而是将原始音频直接转换为经过清理和格式化的文本。Google 官方博客将其定位为“专为智能语音交互设计的精确语音转文本模型”。

该模型与此前发布的 Gemini 3.5 Live Translate 同属 Gemini Audio 产品线。据 Google 透露,Gemini 3.5 Transcribe 相比上一代转录模型 Chirp 3 实现了“重大进步”,尤其在多语言性能和词错率方面提升显著。从用户说话到最终生成转录文本,整体速度预计可提升约 70%。

二、核心功能:自我修正、填充词删除、函数调用

Gemini 3.5 Transcribe 的核心能力可概括为五个方面:

1. 智能转录(Smart Transcription)

模型可无缝处理说话过程中的自我纠正——例如用户说“我们周二见面——不,还是周三吧”,模型会自动识别并输出正确的“周三”。同时自动删除“嗯”“呃”“啊”等填充词,并对输出文本进行自动格式化。

2. 函数调用(Function Calling)

模型可将图像生成、文件分析等复杂任务委派给其他 Gemini 模型执行。这一能力目前已在 macOS 版 Gemini 应用中上线。

3. 自定义词汇(Custom Vocabulary)

用户可向模型提供自定义词汇表,使其识别专业术语、特殊拼写及行业专有名称。

4. 多语言支持

模型自动检测并转录超过 85 种语言,并支持地区口音和不同方言。

5. 多说话者识别

在预录音频场景中,模型可为最多三名说话者进行带时间戳的语音归属识别。Google 表示对三名以上说话者的支持目前为实验性功能。


三、性能数据:流式 4.0%、非流式 2.6%

Google 公布了由第三方机构 Artificial Analysis 测量的词错率(Word Error Rate, WER)数据:

场景词错率(WER)
实时流式4.0%
非流式(预录音频)2.6%

在 FLEURS 多语言基准上,模型同样全面优于上一代 Chirp 3。Google 还表示,模型在噪声较多的真实环境中具备更好的转写表现,能够准确识别邮政编码、订单号等字母数字实体。

四、应用落地:Gboard Rambler、macOS Gemini、Chrome 即将上线

Gemini 3.5 Transcribe 已进入多条 Google 产品线:

  • Android — Gboard Rambler:该模型已为 Android 平台 Gboard 键盘的 Rambler 功能提供支持。Rambler 是 Google 在 5 月宣布的语音输入功能,可将口述想法转化为精炼文本,并支持语音编辑、纠正拼写错误、更改写作风格。目前 Rambler 支持阿拉伯语,需在 Pixel 11 上使用,并在部分国家和地区逐步推出。
  • macOS — Gemini 应用:模型已向所有 macOS Gemini 应用用户以英语推出。用户可通过语音让 Gemini 生成图像、查询信息、总结文本、分析文件等。
  • Chrome 浏览器(即将上线):Google 计划将模型引入 Chrome 浏览器,届时用户可在任意网页输入框中直接通过语音输入文字。

此外,模型还将扩展至 Search Live、Gemini Live、Docs、Keep 和 Gmail 等产品。


五、开发者入口:AI Studio 与 Antigravity 公开预览

开发者现可通过以下渠道以公开预览形式使用 Gemini 3.5 Transcribe:

  • Google AI Studio:通过 Gemini API 访问
  • Google Antigravity:Google 的代理式开发平台
  • Gemini Enterprise Agent Platform:企业用户入口

模型通过两套 API 提供服务:

  • Live API(gemini-3.5-transcribe-live):实时流式接口,支持双向流式传输,延迟低于一秒
  • Interactions API(gemini-3.5-transcribe):处理预录音频,支持会议、通话录音转写,提供词级时间戳

六、关于 Gemini 3.5 Live 的说明

部分早期报道提及 Google 同时发布了 Gemini 3.5 Live 和 Gemini 3.5 Live Experimental 两款模型。但据 The Verge 后续更新,Google 方面澄清仅 Gemini 3.5 Transcribe 于 8 月 26 日正式发布,另外两款模型并未同步推出。

Gemini 3.5 Transcribe 以 2.6% 的非流式词错率、85+ 语言支持、自我纠正与填充词自动删除等能力,将语音转文本从“听写工具”升级为“理解式转录”方案。配合函数调用能力,模型不仅转写语音,还能将语音指令转化为跨模型的任务执行。随着 Rambler、macOS Gemini 和即将到来的 Chrome 集成逐步铺开,这一模型正在从开发者工具走向广泛的消费级应用场景。

更多信息请参阅官方博客:blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/


AITOP100-AI资讯频道将持续关注AI行业新闻资讯消息,带来最新AI内容讯息。

想了解AITOP100平台其它版块的内容,请点击下方超链接查看

AI创作大赛 | AI活动 | AI工具集 | AI资讯专区 | AI小说

AITOP100平台官方交流社群二维码:

AITOP100平台官方交流社群二维码AITOP100平台官方交流社群二维码

0
0
文章来源:AI TOP100
免责声明:本文不代表本平台立场,且不构成投资建议,请谨慎对待。
全部评论
暂无评论
相关AI工具
  • 谷歌Gemini
相关资讯
  • 当“孙割”的19年白月光被蒸馏成15KB:AI时代,连吃瓜都变得赛博朋克了

  • Google发布Gemini3.5 Transcribe:其为迄今为止“最精准”的语音转文本模型

  • DeepSeek-V4-Flash-Vision-Exp上线:多模态 Agent 能力逼近 Opus-4.8,Files API同步推出

  • OpenAI全面开源Codex Harness:AI编程智能体的"发动机",向开发者开放

  • 突破传统RAG天花板,Mistral Agentic Search把复杂文档问答准确率拉到86%

热点资讯

每日AI资讯-2026年8月20日

7天前
每日AI资讯-2026年8月20日

每日AI资讯-2026年8月25日

2天前
每日AI资讯-2026年8月25日

每日AI资讯-2026年8月24日

3天前
每日AI资讯-2026年8月24日

陵水海归小镇x妙呀 品牌IP设计大赛:万元现金+创业支持

9天前
陵水海归小镇x妙呀 品牌IP设计大赛:万元现金+创业支持

每日AI资讯-2026年8月19日

8天前
每日AI资讯-2026年8月19日
分享
0
0

欢迎来到AI Top100!我们聚合全球500+款AI智能软件,提供最新资讯、热门课程和活动。我们致力于打造最专业的信息平台,让您轻松了解全球AI领域动态,并为您提供优质服务。

合作伙伴
联系我们
加入AITOP100社群
加入社群
AITOP100商务微信
商务微信
相关链接
服务及隐私政策
网站地图
关于我们
粤ICP备2022124843号-2粤公网安备44030002004505广播电视节目制作经营许可证:(粤)字第00712号Copyright © 华强方特(深圳)动漫有限公司 版权所有