今天,字节跳动Seed团队甩出了一个重磅产品——原生音视频全双工大模型 SeedRealtime
和以往还在实验室里跑demo的模型不同,SeedRealtime 这次是带着真家伙来的
目前,这套能力已经在豆包App全量上线,用户只需将App更新至最新版本,在对话框内选择“打电话”进入视频通话界面,就能直接体验。在业界,这算是率先把音视频全双工技术推到了规模化落地的位置。

工具地址:豆包AI官网
告别“听—转写—想—说”的流水线
用过传统AI视频通话的人都有个痛点:对话节奏总是“卡拍”。要么你话没说完它急着抢答,要么你说完了它还要愣个一两秒才反应过来。
这是因为传统的级联系统通常是“听—转写—想—说”逐段拼接的。语音识别(ASR)、视觉模型、文本生成、语音合成(TTS)分属不同的模块,中间还要依赖外部的语音活动检测(VAD)来判断谁在说话。这种流水线作业不仅延迟高,还容易在传递中丢失信息。
SeedRealtime 最核心的差别就在架构。它采用统一的端到端架构,把音频、视频和文本原生揉在一起,不再依赖外部模块进行轮次判断。模型一手接住画面和声音,一手直接生成回应,在连续的多模态信息流中同步完成感知、理解、决策与表达。
这种原生融合带来的最直接收益,是音视频对话里的说话节奏问题减少了约50%。抢话、停顿突兀、答非所问的割裂感大幅降低,单次对话能够完整、顺畅交流的概率明显提升。
长着眼睛、耳朵和嘴巴的“分寸感”
除了不卡拍,SeedRealtime 更妙的是它在实时场景里的“分寸感”。
它不仅能听懂你在说什么,还能看懂你在干什么。在官方展示的案例中,模型能够在多人聚会中识别不同人物身份并持续对应发言者;在博物馆里持续观察镜头画面,识别到指定文物后主动提醒;甚至在你操作咖啡机时,它能根据画面变化实时纠错。当你指着某个东西问“这个怎么弄”时,它能结合画面、手势和视线,准确判断“这个”到底指向什么。
更重要的是,它知道什么时候该说话,什么时候该闭嘴。在机场等嘈杂场景中,它能区分你和旁人的对话,不会因为背景噪声或无关聊天被误触发;在儿童学习场景里,也能持续跟随互动,不受背景电话声的干扰。
它能像真人对话那样留出呼吸的间隙,在察觉画面状态变化时主动提醒,也能调用工具融入表达。交互从被动响应升级成了主动协作。
一条新的技术路线
对全模态智能助手而言,SeedRealtime 给出了一条新路线——不再依赖把多个单模态模型用管道串起来,而是让一个模型同时长着眼睛、耳朵和嘴巴。
字节Seed团队表示,未来将继续优化端到端时延、主动感知与决策能力、多人复杂场景理解以及工具调用能力,推动AI从传统问答交互进一步发展到能够在真实场景中持续理解环境并协助完成实际任务。
小编建议大家去豆包App更新一下,就能体验这个新功能。
AITOP100-AI资讯频道将持续关注AI行业新闻资讯消息,带来最新AI内容讯息。
想了解AITOP100平台其它版块的内容,请点击下方超链接查看
AI创作大赛 | AI活动 | AI工具集 | AI资讯专区 | AI小说
AITOP100平台官方交流社群二维码:










