字节跳动推出音视频全双工大模型SeedRealtime,已在豆包全量上线

N.R. Finch
Published todayAbout 3 min read

字节跳动8月5日发布原生音视频全双工大模型SeedRealtime,已在豆包App全量上线;该模型将声音、画面、文本统一到同一架构,试图用更自然的AI对话抢占用户时长。

01

全双工是什么,跟之前的语音助手有什么不同?

全双工(像打电话一样,双方可以同时说话、随时插嘴)意味着AI不再是"你说完我再答"的一问一答模式。
之前的主流方案是级联系统(把语音识别、视觉理解、语音合成等模块串成一条流水线)——每多一个模块,延迟就多一层。
SeedRealtime把声音、画面和文字塞进同一个模型,不再拆成多个模块排队处理。这意味着→ 理论上延迟更低,模型能同时"听、看、说"。
02

这个模型具体能做到什么?

音视频联合理解:模型能结合画面消除歧义——比如用户说"这个怎么弄",它会看当前画面和手势来判断"这个"到底指什么。
主动交互:不需要用户先开口。官方演示里,模型在博物馆场景中持续观察镜头,识别到指定文物后主动提醒;用户操作咖啡机时,它能根据画面变化实时纠错
交互节奏控制:能分辨旁人闲聊和背景噪声,不会误触发;该接话时接话,该停顿时停顿。用大白话说= 它试图做到"像跟真人打视频电话"的自然感。
03

评测数据说了什么?

字节披露的端到端人工评测显示,相比传统级联系统,SeedRealtime将音视频对话中的节奏问题减少约一半
单次对话能够完整顺畅交流的概率也有明显提升。
不过,这是字节自己的评测数据,目前没有披露第三方对比基准。这意味着→ 数据方向值得关注,但幅度需要更多独立验证。
04

字节为什么急着全量上线?

豆包App是字节在消费端的核心AI产品,全量上线全双工模型的逻辑很直接:降低交互门槛 → 拉用户规模 → 抢应用内停留时长。
这反映出当前AI应用层的竞争焦点已经从"谁的模型更强"转向"谁能让用户用得更久"
用大白话说= 模型能力是入场券,用户时长才是商业价值的真正载体。
05

这件事最大的不确定性在哪?

算力和带宽成本:连续多模态信息流的实时处理,对云端算力和网络带宽的消耗呈指数级增长——推理成本能否控制在商业可接受范围内,是所有AI企业的共同难题。
用户留存:新鲜感褪去后,全双工视频通话能否沉淀出高频、刚需的核心场景,还没有答案。
这意味着→ 技术突破是第一步,但真正的考验在运营阶段——字节需要证明用户不只是"试一次就走"。

Content is for reference only, not financial advice.

字节跳动推出音视频全双工大模型SeedRealtime,已在豆包全量上线 · nashnova