字節跳動推出音視頻全雙工大模型SeedRealtime,已在豆包全量上線
N.R. Finch
字節跳動8月5日發佈原生音視頻全雙工大模型SeedRealtime,已在豆包App全量上線;該模型將聲音、畫面、文本統一至同一架構,試圖用更自然的AI對話搶佔用戶時長。
全雙工是甚麼,跟之前的語音助手有何不同?
全雙工(如同打電話,雙方可同時說話、隨時插嘴)意味着AI不再是「你說完我再答」的一問一答模式。
之前的主流方案是級聯系統(將語音識別、視覺理解、語音合成等模組串成一條流水線)——每多一個模組,延遲就多一層。
SeedRealtime將聲音、畫面和文字放進同一個模型,不再拆成多個模組排隊處理。這意味著→ 理論上延遲更低,模型能同時「聽、看、說」。
這個模型具體能做到甚麼?
音視頻聯合理解:模型能結合畫面消除歧義——例如用戶說「這個怎麼弄」,它會看當前畫面和手勢來判斷「這個」到底指甚麼。
主動交互:毋須用戶先開口。官方演示中,模型在博物館場景持續觀察鏡頭,識別到指定文物後主動提醒;用戶操作咖啡機時,它能根據畫面變化即時糾錯。
交互節奏控制:能分辨旁人閒聊和背景噪音,不會誤觸發;該接話時接話,該停頓時停頓。簡單來說= 它試圖做到「像跟真人打視頻電話」的自然感。
評測數據說了甚麼?
字節披露的端到端人工評測顯示,相比傳統級聯系統,SeedRealtime將音視頻對話中的節奏問題減少約一半。
單次對話能夠完整順暢交流的概率亦有明顯提升。
不過,這是字節自身的評測數據,目前並無披露第三方對比基準。這意味著→ 數據方向值得關注,但幅度需要更多獨立驗證。
字節為何急着全量上線?
豆包App是字節在消費端的核心AI產品,全量上線全雙工模型的邏輯很直接:降低交互門檻 → 拉用戶規模 → 搶應用內停留時長。
這反映出當前AI應用層的競爭焦點已從「誰的模型更強」轉向「誰能讓用戶用得更久」。
簡單來說= 模型能力是入場券,用戶時長才是商業價值的真正載體。
這件事最大的不確定性在哪?
算力和頻寬成本:連續多模態信息流的即時處理,對雲端算力和網絡頻寬的消耗呈指數級增長——推理成本能否控制在商業可接受範圍內,是所有AI企業的共同難題。
用戶留存:新鮮感褪去後,全雙工視頻通話能否沉澱出高頻、剛需的核心場景,仍未有答案。
這意味著→ 技術突破是第一步,但真正的考驗在營運階段——字節需要證明用戶不只是「試一次就走」。
Content is for reference only, not financial advice.