字节跳动发布大模型SeedRealtime,原生融合音视频与文本

2026-08-05 14:01:07
18143
目前,SeedRealtime已在豆包App全量上线,在业界率先实现了音视频全双工技术的规模化落地。

字节跳动于8月5日正式推出原生音视频全双工大模型SeedRealtime,用统一架构原生融合音频、视频与文本,能在连续的多模态信息流上实时交互,带来“边看、边听、边说”的全新体验。目前,SeedRealtime已在豆包App全量上线,在业界率先实现了音视频全双工技术的规模化落地。

音视频实时交互此前长期卡在两种形态之间:级联系统依赖ASR、VLM、TTS等多个模块串联,延迟层层叠加,信息逐级损耗;端到端模型虽更流畅,但不少方案仍依赖外置VAD判断轮次,本质上仍接近一问一答的半双工交互。

SeedRealtime的核心突破,在于将声音、画面、时序与表达统一到同一个端到端模型中。它不是先听完、再看完、最后作答,而是在连续音视频流上让感知、理解、决策与表达同步进行,使“听到的”和“看到的”能够共同参与每一次实时判断。

免责声明:本文观点来自原作者,不代表天天在线的观点和立场。文章内容仅供参考、交流、学习,不构成投资建议
责任编辑:蓝羽_XN054
猜你感兴趣