人工智能 来源:MarkTechPost 整理:feaOS 2026-08-10 14:45:18

字节跳动发布SeedRealtime:首个原生视听全双工大模型

近日,字节跳动的Seed团队推出了一款名为SeedRealtime的原生视听全双工语言模型。该模型融合了音频、视频和文本信息,在单一统一架构中实现实时多模态交互。与传统的分阶段处理方式不同,SeedRealtime采用端到端的设计,实现了感知、理解、决策和表达的并行运行,并且在演示中展示了跨模态身份绑定、基于视觉状态进行纠正以及主动语音互动等突破性功能。尽管目前该模型仅部署于字节跳动旗下的消费者助手Doubao应用内,但其提出的参考架构为实时音视频产品开发提供了新的思路。例如,在嘈杂的聚餐环境中,SeedRealtime能够通过声音和图像识别来绑定身份,并且在河北省博物馆中,当用户要求提醒特定青铜屏风出现时,模型会主动提示。

ENTRY_ID: NEWS-12152 READ_MODE: SHORT_SIGNAL