SeedRealtime 技术解析:音视频全双工模型如何实现实时交互

摘要:SeedRealtime 把音频、视频和文本纳入统一时间流,目标是减少级联式语音系统的延迟、抢话和上下文损耗。本文讨论统一架构、打断控制、回声治理与机器人落地边界。

人机实时音视频全双工交互与统一流式模型

视频通话里的智能助手,过去常给人一种微妙的迟钝感:你说完一句话,它停一拍;你只是换气,它已经开始回答;你临时插话,它还在按原稿往下念;镜头里出现了关键物体,它却要等你明确提问。单项能力可能都很强,组合起来却像一支通过对讲机协作的团队,每个成员都在等上一个环节交接。

字节跳动 Seed 团队于 2026 年 8 月发布的 SeedRealtime,瞄准的正是这种交互断层。官方将它定义为“原生音视频全双工大模型”:音频、视频和文本进入统一架构,模型在连续多模态信息流上实时理解、判断和表达,支持边看、边听、边说。目前该能力已在豆包 App 全量上线。官方还披露,在端到端人工评测中,相比级联模型,其音视频对话节奏问题减少了一半,单次对话顺畅、完整交流的概率也有明显提升。

这项发布值得关注的地方,不只是一组实时演示。它把多模态模型的竞争推向了更难衡量、也更接近日常交流的一层:模型是否理解时间,是否知道一句话说给谁听,是否懂得闭嘴,是否能在自己发声时继续听见用户,以及是否能在画面持续变化时保持任务。

级联系统为什么容易“卡一下”

典型的实时语音或视频助手通常由多个模块接力。麦克风音频先经过降噪、回声消除和语音活动检测,再送入自动语音识别;摄像头画面由视觉模型抽帧理解;识别文本和视觉描述交给语言模型;语言模型生成文字后,语音合成模块再把它读出来。系统还要另设对话管理器,决定何时开始生成、何时停止播放、用户插话后该保留多少上下文。

这种方案工程成熟、模块可替换、故障容易定位,在很多客服和会议场景中仍有很高价值。瓶颈来自模块边界。第一类问题是延迟累加。语音识别需要积累一定音频才能稳定解码,视觉模块要等待抽帧与编码,语言模型要等到足够完整的输入才开始推理,语音合成又要积累首段可播放音频。每一段单看可能只有几十或几百毫秒,串联后就会形成可感知的停顿。网络抖动、排队和跨服务调用还会放大尾部延迟。

第二类问题是信息压缩。语音经过识别后,音高、语速、犹豫、重音、笑声和情绪线索可能被压成普通文字;视频经过抽帧和描述后,视线方向、手势轨迹、物体刚刚出现的时刻也可能被简化。语言模型拿到的是多个模块整理过的摘要,原始信号里的细粒度关联已经损耗。用户指着镜头说“这个怎么装”,词语本身信息很少,答案依赖手指指向、零件位置、前几秒的操作和说话时机。若这些线索由不同模块异步提交,系统很容易指错对象。

第三类问题是错误传播。识别模块把专有名词听错,语言模型会基于错误文本认真推理;视觉模块遗漏了一个危险动作,后续模块通常无从恢复。各模块还可能采用不同时间戳和不同上下文窗口,造成声音与画面对不上。模块越多,调参目标也越容易冲突:为降低误触发而延长静音阈值,会让回答更慢;为追求抢答速度而缩短阈值,又会增加打断用户的概率。

因此,级联瓶颈并不等同于某个组件性能不足。它更像组织成本:信息在交接中变薄,时间在等待中增长,局部最优难以直接变成整体自然。

人机实时音视频全双工交互与统一流式模型
人机实时音视频全双工交互与统一流式模型

统一流式多模态解决了什么

SeedRealtime 的官方介绍强调统一架构和连续信息流。可以把这理解为三个变化。

其一,输入不再以“完整问题”为基本单位。音频帧和视频帧持续抵达,模型需要一边接收,一边更新对当前场景的判断。刚才是谁说话、用户看向哪里、手里拿着什么、任务目标是否出现,都属于随时间变化的内部状态。回答也可以在输入仍然继续时生成,输入通道与输出通道并行工作。

其二,声音、画面、文字共享同一段交互历史。视觉线索可以帮助消解同音词,声音可以提示镜头里谁正在发言,历史动作可以解释“刚才那个”的指代。官方展示的聚餐案例中,模型需要把多人外形、姓名、声音和各自旅行偏好持续对应;机场案例里,航班信息已经移出画面后,模型仍要调用先前看过的内容回答问题。这类能力依赖跨模态时序绑定,单张图片问答无法覆盖。

其三,“是否说话”也进入模型决策。传统系统常把内容生成和轮次控制分开:外部规则宣布用户说完,模型才获得回答权。统一流式模型可以综合语义、语气、视线、动作、环境声和对话历史,持续估计此刻应当倾听、简短附和、开始回答、停止输出,还是继续沉默。官方称 SeedRealtime 的轮次判断不再交给外部语音活动检测规则,而由模型基于多模态信息持续决策。

这里需要保持技术上的谨慎。官方目前公开的是产品说明、案例和人工评测结论,尚未在发布页面披露参数规模、训练数据构成、音视频编码方式、流式解码机制、首包延迟分位数、评测样本量及完整对照设置。统一架构也不意味着产品链路里完全没有音频前处理、编解码、传输、工具调用或安全模块。更稳妥的说法是:轮次、语义与多模态关联被更深地纳入主模型决策,模块之间最影响自然度的隔墙有所减少。

打断、轮次与语音活动检测是三件事

实时对话最容易被一个“检测到声音”的开关过度简化。语音活动检测通常回答:当前音频里有没有人声。它能排除一部分静音和背景声,却无法独立判断这段声音是否面向助手,也无法判断用户是否已经表达完整。

轮次判断回答的是:谁拥有当前话语权,以及话语权是否将要转换。用户说“我想订明天下午……”后短暂停顿,可能只是在回忆时间;说完“就这样吧”后仍有背景电视声,语义上已经结束。多人场景更复杂:旁人对用户说话、机场广播响起、孩子在远处喊叫,都含有人声,但未必构成给模型的新轮次。视频中的朝向、口型、手势和视线能提供额外证据。

打断处理还要再多一步。用户在助手说话时发出声音,可能是“嗯嗯”这类反馈,可能是笑声,也可能是纠正“停,不是周二,是周三”,还可能只是咳嗽。系统若一听见声音就停止,会显得敏感;若坚持播完,会显得强势。全双工模型需要区分附和、竞争性插话、紧急制止和无关声响,并决定暂停、终止、改写还是继续。停止播放也只是表层动作,模型还要知道用户听到了回答的哪一部分,避免恢复后重复整段内容或引用尚未播出的信息。

所谓自然节奏,因而不是单纯追求快。过早回答会抢话,过晚回答会冷场;极短确认适合立即发出,涉及安全或复杂操作的建议则应先看清环境。SeedRealtime 官方列出的节奏问题,正包括话未说完被抢断、话音已落却回应迟缓、背景杂音与闲聊误触发。人工评测中此类问题减少一半,是一个有意义的产品指标,但由于细节尚未公开,它更适合说明相对改进,暂时不宜被外推成所有语言、设备和场景下的固定收益。

全双工还要跨过回声自激

“边听边说”首先是一项声学工程挑战。手机或机器人扬声器播放模型语音时,麦克风会再次采集这段声音。若系统把回采音当成用户输入,轻则触发无意义识别,重则模型听见自己的话后继续回应自己,形成回声自激循环。房间混响、设备移动、音量变化、扬声器失真都会让回声路径持续改变。

声学回声消除通常利用即将送往扬声器的参考信号,估计它经过扬声器、空间和麦克风后的回声,再从采集信号中减去。全双工场景还存在“双讲”:助手与用户同时说话。回声抑制过弱,残余播放声会污染识别;抑制过强,又可能把用户近端语音一起削掉。IETF 关于 WebRTC 音频处理的规范把回声消除列为实时通信的重要要求,移动端全双工研究也常把回声消除、降噪、语音活动检测、说话人识别和轮次检测视为相互耦合的前端任务。

模型层面的语义判断可以容忍一部分残余回声,例如识别出某段内容与自己刚刚生成的语音高度一致。然而它无法替代稳定的声学链路。尤其在免提大音量、空旷展厅、车内、机器人机身振动或多扬声器环境中,前端质量会直接决定模型收到什么。原生全双工的产品体验,实际由设备声学、采集播放同步、网络传输、模型推理和轮次策略共同完成。

延迟应当拆开看

实时系统常用一个数字宣传延迟,但用户感受到的是一串时间。采集端有分帧和缓冲,网络有上行传输,服务端有排队和编码,模型有首个可输出单元的等待,语音合成有首包生成,下行与播放器又有抖动缓冲。视频还会带来帧率、曝光、编码和关键帧等待。

更合理的观察至少包括四类指标:用户表达结束至助手起声的响应延迟;用户开始插话至助手停止播放的打断延迟;关键视觉事件出现至模型提醒的感知延迟;长对话中的延迟分位数与抖动。平均值很好看时,少量长尾卡顿仍会破坏信任。对话节奏也要单独评价,因为低延迟系统完全可能频繁抢话。

统一流式建模有机会减少等待完整转写、完整视觉描述和整句文本生成的时间,并让语音输出更早启动。代价是在线计算持续发生,视频流尤其昂贵。系统可能需要动态采样:静态画面降低视觉频率,动作发生时提高采样;简单反馈走短路径,复杂问题分配更多推理预算。模型还需处理“先说后改”的风险。流式输出越激进,首字越快,后续发现新证据时越容易自我修正。自然交互追求的是可用的及时性、稳定性和正确性平衡。

主动视觉让助手开始“守望”

SeedRealtime 展示了几种主动视觉场景:在博物馆移动镜头中等待指定展品出现;观察咖啡制作过程,发现整粒咖啡豆被直接倒入萃取手柄后提醒;快速翻阅论文时,看到指定章节便叫停。共同结构是“持续观察+条件触发”:用户先交代目标,模型保留任务,在连续画面中检测状态变化,并选择合适时机开口。

这比单次拍照问答更接近现场助手,也带来新的产品问题。首先是触发阈值。目标只露出一角时要不要提醒?模型有多大把握?提醒太早会误报,提醒太晚会错过动作。其次是注意力分配。镜头里每秒都有变化,哪些变化与当前任务相关,哪些应忽略,需要任务记忆与视觉显著性共同决定。再次是表达成本。频繁播报会打扰用户,关键提醒又不能埋在长篇解释里。

主动视觉还意味着持续采集。产品应清楚说明摄像头何时工作、数据在哪里处理、是否留存、用户如何暂停,以及敏感画面怎样被屏蔽。对于儿童、家庭、办公区和公共场所,旁观者可能没有主动参与对话。能力越持续,权限提示、最小化采集和可见的关闭入口越重要。

机器人与客服:适用边界必须先画清

原生音视频全双工很容易让人联想到服务机器人、导览设备、远程售后和视频客服。它确实能改善多项体验:客户可以举着故障设备边操作边询问;模型在对方补充信息时停止长答;机器人能根据视线和指向判断服务对象;嘈杂门店里也有机会区分顾客与旁人谈话。主动视觉还能在步骤遗漏、目标出现或风险增大时及时提醒。

但“对话更像人”不等于“可以独立负责”。客服场景至少有四条边界。

第一,身份与责任边界。用户应明确知道对面是自动系统,重要承诺要可追溯。退款、理赔、账户冻结、合同变更等操作,需要清晰授权、规则校验和人工升级通道。流畅语音不能成为模糊责任主体的包装。

第二,知识与行动边界。模型可以解释流程、收集信息、调用受控工具,却不应凭语气自信地越权承诺。工具调用应采用最小权限,涉及支付、删除、开锁、改签等高影响动作时要二次确认,并把执行结果与语言生成分开校验。用户打断过程中,尚未确认的参数不能被当作最终指令。

第三,安全边界。维修、电气、医疗、驾驶和机械操作中,画面可能模糊、延迟或被遮挡。模型看到的只是摄像头视野,缺少温度、力反馈、内部故障等信息。此时应明确不确定性,优先给出停机、隔离和联系专业人员的建议。机器人若带有移动或机械执行能力,还需要独立的碰撞检测、速度限制、急停与安全控制器,语言模型不能承担最后一道物理安全防线。

第四,情绪与公平边界。全双工模型能利用语速、停顿和表情调整回应,但情绪推断存在误差,也可能触及敏感属性。客服系统不应利用用户焦虑推动消费,不应根据口音或表达习惯降低服务等级。对老人、儿童、语言障碍者和嘈杂环境用户,误打断率、转人工成功率与任务完成率都应单独评估。

因此,较稳妥的落地顺序是先进入可撤销、低风险、有人兜底的任务,例如导览、产品讲解、信息采集、标准化排障和学习陪练;再逐步扩展到受控工具操作。评价体系也要跳出“回答像不像人”,加入误唤醒、漏打断、抢话、错误对象识别、主动提醒误报、敏感操作确认、人工接管耗时和隐私合规等指标。

SeedRealtime 的意义与待答问题

SeedRealtime 把实时多模态交互的核心矛盾展示得很清楚:高水平问答只是基础,持续在线的模型还要管理注意力、时间和话语权。它需要记住画面里已经消失的信息,理解谁在对谁说话,听见插话后及时让出通道,抵抗旁人聊天与自身回声,并在用户没有逐句提问时选择是否提醒。

官方案例和已披露评测表明,统一音视频全双工路线已经进入大规模产品体验阶段。不过,外界仍需等待更完整的技术报告与基准数据,包括多语言表现、弱网和不同设备上的延迟、长时视频记忆、多人重叠语音、回声条件、主动提醒准确率、安全策略及计算成本。尤其是“节奏问题减少一半”这一结果,若未来公开评测定义、样本规模和置信区间,将更便于行业比较。

对开发者而言,SeedRealtime 带来的启示很务实:别再只优化回答内容。一次视频对话是否顺畅,取决于模型何时听、看哪里、记住什么、何时开口、何时停下,以及出错后能否安全交还给人。全双工的价值,最终要落在这些细小而连续的判断上。

来源

  1. 字节跳动 Seed,《SeedRealtime 音视频全双工大模型发布:走向全模态自然交互》,2026-08-05:https://seed.bytedance.com/zh/blog/seedrealtime-audio-visual-full-duplex-llm-released-toward-omni-modal-natural-interaction
  2. 字节跳动 Seed,SeedRealtime 项目主页:https://seed.bytedance.com/seedrealtime
  3. IETF,RFC 7874:WebRTC Audio Codec and Processing Requirements:https://datatracker.ietf.org/doc/html/rfc7874
  4. Full-Duplex-Bench: A Benchmark to Evaluate Full-Duplex Spoken Dialogue Models on Turn-taking Capabilities:https://arxiv.org/abs/2503.04721
  5. A Small-footprint Acoustic Echo Cancellation Solution for Mobile Full-Duplex Speech Interactions:https://arxiv.org/abs/2508.07561
分享到