客服录音里,用户说“没问题,我再等等”,文字看着很客气;但若这句话前面沉默了十秒,语速突然放慢,另一端的语音助手还在重复同一句答复,质检人员大概不会把它判作一次顺利沟通。把通话先转写,再让语言模型读文本,能处理“说了什么”,却未必保留停顿、重音、说话人交叠和音色变化。Modulate 正在把这块遗漏做成产品。
9 月 28 日,这家波士顿公司宣布获得 2500 万美元新融资,由 Future Ventures 领投,Hyperplane 和 Lakestar 参与;公司新闻稿称累计融资达到 6000 万美元,资金将用于模型研发、产品工程、开发者工具和合作网络。[1] 这条融资消息真正值得观察的不是金额,而是它把语音 AI 的投资方向指向“听懂”,而不只是“说得像人”。TechCrunch 对团队的采访也指出,Modulate 往往并不取代企业已有的语音服务,而是旁路分析通话,给出意图、风险和合规信号。[2]
音频原生,不等于不要转写
“先转写后理解”是很实用的工程路径:语音识别产出文字,语言模型在文字上做摘要、分类或问答。它的问题也具体。两个人同时说话,转写可能漏掉打断;讽刺与真诚可能落成同一句话;背景里的警报声、长时间沉默,未必被写进逐字稿。Modulate 所说的 audio-native,是分析时直接利用声音中的声学和会话信息,而不是只把识别文本交给后续模型。[3][4] 这不意味着文本不重要。该公司的系统包含语音识别,词语内容仍是证据之一;差别在于它不让转写稿成为唯一输入。
Modulate 把核心架构叫 Ensemble Listening Model,缩写 ELM。它不是一颗更大的端到端模型,而是让一百多个专门处理不同问题的组件共同工作:底层识别说话人数、停顿和语音片段;接着提取情绪、语调、压力或合成语音等线索;再结合语义判断意图、话语中的行为以及整段对话的事件。公司在 1 月发布 Velma 2.0 时,将这些工作划为基础音频处理、声学信号提取、感知意图、行为建模和会话分析五层,并描述了一个按时间对齐、汇合各组件结果的编排层。[3] 9 月的融资新闻稿仍将“超过一百个专门模型”作为技术主线。[1]
“按时间对齐”是这里最容易被忽略的设计。一次十分钟的通话,不该只有最后一句“满意/不满意”。Velma 产品页说,它会产生与具体时刻相连的分数和事件,并保留汇合判断所依据的底层信号;企业可以据此定位风险何时升高、谁在讲话、随后发生了什么,再把告警交给人工坐席或风控系统。[4] 这是一种输出与审计方式,不代表每一个主观判断都有可以独立复核的客观真值。尤其“情绪”“欺骗迹象”“真实意图”这类标签,不能被当成读心术。
它的出身也解释了产品取向。Modulate 最早在多人游戏语音环境中做内容审核,ToxMod 被用于《使命召唤》《GTA Online》等游戏的语音场景。玩家聊天噪声大、行话多、互相调侃与真正骚扰的边界难画;只看脏话关键词会漏掉语境,也容易误伤。公司后来把积累下来的分析能力扩展到客服、欺诈检测和语音智能体监测。[3] 这段经历提供了工程动机,但游戏里表现好,不会自动证明系统能适用于银行、医疗或不同语言地区的通话。
可以用在哪儿,哪些数字要打折看
今年 6 月,Modulate 宣布通过 Velma Enterprise API 开放其会话智能能力,目标是实时而非仅事后分析:识别潜在合成声音、通话中的操纵或升级风险、客户困惑与挫折,也检查 AI 坐席是否作出了不准确表述、违反政策或未正确回应客户需求。官方介绍的交付形态包括实时流或录音接入、API、webhook、看板和人工审核界面。[5][4] 这意味着企业的第一项工程不是“接一个更好的转写接口”,而是把输出对接到原有的质检、工单、反欺诈和升级处理流程。
新闻稿披露,Modulate 的模型每月分析超过 1000 万小时音频,历史累计处理超过 6 亿小时;并声称其语音识别和深伪语音检测在公开基准上排名第一,批量转写 API 定价每小时 0.03 美元,深伪检测在其引用的公开基准数据上准确率为 98.9%。同一新闻稿称,Velma 相对传统 LLM 的真正例检出准确度高两倍、误报少七倍,特定效率比较最高可达一千倍。[1] 这些是公司提供的口径,比较对象、数据集、阈值、任务定义和成本核算方式都决定结论;不能写成“任何真实通话都能识别 98.9% 的诈骗”,更不能把模型效率直接等同企业最终账单。1 月发布时公司还给出过“对话理解准确度高约 30%、成本效率高 10—100 倍”的不同表述,[3] 显然也不能跨测试口径硬拼成一条统一的性能曲线。
客户最该追问的是误报和漏报如何分布。深伪检测在标准数据集上识别干净的合成样本,与电话线路压缩、多轮转接、环境噪声、重口音、老年人声音和真人变声器混杂时的效果,不是一回事。欺诈事件通常基数很低:即使分类器总体准确率可观,只要把大量正常来电标成风险,人工复核队列就可能先被淹没。反过来,为了少打扰用户把阈值设得太高,又会漏掉值得拦截的行为。企业应在自身样本上分别报告精确率、召回率、每千通误报数、从风险出现到告警的延迟、人工审核耗时,而非只看一张公开榜单。
TechCrunch 采访中还有一个细节:公司称其系统如今运行一百多个模型,大致分为信号提取与意图/事件分析两类,并认为小模型可以按需求增加新能力,减少对特定高算力硬件的依赖;报道同时提到团队正在加强本地和设备端部署以改善隐私。[2] 这是公司的产品方向,不能因此宣称所有当前 API 都能在客户自己的手机或内网无条件运行。对医疗与金融客户,部署位置、音频留存、跨境传输、供应商访问权限往往比每小时便宜几分钱更重要。
该怎样试点
最合理的入口,是把它当“给人提供线索的听觉传感器”,不要直接授权它对人作出高风险裁决。先选一个有清楚处理动作的场景,比如客服对话中发现 AI 坐席反复答非所问,提醒人工接管;或者为已经由反欺诈系统标记的通话追加合成声音风险线索。把问题限定清楚:谁会收到提醒、需要多快、人工可以看到哪段录音和哪些时间戳、如果判断错了怎样撤销。没有这些流程,再漂亮的“理解情绪”分数也只是新仪表盘。
试点数据至少要包含安静与嘈杂环境、不同设备和线路、口音、年龄、语言切换、多人重叠、真实的非恶意玩笑,也要测试对方知道系统存在后是否容易规避。拿企业自己标注的难例做盲测,把转写稿加现有规则或 LLM 的基线放在一边比较;同时测响应延迟、接口失败的兜底、录音存储期限和实际单通成本。先让模型提示人工核查,确认误报成本可控后再考虑自动化动作。对涉嫌诈骗、儿童安全等高风险标签,建立复核和申诉机制,避免把不确定的声音特征直接归因给个人。
隐私问题尤其不能拖到采购后。声音能透露健康状况、身份特征与周围环境,还可能包含没有参与服务协议的第三人。企业应明确告知与合法处理依据,控制采集与访问范围,保存必要的最短片段,对模型训练或改进的数据用途单独审核。产品页称支持严格删除政策与企业安全实践,[4] 采购方仍需拿到可执行的合同条款和技术证据,不能把网页上的承诺当成审计完成。
音频原生模型还有一种特殊难题:标签本身会随场景变化。游戏中的高声喊叫,可能是队友配合而非威胁;客服里的沉默,可能是客户在找订单号而非不满。模型若只输出“愤怒概率 0.8”,却不告诉审核员触发点和通话前后的背景,现场人员很难判断该不该采取行动。Velma 所说的时间戳事件和底层信号链,[4] 应被当成复核入口:听取相关片段、结合对话上下文、确认是否存在其他解释。尤其涉及“欺骗”与“骚扰”的判断,应区分可观察到的特征、算法推断的风险和最终由人作出的事实认定。
从技术栈看,ELM 的模块化既是长处也是成本。新的合成语音手法出现时,可以更新相应的检测器,而不必每次重训整套大型模型;不同企业也能选择自己关心的信号。但多个模型的输出如果互相矛盾,编排层如何定权重、如何处理缺失片段、模型版本升级后是否改变历史分数,都需要可追踪的发布管理。单独一项检测在实验集上好用,接进复杂工作流后可能被语音识别错误、说话人分离错误或噪声叠加放大。供应商如果只能展示最后一个风险分,不能解释版本、输入质量和具体时间段,客户很难独立评估变更造成的影响。[3][4]
实时能力也应按任务拆开谈。呼叫中心需要在通话仍可挽回时提醒坐席,信任与安全团队处理游戏举报也许允许几分钟延迟,监管抽检甚至可事后批量运行。三者对延迟、吞吐和成本的权衡完全不同。公司给出的每小时 0.03 美元是“批量转写 API”的价格,[1] 不应直接拿它推算实时会话理解、深伪检测、事件编排、录音存储和人工复核的总拥有成本。采购时索取完整计费单位和峰值并发测试,比只比较发布会上的单项价格更可靠。
这里还存在组织边界。质检部门关心客户是否被理解,反欺诈部门关心钱是否被转走,安全部门关心欺凌或诱导,法务部门关心录音的合法用途。同一套音频模型可能给这些部门提供不同信号,但不应该让所有部门默认听见完整录音。设计上可以把风险事件与原音频分开存放,普通坐席只看必要提示,经过授权的复核人员才访问对应片段;模型供应商的运维权限、客户删除请求和数据导出则另列流程。平台声称可对接现有语音基础设施,[4] 真实可行性还要看企业当前通话路由、录音加密和身份体系。
融资本身说明资本愿意押注这层“理解能力”,却不能替客户验证模型。9 月新闻稿提到健康机构保护、儿童安全、社交平台治理等多类用途,[1] 这些问题的伤害成本与容错空间差别很大。一个通用的“准确率”无法为所有用途背书;尤其遇到弱势群体、方言或跨文化交流,应有独立的分组评估,且允许用户质疑和纠正机器记录。这样的实施成本不在模型参数里,却往往决定项目能否长期使用。
如果企业已经有成熟的转写加 LLM 质检系统,也没有必要为“音频原生”四个字推倒重来。把两种方案放到相同的录音集合上:哪类问题是全文本基线稳定漏掉、而声学信号能够补出的?引入后每减少一次人工漏审需要付出多少误报、算力和录音访问成本?如果结果只是在普通主题分类上小幅改善,技术新颖未必对应业务价值;如果能在客户尚未挂断时可靠发现升级风险,时间优势可能比总准确率更值钱。衡量对象应该是业务事件,而不是供应商自选标签的展示效果。
对合成声音检测尤其要守住证据门槛。一个电话被标作“疑似深伪”,最多是触发额外身份核验的理由,不宜直接作为冻结账户、拒绝服务或指认当事人的唯一依据。攻击者会换模型、改采样率、加入真实噪声;正常用户也可能因为助听设备、网络压缩或疾病改变声音。企业需要留下可以申诉的人工通路,既保护资金,也避免因声学差异把合法客户挡在门外。
Modulate 的路径并非“语言模型不再有用”。文本摘要、知识检索和后续服务仍可能由语言模型处理。它提出的是一个更窄也更实际的判断:人在声音中表达的信息,比逐字稿多。企业是否需要为这些额外线索付费,最终取决于它能否在自己的通话、自己的风险阈值和自己的人工流程中,稳定地少漏掉真正重要的事。
原始资料与采访
[1] Modulate 新闻稿,2026-09-28,Modulate Raises $25M to Scale Its Lead in Frontier Audio-Native AI(ACCESS Newswire 发布;以下为转载全文):https://www.finanznachrichten.de/nachrichten-2026-09/69694953-modulate-raises-dollar-25m-to-scale-its-lead-in-frontier-audio-native-ai-200.htm ;原始发布页:https://www.accessnewswire.com/newsroom/en/computers-technology-and-internet/modulate-raises-25m-to-scale-its-lead-in-frontier-audio-native-ai-1227713
[2] TechCrunch,2026-09-28,Modulate raises $25M for its voice models and analysis suite(含创始人采访):https://techcrunch.com/2026/09/28/modulate-raises-25m-for-its-voice-models-and-analysis-suite/
[3] Modulate,2026-01-20,Modulate Unveils the Ensemble Listening Model (ELM):https://www.modulate.ai/press-releases/modulate-unveils-the-ensemble-listening-model-elm-a-fundamentally-new-ai-architecture-optimized-for-accuracy-transparency-and-cost
[4] Modulate Velma 产品与方法页:https://www.modulate.ai/velma
[5] Modulate,2026-06-03,Modulate Expands Velma Platform with Voice-Native Real-Time Conversation Intelligence for Enterprises:https://www.modulate.ai/press-releases/modulate-expands-velma-platform-with-voice-native-real-time-conversation-intelligence-for-enterprises