听懂七大方言之后:Qwen Audio 3.0 ASR Flash 如何重做语音识别的产品边界

摘要:Qwen-Audio-3.0-ASR-Flash把实时流式、短音频识别和最长12小时文件转写拆成三条服务链路,并围绕30个语种、汉语方言、热词、Context、时间戳和说话人分离补齐生产接口。语音识别的竞争正在从单纯听写转向可直接进入业务流程的数据能力。

2026 年 7 月 30 日,阿里云百炼上线 Qwen-Audio-3.0-ASR-Flash 系列,覆盖实时流式、短音频同步识别和最长 12 小时文件转写。它把 30 个语种、汉语方言、上下文增强、热词、时间戳与说话人分离装进三条不同的服务链路,目标是让 ASR 从单纯“听写”进入可直接接入生产系统的阶段。

语音识别已经是一项高度成熟的 AI 能力。手机输入法、会议纪要、客服录音质检和视频字幕每天都在使用 ASR,用户也很容易形成一种错觉:既然普通话转文字已经做得很好,语音识别似乎只剩下速度和价格竞争。

复杂业务会迅速打破这种印象。一场工厂检修会议里可能同时出现地方口音、设备型号、英文缩写和数字参数;客服通话常有电话窄带、背景噪声与多人插话;直播字幕要求边说边出字,还要及时断句;金融双录需要区分说话人、保留时间戳,并把金额、日期转成统一格式。识别结果错一个字,有时只是字幕瑕疵,有时会改变工艺参数、合同金额或质检结论。

Qwen-Audio-3.0-ASR-Flash 的看点,因而不局限于“增加了多少语言”。这次发布把同一代语音识别能力拆成三种服务形态,并围绕中文方言、专业术语、长文件和结构化输出补齐工程接口。理解这三条产品线的差别,比记住一个模型名称更重要。

Qwen Audio 3.0 ASR Flash覆盖实时、短音频和长文件转写

三个模型,分别处理三种时间尺度

阿里云在 7 月 30 日同时新增三个模型 ID:

模型 工作方式 接口 单次时长/大小 典型用途
qwen-audio-3.0-asr-flash-streaming 实时流式 WebSocket 音频时长不限 直播字幕、在线会议、语音助手
qwen-audio-3.0-asr-flash 非实时短音频 HTTP 5 分钟以内;文件大小按最新接口文档确认 语音消息、短视频、单段录音
qwen-audio-3.0-asr-flash-filetrans 非实时整文件 HTTP 异步任务 最长 12 小时、最大 2GB 会议、访谈、客服质检、金融双录

三者共享多语种、方言、热词、Context上下文增强和时间戳等能力,输出形态并不完全相同。Streaming默认返回句级与字词级时间戳;两个非实时模型的时间戳固定开启。只有Filetrans长文件版额外支持说话人分离,更适合回答“谁在什么时间说了什么”;5分钟短音频版追求接口简单和快速返回,不承担长任务调度。

短音频版的时长上限明确为5分钟;文件大小在阿里云帮助文档中仍存在新旧口径并存:最新音频规格表列为2GB,另一处说明仍保留10MB。生产接入前应按实际输入方式和最新API文档确认,不能只依赖单张选型表。

这种划分来自计算与交互约束。实时 ASR 需要持续接收小块音频,并不断返回可修改的中间文本;文件转写可以看到完整音频,允许更充分地利用后文修正前文,还要完成分段、说话人聚类和结果文件生成。若用一套接口勉强兼顾所有场景,开发者往往会在延迟、稳定性和输出结构之间反复妥协。

还需注意命名。Qwen-Audio-3.0-ASR-Flash是此次新增的百炼云服务系列,与百炼Qwen-ASR系列(qwen3-asr-*)以及QwenLM开源Qwen3-ASR权重属于不同产品和部署形态,不能只凭名称互换端点。前者不支持情感识别;百炼Qwen3-ASR支持七类情感,但实时版本当前不返回时间戳,也不支持同一WebSocket连接复用。生产接入时,应以完整模型ID和对应文档为准。

流式识别难在哪里:模型要在未来到来之前做决定

离线转写可以读完整句话,再决定前半句如何断词和加标点。实时系统没有这份便利。用户说出“今天下午三点……”时,后面可能接“停机检修”,也可能接“开始试生产”。字幕必须先显示已有内容,同时保留修订空间。

一套流式 ASR 链路通常包含音频解码、语音活动检测、声学特征编码、增量解码、文本归一化和结果提交。Qwen-Audio-3.0-ASR-Flash-Streaming 通过双向 WebSocket 接收连续音频,客户端发送音频块,服务端返回中间结果与最终句子。官方 SDK 示例常用8kHz或16kHz采样率,当前音频规格表则标注支持任意采样率,并列出PCM、WAV、MP3、Opus、Speex、AAC、AMR等格式,覆盖电话录音、浏览器、移动端和常见媒体文件。

其中最影响使用体验的组件之一是 VAD,即语音活动检测。它要判断人是否还在说话。静音阈值太短,短暂停顿就会被切成两个句子;阈值太长,字幕迟迟不提交,语音助手也会显得反应迟钝。该系列通过 max_sentence_silence 配置句末静音阈值,单位为毫秒。开发者需要根据场景调节:实时对话重视低延迟,会议纪要更在意句子完整,演讲和古诗朗诵还会出现具有语义作用的长停顿。

流式输出通常有“暂定”和“确认”两种状态。模型在接收更多音频后可能改写中间文本;当 VAD 判定句子结束,才发出最终结果。前端若把每个中间结果直接追加到页面,就会产生重复文字。正确实现应依据事件状态替换当前未确认片段,再把最终句子写入稳定区。

连接管理同样属于识别质量的一部分。官方文档说明,Streaming 的 WebSocket 可在一个任务完成后复用:客户端发送 finish-task,等待服务端返回 task-finished,随后用新的 task_id 开始下一项任务;空闲 60 秒仍无新任务,连接会自动断开。生产系统还要配置心跳、断线重连、音频缓冲和幂等处理。若网络重连后丢失两秒语音,模型本身再准确也无法恢复缺失内容。

方言覆盖的意义,不等于所有方言精度相同

官方发布摘要称,新系列支持汉语传统七大方言体系——官话、吴语、湘语、赣语、客家话、闽语和粤语,并覆盖 20 多种地区官话口音。具体接入文档进一步列出普通话、粤语、吴语、闽南语、客家话、赣语、湘语、晋语,以及中原、西南、冀鲁、江淮、兰银、胶辽、东北、北京、港台等口音范围。

方言识别比“带口音的普通话”复杂得多。口音主要改变发音,方言还可能拥有不同的音系、词汇和语法。同一个词在不同地区可能发音差异明显,某些方言还存在连续变调、文白异读和大量口语化表达。训练数据分布也极不均衡:普通话和粤语拥有较多公开或商业语料,小众方言的数据规模、转写规范和标注一致性往往不足。

因此,“支持七大方言体系”首先表示模型和接口允许这些语音进入识别范围,不能自动推导出每个方言、每个地区、每种噪声条件都达到相同错误率。阿里云当前公开页面没有给出按语种和方言拆分的统一字符错误率,也没有公布与 Whisper、Paraformer 等系统在同一测试集上的横向结果。采购或上线前仍要用自身录音做盲测,尤其应覆盖重口音、混合普通话、多人交叠和专业词汇。

中文 ASR 常用字符错误率 CER:

$$
CER=\frac{S+D+I}{N}
$$

其中,$S$、$D$、$I$ 分别是替换、删除和插入字符数,$N$ 是参考文本字符总数。英语等以词为基本单位的语言常用 WER。企业评测还应增加数字准确率、专有名词召回率、断句准确率、时间戳偏差和说话人混淆率。只报告一项总体 CER,可能掩盖金额、设备编号等低频高风险错误。

30 个语种背后,更值得看的是混合场景

Qwen-Audio-3.0-ASR-Flash 系列扩展到 30 个语种,包括中、英、日、韩、越南语、泰语、印尼语、马来语、菲律宾语、印地语、阿拉伯语,以及多种欧洲语言。实时接口可以通过 language_hints 提示候选语种,最多设置四个值;不设置时由模型自动识别。

多语种支持的实际价值经常出现在混合语音里。技术会议会在中文句子中穿插 GPU、PID、CAE、MCP 等缩写,跨国客服可能在品牌名、地址和产品型号之间切换语言。传统做法先做语种识别,再把整段送入单语模型;一旦前置判断错误,后面的识别会整体偏离。统一多语种模型有机会利用上下文处理局部切换,具体效果仍需围绕代码切换比例和行业词表测试。

官方还强调中文古诗词优化。古诗词的困难包括文言词序、罕见词、同音字密集,以及韵律停顿与现代标点不完全一致。专项优化可以服务课堂讲解、有声读物和文化内容数字化,但现有资料未给出独立古诗词测试集和准确率。更稳妥的工程方案,是把模型能力与篇目库、作者名录、诗句检索或后处理校对结合,减少同音误写。

热词与 Context:从词表加权走向条件化识别

Qwen Audio 3.0 ASR Flash面向方言、行业术语和生产系统

工业、医疗、金融和政务语音的主要障碍,往往集中在低频专有名词。比如“轴承座内孔圆跳动”“聚醚醚酮”“脓肿分枝杆菌”,在通用语料中出现较少,却可能是整段记录最有价值的信息。

Qwen-Audio-3.0-ASR-Flash 提供两种增强路径。

第一种是热词。开发者预先提供品牌名、人名、型号和术语,并为它们设置权重,使解码器在声学证据接近时更倾向于这些候选。热词适合明确、稳定的词表,优点是控制直接;词表过大或权重过高也可能产生“硬猜”,把相近发音误识别成热词。

第二种是 Prompt Context。开发者可以在请求中描述会议主题、行业背景或对话历史,例如“这是一场关于油气管网压缩机预测性维护的会议,涉及振动、轴温、喘振和 SCADA”。模型由此获得比孤立词表更丰富的语义条件,能够利用词语之间的关联消除同音歧义。Context 的价值在于按请求动态变化,无需为每次会议重新创建固定词表。

两种机制适合组合使用:把高风险、必须准确的术语放进热词,把业务背景、人物角色和当前议题放进 Context。企业还应记录每次请求使用的词表与上下文版本,方便复现错误和回归测试。若模型更新后同一段音频输出变化,没有版本化配置就很难判断差异来自模型、热词还是提示上下文。

从声音到可用文本,还差三层后处理

“听对字”只是转写链路的一部分。文档、字幕和质检系统还需要文本归一化、标点、时间对齐与说话人结构。

Qwen-Audio-3.0-ASR-Flash 强化了标点预测和文本归一化。口语中的“二零二六年七月三十日”“三万五千元”“百分之零点八”,可以转成更适合阅读和计算的标准形式。这个过程通常称为 ITN,即逆文本归一化。它提高可读性,也带来新的校验需求:编号“二零零三”究竟应输出 2003,还是保留为字符串“2003”;“一二零”可能是数值、编号或急救电话。业务系统应对金额、日期、身份证号和设备编码做格式与范围检查。

实时模型默认返回句级和字词级时间戳,单位为毫秒。句级字段标识整句开始和结束,字词数组记录每个单元的起止时间及其后标点。它可以驱动字幕对齐、关键词高亮、录音点击回放和质检证据定位。中间识别结果的结束时间可能为空,只有句子确认后才能作为稳定标注使用。

长文件版额外支持说话人分离。其目标是把音频片段聚类为 Speaker 1、Speaker 2 等身份,再和转写句子绑定。Filetrans通常支持最长12小时、最大2GB,但启用说话人分离时官方建议音频不超过2小时,并要求单声道输入,否则可能失败或超时。说话人分离并不等于身份识别,系统通常只知道“这是同一个声音”,并不知道此人姓名。若会议中多人音色接近、频繁打断或使用远场麦克风,聚类可能发生串人,关键会议仍需人工抽查。

价格已经低到可以按“每小时”算账

阿里云百炼按输入音频秒数计费,输出文本不另收费。官方原价显示,华北 2(北京)地域的 Streaming 为 0.00033 元/秒,短音频版和 Filetrans 均为 0.00022 元/秒。换算后,实时识别约 1.188 元/小时,离线转写约 0.792 元/小时

以每月处理 1 万小时录音为例,仅模型调用原价约为:实时 11,880 元,离线 7,920 元。新加坡地域面向国际部署,Streaming 为 0.00066 元/秒,即 2.376 元/小时;两个非实时版本为 0.00026 元/秒,即 0.936 元/小时。上述计算未包含存储、网络、音视频预处理、结果校验和应用开发成本,也未考虑限时优惠。

北京地域三个模型ID各自提供36,000秒、也就是10小时免费额度,并非系列共享;有效期为自开通百炼、模型发布或申请通过之日起90天,以较晚者为准,新加坡没有这项免费额度。两个非实时模型的限额为600 RPM,Streaming为1200 RPM,也就是20 RPS。对于长文件业务,RPM并不直接等于吞吐量:一个12小时文件和一个30秒文件都占一次提交请求,后台排队、并发任务数、结果回调和文件下载才会决定整条链路的处理能力。

高并发文件转写适合使用异步任务和事件回调。官方生产建议指出,任务查询接口默认 20 QPS,最高可扩至 100 QPS;若大量任务不断轮询状态,很容易把查询端点打满。通过 EventBridge 在任务完成时主动推送结果,可以减少无效查询。音频应先上传对象存储,再以 URL 提交,同时配置指数退避、失败重试和结果幂等。

企业落地时,应该怎样评测

Qwen-Audio-3.0-ASR-Flash 公开资料提供了覆盖范围、接口规格和价格,但没有给出统一公开测试集上的 CER/WER、实时率 RTF、首字延迟与终句延迟。这意味着选型不能只看产品页,也不宜直接用不同厂商在不同数据集上公布的数字排序。

一套较完整的企业评测至少应包含以下五组样本:安静近场语音、电话 8kHz 窄带、远场与背景噪声、方言及口音、多人交叠。行业术语、数字、单位、英文缩写和人名应单独统计。实时场景还要测首个中间结果延迟、最终结果延迟、字幕回改次数和长连接稳定性;长文件场景则要测实际处理倍率、说话人混淆率、时间戳偏差和失败重试率。

评测集应来自自身业务,并保留一部分从未用于调词的盲测数据。若所有样本都用于反复调整热词和 Context,得到的高分很可能无法代表新来电、新设备或新会议。涉及医疗、金融和工业控制时,关键数字与术语还应进入规则校验或人工复核队列。

数据合规同样需要提前设计。这一系列目前以云服务方式提供,业务音频会发送到指定地域的服务端。企业要明确录音授权、数据分类、保存期限、跨境要求和访问审计。北京与新加坡使用不同地域的 API Key 和服务地址,选择地域不能只按网络延迟决定。

结语

Qwen-Audio-3.0-ASR-Flash 的产品思路很清楚:实时版解决边说边出字,短音频版降低简单调用门槛,Filetrans 负责最长 12 小时的结构化转写;多语种和方言扩大输入边界,热词与 Context 处理行业词汇,时间戳、说话人分离和文本归一化把结果推向可用数据。

它也保留了需要验证的空白。官方尚未公布按方言、噪声和场景拆分的错误率,流式延迟与长文件处理倍率仍需实测;“支持 30 个语种”描述的是能力范围,企业采购关心的则是自有录音上的稳定精度。

语音识别下一轮竞争,很可能集中在四项工程指标:复杂口音能否听懂,专业词能否通过上下文快速适配,长时间运行能否保持稳定,识别结果能否直接进入业务流程。模型已经把每小时调用成本压到一元左右,数据质量、场景评测与系统集成将决定最终效果。


参考资料

  1. 阿里云百炼:模型上下架与更新——2026 年 7 月 30 日新增 Qwen-Audio-3.0-ASR-Flash 系列
  2. 阿里云百炼:语音识别模型选型与能力对照
  3. 阿里云百炼:Qwen-Audio-3.0-ASR-Flash-Streaming模型信息
  4. 阿里云百炼:Qwen-Audio-3.0-ASR-Flash模型信息
  5. 阿里云百炼:Qwen-Audio-3.0-ASR-Flash-Filetrans模型信息
  6. 阿里云百炼:实时语音识别用户指南
  7. 阿里云百炼:非实时语音识别用户指南
  8. 阿里云百炼:模型调用价格
  9. 阿里云百炼:模型调用限流
  10. GitHub:QwenLM/Qwen3-ASR

注:文中价格为官方页面显示的原价,地域、免费额度和活动价格可能调整;能力与限制以实际调用地域的最新文档为准。官方未公布的模型参数量、训练数据规模和统一横向准确率,本文未作推测。

分享到