标签: 音频原生模型

0

不把声音先压成文字:Modulate 的音频原生模型想听见什么

客服录音里,用户说“没问题,我再等等”,文字看着很客气;但若这句话前面沉默了十秒,语速突然放慢,另一端的语音助手还在重复同一句答复,质检人员大概不会把它判作一次顺利沟通。把通话先转写,再让语言模型读文本,能处理“说了什么”,却未必保留停顿、