标签: 实时语音

0

GPT‑Live‑1把语音代理推入“边听边说”时代:实时模型真正难的不是声音,而是打断、状态与工具协同

OpenAI在API中上线GPT‑Live‑1,主打全双工实时语音:系统能够在输出语音的同时继续接收用户声音,处理自然打断、背景噪声和长对话,并把复杂推理或工具调用交给后端模型。OpenAI称其在Full Duplex Bench上较GPT‑Realtime‑2.1提升30个百分点,语音前端价格为每分钟0.05美元。厂商自报基准仍需第三方复现,但产品方向十分明确:语音AI正从“录音—转文字—生成—合成”的轮次式管线,走向持续感知、实时决策和多模型协作。对电话客服、设备运维、车载助手和工业现场而言,决定体验的将不再只是识别准确率,而是端到端延迟、打断恢复、噪声鲁棒性、工具安全与业务状态一致性。

0

AI技术每日分析-20260514

今日国际AI主线不是单一模型刷榜,而是“能力进入生产环境以后,安全、部署和交互方式同步升级”。微软在5月12日披露,其多模型智能体安全系统已经在公开基准和内部测试中达到较高漏洞发现效率,把AI从辅助审计推进到接近生产级漏洞研究工具。Google则把二进制透明度扩展到Android生态中的Google签名应用,为端侧AI时代的软件完整性建立更可核验的公开账本。OpenAI连续释放两条企业化信号:一是5月11日成立Deployment Co…