大模型接口返回 200,不代表任务成功:LLM 应用的韧性工程
传统后端服务里,错误通常有清晰信号:连接超时、HTTP 500、字段校验失败或数据库事务回滚。大模型应用增加了一类更麻烦的状态——调用在技术上完全成功,模型也输出了合法文本甚至合法 JSON,但内容不可用、事实错误、遗漏约束,或者生成了会让后续工具执行危险动作的参数。
传统后端服务里,错误通常有清晰信号:连接超时、HTTP 500、字段校验失败或数据库事务回滚。大模型应用增加了一类更麻烦的状态——调用在技术上完全成功,模型也输出了合法文本甚至合法 JSON,但内容不可用、事实错误、遗漏约束,或者生成了会让后续工具执行危险动作的参数。
1993 年,一支身处巴格达的开发团队用 Motorola 68000 汇编语言为 Amiga 编写了益智平台游戏《Babylonian Twins》。三十三年后,原作者借助大语言模型,把这套几乎没有现代工程文档、与特定硬件紧密耦合的代码迁移到了 Godot 引擎。表面上看,这只是一次带有怀旧色彩的游戏复刻;从工程角度看,它更像一场小型实验:当模型能够阅读汇编、调用旧工具链、对比二进制并生成现代语言实现时,遗留软件迁移的成本结构会发生怎样的变化?
大语言模型最让人觉得“违反直觉”的优化之一,是Speculative Decoding。自回归模型在逻辑上必须一个Token接一个Token生成:第51个Token取决于前50个,没看到第50个就无法确定第51个。既然这个因果链不能打...
智能体模型更主动、更擅长工具调用和多步执行,同时可能省略澄清、假设与交接。本文分析执行目标如何影响沟通,并提出执行接口、沟通接口和协作评测的设计方法。
MoE把模型容量与单Token计算量拆开,也把显存、KV Cache、路由通信和设备利用率带入成本核算。本文结合dots3-note与Qwen3.8-27B分析本地部署的完整账单。
Oversight Board 对10款商业模型的测试发现,当批评对象来自言论限制较多的国家时,模型拒绝生成政治批评材料的概率从14%升至34%。这提示基础模型可能把某些司法辖区的限制外溢给全球用户。
Unslop对12750篇arXiv论文的检测显示,2026年初接近39%的论文被标记为机器写作,计算机科学过去12个月比例达到65%。这些数字可以说明AI辅助写作正在扩散,却不能直接作为学术不端或AI代写证据。
智谱被曝落地1GW级国产AI算力数据中心,并完成对中科加禾的收购。1GW首先是电力规模,不等于模型算力指标。国产AI芯片下一阶段的考验,将从单卡性能转向大集群稳定运行、异构调度和有效利用率。
中国开放权重模型正在把全球AI竞争从单纯模型能力比拼,推向成本、部署、开发者生态和产业落地的综合竞争。模型影响力不再只来自一次发布或一张榜单,而会沉淀在代码、服务器、业务系统和日常工作流程中。
路透社报道称,中国商务部正与国内主要科技企业讨论,研究是否限制海外访问中国最先进的 AI 模型。这一信号说明,AI 出口管制正在从芯片、设备和算力,进一步走向模型能力本身。
DeepSeek 开源 DeepSpec,把投机解码从论文概念推进到训练、评估和部署工具链。大模型竞争正在从参数规模转向单位 token 成本。
2026 年油气行业峰会把算力底座、AI 大模型、工业软件、安全生产放在同一张图景里讨论。这说明油气行业的数智化已经过了“有没有 AI”的阶段。
过去我们谈 AI 芯片,最习惯盯着算力、制程和 GPU 数量,但最新数据说明,AI 芯片里真正吞掉成本大头的,已经不是逻辑计算单元,而是高带宽内存 HBM。随着模型变大、上下文变长、并发推理增加,AI 基础设施的竞争逻辑正在从“谁有更多算力”转向“谁能更便宜、更高效地拿到并利用内存”。
大模型竞争越来越像一场全球统一命题的高考。每家公司都能讲自己的故事,但一旦进入公开测评、盲测榜单、数学证明、代码修复和长任务Agent场景,故事就会被压缩成一句话,你到底考了多少分。
如果这轮融资最终落地,它的意义绝不只是DeepSeek拿到一笔钱,而是中国AI产业、国资资本和算力自主路线的一次重新对齐。
哈佛医学院发表于《Science》的一项研究显示,推理型大模型在急诊分诊等临床任务中部分表现已超过人类医生,尤其在信息最少、决策最紧迫的早期阶段更具优势。这并不意味着AI将取代医生,但它很可能正在重新定义医疗系统中的第二意见、漏诊提醒和临床推理辅助。
Musk与Altman的OpenAI世纪审判进入第三天,Musk在交叉质询中承认未阅读OpenAI转营利细则,法官制止其"AI灭绝论"发言。Meta一季度营收563亿美元同比增33%,但将2026年AI资本开支上调至1250-1450亿美元,盘后股价暴跌7%。Alphabet一季度Google Cloud营收200亿美元同比增63%,GenAI产品收入同比增近800%,AI资本开支上调至1800-1900亿美元。五大科技巨头2026年AI资本开支总额有望突破6500亿美元。
过去几年,我们讨论 AI 招聘时,最担心的问题通常是:它会不会歧视女性?会不会歧视少数族裔?会不会把学历、年龄、地域、学校背景变成隐形门槛? 但一篇新论文提出了一个更微妙、也更容易被忽视的问题:当求职者用 AI 写简历,企业也用 AI 筛简历时,模型会不会偏爱“自己写出来的简历”? 这个问题听起来像科幻,却已经进入了现实招聘场景。论文《AI Self-preferencing in Algorithmic Hiring》研究的正是这种现象:大语言模型在充当评审者时,是否会系统性地偏好由自己生成的内容,而不是人类写的内容,或者其他模型生成的内容。作者将其称为 AI self-preferencing,也就是“AI 自我偏好”。 这件事真正危险的地方,不在于模型“有意识地偏心”,而在于它可能通过文风、句式、表达结构、信息组织方式,识别出某种熟悉的语言模式,然后把这种熟悉感误判成“更专业”“更清晰”“更适合岗位”。 换句话说,未来招聘中真正吃亏的人,可能不是能力差的人,而是没有用对同一个 AI 工具的人。
DeepSeek 今天正式推出 V4 系列模型预览版并同步开源,一次性发布 V4-Pro 和 V4-Flash 两个版本。最大的变化不是某项跑分又刷新了,而是一个产品决策:百万 token 上下文,全线标配,不额外收费。这意味着长上下文从"高端选配"变成了基础能力。
MIT与国际数学奥林匹克体系相关团队推出MathNet,号称全球最大的奥数级数学题与解答数据集。它覆盖40多年、47个国家、17种语言、约3万道题,不只是给模型“刷题”,更是在逼问今天的大模型究竟有没有真正的抽象推理能力。