摘要:Anthropic发布Claude Opus 5,强调以Opus 4.8相同价格提供接近Claude Fable 5的能力,并增加多档推理强度、百万Token上下文和更长输出。
**摘要:**Anthropic发布Claude Opus 5,强调以Opus 4.8相同价格提供接近Claude Fable 5的能力,并增加多档推理强度、百万Token上下文和更长输出。对企业而言,模型采购已经不能只看一次评测成绩,还要计算任务总成本、长流程可靠性和数据治理成本。所谓“不设置数据保留要求”,也需要结合产品渠道、合同、日志和第三方云平台具体判断。
7月24日,Anthropic发布Claude Opus 5。
官方将其定位为面向编码、企业知识工作和复杂智能体任务的高性能模型,并称它能够以更低成本接近Claude Fable 5的前沿能力。模型提供多档推理强度,企业可以根据任务难度,在响应质量、延迟和成本之间进行选择。
Claude Opus 5的API价格为每百万输入Token 5美元、每百万输出Token 25美元;快速模式约为默认速度的2.5倍,价格约为基础模式的两倍。模型支持100万Token上下文、最高12.8万Token输出,并默认启用思考模式。
这些指标很容易被做成一张模型参数表。
企业更需要回答三个问题:完成一个业务任务总共花多少钱,长流程能不能稳定做完,业务数据最终留在哪里。
第一笔账:任务总成本
API单价只是模型成本的一部分。
一个智能体处理合同审查,可能需要读取文档、检索知识库、调用规则引擎、生成修改建议,再根据人工反馈重新执行。模型能力稍弱时,可能需要更多轮对话、更多工具调用和更多人工纠错。
因此,价格更低的模型未必带来更低的任务成本。
企业需要统计一次任务消耗的输入输出Token、执行时长、工具调用次数、失败重试次数和人工介入时间。
假设模型A单价较高,却能一次完成任务;模型B单价较低,却需要三次重试并产生大量输出,最终成本可能反而更高。
Anthropic强调Opus 5更擅长自我检查、根据结果继续迭代和完成端到端任务,这些表述目前主要来自厂商评测和客户案例,需要由企业自己的测试集验证。
推理强度成为成本控制旋钮
Claude Opus 5提供从低到最高的多档推理强度。
简单分类、格式转换和信息提取可以采用较低强度;复杂代码修改、科研分析和长链规划可以提高推理预算。
这种设计意味着企业不必为所有任务支付同样的计算成本。
模型路由系统可以根据任务类型自动分配推理强度:先由小模型判断难度,再选择Opus 5的不同档位;低风险任务直接执行,高风险任务增加验证和复核。
推理强度由此从模型内部参数,变成企业可以管理的资源。
第二笔账:长流程可靠性
很多模型在单轮问答中表现良好,进入几十步任务后容易发生偏移。
智能体可能忘记最初目标,重复调用工具,修改了不该修改的文件,或者在中间步骤失败后继续输出看似合理的结果。
企业关心的不只是“模型是否会做”,还包括:
同一任务重复执行十次,成功率是否稳定;工具调用失败后能否恢复;是否会在未经确认时扩大操作范围;生成结果能否通过规则和测试验证;处理时间是否符合业务节拍。
Anthropic在发布材料中突出Opus 5的检查和迭代能力,目标正是提高复杂任务的完成率。
不过,厂商基准不能替代企业验证。
软件开发团队应使用真实代码库和持续集成测试;制造企业应使用工艺规则、设备数据和历史故障案例;金融和法律团队还要测试错误引用、遗漏条款和合规风险。
百万Token上下文不等于无限记忆
Opus 5支持100万Token上下文,可以一次处理大型代码库、长文档和大量历史记录。
上下文越长,输入成本越高,关键信息也可能被大量无关内容稀释。
企业不应把所有资料直接塞进上下文。更合理的方式是先做权限过滤、语义检索和结构化提取,再把与当前任务相关的内容交给模型。
百万Token上下文提供了容量上限,知识治理仍然决定模型能否找到正确证据。
第三笔账:数据治理
Anthropic称,与此前Opus系列一致,Claude Opus 5的一般访问方式不设置数据保留要求。
这句话不能直接理解成所有场景都“零留存”。
企业还要确认具体使用渠道:是Anthropic直接API,还是通过第三方云平台;是否启用了日志、缓存和错误分析;用户是否主动提交反馈;数据是否进入企业自己的观测平台;合同中如何约定保留周期和模型训练用途。
模型厂商不强制保留数据,也不意味着企业内部系统没有保存调用记录。
对于工业图纸、源代码、客户资料和医疗数据,企业需要形成完整的数据流向图,明确哪些数据离开本地、经过哪些服务、保存多长时间,以及谁有权查看。
成本和数据之间存在联动
企业为了降低Token费用,可能会使用缓存、会话记忆和调用日志。
这些技术可以减少重复输入,却会增加数据留存范围。为了提高智能体可靠性,企业也会保存完整轨迹,用于回放和审计。
所以,低成本、可追溯和最小化留存之间存在权衡。
敏感任务可以采用短期加密缓存,达到目的后自动删除;审计记录可以只保存必要元数据,对原始内容进行脱敏;高敏感数据则可以使用本地模型或私有部署。
企业采购模型的方式会改变
过去采购软件时,企业往往选择一个主产品长期使用。
模型迭代速度快,能力和价格不断变化,单一模型绑定会增加迁移风险。
更合适的方式,是建立统一模型网关和内部评测体系。不同任务可以调用不同模型,同一任务也可以设置主模型、备用模型和验证模型。
模型出现降级、价格变化或合规问题时,企业能够快速切换。
Opus 5的发布不会结束模型竞争,它进一步说明模型能力、价格和推理档位正在商品化。企业的长期优势会来自模型管理能力,而不是押中某个版本。
结语
Claude Opus 5的核心卖点,可以概括为更强任务能力、更灵活推理预算和更适合企业的数据政策。
企业仍需算清三笔账。
第一笔是任务总成本,包含Token、工具、时间和人工纠错;第二笔是长流程可靠性,关注成功率、恢复能力和可验证性;第三笔是数据治理,覆盖调用渠道、日志、缓存、合同和权限。
模型排行榜回答“谁在某项测试中分数更高”。
企业采购要回答的是,哪个模型能在自己的流程中,以可接受的成本稳定完成任务,并且不会把数据和责任留在看不见的地方。
主要参考
- Anthropic:《Introducing Claude Opus 5》。
- Anthropic:Claude Opus 5使用、安全与价格说明。
- Anthropic:Claude模型官方发布说明。