9月15日,Salesforce与NVIDIA在Dreamforce发布Koa。它是Salesforce首个面向CRM的专用推理模型,基础来自NVIDIA Nemotron 3 Super。Salesforce依据近30年的CRM部署经验构造合成工作流训练Koa,覆盖销售线索、商机推进、服务工单等多步骤任务,再通过后训练让模型学习流程、工具调用与业务约束。
这项发布比“某软件接入了一个更强大模型”更有产业含义。过去两年,企业软件的常见AI架构是通用大模型加RAG:模型负责理解和生成,检索系统把客户资料、产品文档、知识库送进上下文。Koa选择了另一条路线,把长期沉淀在产品逻辑、实施方法和业务规则中的知识,部分转化为模型本身的推理习惯。
Salesforce称,Koa在其CRM Benchmark部分任务中达到或超过领先通用模型,错误率降低约3倍。这些结果属于企业自测,测试集构造、任务分布、对比模型配置及外部可复现性仍需独立评测。即便暂不接受性能结论,Koa所代表的产品方向已经清楚:大型企业软件厂商开始争夺领域模型的训练权、权重控制权和部署边界。
CRM为什么适合做专用推理模型
CRM表面上是一组客户记录,实际运行中包含大量有顺序、有条件、有权限的业务流程。销售人员收到线索后,需要判断行业、规模、地区与购买意向,补全联系人信息,分配负责人,安排跟进,推进商机阶段,生成报价并预测成交概率。客服人员处理工单时,要核验身份、查询产品与服务记录、判断优先级、检索解决方案、决定升级路径并记录结果。
这些任务的难点不只在“知道什么”,还在“下一步该做什么”。知识库可以告诉模型退换货政策,却未必让模型稳定遵循先验身份、再查订单、后判断适用条款的顺序。数据库可以返回商机字段,却不能自动解释什么情况下应将商机推进到下一阶段。流程知识往往散落在产品代码、配置项、顾问文档、管理员经验和一线员工习惯里。
通用模型依靠提示词也能完成部分流程,但稳定性受上下文表达影响。企业需要反复写系统提示、提供示例、调用检索,再用工作流引擎纠正模型。业务越复杂,提示越长,调用成本和维护负担越高。模型升级后,原有提示还可能出现行为漂移。
专用后训练试图把高频流程模式变成模型参数中的倾向。模型看到一项CRM任务时,更容易按领域惯例拆解步骤,选择合适工具,并识别阶段、对象和权限之间的关系。训练目标是学习销售、服务和营销流程中的结构,而非固化某个客户的数据。
CRM也具备训练垂直模型的良好条件。Salesforce拥有长期产品经验、丰富的元数据结构、成熟的工作流抽象和大量可模拟任务。线索、账户、联系人、商机、案例等对象关系相对清晰,任务是否完成也较容易用状态和规则验证。相比开放式创作,CRM操作更适合生成合成轨迹并自动检查步骤结果。
合成工作流解决了数据边界问题,也带来新的验证责任
Salesforce强调没有使用客户真实数据训练Koa。这一点直接回应了企业客户最敏感的顾虑:供应商是否会把合同、客户名单、服务记录和内部流程拿去训练共享模型。采用合成工作流,厂商可以在不复制真实业务数据的情况下模拟任务,保留流程结构并控制敏感信息风险。
合成数据并不等于随意编造样本。高质量工作流需要明确角色、对象状态、业务目标、可用工具、限制条件和预期结果。以销售线索转化为例,样本应包含缺失字段、重复联系人、区域分配规则、资质判断、冲突处理与操作日志。模型只有接触足够多的正常路径、异常路径和拒绝路径,才能在生产中形成较稳健的策略。
厂商拥有多年实施经验,优势在于知道企业流程通常在哪里失败。真实CRM项目中,麻烦常来自脏数据、配置差异、跨部门责任、例外审批和权限边界。若合成任务只覆盖理想流程,模型会在演示环境表现流畅,到了客户现场便频繁停顿或误操作。Salesforce需要持续证明其合成工作流覆盖了多行业、多规模和多配置下的复杂情况。
合成数据还有偏差问题。厂商会把自身产品理念写进样本,模型可能因此偏好某种标准流程,弱化客户独特做法。对于高度定制的CRM系统,通用领域模型仍需读取组织配置、术语、权限和历史状态。企业采购时应要求供应商解释基础领域能力与客户定制能力如何分层,哪些行为来自模型权重,哪些由可见策略控制。
由于训练集不含真实客户数据,生产推理仍然要安全访问客户数据。数据是否进入上下文、在何处处理、保留多久、是否用于日志和后续训练,是另一组问题。企业不能把“不用真实数据训练”等同于“运行过程中不处理真实数据”。训练边界、推理边界与日志边界必须分别审查。
Koa与通用模型加RAG的区别
RAG的核心能力是按当前问题检索相关材料,让模型基于新鲜、私有的信息回答。它适合政策问答、产品知识、合同查找和客户历史摘要。RAG解决的是“模型此刻需要知道哪些事实”。当任务需要连续决策时,检索只能提供依据,未必能保证模型按正确流程执行。
领域推理模型关注的是“模型习惯怎样处理这一类任务”。后训练可以让模型学习拆解CRM任务、选择工具、验证前置条件、处理异常和停止操作。它减少每次都用长提示解释行业常识的需求,也可能降低工具选择错误。
Koa仍需读取客户最新数据、业务政策和实时状态,这些信息应通过受控的数据接口提供,不应固化在权重里。更合理的生产架构是:领域模型提供CRM任务的推理能力,RAG和数据连接器提供组织事实,工作流与策略引擎约束关键动作,审计系统记录全过程。
如果企业把所有规则都训练进模型,会失去可见性和更新速度。促销政策、审批额度、区域划分随时可能变化,重新训练模型并不经济。规则系统更适合明确且频繁变化的约束,模型则适合处理流程理解、语义映射和复杂分支。软件厂商需要划清参数化知识、检索知识、配置规则和实时数据四种资产的边界。
这一区分也影响评测。问答型RAG可用答案准确率衡量;流程模型还要评估任务完成率、工具选择、参数正确性、步骤顺序、权限合规、异常恢复和停止条件。一个模型最终给出正确结果,但中途访问了不该读取的记录,依然是不合格的企业模型。
掌握模型权重意味着什么
Salesforce掌握Koa模型权重,并把后训练与推理放在自己的信任边界内。对于企业软件厂商,这是战略能力,而非单纯的技术选择。依赖外部模型API时,厂商受制于价格、限额、版本、区域供应、数据处理条款和模型行为变化。掌握权重后,可以决定部署位置、推理优化、模型更新节奏和客户隔离方式。
权重控制也使Salesforce能够把模型更深地嵌入产品。它可以针对自家对象模型、工具接口和工作流语言做联合优化,减少中间适配。模型输出不必停留在自然语言,还可直接生成结构化调用、验证业务状态并与Agentforce等产品体系协作。
这种优势会强化企业软件头部厂商的数据与流程壁垒。通用模型实验室拥有基础模型能力,却未必掌握某个行业数十年的实施经验;软件厂商掌握客户流程,却未必有能力从头训练前沿基础模型。Koa采用NVIDIA Nemotron 3 Super作为底座,展示了一种分工:基础模型供应商提供可定制模型和算力工具,企业软件厂商完成领域后训练、评测、部署和商业交付。
这条路线会吸引ERP、供应链、医疗、金融、法律和工业软件厂商跟进。它们可能不再满足于调用闭源通用模型,而会争取可控权重,把行业流程做成专用推理层。模型参数规模未必持续扩大,领域任务上的有效性、部署成本和合规能力会成为主要指标。
掌握权重也意味着承担更完整的责任。模型出现偏差、漏洞或性能退化时,软件厂商不能简单把问题归因于外部API。它需要管理训练数据谱系、模型版本、评测覆盖、漏洞修复和生命周期,并向客户提供足够透明的变更记录。
私有云、隔离网络与气隙环境为何重要
Salesforce披露,面向政府与强监管客户,Nemotron模型还会进入Missionforce,可部署到私有云、隔离网络甚至完全气隙环境。这一安排说明垂直模型竞争已经触及部署主权。
政府、国防、金融、能源和关键基础设施客户拥有大量不能离开本地边界的数据。有些环境无法持续访问公共云,有些系统要求严格的跨域交换审批。只提供在线API的模型,即使能力更强,也可能无法进入这些工作负载。
可在隔离环境部署,要求模型权重、推理服务、依赖组件、监控和更新机制均可交付。供应商还要解决离线授权、补丁分发、硬件兼容、日志留存和安全审计。对客户而言,这类部署的采购成本更高,运维责任也更重,但能换取数据、网络和变更控制权。
气隙部署不会自动带来安全。模型文件和软件包需要供应链验证,更新介质可能成为攻击入口;本地管理员拥有更高权限,也会产生内部风险。企业应要求软件物料清单、签名验证、离线补丁流程、权重完整性检查和本地审计接口。部署地点只是信任边界的一部分。
从产业角度看,可离线交付的领域模型将打开公共云难以覆盖的市场。能够同时支持SaaS、私有云和气隙环境的厂商,会在监管行业获得更强议价权。代价是产品版本碎片化和长期支持成本上升,这会进一步有利于资金与工程能力雄厚的平台厂商。
如何看待“错误率降低约3倍”
Salesforce称Koa在其CRM Benchmark部分任务中达到或超过领先通用模型,错误率降低约3倍。该数字来自企业自测,现阶段应把它看作产品方提供的初步证据,不能直接推导为所有客户场景都能获得同等改善。
评估这类声明,需要追问五个问题。第一,错误如何定义,是最终答案错误、工具选择错误、参数错误,还是整个任务轨迹错误。不同定义会显著改变结果。第二,Benchmark是否与合成训练工作流同分布。如果训练和测试任务结构高度相似,模型可能获得较大优势,面对客户定制流程时优势会缩小。
第三,对比的通用模型使用了怎样的提示、工具描述和RAG配置。领域模型经过专门后训练,若通用模型只得到简短提示,对比并不完整。第四,测试覆盖哪些CRM对象和复杂度,是否包含权限冲突、数据缺失、工具失败与长链条任务。第五,结果能否由第三方复现,是否公开足够的任务定义和评分方法。
企业在试点中应采用自己的历史任务做盲测,并清除个人与敏感信息。样本要包含成功案例、失败案例、少数复杂案例和明确拒绝的案例。评测人员应同时来自业务、IT、安全和合规部门,避免只看演示完成速度。
内部测试结果也应注明企业自测。企业可以报告“在本公司选取的某类工单样本中表现如何”,但不应把有限样本包装成行业通用结论。上线决策还要关注单位任务成本、延迟、人工复核时间和失败后的处理成本。
企业软件商业模式会怎样变化
领域推理模型会把部分实施服务产品化。过去,CRM项目需要顾问把销售方法、服务规范和审批流程配置进系统。模型如果已经掌握常见流程,可以缩短需求解释、流程搭建和员工培训时间。软件厂商可能把“行业推理能力”作为新的付费层,与席位、数据容量和自动化调用量共同计价。
与此同时,实施顾问的工作不会消失,会更多转向流程梳理、例外治理、数据质量和模型评测。标准路径越多由模型完成,客户特有规则越需要顾问明确表达并建立验证。咨询公司若只提供模板配置,利润空间可能被压缩;能够建设评测体系、治理策略和跨系统流程的团队会获得新需求。
企业软件的护城河也会重新排序。界面和基础功能更容易被生成式AI复制,长期积累的对象模型、流程语义、权限体系、行业数据结构和客户信任更难替代。软件厂商能否把这些资产转化为模型能力,同时保持客户数据隔离,将决定其AI产品的差异化。
基础模型厂商会面临渠道变化。若大型软件公司选择开放权重底座并自行后训练,闭源API在企业核心流程中的份额可能受到挤压。通用模型仍会服务广泛任务,但在高频、稳定、受监管的领域流程里,专用模型有机会凭成本、控制和一致性获得优势。
NVIDIA在这类合作中的角色也更深入。它提供的不只是GPU,还包括Nemotron模型和定制部署基础。随着更多软件厂商训练领域模型,算力供应商会向模型工具链、推理优化和企业交付延伸,争取成为垂直AI的共同底座。
企业采购Koa类模型应做的检查
第一项检查是任务边界。企业应明确模型负责建议、生成草稿,还是可以直接执行。对于修改客户权益、价格、合同、退款和权限的任务,初期应保留人工确认,并建立操作回滚。不要因为模型被称为“CRM推理模型”就默认它理解本公司的全部政策。
第二项检查是数据边界。要求供应商书面说明训练数据、推理数据、提示与输出日志的处理方式,确认数据驻留区域、保留期限、子处理商和是否用于改进模型。合成训练数据降低一类风险,不能替代对生产数据流的审查。
第三项检查是定制机制。了解企业术语、字段、流程和政策通过何种方式注入,是配置、RAG、微调还是提示。优先选择可追踪、可更新、可回滚的机制。频繁变化的规则不宜埋入不可见权重。
第四项检查是评测证据。除厂商Benchmark外,用企业自己的任务集测试,并记录每次模型和配置版本。关键指标包括完整任务成功率、步骤正确率、越权率、误拒率、人工接管率、平均处理时间与单位任务成本。所有内部性能结果均应标注企业自测。
第五项检查是退出能力。企业要确认能否导出提示、配置、工作流、评测集和审计日志,避免模型平台更换时丢失治理资产。模型权重可能属于供应商,但企业自己的流程定义与测试证据应保持可迁移。
给企业管理层的行动建议
正在建设CRM Agent的企业,可以先挑选流程明确、数据风险较低、结果易验证的任务,例如线索信息补全、工单分类、跟进建议和知识摘要。用这些任务比较通用模型加RAG与领域模型,观察端到端成本和人工节省,不要只比较单次问答得分。
第二步是把企业流程资产化。梳理标准操作、对象关系、审批条件、异常路径和停止条件,建立机器可读的任务定义与测试案例。即使最终不采购Koa,这些资产也能用于其他Agent平台,减少对某个模型提示技巧的依赖。
第三步是建立模型与规则的分工。相对稳定的领域常识可由模型承担,实时事实通过检索和系统查询获得,明确底线由确定性规则执行,高影响例外交给人工。分工清楚后,模型更新不会轻易改变企业控制边界。
第四步是要求业务部门参与持续评测。CRM流程每天都在变化,销售政策、产品组合、服务承诺和组织权限会调整。一次验收无法覆盖长期运行。企业应设置固定样本与新增案例,按版本回归测试,并跟踪真实生产中的失败模式。
第五步是评估部署主权。普通商业流程可优先使用托管服务以降低运维成本;强监管、敏感数据或断网环境则应评估私有云、隔离网络和气隙部署。部署方式应由数据分类和业务连续性决定,不能跟随市场口号。
直接的产业判断
Koa预示着企业AI竞争将从“谁接入最强通用模型”转向“谁拥有最深的流程知识,并能把它稳定转化为模型行为”。CRM只是起点。ERP、供应链、医疗、保险、法律和工业软件都会出现类似模型,通用底座与领域后训练的组合将成为重要产品形态。
垂直模型不会让RAG和工作流引擎退出。生产系统会形成四层结构:基础模型提供通用语言与推理能力,领域后训练提供行业流程倾向,企业数据系统提供实时事实,治理层负责权限、规则和审计。任何一层被宣传成万能方案,都会在复杂业务中暴露缺口。
大型软件厂商拥有产品语义、实施经验、客户渠道和部署信任,因而在领域模型时代占据有利位置。它们也面临新的透明度要求:客户需要知道模型为何采取某一步、使用了哪些数据、违反规则时如何阻断。产品能力与治理能力会一同决定采购结果。
对企业用户而言,Koa类模型最有价值的地方,是减少模型学习行业流程的成本;最大风险,则是把供应商默认流程误当成本公司的正确流程。企业应主动掌握流程定义、评测集和政策边界,再选择模型承载其中适合参数化的部分。
CRM软件已经从记录系统走向行动系统。模型一旦参与线索分配、商机推进和客户服务,错误会直接影响收入、客户关系与合规。下一阶段的赢家,不会只靠更流畅的回答,而要在领域任务完成率、数据边界、部署控制和可审计性上同时过关。
参考资料
- Salesforce,《Announcing Koa: Salesforce’s First CRM Reasoning Model, Built on NVIDIA Nemotron》,2026-09-15。
https://investor.salesforce.com/news/news-details/2026/Announcing-Koa-Salesforces-First-CRM-Reasoning-Model-Built-on-NVIDIA-Nemotron/default.aspx - TechCrunch,Salesforce与NVIDIA Koa相关报道,2026-09-15。
https://techcrunch.com/2026/09/15/salesforce-and-nvidias-new-reasoning-model-is-everything-the-ai-labs-should-fear/