北京近日印发《北京市加快词元经济发展的行动方案(2026—2028年)》。这份由市经济和信息化局、市发展改革委联合发布的文件,提出六个方面、十项举措,涉及词元工厂、质量评测、分发平台、智能体、行业知识和金融人才保障。它不是把“Token”换成一个更时髦的产业名称,而是在尝试回答一个实际问题:模型训练完毕之后,怎样以稳定、可计量、可比较、可结算的方式,持续把智能能力交付给客户?
文件于2026年9月15日落款,自公布之日起施行,期限至2028年12月31日。政策原文没有给出全市词元产量、产业规模或补贴总额目标。判断其力度,不能靠臆测某个产值数字,而要看生产、评测、分发与应用之间能否形成真正的交易闭环。
词元不是商品的全部,服务质量才决定购买
词元是大模型处理文本等信息时使用的基本计量单位。用户向模型输入问题,模型输出回答,服务提供商可以据此计量用量。但一个词元本身并不能告诉客户答案是否准确,是否在高峰期按时返回,敏感数据是否得到妥善处理。不同模型的计数方法、推理能力、上下文长度和输出质量也不同,简单比较“每百万词元价格”容易失真。
北京方案值得注意的地方,是没有把扩容算力单独当成终点。第一部分强调建设词元工厂和模型、芯片适配,第二部分紧接着要求做质量评测、智能路由、统一接口、计量和结算;第三部分又把消费端落到智能体和具体行业。换句话说,算力生产的是供给能力,评测让供给有可比较的质量信息,平台降低调用与交易成本,真实场景再检验是否值得付费。少了任何一环,都可能出现“机器很忙、客户却不续费”的局面。
所谓词元工厂,可以理解为面向外部客户持续提供模型推理服务的工程体系,不等同于一间摆满服务器的机房。方案提出制定分级评价标准,考察模型适配数量、词元吞吐速度、首字延迟、缓存命中率和电能利用效率(PUE)。这些指标共同反映能否稳定交付:吞吐量影响高并发承载,首字延迟影响交互体验,缓存命中率关系到重复请求的成本,PUE则关系到基础设施耗能。企业不能只展示峰值性能,还需要在真实负载下说明稳定性、故障恢复、有效输出率和全链路成本。后几项是企业经营上应自行核算的指标,并非文件列出的考核条文。
方案还提出优化土地、能耗、通信网络等要素保障,对有行业引领力的词元工厂给予支持;推动基础模型迭代、模型与芯片适配,攻关推理专用芯片、轻量化和边缘部署。这显示北京并非只押注单一大模型或单一硬件路线。推理服务的成本受芯片、内存、网络、调度、模型结构和请求形态共同影响,软硬协同往往比孤立追求一项跑分更有价值。边缘部署尤其适合对时延、离线运行或数据驻留有要求的场合,但也要权衡模型能力与设备运维成本。
评测与分发,决定市场能不能形成价格
方案明确支持企业与第三方评测机构合作,探索词元测试平台,建立客观公正的性能和质量标准,为定价与模型智能路由提供依据。这一步并非给所有模型排一张永久不变的总榜。客服问答、合同审阅、生产计划、代码生成的错误成本不同,评测应该覆盖任务、语言、行业资料、峰值流量和安全约束。对于采购者,有用的是在自己的样本集和预算下,哪一种配置能稳定完成任务,而不是哪一个通用榜单名次最高。
文件提出由分发平台提供统一接口、模型聚合、词元计量和结算,增强跨模型、跨模态、跨区域接入能力,并推动这类平台纳入新型基础设施布局。平台的经济价值在于减少逐个接入、逐个签约、逐个对账的摩擦,让应用开发者有机会按照质量、价格和可用性切换供应。它也可能成为重要的市场入口。不过,“纳入布局”不等于已经建成公共平台,更不意味着所有调用将统一定价;政策方向和已实现的服务能力要分开看。
平台越重要,企业越应警惕新的锁定效应。采购方在签订服务协议时,要问清词元计数口径、缓存请求计费、超时和失败重试、跨区域调度、数据留存、模型版本更迭及退出后的迁移方式。提供方则需要公开可核验的服务等级与计费规则,避免低单价掩盖高重试率和后续迁移成本。能被客户审计的价格,比表面便宜但难以核对的报价更容易获得长期订单。
智能体要跨过“演示成功、运行失控”的坎
在需求侧,方案支持面向个人与机构的通用智能体,同时聚焦工业制造、科学研究、生物医药、教育教学等领域开放场景。其核心软件生态部分特别提到记忆管理、安全权限管控、组件间高效通信,以及任务执行全过程的安全保障。这些表述比“让模型多做几个步骤”更接近企业真正关心的问题:系统能否理解已有工作记录,能否在适当权限内调用工具,能否留下清晰的操作痕迹,出现错误能否中止和回滚。
以企业采购智能体为例,试运行不应仅挑十道容易回答的问题。应该选择真实工单,分出可自动回复、需人确认、禁止自动执行三类;对每一类设定准确性、响应时间、人工介入比例和事故处置流程。若涉及付款、合同、设备控制或医疗建议,更要限制写入和执行权限。一个不会擅自执行高风险操作的系统,比一个偶尔令人惊艳却无法解释操作路径的演示更有商业价值。
北京同时提出探索“数据本体”技术范式:把高质量数据集、场景信息与合规要求等知识融合成模型可用的数据产品或服务,鼓励企业将行业知识、工艺参数、设备数据封装起来,探索合作和商业模式。这里不能简单理解为把工厂数据库原样送入模型。设备编号、工序关系、异常处置、权限边界和数据来源,必须先整理成有语义、有版本、有责任人的知识对象,模型才有可能在生产语境中正确使用。文件称相关成果纳入高质量数据集奖励支持范畴,但未在正文规定统一奖励金额。
对制造企业而言,行业知识是长期积累的资产,却也可能夹杂商业秘密与个人信息。数据产品化之前,要先明确谁有权授权、哪些数据可脱敏、是否允许用于训练、输出如何追溯、合作终止后如何删除。拥有场景的企业并非只能当模型公司的“免费标注员”;若能掌握业务规则和质量验收方法,它在产业链上的议价能力也会增强。
海外服务、金融工具和人才培训如何落地
方案提出依托中国—上合组织国家人工智能应用合作中心等载体,面向共建“一带一路”国家及新兴市场提供开源模型适配、智能体部署、开发工具链和算力服务,并完善数据及内容合规、多语种调优、海外运维支持。出口的不是抽象词元,而是能够在当地语言、法律和业务流程中运行的解决方案。企业进入一个新市场,首先需要验证本地语料和任务表现,再设计数据跨境、服务交付、故障响应与支付安排;不能把国内演示视频当成交付能力证明。
金融方面,文件支持金融机构面向算力基础设施和词元消费场景开发专项产品,向企业提供中长期信贷;人才方面,要求利用产教融合等资源,对软件工程师开展模型调优、推理加速、平台运维、安全合规培训。金融机构是否愿意放款,仍取决于可验证的合同、现金流和风险管理,政策没有承诺企业只要采购词元就能获得贷款。培训也不应止于熟悉提示词,而应训练工程师在性能、成本、安全之间做取舍。
企业现在可以做三件具体的事。第一,把现有AI项目的成本账重新算一遍:按业务任务统计调用量、有效完成率、人工复核时间和单位任务成本,而不只看账单上的词元数。第二,建立自己的评测集和失败样本库,对不同模型与分发渠道做持续对照,特别记录模型升级前后的性能漂移。第三,从权限明确、数据可治理、收益可量化的流程启动试点,先划清人工接管条件,再扩大自动化范围。
对于算力和平台企业,机会则在可靠交付:给客户可解释的计量、真实负载下的服务承诺、跨模型迁移工具,以及适合行业场景的质量评测。对于工业企业,重点是把自己的工艺知识整理成可用、可控、可交易的服务,而不是急于发布一套“大模型”。对于投资机构,判断项目应更多观察复购、单位任务毛利和履约风险,少被单次展示的词元吞吐数字左右。
还需要讨论一个容易被忽略的定价问题:模型服务具有明显的分层需求。个人消费者可能在意随时可用和低门槛,企业客户却更在意高峰期的响应、数据隔离和稳定版本。即使调用同一个基础模型,这两类产品也不能只用单价比较。更合理的合同可能同时约定基础容量、用量计费、质量门槛和事故补救;但具体安排应由交易双方商定,行动方案没有指定统一合同模板。若服务商用低价获取客户,却无法在需求激增时履约,最终损害的是整个市场对词元计量的信任。
跨模型路由也有一项经营上的现实考题。平台可以把简单任务交给成本较低的模型,把复杂任务交给能力较强的模型,但“简单”和“复杂”必须由实测结果界定。把全部请求都导向高价模型,可能浪费预算;只按最低价调度,又可能增加错误和返工。企业可先选择一两个高频流程,统计任务难度、回答质量、重试次数、人工修订时间,再设计路由规则。重要的不是节省了多少词元,而是每个被正确完成的任务花费多少。
质量评测也不能忽略责任归属。开发者采用第三方模型,分发平台负责路由,应用公司负责用户界面,行业客户提供内部数据,出错时究竟哪一环应该处置?合作协议需要区分模型缺陷、数据失真、提示注入、接口故障和人工误操作,保留相应日志,并约定通知与纠错时限。尤其在多方接力的业务流程中,可审计性不是附加功能,而是形成可持续交易的前提。
对于中小软件企业,“词元工程师再技能化”并不意味着全员改行训练基础模型。多数团队的切入点可能是调用优化、任务评测、知识库维护、安全权限与平台接入。培训若能与真实项目相连,让工程师在预算、延迟和错误率约束下交付一个流程,比学习一套孤立术语更有效。城市层面的政策能提供平台和资源,最终仍需要企业把能力转成客户可感知的结果。
政策成效还有一个值得持续观察的信号:参与者是否从单纯卖调用量,转向为完成任务承担服务责任。如果平台只聚合接口而不提供质量信息,企业仍需自己承担全部筛选成本;如果工厂只报峰值产能,却不能说明持续服务能力,规模也很难转化为可信供给。相反,若第三方评测能够被采购方复验,路由能够被开发者解释,客户能够按任务效果核算成本,市场才会出现比较扎实的价格发现。未来可以关注开放的评测方法、真实场景的续费、跨模型迁移的难易,以及工程人才是否能在中小企业里独立完成部署和运维。这些比一场发布会上的热词,更能反映产业是否成熟。
北京这项政策的产业判断其实很朴素:智能能力只有进入具体任务、按质量被验收、按规则被计费,才能从研发支出变成稳定供给。未来三年的竞争未必是谁生产了最多词元,而是谁能把成本可控、质量可信、安全可审计的智能服务交到客户手里。
资料来源:北京市人民政府门户网站,《北京市加快词元经济发展的行动方案(2026—2028年)》,2026年9月20日页面;新华社,2026年9月18日报道。