2026年10月4日
广东省政务和数据部门在广州琶洲人工智能与数字经济试验区启动为期一年的词元发展监测试点。10月3日,多地政府门户转发了相关消息。它是广东全省首个同类试点,目标是围绕词元生产、流通和应用建立统一监测体系,给数字经济运行分析与政策制定提供数据。广东此前提出将相关指标纳入全省数字经济监测体系,如今先在具体区域试用统计方法。信息说到这里为止:试点要怎样报送、企业是否必须接入、怎样核算费用,现有资料没有给出可供本文确认的细则。
一家企业部署模型后,运营经理看到调用次数,财务看到费用,业务部门看工单是否结案。三张表不一定对得上。输入和输出可能分别计费,缓存复用另有口径,推理、图像与语音也未必能直接折算。词元能记录部分服务用量,却不能替企业回答有没有把工作做好。把所有请求堆成一个大数,重复生成也显得像繁荣。琶洲试点后续最值得看的,正是统计边界如何确定、记录能否复核。
拿客服场景来说,企业可能在一个会话中调用检索、摘要和回答模型。若只按最终回答统计,途中用掉的词元会消失;若把每个步骤独立计入服务量,又可能把同一业务任务重复算作多个“成果”。这不是报道披露的具体案例,而是由上述统计口径差异推导出的计量难题。解决办法并非选一个最漂亮的总数,而是保留两层记录:底层保留按调用划分的消耗,上层把调用归入可识别的任务和业务结果。前者服务技术核算,后者服务经营判断。
总量有用,但不能替代分母
监测词元生产、流通和应用,涉及的不是同一件事。模型或服务提供方产生可交付能力,平台与渠道转接调用,企业把能力用于具体业务。现有资料没有为这三个环节给出正式定义,因此这里不能把一种业务划分直接当成广东试点的官方分类。可以确定的是,一旦跨主体汇总,口径就比公司内部报表难得多:一次调用由哪个主体计入?内部测试与对外服务怎样区分?缓存复用与重复请求算不算等价用量?这些疑问必须在统计规则和数据边界清楚以后才有答案。
我想先看分母。某个月词元用量翻倍,可能是付费客户多了,也可能只是提示词变长、模型重试更多。单独拿用量说“产业壮大”,容易把技术浪费当增长。对经营者而言,按完成的有效任务计算单位成本,比按词元规模排名更接近决策。比如同一类型的工单,记录合格处理的数量、平均人工复核时间、模型调用费用和失败后返工比例。这里的指标是给企业做内部基线的建议,不是试点公布的考核表。企业可以用同一段时间、同一任务定义比较两套流程,而不是拿不同难度的任务相互比价。
账上还得给质量留位置。模型费用降了,回答出错却让员工重做,这笔买卖未必合算。反过来,高成本模型未必不划算:若它让复杂任务一次通过,实际每件交付的总成本反而较低。判断“便宜”的单位应当是经确认完成的一件工作,而非孤立的一千个或一万个词元。没有完整的任务链数据时,词元只能说明资源消耗,不能直接证明生产率。
另一件容易混淆的事是“量”和“价”。提供同样字数的回答,两家服务商给出的账单未必相同;一个厂商内部不同模型的调用,也可能由于任务难度不同而产生不同的输出与质量。区域监测若要讨论经济价值,不能简单用总词元乘一个假定单价。对企业也是如此:年度预算里应分开预测任务需求、单任务用量和采购价格。业务量增长时,费用未必同比增长;如果模型供应、缓存命中率或工作流发生变化,三个变量会各走各的。这样分开记账,有助于避免把账单涨价误读成服务需求增加。
还要当心“平均数”抹平高成本异常任务。企业可以把不同任务分组,观察中位费用和异常费用占比,特别注明批量处理和实时交互的差别。报表若只写平均每次调用的词元数,少数耗费极高的请求可能被大量简单请求淹没;管理者真正需要的是知道谁在消耗预算,以及这笔预算换来了什么。若任务类型划分不稳定,就先保留原始的任务归属记录,别为了画图方便反复调整统计边界。
一年的试点也提醒我们,统计方法不是发一张表就结束。相同服务在不同提供方可能有不同计价规则,不同模态的任务更难被一个数字压平。做区域统计时,重复计量风险会沿着模型服务商、云平台、应用开发者和最终用户的链条传递。若把每层流转都简单相加,总量会高估实际最终使用量。这里是对统计设计的推论,不能据此断言试点现在已经发生重复统计;它只说明公开的统一口径为什么值得等。
企业不必等试点结果才开始记账
琶洲的试点对象和具体报送方式,现有资料没有展开。其他地区的企业不必因此假设自己马上承担新义务,更不能把尚未发布的规范写进合同。能先做的是清理自有数据。在不改变既有隐私与权限安排的前提下,为每项模型调用保留任务编号、时间、模型或供应商、输入输出用量、缓存情况、费用、调用结果,以及是否进入人工复核。多模态任务则单独记录类型,不勉强换算成一个“万能词元”。这些字段是本文提出的企业管理样例,不是广东的法定填报要求。
一线团队最容易漏掉失败。请求超时、回答被舍弃、重复生成,在供应商账单上可能都是消耗,在业务报表上却一件都不算。把失败与重试标出来,月末就能问一个实在的问题:费用上涨,到底来自有效需求增加,还是来自流程本身不稳定?如果只有一张付款凭证,采购部门无法回答。产品负责人和财务还可以按任务类型抽样核对,不需为监测而采集超出业务所需的原始对话。底层用量留得住、个人信息留得少,审计与控制成本才能并行。
可以从一个任务做四周内部观察,比如同一客服队列中符合条件的问答,别一上来就统计全公司。第一周确认任务与“完成”的定义,其后连续记录调用费用、人工复核用时、返工件数及抽样质量。月底比较每件合格结果的综合成本;若样本或工作量变化太大,就把结论写成“不足以比较”。四周是建议的企业内部试验时长,不是官方试点安排。这样的实操比对企业究竟“生产”了多少词元保持克制,却能为下一步采购和优化提示词提供依据。
部门之间如何分摊,也值得提前说清。研发的压测调用不能全摊进客服部门的单位处理成本;市场部试验内容生成,也不宜算成已经交付客户的服务量。建议建立一份小小的内部字典:哪些是生产环境,哪些是测试;什么算一次可交付任务;重试费用回到哪个成本中心;异常由谁确认。字典可以随着业务更新,但每次改变都应留下生效日期,否则本月与上月的增长很可能只是口径变了。这个动作不需要等待任何省级标准,却能让不同部门在同一张报表上谈话。
实际实施时不必追求把全部历史数据补齐。先挑费用高、任务边界清楚的一条流程,核对供应商月账单和内部调用日志能否相互解释;差额若来自免费额度、账期错位、缓存折扣或失败请求,分别标注。原因不能确定就留作未核实差额。至少从此以后,预算会有一条可信的起点。没有可信起点,所谓“同比节省百分之多少”通常也站不住。
这里有个容易被财务和产品团队忽略的时间差。模型账单可能在月底结清,业务任务却跨月完结。如果把当月费用直接除以当月结案数,碰上月底集中提交、次月统一验收的项目,单位成本会突然上蹿。小团队未必需要复杂系统,只要在台账里同时保留调用日期与任务结案日期,明确费用按哪种规则归集,解释月度波动时就少些误会。规则用固定版本保存,别看到数字难看就临时改。
若企业同时采购几家模型服务,内部任务编号尤其有用。它可以让不同供应商账单回到同一个业务问题上;没有这层关联,比较模型单价时便会忽视某一家多做了检索或反复生成。负责人不必每天翻全部日志,按月抽样检查一批高费用和失败任务即可。差额找到原因,下一次优化才有靶子。
采购谈判也会受益。供应商报出的单价若使用不同计量单位,采购可以要求同一任务样本的实测费用、延迟和失败重试记录,不必凭宣传页面判定谁更便宜。服务合约可以约定报表提供频率、异常费用提醒和账单争议的核对方式;具体条款要依据双方实际服务设计,而不是假托这次试点已经规定了格式。数据可对账,企业才有能力换供应商,或者决定哪些任务改用更小的模型。
统计政策和经营管理之间还有一道门
企业内部还有一种值得保留的“坏消息”:某个流程使用量低,不一定代表技术失败。可能是员工没有获得适合的入口,可能是任务本来就少,也可能是试验阶段对错误的容忍度不够。反过来,调用很频繁也可能只是员工不断改写同一个问题。把使用量与真正完成任务的人数、任务反馈和人工耗时放在一起观察,才能讨论应用是否站稳。企业不能为了追逐用量而让员工增加无意义调用。
地方监测要回答区域内服务量和应用分布,企业经营则要回答谁为服务买单、结果是否值得。两者相关,但不能混为一谈。如果监测体系成熟,地方有机会比过去更细地观察AI服务在哪些行业被使用,产生多少服务量及相应经济价值;这是一种可能方向,不是已经公布的实际测算。到那一步,统计数据如何避免重复计算、如何保护商业敏感信息、如何与成本和成效对照,都会影响它是否真正有用。
这也给行业研究者出了题。若以后看见某个地区的词元量上升,先看覆盖了多少企业和应用、统计期是否可比、跨平台传输是否被算了两遍。再看实际有多少场景从试验进入稳定运行。仅凭一个年度增速,很难区分统计覆盖扩大和真实需求增长。把这些问题摆出来不是否定试点;恰恰因为这个试点试图建立统一监测,后续公开的定义与说明比一句增长口号更值得细读。
这里尤其需要挡住一种误读:词元规模可以被拿来观察服务的生产与消费,却不意味着词元天然是一种资产,更不能由一个试点推出交易市场、价格承诺或财政补贴。词元不宜简单金融化。企业若据此预测补贴或把用量当作未来收入,便把尚在探索的统计工具误读成确定的商业承诺。项目预算仍应根据真实合同、运行成本与可验证的交付来编。
我的判断是,一套能解释差异的口径,比一个漂亮总量更有用:同一类任务为何耗费不同资源,账单为何与完成数对不上,各环节的边界又在哪里。这是本文的推论,不是试点公布的成果。眼前可确认的仍然只有广东在琶洲启动为期一年的全省首个试点,以及统一监测词元生产、流通、应用的方向。企业现在就可以把可复核的任务台账建起来;等正式口径出来,再决定哪些字段能对接、哪些定义需要调整。
以后读试点公开信息,我会先找统计单位的定义,再看跨平台调用如何避免重复计算;若有应用效果的记录,还要确认它是否与用量并列呈现。眼下企业完全可以自己先做一件小事:拿一个真实任务,把调用账单和完成结果对齐。等能解释清楚每笔差额,词元才真正进入日常经营,而不是只出现在一张增长曲线上。
资料来源:广东政数/汕尾市人民政府,《词元发展将有“度量衡” 广东启动全省首个词元发展监测试点》,2026年10月3日。https://www.shanwei.gov.cn/shanwei/swzdly/spgg/spbzh/content/post_1280777.html