国家数据局把数据标注试点从7城扩到39城:AI竞争开始争夺“高质量数据生产线”

国家数据局把数据标注试点从7城扩到39城:AI竞争开始争夺“高质量数据生产线”

国家数据局把数据标注试点从7城扩到39城:AI竞争开始争夺“高质量数据生产线”

摘要

国家数据局把数据标注试点从7城扩到39城:AI竞争开始争夺“高质量数据生产线”正文配图

国家数据局近日宣布,将在32个城市布局第二批数据标注先行先试工作。加上此前成都、沈阳、合肥、长沙、海口、保定、大同7个先行城市,全国开展数据标注先行先试的城市将达到39个,重点覆盖工业制造、医疗健康、交通运输、具身智能等领域。与此同时,国家数据局披露,截至2026年8月,全国已建成高质量数据集超过12.6万个、总体量超过1815PB,较今年一季度末增长超过89%。这一轮扩围值得产业界重视:数据标注正在从相对分散的数据加工服务,升级为支撑行业大模型、工业智能体、自动驾驶和具身智能的重要产业基础能力。未来稀缺的,将是能够围绕专业场景持续生产、评测、迭代高质量数据集的工程体系。

一、第二批一下增加32个城市,数据标注先行先试进入规模化阶段

8月29日,国家数据局官网转载央视新闻消息,明确国家数据局将在32个城市布局第二批数据标注先行先试工作。

这次扩围的幅度很大。此前国家数据局确定的首批7个数据标注基地分别位于成都、沈阳、合肥、长沙、海口、保定和大同。新一批32个城市加入后,全国开展相关先行先试的城市总数将达到39个。

官方同时给出了几个重点行业:工业制造、医疗健康、交通运输、具身智能。

这几个行业有一个共同特点——数据量大、专业门槛高、场景差异明显,而且大量原始数据无法直接用于模型训练。工业领域的设备振动、工艺参数、缺陷图片、三维模型、仿真结果,需要结合工程知识进行清洗和标注;医疗影像需要专业医生参与;自动驾驶依赖图像、视频、点云、道路环境和时序数据;具身智能还需要大量动作、运动控制、多模态感知、仿真场景和人类行为数据。

因此,新一轮数据标注试点的产业意义已经超出传统“外包打标签”,它更接近一套AI数据生产基础设施。

二、国家政策主线已经很清楚:数据标注要进入“数据集—模型—场景”闭环

数据标注在国家政策体系中的位置,过去两年明显上升。

2025年1月,国家发展改革委、国家数据局、财政部、人力资源社会保障部联合发布《关于促进数据标注产业高质量发展的实施意见》,首次从国家层面对数据标注产业进行系统谋划。

文件提出,到2027年,数据标注产业专业化、智能化和科技创新能力显著提升,产业规模大幅跃升,年均复合增长率超过20%,建设一批成效明显、特色鲜明的数据标注基地。

政策同时提出释放公共数据标注需求,在现代农业、智能制造、信息服务等领域挖掘需求;支持政务大模型所需数据标注和训练;推动数据标注服务纳入政府采购范围;加快数据标注关键设备、标准和人才体系建设。

2025年7月,国家数据局进一步提出,要打造“数据标注+高质量数据集+模型+应用场景+市场化价值化”的闭环生态。

到2026年,这条路线已经逐步从政策设计进入规模部署。第二批32个城市的扩围,就是一个非常明确的实施信号。

三、12.6万个高质量数据集背后,AI基础设施正在发生变化

国家数据局8月29日公布的另一组数字更值得关注。

截至2026年8月,全国已经建成高质量数据集超过12.6万个,总体量超过1815PB,较今年一季度末增长超过89%。国家数据集管理服务系统今年4月上线后,已经发布数据集超过1700个。

这说明AI基础设施的建设重点正在扩展。

过去几年行业讨论基础设施,注意力主要集中在GPU、智算中心、网络和大模型平台。随着模型能力逐渐成熟,越来越多企业发现,行业模型效果的瓶颈往往并不完全来自算力,而来自数据。

制造企业尤其明显。企业可能积累了十几年设备数据、质量数据、图纸、工艺文件、维修记录和生产报表,但这些数据分散在MES、PLM、ERP、SCADA、文件服务器甚至个人电脑中。

把这些数据直接交给大模型,价值有限。需要完成数据分类、脱敏、清洗、知识结构化、标签设计、质量检测、版本管理,再通过实际任务验证数据集是否能够提升模型效果。

高质量数据集由此变成一种新的工程资产。

四、工业数据标注最有价值的部分,是把工程师经验转成机器可以学习的结构

对于工业企业来说,数据标注很容易被理解成机器视觉中的“画框”。

实际价值远不止这一层。

以设备运维为例,一段轴承振动波形本身只是时间序列。要训练故障诊断模型,需要进一步标记设备类型、转速、负载、故障位置、故障等级、维护记录和最终检修结果。

在质量检测中,一张缺陷照片除了标记缺陷位置,还需要定义缺陷类别、尺寸、成因、是否影响性能、如何返工。

在CAD/CAE场景中,零部件几何模型还可以关联材料、载荷、边界条件、网格、求解结果和设计规则。

这些工作实际上是在把工程师长期积累的know-how转换成机器可学习的数据结构。

因此,工业数据标注产业未来会出现明显分层。基础标注越来越容易自动化,甚至直接由大模型和视觉模型完成初步处理;高价值环节会向专业知识标注、复杂多模态标注、质量评测、数据合成和数据集持续运营迁移。

真正有壁垒的企业,需要同时理解行业和AI。

五、具身智能可能成为这一轮数据产业扩张的重要增量

国家数据局此次明确把具身智能列入第二批先行先试重点领域。

具身智能对数据的需求,与传统互联网大模型差异很大。机器人需要处理图像、深度信息、力觉、触觉、关节状态、动作轨迹、环境状态等多种数据。

训练一个机器人抓取物体,需要记录它看到了什么、机械臂如何运动、夹爪什么时候闭合、用了多大力量、抓取是否成功,以及失败发生在哪里。

如果进一步训练通用机器人,还需要大量不同环境、不同任务、不同物体的数据。真实世界采集成本很高,因此仿真数据和合成数据会越来越重要。

这也意味着,机器人数据公司未来可能同时具备几种能力:真实场景采集、机器人遥操作、动作数据标注、仿真场景生成、数字资产制作、数据质量评估,以及数据集与模型训练效果验证。

从深圳等地已经发布的具身智能相关政策看,动作数据、多模态数据和仿真场景已经开始进入具体财政支持规则。国家数据局把具身智能纳入数据标注先行先试,也进一步确认了这一方向的产业价值。

六、数据标注产业自身也在升级:人工标注会减少,专家和Agent参与会增加

过去的数据标注产业高度依赖人工,这一模式正在变化。

视觉模型已经能够自动完成目标检测和初步框选,大模型可以辅助文本分类、知识抽取和问答数据生成,多模态模型可以生成初始标签,再由人工审核。

今后的典型流程可能变成:模型先标注,人工复核;普通标注员处理通用任务,行业专家处理复杂样本;真实数据和合成数据共同构建训练集;数据集进入模型训练后,根据模型错误继续反向补充数据。

这是一套持续迭代的“数据闭环”。

武汉在入选第二批智慧交通数据标注先行先试后,就公开提出,要推动数据标注从“以人为主”向“人机协同、专家深度参与”的多层次模式转型,并围绕“试技术、试数据、试场景、试标准”推进建设。

这类思路很可能会成为第二批城市探索的重点。

七、对企业来说,新的机会在哪里

第一类机会是行业高质量数据集建设。制造、能源、交通、医疗、机器人等行业都有大量原始数据,但真正可用于模型训练的数据仍然稀缺。具备数据治理、行业知识和模型能力的企业,可以从一次性数据处理转向持续建设行业数据资产。

第二类机会是数据标注工具。自动标注、智能质检、数据去重、异常检测、合成数据、数据集版本管理、数据血缘和评测工具,会成为新的软件市场。

第三类机会是工业知识工程。很多工业数据必须由工程师参与定义标签体系。能够把专家知识、规则、知识图谱和数据标注流程结合起来的平台,更适合工业大模型和工业智能体。

第四类机会是具身智能数据服务。遥操作采集、动作数据、多模态数据、仿真环境、数字资产模型会持续增加需求。

第五类机会是数据合规和可信流通。医疗、工业、交通等数据普遍具有敏感性。数据脱敏、可信数据空间、隐私计算、授权管理、数据合规评估会成为数据集建设的必要环节。

第六类机会是数据集评测。未来企业采购数据集,不会只关心“多少TB”,还会关心数据能让模型提升多少。能够建立模型效果与数据质量之间评测体系的公司,会获得更高价值。

八、一个容易被忽略的变化:数据企业开始从“卖数据”走向“卖模型效果”

2026中国国际大数据产业博览会发布的《中国数据产业发展报告(2026)》显示,2025年我国数据产业规模达到6.78万亿元,同比增长15.7%,数据企业数量达到48.2万家。

报告同时判断,词元服务、智能体创新、AI原生数据技术和合成数据将成为重要发展方向。

这意味着数据公司的商业模式正在变化。过去数据企业通常按照数据量、数据条数或者项目工作量收费。以后更有价值的服务,可能按照训练效果、模型准确率、场景成功率或者持续调用效果定价。

例如,一个工业缺陷数据集如果可以把视觉质检漏检率明显降低,它的价值显然不能简单按照图片数量计算。一个机器人动作数据集,如果能够显著提高某类抓取任务的成功率,也会形成完全不同的定价逻辑。

数据与模型之间的价值关系,会越来越紧密。

九、风险同样值得提前看

第一是数据合规。工业数据可能涉及商业秘密,交通数据涉及地理信息和安全,医疗数据涉及敏感个人信息。数据进入标注和模型训练流程以后,采集、授权、存储、处理、传输都需要明确边界。

第二是低端产能扩张。39个城市开展先行先试后,地方可能出现大量数据标注基地。如果仍然停留在低技能人工标注,很容易陷入价格竞争。

第三是“建数据集”与“模型有用”之间存在距离。数据量大并不等于数据质量高,真正的高质量数据集需要经过模型训练和实际场景验证。

第四是行业专家成本高。工业、医疗、科研等领域的数据需要专业人员参与,如何把专家经验转化成标准化、可复制的数据生产流程,是企业必须解决的问题。

第五是合成数据质量。合成数据能够降低采集成本,但如果模型生成的数据存在偏差,训练结果可能进一步放大偏差。合成数据仍然需要真实数据校验和质量评测。

十、从39个城市往后看,AI产业开始形成新的区域竞争力

第二批数据标注先行先试扩围到32个城市之后,全国相关城市达到39个,这意味着数据供给能力开始进入地方人工智能产业竞争。

过去一个城市发展AI,经常看三个条件:有没有算力、有没有模型公司、有没有应用场景。

现在还要增加一个条件:有没有持续生产高质量行业数据的能力。

算力可以买,模型可以调用,行业数据却高度依赖本地产业和真实场景。制造业城市拥有设备和工艺数据,汽车产业城市拥有智能驾驶和道路数据,医疗资源集中的城市拥有医疗数据,机器人产业集聚区拥有动作和具身数据。

数据标注先行先试的价值,就在于把这些原来散落在产业中的数据资源,逐步转化成可以支撑模型训练和行业智能化的数据资产。

对工业智能企业来说,这也是一个很实际的信号。未来工业智能体的竞争,会越来越靠近“高质量数据集+行业知识+模型+工具链+真实场景”的组合能力。

参考来源

  1. 国家数据局:《央视新闻|国家数据局:在32个城市布局新一批数据标注先行先试》,发布日期:2026年8月29日。
    https://www.nda.gov.cn/sjj/swdt/mtsy/0829/20260829095640662031992_pc.html

  2. 国家数据局:《央视新闻|国家数据局:全国已建成高质量数据集超12.6万个》,发布日期:2026年8月29日。
    https://www.nda.gov.cn/sjj/swdt/mtsy/0829/20260829095557774013837_pc.html

  3. 国家数据局:《中国数据产业发展报告(2026)在数博会主论坛发布》,发布日期:2026年8月28日。
    https://www.nda.gov.cn/sjj/zhuanti/ztdsjblh/ztxwfb/0828/20260828233336307959824_pc.html

  4. 国家发展改革委、国家数据局、财政部、人力资源社会保障部:《关于促进数据标注产业高质量发展的实施意见》,发布日期:2025年1月13日。
    https://www.nda.gov.cn/sjj/zwgk/zcfb/0113/20250113101518513076594_mobile.html


分享到