企业AI项目最常见的预算倒置,是把钱花在模型、界面和演示,把数据整理当成上线前顺手完成的准备工作。
结果通常很一致:聊天窗口很漂亮,回答也很流畅,但同一个问题每次引用不同版本;文件权限被打平;表格、扫描件和附件丢失结构;业务人员不敢依据答案做决定。项目随后进入漫长的“继续调Prompt”和“再换一个模型”,真正的数据问题始终没人负责。
广东省档案馆发布的采购需求,计划基于不少于5万件馆藏档案建设高质量语义特征数据集,并配套智能检索和知识问答系统。公告把准确性、完整性、一致性、可追溯性和合规性写进交付要求。它释放了一个重要信号:高质量数据集正在从政策术语变成有范围、有预算、有验收标准的工程产品。
未来两年,大量政企AI项目会把主交付物从“一个能聊天的系统”调整为“可持续运营的数据资产与任务系统”。模型仍然重要,但在多数知识密集场景,数据版本、权限、语义结构和反馈闭环带来的差距更大。
一、先定义数据产品,不要先定义聊天机器人
“建设知识库”太宽泛。项目启动时需要定义具体数据产品:服务哪些用户,支持哪些任务,覆盖哪些资料,更新频率多高,允许输出什么,不能输出什么。
档案智能检索至少包含目录检索、实体查询、事件关联、原文定位、专题汇编和证据引用。企业场景可能是合同条款核查、设备故障检索、研发规范问答或客服处置建议。不同任务需要的数据结构和质量标准完全不同。
如果目标是“让用户随便问”,项目团队会不断扩大范围,却无法判断何时完成。更可执行的方法是建立任务清单。例如先支持20类高频查询,每类给出输入样例、正确答案、允许的数据源、响应时间和证据要求。数据集围绕这些任务建设,系统也按这些任务验收。
数据产品还要有责任人。业务部门负责定义内容和使用边界,数据团队负责结构、质量和更新,安全团队负责权限与合规,AI团队负责检索、排序和生成。不能把所有问题交给一个“知识库项目经理”,更不能让模型供应商替企业决定哪些内容可信。
二、5万件资料不是5万个文件,而是一组可计算对象
把文档上传到向量数据库,不等于建成数据集。一个可运营的数据对象至少应包含原始文件、结构化内容、元数据、语义关系、权限、来源和处理记录。
原始文件是证据底座,扫描图、PDF、表格、附件和版式都要保存。结构化内容包括标题、段落、表格、页码、日期、机构、人名、地点和主题。元数据说明档案号、形成时间、保管期限、密级、载体和版本。语义关系把人物、事件、机构和文件联系起来。权限决定谁可见原文、谁只能看脱敏摘要。处理记录说明OCR、清洗、切分、标注和复核由谁、在什么版本完成。
对象之间还要保留层级。一本卷宗、一个文件、一页、一段、一张表不是同一粒度。RAG切分若破坏上下文,模型可能把标题与正文分开、把表头与数据分开、把批复与请示混在一起。切块应服务于任务,而不是固定每500字切一次。
建议给每个对象分配稳定ID。后续重做OCR、修正日期或调整切分时,ID不变、版本递增。引用答案时记录对象ID和版本,才能在资料更新后解释当时依据。若每次导入都重新生成向量且没有版本,审计和增量更新都会失控。
三、质量标准必须能被机器和人工共同验收
“准确、完整、一致”如果没有测量方法,就只是合同语言。项目应为不同字段和任务建立可计算指标。
准确性可以抽样核对OCR字符、日期、人名、机构、数字和表格单元格。关键字段不应只给总体准确率,因为大量普通文本会掩盖少量高风险数字错误。金额、编号、时间和否定词需要单独统计。
完整性要检查资料是否漏件、漏页、漏附件、漏表格,段落层级和页码是否保留。对多媒体或特殊格式,不能因为解析器不支持就静默跳过,应明确进入待处理队列。
一致性包括同一实体名称是否统一、日期格式和行政区划是否规范、字段值是否符合字典、同一文档不同版本是否冲突。实体归一不能直接覆盖原文,标准名称和原始表述要同时保留。
可追溯性要求每个结构化字段能回到原文位置,最好保留页码、坐标或图像区域。用户点击引用时看到的是确切证据,而不是整篇几十页文件。处理流水线每一步保存版本、参数和操作者,错误才能定位。
合规性则包括版权、个人信息、密级、保留期和用途限制。数据能被内部人员看到,不代表可以送到外部模型;可以用于检索,不代表可以用于训练。权限策略要随数据对象进入索引和生成链,而不是在前端登录后一次性判断。
四、RAG验收要从“像不像”转向任务指标
知识问答演示容易选择答案明确、资料干净的问题,现场看起来效果很好。正式验收必须建立固定评测集和盲测集。
评测至少分四层。第一层是检索召回:正确证据是否出现在前若干结果。第二层是排序:最相关、最新、权限正确的证据是否靠前。第三层是答案质量:事实、数字、条件和结论是否与证据一致。第四层是拒答:资料不足、权限不够或存在冲突时,系统是否停止编造。
RAG原始论文把参数化模型与可更新的非参数记忆结合,并明确把知识更新与来源追溯列为动机;BEIR在18类异构检索数据集上显示,BM25仍是稳健基线,重排通常效果更好但计算成本更高;RAGAS则把评估拆成检索上下文、忠实使用证据和生成质量等维度。这些研究共同说明:企业不能只用一个“答案正确率”概括系统,更不能默认向量检索必然优于关键词与重排组合。
不同任务需要不同权重。档案检索宁可返回多条候选,也不能漏掉关键史料;合同核查要突出条款与版本;设备维修问答要确保安全条件和适用型号;政策查询必须优先最新有效文件,并提示废止关系。
评测集应覆盖难例:扫描质量差、简称与全称、同名人物、跨文档关系、表格问答、时间条件、否定表达、版本冲突和无答案问题。只测试“某文件是什么时候发布的”,无法证明系统能处理真实业务。
还要记录端到端成本。一个问题调用多少次模型、检索多少对象、耗时多久、需要多少人工复核。准确率提高1个百分点若以十倍成本和延迟为代价,未必适合生产。验收必须同时看质量、速度和单位任务成本。
五、采购合同要把数据集和应用拆开
把“数据治理+知识库+大模型+前端”打成一个总价包,容易让供应商用可见界面覆盖不可见的数据缺陷。建议把交付拆成相互关联的几个包。
第一包是数据清单与治理规则,包括范围、对象模型、元数据、权限字典、质量规则和更新机制。第二包是数据加工成果,包括原始文件映射、结构化对象、标注、关系和质量报告。第三包是检索与生成服务,明确接口、模型可替换性和评测结果。第四包是业务应用,围绕具体任务设计界面和流程。第五包是运营服务,处理新增资料、错误修正、权限变化和效果监控。
付款节点也应与可验收成果绑定。完成一批数据后先抽检,不要等5万件全部加工完才发现规则错误;检索指标达到门槛后再进入生成;业务试点达到使用效果后再扩展范围。
合同要明确数据和派生成果归属。原始资料、结构化数据、标注、实体词典、评测集、质量规则和反馈记录都应可导出,不能被锁在供应商专有平台。模型和向量数据库可以替换,数据资产与评测资产必须留在甲方控制下。
供应商使用外部模型、OCR或标注平台时,要披露数据流向、处理地域、保留策略和分包方。涉密或敏感资料需要在受控环境处理,日志和临时文件同样受约束。
六、数据集上线后才进入真正的运营期
知识数据不是一次性交付。新文件不断产生,旧文件会修订,机构名称和权限会变化,用户也会发现错误。若合同只覆盖建设、不覆盖运营,系统上线几个月后就会陈旧。
需要建立数据变更流水线:新增资料自动进入待处理区,完成病毒扫描、格式识别、OCR、元数据抽取和权限继承;质量规则通过后进入正式索引;高风险字段或低置信内容进入人工复核。修正已有对象时,保留旧版本和影响范围。
用户反馈不能只收集“赞”和“踩”。应允许标记证据错误、答案遗漏、版本过期、权限异常和任务未覆盖,并自动关联查询、检索结果、模型版本和数据对象。数据团队按错误类型分派,而不是把所有反馈交给Prompt工程师。
建议建立数据SLA:新资料从接收到可检索的时间,关键错误修复时间,权限变更生效时间,失效文件下线时间,以及评测集定期回归频率。业务部门需要知道数据产品和其他生产系统一样,有服务承诺和运行责任。
七、AI服务商的价值会从模型调用转向数据工程
通用模型能力不断接近,单纯转售API的利润会被压缩。真正持续的收入来自理解客户数据、建立对象模型、维护质量规则、连接业务系统和运营反馈闭环。
服务商需要补齐四类能力。第一是行业数据建模,知道哪些字段、关系和版本影响业务。第二是复杂文档处理,能处理扫描件、表格、图纸、附件和混合版式。第三是数据治理与安全,把权限、溯源和保留期贯穿检索链。第四是评测运营,用固定任务集持续比较模型、检索策略和数据版本。
产品也应从“上传文件即可问答”升级为数据工作台。客户能看到覆盖率、低质量对象、权限冲突、更新队列、热门查询和失败任务;可以修正实体、合并重复对象、调整规则并触发回归测试。
服务商若只展示答案,不展示数据健康度,客户很难形成长期信任。反过来,能够把数据质量改进与业务指标联系起来,就有机会从一次性项目转为持续运营合同。
八、企业的12周落地路线
第1至2周,选择一个高价值、边界清晰的任务,不做“全企业知识问答”。收集100至300个真实问题,标注正确证据和答案,确定无答案与权限场景。
第3至5周,设计数据对象和处理规则。选择一批代表性资料,覆盖扫描、表格、附件、多个版本和敏感内容;建立稳定ID、元数据、切分、权限和溯源方法;人工抽检并修正规则。
第6至8周,构建检索基线。先不用复杂Agent,验证关键词、向量、结构化过滤和重排组合;测量召回、排序、延迟和成本。只有正确证据稳定进入结果,才接生成模型。
第9至10周,加入答案生成和引用。设置拒答、冲突提示和权限过滤;对数字、时间、名称和条件做自动校验;让业务人员进行盲测。
第11至12周,接入真实流程并建立运营看板。记录哪些问题被使用、哪些需要人工、错误来自数据还是模型、新资料多久上线。达到门槛后再扩展任务和数据范围。
整个过程中,评测集、数据规则和反馈记录与应用同等重要。它们决定项目能否在换模型、换供应商后继续运行。
九、推荐的数据与检索技术架构
底层采用对象存储保存不可变原件,元数据仓保存稳定ID、版本、权限和处理状态,搜索引擎承担关键词与结构化过滤,向量索引只保存语义表示及对象引用。向量库不应成为唯一事实库,因为它不擅长版本、事务和复杂权限管理。
处理流水线按事件运行:原件进入后生成内容哈希,完成格式解析、OCR、版面分析、表格恢复、实体抽取和切分;每个步骤输出质量分和错误码。低置信对象进入人工队列,高置信对象也按比例抽检。重处理生成新版本,不覆盖旧结果,索引切换采用蓝绿方式,便于回滚。
检索时先由权限与结构化条件缩小候选,再组合关键词、向量和图关系召回,最后用重排模型排序。生成模型只能看到通过权限过滤的证据片段,并同时收到对象版本、页码和来源等级。答案输出后,规则服务检查数字、日期、引用覆盖和禁答条件;高风险任务转人工复核。
架构验收应包含故障演练:OCR服务不可用时资料是否进入待处理而非丢失,向量索引重建时线上检索是否连续,权限撤销后缓存多久失效,模型供应商切换是否影响数据对象与评测。能经受这些工程约束的数据平台,才配得上“可持续运营”。
结语
高质量数据集进入政府采购与项目验收,意味着AI产业正在补上长期被忽略的基础层。一个可靠的知识系统,首先是资料范围清楚、对象结构稳定、质量可以测量、权限能够继承、证据可以回溯;聊天界面只是这些能力的使用入口。
企业应改变交付顺序:先验收数据资产,再验收检索,最后验收生成和业务应用。模型可以按季度更新,数据对象、质量规则和评测资产必须长期积累。
如果一个AI项目无法回答“用了哪一版资料、证据在哪里、谁有权看、错误怎样修”,它就不应进入关键业务。先把数据做成可验收资产,再谈智能。
参考资料
- 广东省档案馆|档案专题高质量语义特征数据集建设及配套智能检索与知识问答系统采购公告|2026-09-20:5万件档案数据集及质量要求。https://www.da.gd.gov.cn/portal_home/content/10923
- Lewis等|Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks|NeurIPS 2020:RAG的参数化/非参数记忆架构与来源问题。https://arxiv.org/abs/2005.11401
- Thakur等|BEIR: A Heterogeneous Benchmark for Zero-shot Evaluation of Information Retrieval Models|NeurIPS 2021:异构检索基准与BM25、稠密检索、重排比较。https://arxiv.org/abs/2104.08663
- Es等|RAGAS: Automated Evaluation of Retrieval Augmented Generation|2023/2025:检索上下文、忠实性与生成质量评测框架。https://arxiv.org/abs/2309.15217
- NIST|AI Risk Management Framework:把可信性要求纳入AI设计、开发、使用和评估。https://www.nist.gov/itl/ai-risk-management-framework
- ISO/IEC 25012|Data Quality Model:数据质量特征模型。https://www.iso.org/standard/35736.html