从RAG到机构记忆:V7上下文图谱为何把“证据链”变成企业AI核心资产

机构记忆与上下文图谱信息海报 企业知识库过去两年的主流方案,是把文档切成若干片段,计算向量,在用户提问时召回最相似的几段,再交给大模型组织答案。这套RAG架构解决了“模型不知道内部资料”的问题,却没有真正解决“组织知道什么、为什么知道、知识之间如何关联”的问题。

V7公开的Context Graph案例值得关注,原因不在于它又做了一个知识图谱,而在于它把企业AI所需的上下文重新定义为四类对象:实体、关系、时间和证据。系统先用GPT-5.6 Luna从大量文件中抽取公司、人员、合同、资产与事件,把关系绑定到原始材料,再由更强模型完成跨文档推理,并通过MCP向ChatGPT等客户端提供能力。这里的关键变化是:检索对象不再只是文本片段,而是一个可以追踪来源、沿关系遍历、持续更新的机构记忆。

一、向量RAG的上限,不是召回率,而是缺少“组织语义”

向量检索擅长回答“哪段话和问题最像”,但机构研究经常问的是另一类问题:某家公司与哪些供应商存在依赖?某位董事还关联哪些资产?一项合同变更是否与之后的融资、诉讼或管理层调整有关?这些问题没有一个完整答案藏在单一段落里,答案必须由多份文件中的多个事实拼接而成。

单纯扩大上下文窗口也不能根治问题。把几十份材料全部塞给模型,会增加成本和延迟,还会造成注意力稀释;更重要的是,长上下文只是“把材料放在桌上”,并未建立稳定的对象标识。不同文件中的“ABC公司”“ABC Holdings”和旧名称可能指向同一主体,同名高管却可能是不同的人。如果没有实体消歧,模型每次都要临时猜测,答案难以复现。

因此,Context Graph的价值首先是建立机构级语义坐标系。每个实体拥有稳定ID,每条关系有类型、方向、有效时间和置信度,每个事实又指向原文页码、段落或表格单元格。模型回答问题时,不是凭一次性的上下文“理解”组织,而是在一个持续维护的事实网络上工作。

二、真正重要的不是图,而是图上的证据链

传统知识图谱容易陷入一个误区:只追求节点和边的数量。对企业AI而言,一条没有来源的关系几乎没有生产价值。例如系统记录“甲公司供应乙公司”,使用者会继续追问:依据是哪份合同?合同何时生效?是直接供应还是经销关系?信息是否已经过期?

可审计的关系至少需要携带六项元数据:来源文档ID、原文定位、抽取时间、关系有效期、抽取模型与版本、人工或规则复核状态。如果事实来自表格,还应保存行列坐标与表头;如果来自扫描件,应保留OCR文本与原始页面的对应关系。这样,当模型声称“供应关系在2025年终止”时,用户可以一键回到合同终止条款,而不是只看到一个貌似确定的自然语言结论。

证据链还必须允许冲突存在。年报、新闻稿、数据库和访谈记录可能给出不同数字,系统不应过早覆盖旧值,而应把它们记录为带来源、时间和口径的多个声明。上层推理模型负责说明差异,例如“公司公告采用合并口径,第三方数据库采用单体口径”。企业记忆不是一本永远正确的百科全书,而是一个能展示证据强弱与事实演变的账本。

V7称其HERB检索系统在内部测试中较基线提高69%,并减少无法回答问题上的幻觉。这个数字属于厂商自报,不能直接外推到其他行业,但其评价方向是对的:一个知识系统不仅要考察“答对多少”,还要考察“证据是否支持答案”和“没有证据时能否拒答”。

三、可落地的系统应当分成五层

第一层是原始证据层。合同、邮件、报告、会议纪要、数据库记录和网页快照以不可变对象保存,生成内容哈希,并记录版本、访问权限与保留期限。后续任何抽取结果都必须能反向定位到这一层。

第二层是解析与标准化层。系统完成OCR、版面分析、表格识别、语言检测和文档分类。实践中不要急于让大模型直接抽取全部信息,页眉页脚去除、数字单位归一、日期解析等确定性任务更适合规则或专用模型,否则错误会被带入整张图。

第三层是实体关系层。先定义少量高价值本体,例如企业、人物、资产、合同、事件及“任职于、持有、供应、担保、诉讼关联”等关系。抽取模型输出结构化候选事实,实体解析服务完成去重和消歧。任何低置信度或高风险关系进入人工复核队列,而不是直接成为“真相”。

第四层是混合检索层。图遍历适合查关系,关键词检索适合查精确术语,向量检索适合找语义相近材料。生产系统不应在图数据库与向量数据库之间二选一,而应根据问题分解结果组合三种检索。例如先在图中找到目标公司的关联合同,再在这些合同范围内进行段落向量检索,最后读取原文证据。

第五层是推理与交付层。高能力模型负责制定查询计划、合并证据、识别矛盾并生成答案;MCP或受控API负责把能力提供给聊天、研究和工作流客户端。这里必须把“查询计划”和“最终结论”同时写入审计日志,以便复盘模型为何访问某些材料、为何得出某个判断。

四、模型分工比“一律使用最强模型”更经济

V7案例采用较轻模型进行大规模抽取,再让更强模型执行复杂推理,体现了一种重要工程原则:稳定、重复、可验证的工作应尽量下沉到低成本模型,高不确定性的综合判断才使用高能力模型。

企业可采用三级路由。第一级处理文档分类、字段抽取和格式标准化,要求结构化输出与低单价;第二级处理实体消歧、关系判定和冲突检测,要求较强语义能力;第三级只处理跨文档研究、假设验证和报告生成。每一级都建立独立评测集,避免只看最终答案,无法判断错误究竟来自OCR、抽取、消歧、检索还是推理。

成本控制也不应只计算Token。一次错误的实体合并可能污染数千条关系,后续纠正成本远高于模型调用费。因此,高影响操作要设置“写入门槛”:新关系可以先进入候选区,只有满足双来源印证、规则校验或人工批准后,才能进入可信主图。图谱更新需要版本化,支持回滚和比较两个时间点的变化。

五、企业实施不应从“全量知识图谱”开始

最稳妥的起点是一个明确、可验证的研究流程。例如供应商尽调可先回答五个问题:主体身份是什么、关键股东和高管是谁、核心客户与供应商有哪些、近三年发生过哪些重大事件、每个结论的证据在哪里。围绕这些问题设计本体和评测集,比试图一次建成覆盖全公司的“知识大脑”更容易产生价值。

第一阶段选择500至2000份代表性文档,人工标注50至100个真实问题,并为答案建立金标准证据。基线至少包括关键词检索、普通向量RAG和图谱增强检索。评测指标应包含实体解析准确率、关系抽取精确率、证据命中率、回答完整度、拒答准确率、查询延迟和单次成本。

第二阶段接入增量数据,验证删除、权限变化和事实过期能否正确传播。若员工失去某项目权限,图谱检索也必须立即隐藏相关节点和证据;若原文被依法删除,派生摘要、缓存和向量索引不能继续泄露内容。权限应从证据对象继承到关系和回答,而不是只在聊天入口做一次身份检查。

第三阶段才扩展到自动工作流。系统可以生成公司关系简报、发现合同异常、跟踪管理层变动,但高风险结论必须保留人工确认。所谓50至100步研究流程缩短到分钟级,真正的收益不是完全无人化,而是把研究员从机械找材料转向审查证据、判断口径和处理例外。

六、用“可回答”与“可证明”两套指标验收

很多知识库项目验收时只统计回答正确率,这会掩盖系统最危险的失败:答案碰巧正确,引用却不支持结论。上下文图谱应把评测拆成两条链。第一条是事实链,检查实体是否匹配、关系方向是否正确、时间范围是否有效;第二条是证据链,检查引用材料是否真的蕴含结论、定位是否准确、用户是否有权看到该证据。

可以为每个测试问题预先标注“最小充分证据集”。系统多引用无关材料要扣分,漏掉关键证据也要扣分。对于需要三跳关系的问题,例如“某基金通过哪家控股公司间接持有哪些资产”,还应逐跳检查,不应只凭最终答案打分。这样才能识别模型在中间步骤中猜对结果的情况。

拒答测试同样重要。测试集中应故意加入不存在的合同、混淆同名人物、超出权限的问题和证据相互冲突的问题。理想系统不是强行给出完整答案,而是明确区分“未检索到证据”“证据不足”“存在冲突”和“无权访问”。这四种状态对应不同后续动作,不能统一写成“我不知道”。

上线后还要监控图谱健康度:孤立实体比例、无来源关系比例、超过有效期但未复核的事实数量、同一实体的冲突声明数量、从答案跳转原文的成功率。业务人员纠正一次事实后,系统应把纠错回流到抽取规则和评测集,而不是只修改当前答案。长期来看,这套反馈闭环比一次性的模型升级更能提高可信度。

七、治理难点在权限、删除和时间

图谱天然会放大信息的可发现性。某份文件单独看并不敏感,但把人员、投资、客户和事件连接起来后,可能推导出高度敏感的商业关系。因此,权限不能只绑定文档,还应约束关系遍历与聚合结果。用户有权查看两个节点,不一定有权看到系统推导出的关联。

删除也比普通文档库复杂。原文被撤回后,相关向量、实体属性、关系、摘要、缓存和训练样本都可能成为派生副本。系统需要维护数据血缘,能从一个证据对象找到全部派生产物,并按政策删除或降级可信度。否则“原文件已删除”只是界面状态,知识仍潜伏在图中。

时间维度则决定机构记忆是否会变成机构误导。任职、持股、合同和供应关系都有生效与终止时间。查询“当前供应商”时不能返回三年前已经结束的关系;查询历史交易时又不能用今天的数据覆盖过去状态。每条边最好区分事件发生时间、事实有效时间和系统获知时间,以支持回溯和审计。

八、机构记忆将成为企业AI的长期护城河

模型可以替换,向量数据库也可以迁移,但经过多年清洗的实体主数据、关系历史、证据映射、权限规则和人工纠错记录很难复制。它们共同构成企业独有的“上下文资本”。这也是为什么模型越强,可信上下文反而越稀缺:推理能力可以按调用购买,组织事实却必须在业务过程中积累。

因此,企业下一阶段不应只问“选哪一个大模型”,而应问三个更基础的问题:我们的关键事实是否拥有稳定标识?每个结论能否回到原始证据?权限、时间和冲突是否进入了知识结构?如果答案是否定的,再强的模型也只能把零散材料组织成一段更流畅、却未必可审计的文字。

Context Graph不是对RAG的简单替代,而是把RAG放回更完整的企业知识工程中:向量负责相似性,图负责关系,原文负责证据,权限系统负责边界,模型负责规划与解释。只有这五者同时成立,企业AI才可能从“会回答文档问题”升级为真正可靠的机构记忆。

对准备启动项目的团队,一个可执行的90天顺序是:前两周确定单一业务问题、本体边界和权限模型;第三至六周完成代表性文档解析、实体消歧及证据定位;第七至十周上线混合检索和分层模型路由;最后两周用真实研究员盲测,并集中修复证据错误而非润色答案。若90天后仍无法稳定回到原文,应该缩小范围,而不是继续扩大文档数量。

机构记忆与上下文图谱信息海报要点图文海报

参考资料

  1. OpenAI / V7,《How V7 gives AI agents institutional memory》,2026-09-21:https://openai.com/index/v7/
  2. 2026年9月22日《AI技术每日分析:上下文、运行时与默认安全成为企业Agent新底座》:/2026/09/22/2026-09-22-AI技术每日分析-20260922/
分享到