机器人出厂后怎样继续学:CFAM把现场经验写进可控记忆

CFAM机器人部署后现场适应示意图

工厂里最常见的机器人“新问题”,未必是从来没见过的任务。还是抓同一种零件,只是上料盒偏了几厘米;巡检车仍走那条路,只是地面更湿;机械臂依然搬同类工件,只是负载和摆放角度不同。工程师当然可以重新采样、标注、微调和验证,但每次细小变化都走完整流程,现场会先被停机时间拖垮。

Skylark Labs与卡内基梅隆大学、加州大学伯克利分校等研究者的论文《Continual Field-Adaptive Models (CFAMs) for Post-Deployment Physical AI》于9月3日提交arXiv,9月27日获得行业媒体进一步报道。[1][2] 它讨论的是部署后、设备端、无梯度的近分布变化适应。把它说成“机器人学会任意新工作”,会误读论文最重要的限制:新情况必须仍在已有技能族附近,且新的现场经验要先被判定为成功。

冻住底座,只让一层记忆生长

CFAM将系统拆成相对稳定的Sensor、Reasoning、Action三个模块,以及可以在现场写入的Capsule Field。Sensor把多模态观测转为有三维几何依据的场景表示;Reasoning分解任务、选择技能并评估结果;Action根据当前几何执行相应技能。论文设定前三者在部署后冻结,不通过现场梯度更新直接改变其参数。Capsule Field则保存可调用的Competence Capsule:它不是一张原始视频,而是把触发情境、几何锚点、动作轨迹和结果约束联系起来的一份技能记录。[1]

一个直观例子是“从料箱指定区域拿起工件”。在演示时,系统记录工件几何锚点与末端轨迹;换到另一处相近姿态时,先检索匹配的胶囊,再用Geometric Residual Transform(GRT)将原轨迹按当前三维锚点做几何变换。这里的变化是对已知动作重新对位,而不是从零生成一项抓取技能。Reasoning模块仍需判定任务阶段与结果,位姿估计、遮挡、末端抓持和执行器精度任何一环有偏差,几何变换都可能无法补救。

论文把技能执行单位从“每一步都解码一次动作”改为“按技能发出经过几何调整的动作”;对于由多个技能组成的任务,理论上可以减少重复推理调用。但速度优势应在真实控制频率、视觉处理时延和故障重试下测量,不能仅凭推理调用次数判断产线节拍。尤其在接触丰富的插装、去毛刺或柔性物料操作中,单次轨迹变换不能替代高频力反馈和过程控制。

所谓“继续学习”发生在成功执行之后。系统观察到一个位于已知技能适用边缘的实例,且结果经过内部信号验证,便把它写作新的胶囊;未来再碰到类似工况,就多了一个就近可检索的经验点。论文描述的现场更新不需要操作员逐条打标签,也不做梯度反传,强调单次前向计算和本机写入,同时对记忆体量设置固定预算。[1] 这比随时改动整个策略模型更容易隔离回归风险,却仍需要回答一个棘手问题:机器怎样知道刚才确实成功了?

对于“放进治具”这样的动作,夹爪已松开并不等于工件就位;对于巡检,走完全程也不等于识别了异常。论文的现场增长依赖可验证的成功案例,而不是从失败中自主推导正确动作。企业如果要借鉴这一设计,应优先找有独立结果信号的工位,例如视觉复核、重量确认、扭矩曲线或机床状态回传。若把错误的成功信号写进记忆层,系统可能重复同一错误,而且越来越有把握。

CFAM冻结模块、胶囊检索与受控写入流程示意

论文数字该怎样读

作者在机械臂、四足、人形、四旋翼及越野车五类载体上评估架构;论文说明,物理平台对照策略π₀、CogACT、SpatialVLA使用同一套自有多载体数据。论文报告CFAM只用标准策略前期训练轨迹的40%,就达到后者使用全部轨迹时的工作点,换算为前置轨迹数减少2.5倍。这说的是特定数据和工作点的训练效率,不是任一工厂可少采60%的数据,更不是设备采购成本下降60%。自有数据集的任务与分布仍须结合原文评估。[1]

在另一组近分布变化测试中,作者报告自动吸收经验证成功的案例后,动作成功率由74.0%升至87.9%,提高13.9个百分点;百分比点和相对提升百分比不能混用。顺序适应的仿真实验中,Backward Transfer为−0.5个百分点,LoRA对照为−11.4个百分点,表示该测试里旧技能受影响较小。这里也不能把“仿真里的遗忘较少”直接写成“多班次产线零遗忘”:长期磨损、相机重标定、耗材更换和现场人员介入,都可能改变误差来源。[1]

这些数字覆盖的是研究团队选定的任务、基线和验证协议。跨五类载体证明设计曾在不同硬件上测试,不代表一份胶囊能从四足机器人直接移到机械臂。论文同时明确,完全陌生的新任务、没有已知技能族的开放世界新物体,以及由现场失败自动纠正错误,都不在此次实证边界内。文章所述的形式化性质也有前提;如果感知误差、结果验证或检索距离的前提被破坏,不能把数学保证当作无条件安全认证。

另一种误解是把胶囊记忆理解成“无限堆案例”。本机内存、检索时间和相似案例冲突会随运行时间增加。论文提出固定预算下的衰减与压缩,但企业真正关心的是:压缩后哪一类罕见工况会丢失?如果正常生产样本过多,少量但重要的安全边缘案例是否会被挤出?因此,保留策略必须按风险分级,而不是简单按出现频率排序。

给工厂的试点方案:先划一个小而硬的边界

最适合先试的不是“让机器人接管整条产线”,而是一个已知动作比较成熟、变化范围能刻画清楚的工位。可以选几种形状相近但位置变化较多的工件,明确质量、外形尺寸、允许偏移、抓取区域、碰撞禁区和机床开门状态。先用原有策略跑出基线,再引入可检索经验层;两组要用同样的料批、班次和抽样方式。否则工件本身变简单了,也会看起来像算法变强。

验收时把样本切成三层:训练时见过的常规工况、已知技能族边缘的近分布变化,以及明确超出边界的陌生工况。第一层测回归,第二层测适应,第三层测拒绝或交接人工的能力。对每次写入记录版本号、触发信号、相机和机器人标定状态、检索到的原胶囊、结果证据及操作员是否复核。写入应可撤销;发生碰撞、质量复检失败或异常停机时,能够回放并停用相关胶囊,而非连夜重刷整个模型。

不能只统计“抓取成功率”。还要看每百次操作的人工接管数、返工率、节拍分布尾部、误判成功写入的次数、日志完整率、失败后的安全停止时间、断网条件下是否继续符合边界。对于高危设备,模型输出不得绕开安全PLC、机械限位、急停和门禁联锁;自主记忆的调用权限必须低于确定性的设备安全约束。新胶囊最好先经过影子运行和质量复核,再进入自动执行。即便论文设定可自动写入,企业量产环境也可以选择更保守的发布门槛。

现场团队还要约定哪些变化不属于近分布变化。换刀、换夹爪、换摄像头、工件材料或表面处理改变、工装基准重建,都可能让旧几何锚点和成功信号失效。发生这类事件,应进入重新标定或正式工艺变更流程,而非由记忆层悄悄吸收。软件团队负责版本与回滚,工艺工程师负责判定零件与动作允许范围,设备安全负责人负责停机和联锁测试;职责拆开,才能避免“算法会适应”变成无人负责。

经济账也必须算在正确位置。CFAM研究指向的潜在收益是减少重复示教、缩短已知任务的现场调整时间、降低因小幅工况漂移造成的停线。但它会增加三维感知、结果校验、日志治理、验收和故障分析的成本。要比较的是一季度或一整条产品变更周期的工程师工时、良率和设备可用率,不是某次演示视频里少了几次示教。保留不使用胶囊的原始流程作为回退路径,也是试点成本的一部分。

两类容易被忽视的退化

第一类是检索看起来相近,工艺上却不同。假设同尺寸金属件一批表面有油、一批经过喷砂,两者在视觉与三维几何特征上可能很相似,但吸附力、夹爪摩擦和允许接触的表面位置不同。若系统只用位置与外形判断胶囊“可复用”,就会把正确的轨迹用在错误的物理条件下。企业需把材质、表面处理、载荷、工序版本等离散属性加入检索或硬性权限约束;与其让相似度分数替代工艺卡,不如在越界时明确拒绝执行。

第二类是确认信号漂移。传感器积灰、视觉复核镜头换焦、称重台零点偏移,都可能在机器人控制本身没变时,使“已成功”的判断逐渐失真。对写入记忆层的成功事件,至少保留两种可交叉检查的证据,例如夹紧反馈加首件尺寸,或夹爪压力加下游工位扫码;出现冲突就冻结写入并通知维护,而不是持续收集可疑胶囊。对于事后才能确认质量的产品,系统可先把候选经验保存在隔离区,待下游检验反馈到达再决定是否开放检索。这样会牺牲一部分学习速度,但更符合工业质量追溯的时间顺序。

还要测试写入后的选择偏差。机器人能成功并主动保存的,往往是本来就接近已有能力的情况;真正难的失败样本不能按论文当前机制自动变成新技能。如果统计报表只展示胶囊库中越来越多的成功记录,运营团队会误以为全部工况都在改善。按原始到达的任务流计算分母,分别公布被拒绝、超时、接管和经确认失败的数量,才能看出适应边界有没有扩大。对于事故后追责,胶囊的来源、启用时间与使用次数还应与工单、质量记录关联,避免复盘时找不到是哪一次现场写入影响了哪一批产品。

值得跟踪的,是“会学”之后谁来负责

CFAM提出的架构有价值,因为它将“底座能力稳定”和“现场经验增长”分成两个不同的工程对象。既有策略不必为每个位置变化重新训练,新增经验也可以有边界、有来源、有回滚记录。但研究离大规模连续生产还有距离:对成功信号的依赖、近分布范围的界定、固定内存下的经验保留,以及几何迁移面对接触任务时的表现,都需要第三方和客户工况继续检验。

厂商如果宣称部署后持续学习,采购方不妨问五个具体问题:到底写入了什么;什么条件下才允许写;如何证明该次动作成功;旧任务是否按同样口径回归;一条错误经验怎样撤销。答不清这些问题,“会学”不过是把维护工作藏进了黑箱。能答清,并在现场保留审计证据,才可能让机器人对那些每天都会出现的小变化少一些手工返场。建议首轮项目签订阶段性退出条件:如果连续两周新增胶囊并未提高盲测合格率,或者回归任务的质量指标下降,就暂停自动写入,回到原策略查找原因;如果达到约定门槛,再分批扩大工件和班次。把扩围决定交给生产、质量与安全共同签字,比单独看算法团队的成功率曲线可靠。

资料与核验口径

[1] Pancholi 等,《Continual Field-Adaptive Models (CFAMs) for Post-Deployment Physical AI》,arXiv:2609.04552v1,提交于2026-09-03;架构、数据对照、74.0%→87.9%、Backward Transfer及研究边界均据原论文。https://arxiv.org/abs/2609.04552 (论文HTML全文)

[2] Robotics & Automation News,《Skylark Labs researchers develop AI system that enables robots to keep learning after deployment》,2026-09-27;为后续行业报道,非论文首次发布日期。https://roboticsandautomationnews.com/2026/09/27/skylark-labs-researchers-develop-ai-system-that-enables-robots-to-keep-learning-after-deployment/105179/

分享到