Glance:把本地VLM变成可校准的视觉巡检决策接口

Glance:把本地VLM变成可校准的视觉巡检决策接口封面

视觉语言模型进入工厂后,最容易落入两个误区:一是把“能描述图片”当成“能稳定判定缺陷”,二是把模型输出的一句“看起来正常”直接接到放行逻辑。工业巡检真正需要的不是更会说话的模型,而是一个可测量、可校准、可设阈值、必要时会拒答的决策接口。Glance的价值正在这里:它不是新模型,也不训练模型权重,而是围绕冻结的开放视觉语言模型构建测量与校准层,直接读取一次前向计算中的答案词元logits,把图片问题约束为是/否、单选和有序评分,并返回概率。

按照项目说明,Glance默认使用Apache-2.0许可的Qwen3-VL-4B;图像留在本机,不生成长文本,也无需把图片发送到云端。它支持命令行、Python接口和仅监听本机地址的HTTP服务。对工厂而言,这意味着VLM不必以“聊天机器人”形态进入产线,而可被封装成类似传统视觉算法的结构化组件:输入图像、问题和判定尺度,输出类别、概率、置信度、评分及调用日志。

Glance:把本地VLM变成可校准的视觉巡检决策接口技术图

一、为什么读取logits比生成一句答案更适合巡检

生成式VLM通常逐词生成JSON或自然语言。这个过程会引入与视觉判断无关的失败:格式错误、同义词漂移、解释过长、采样随机性,以及“先说是、后文又保留意见”的语义冲突。Glance把问题收缩为有限答案空间。例如“端子是否漏装”只比较“是/否”对应答案词元的logits;“标签状态属于哪一种”只在“完整、翘起、缺失、其他”之间归一化;“划痕严重度”则在预先给定的有序等级上形成概率分布。

设候选答案集合为 (A={a_1,\ldots,a_K}),模型在指定答案位置给出logit (z_k),最基本的封闭集概率为:

[
p_k=\frac{\exp(z_k/T)}{\sum_j\exp(z_j/T)}
]

其中温度 (T) 可由校准数据估计。二分类可返回“陈述为真”的概率;单选返回各选项概率及最高项;有序评分不应只取最高概率等级,还可计算期望分数 (s=\sum_k k p_k)。这点对工业图像尤其重要:轻微与中等缺陷往往相邻混淆,期望分数能保留“介于两级之间”的信息,便于排序、抽检和升级复核。

概率并不天然等于真实正确率。一个输出0.9的模型,可能在同类样本上只有70%正确。因此,logits只是让校准成为可能,而不是自动完成校准。Glance提供无标签和有标签两类拟合:无标签拟合可用一小批现场图像修正量表上的恒定偏移;有标签拟合则针对特定评分准则学习概率映射。项目特别强调,拟合与准确的rubric文本、模型版本绑定,不能把A工位“焊缝飞溅等级”的校准直接迁移到B工位“表面划伤等级”。

二、面向产线的接口架构

一个可落地的Glance巡检单元可分为六层。

第一层是成像层,包括相机、镜头、照明、触发器和工装定位。VLM不能补偿严重的曝光漂移、反光和视角错位,成像条件仍应先按机器视觉工程规范固化。第二层是图像治理层,负责裁剪ROI、去除无关背景、记录相机与工位元数据,并生成不可变的图像哈希。第三层是Glance推理层,在边缘工作站加载本地VLM,将同一张图像的多项问题批量执行。项目说明同一图像可被读取一次,后续问题复用图像前缀,因此“是否漏件、方向是否错误、标签是否可读、表面是否污染”可作为一个请求处理。

第四层是校准与策略层。它不只保存模型概率,还执行按风险设计的阈值:高置信通过、低置信拦截、中间区间进入人工复核。例如对安全关键漏装,可设置“缺陷概率≥0.35即拦截”,以召回率优先;对低风险外观问题,则可设置更高阈值,控制误报。第五层是产线集成层,通过本地HTTP、OPC UA网关、MES或质量系统传递结果。VLM建议只提供“判定建议”,真正的停线、放行或返工动作由PLC/MES中的确定性规则执行。第六层是观测层,保存模型版本、rubric版本、校准版本、原始概率、阈值、最终动作和人工复核结果,用于漂移监控与审计。

推荐的响应对象至少包含:image_idstation_idmodel_revisionrubric_hashcalibration_id、各选项概率、期望评分、策略阈值、decisionabstain_reason、延迟和时间戳。不能只落库最终的“OK/NG”,否则现场发生争议时无法还原究竟是模型、阈值、成像还是规则导致了判定。

三、阈值、拒答与风险成本

工业阈值不应从“0.5看起来合理”开始,而应从错误成本开始。设漏检成本为 (C_{FN}),误检成本为 (C_{FP}),在概率可信且类别先验稳定的理想条件下,可由期望风险推导阈值;但现场更可靠的做法,是在独立验证集上绘制精确率—召回率曲线,选择满足业务约束的工作点。例如:关键缺陷召回率必须达到99%,在这个前提下再寻找最低误报率。

同时应设置拒答区间,而不是强迫模型处理所有样本。可采用双阈值:正常概率高于 (t_{pass}) 才自动放行,缺陷概率高于 (t_{fail}) 才自动拦截,其余送人工或传统专用算法。对于多分类,除最高项概率外,还应观察第一、第二名概率差、分布熵和“其他”类概率。对有序评分,则可按“期望分数+置信度”组合路由:高分高置信直接拦截,高分低置信优先复核。

校准质量可使用ECE、Brier分数、负对数似然和可靠性图评估,但生产验收不能止于这些总体指标。必须按材料批次、颜色、相机、班次、产品型号和缺陷类型切片。总体ECE很低,并不意味着黑色零件、夜班照明或新供应商材料上仍然可信。阈值也必须版本化;任何模型、提示词、裁剪策略、相机参数或量表文本变化,都应触发回归验证。

四、数据工程约束:rubric本身就是软件接口

VLM巡检的数据难点,往往不在图片数量,而在判定语言是否可执行。好的rubric应满足四点:等级互斥、边界可观察、顺序明确、与实际处置一致。“轻微、一般、严重”过于主观;“无可见划痕、单条且长度小于5毫米、多条或长度5—20毫米、超过20毫米或影响功能面”更适合标注和复核。若图像中无法可靠估计毫米尺度,就必须加入标尺、固定视场,或改用像素/区域占比等可见标准,不能靠模型猜尺寸。

数据集要保留原始图、ROI、采集参数、工单、产品版本和标注者信息。训练或校准集、阈值选择集、最终测试集应按时间或生产批次隔离,避免同一零件的近重复帧跨集合泄漏。缺陷稀少时,不能只报告准确率;若一万张中只有十张缺陷,全部判正常也会得到99.9%准确率。应报告每类召回率、每千件误报数、缺陷漏检上限,以及在拒答覆盖率下的选择性准确率。

人工标签也不是绝对真值。建议关键样本双人独立标注,冲突由质量工程师裁决,并记录一致性。若人之间都无法稳定区分三级和四级,就不应要求模型稳定区分。Glance的校准可以消除概率偏差或量表偏移,但不能凭空创造模型没有的几何能力。项目公开结果也提醒:小模型在对角方向、相对大小、较多数物体计数,以及倾斜、遮挡、截断等非图像质量量表上存在明显局限,增加标签并不一定能挽救。这类任务应优先使用几何测量、检测/分割模型或规则视觉,与VLM做组合,而不是单押VLM。

五、边缘部署与运行治理

Glance适合图像不能出厂、断网运行、单图多问和需要概率阈值的环境。项目给出的硬件路径包括Apple Silicon和CUDA GPU;默认4B模型约需下载8.9GB权重,建议至少16GB统一内存或12GB显存,较小设备可选2B,24GB GPU可尝试8B。项目也提供实验性的MLX路径,但生产选型应以本厂硬件上的压力测试为准,不应把仓库中的单机实验数字直接当作SLA。

部署时应把模型权重、依赖、容器镜像和模型revision全部固定;首次下载后做离线安装包和许可证清单;服务只绑定产线内网或本机接口,并限制可访问目录。相机高频触发时,先计算节拍预算:采图、传输、预处理、VLM前向、规则执行与PLC握手必须共同满足周期。若节拍过紧,可先由传统视觉筛选疑似样本,VLM只做二次判读;也可降低图像最长边、合并多问题、异步处理非关键外观项。

运行期至少监控P50/P95/P99延迟、GPU内存、失败率、拒答率、概率分布、各工位阳性率及人工推翻率。概率整体向0.5收缩,可能意味着照明、焦距或产品外观发生漂移;阳性率突然归零则可能是相机遮挡、ROI错误或接口失效。监控必须连接原图抽样,而非只看数值仪表盘。

在本地部署层面,建议将采图进程、推理服务和产线适配器拆成三个独立单元。采图进程只负责从相机取得带时间戳的原始帧并完成完整性检查;推理服务常驻加载模型,避免每次请求重新初始化权重;适配器负责把结构化结果转换为MES、PLC或质量系统能理解的消息。三者之间使用有界队列,队列满时必须执行明确策略:安全关键工位进入人工复核或暂停放行,非关键外观检测则可按配置丢弃过期帧,不能让不断堆积的旧图像造成“结果正确但已经迟到”。生产服务还应提供健康探针、模型预热、请求超时、熔断和自动重启,并在重启后核对模型文件哈希、revision及校准文件是否与发布清单一致。

高可用不等于简单运行两个模型副本。若两个实例共享同一块GPU、同一电源或同一相机链路,它们仍可能同时失效。企业应先按风险决定需要何种冗余:普通外观分选可以故障后转人工;关键防错可能需要两台边缘主机、独立电源和确定性的旁路规则。升级时采用蓝绿发布:新旧版本同时接收影子流量,比较逐样本概率、最终决策、延迟和错误码;只有差异经过签核,才把控制流量切到新版本。回滚包应同时包含旧模型、依赖、rubric、校准参数和阈值策略,不能只回滚模型权重。

概率校准也应被当成持续的质量计量过程。初次上线时,可将数据分为模型评估集、校准集、阈值集和一次性验收集:校准集只估计概率映射,阈值集只选择业务工作点,验收集只做最终报告,避免同一批数据被反复利用而产生乐观偏差。对二分类,可按概率区间统计样本数、平均预测概率和真实缺陷率,绘制可靠性图;对有序评分,则分别检查各等级概率、期望分数偏差和相邻等级混淆。样本很少时,不应因为某个分桶暂时“百分之百正确”就认定概率可靠,而应报告置信区间,并合并稀疏区间或继续采样。

阈值发布需要与概率校准版本绑定。假设重新校准后,同一张图的缺陷概率从0.42变为0.67,旧阈值若原样沿用,业务含义已经改变。因此每次校准都应在冻结的阈值集上重新计算候选工作点,并输出混淆矩阵、每千件误拦数量、预计人工复核量和最坏切片表现。对极低缺陷率场景,还应通过人为留出的已知缺陷件、历史缺陷回放或经过审批的缺陷样本注入来验证召回链路;不能等真实缺陷偶然出现后才发现报警、消息或执行机构没有连通。

误差监控要区分四类变化。输入漂移关注亮度、清晰度、ROI位置、颜色和产品型号分布;输出漂移关注概率直方图、熵、拒答率与类别占比;性能漂移关注经人工复核后的召回率、精确率和校准误差;系统漂移关注延迟、超时、显存不足和服务重启。每类指标都应有短窗口和长窗口基线,告警后自动附带代表性原图及上下文。若一段时间内缺少真值,可先用输入和输出漂移做早期预警,但不能把“分布没变”误当成“准确率没变”。人工复核结果需要按固定时限回流,形成延迟标签,并定期重算阈值下的真实风险。

还应建立哨兵样本集:选择少量稳定的正常件、典型缺陷、边界件和成像干扰样本,在每次服务启动、模型升级、驱动升级及相机维护后自动回放。哨兵测试不代替完整回归,但能快速发现预处理变化、色彩通道错误、提示词丢失或校准文件加载失败。若同一哨兵样本的概率波动超过预设范围,即使最终OK/NG没有改变,也应阻止发布并查明原因,因为它可能预示阈值附近的大量生产样本即将翻转。

六、如何验证:从模型评测到产线验收

建议用四道门完成验证。

第一道是离线可行性门:选一个明确、可从单张图像判断的任务,收集覆盖正常、典型缺陷、边界缺陷和干扰项的数据,冻结测试集,比较Glance、生成式VLM、传统视觉和人工基线。第二道是校准门:用校准集拟合,再在独立测试集上检查可靠性图、ECE、Brier分数和阈值下的漏检/误检,不允许在测试集上反复调阈值。

第三道是影子运行门:模型在线接图但不控制设备,连续覆盖多个班次、换型、维护和供应商批次;每天抽样复核自动通过样本,所有自动拦截样本均记录人工结论。第四道是受控自动化门:先让系统只触发提示或旁路分流,达到约定样本量与置信区间后,再逐步开放自动拦截;自动放行应最后开放,并保留一键回退到人工/原系统的能力。

验收文件必须写清:适用产品与缺陷、不可用条件、最低成像质量、模型与校准版本、阈值、目标召回率、最大误报率、最大拒答率、延迟SLA、复核流程和重新验证触发条件。没有这份“适用性声明”,模型精度再高也只是实验,不是生产能力。

七、成熟度判断与企业小试路线

从工程成熟度看,Glance已经具备本地运行、结构化概率输出、日志、校准和评测资产,适合作为技术验证或受控影子系统;但它不是开箱即用的工业质检产品。相机治理、工位协议、模型安全、HA、MES集成、量具溯源和长期漂移管理仍由企业完成。

企业小试可控制在六到八周。第一周选择“单工位、单产品族、单一高频判定”,明确错误成本;第二周固定成像并制定rubric;第三至四周采集与双人标注,建立传统算法和人工基线;第五周完成Glance零样本评测、少量校准与阈值设计;第六至七周影子运行;第八周形成Go/No-Go结论。Go的条件不是“演示看起来聪明”,而是独立测试和现场影子数据同时满足召回率、误报率、拒答率和节拍,并且失败模式可被识别和回退。

最值得关注的并非Glance是否替代现有视觉,而是它把VLM从不稳定的自然语言生成器,收缩成可观测的概率测量器。传统视觉负责尺寸、位置和确定性几何,VLM负责难以穷举的语义判定,校准层负责把概率变成风险,规则系统负责最终动作。四者边界清楚,才是本地VLM进入视觉巡检的正确姿势。

参考资料

分享到