重载机器人采购边缘AI平台时,最容易比较的数字是TOPS。数字大、传播快,也便于写进方案。但机器人到了现场,问题通常不发生在峰值算力上,而发生在内存拥塞、传感器丢帧、温度降频、驱动不稳定、网络闪断和异常状态无法恢复上。
2026年9月披露的Praxis One平台采用MediaTek Genio Pro 5100,单SoC NPU算力约106 TOPS,面向重载机器人和本地多模态推理。这类单SoC路线有明显吸引力:集成度高,板级结构简单,功耗和物料成本可能低于多芯片系统。但对工程团队来说,106 TOPS只是选型起点。能不能部署,要看整条感知—推理—决策—控制链是否在目标工况下稳定运行。
下面这份清单不针对某一款芯片,而是用于审查重载机器人边缘AI方案。对象包括矿山、港口、仓储、工程机械和大型制造现场中的移动机器人、装卸机器人及自主作业设备。
一、先把工作负载写清楚,再换算算力
“需要跑大模型”不是工作负载描述。工程团队至少要列出每个模型的输入尺寸、帧率、精度格式、并发数量、上下文长度、调用频率和截止时间。例如:四路1080P视频以每秒25帧采集,其中两路做目标检测,一路做深度估计,一路只在告警时调用视觉语言模型;激光雷达每秒输出十帧点云;控制策略每20毫秒更新一次。
TOPS通常指特定低精度条件下的理论峰值。模型若包含NPU不支持的算子,部分计算会回退到CPU或GPU;内存搬运、前后处理和解码也不会凭空消失。选型时应要求供应商提供目标模型的端到端数据,而不是把芯片峰值乘以一个经验系数。
建议把负载分为三类。硬实时负载包括避障、制动、姿态稳定和安全联锁,必须在确定时间内完成;软实时负载包括路径规划、目标跟踪和抓取位姿,偶发延迟可以容忍但会影响效率;非实时负载包括日志压缩、地图上传和模型更新。三类任务不能放进同一个无优先级队列。
还要保留余量。实验室中的平均占用率不应成为量产配置。模型升级、场景变复杂、传感器增加都会吃掉空间。对承担控制相关任务的平台,持续负载下保留30%左右的计算和内存带宽余量更稳妥,具体数值应通过压力测试确定。
二、看端到端时延,不看孤立推理时间
机器人真正关心的是从物理事件发生到执行器响应的总时间。链路包括曝光、图像传输、解码、预处理、排队、推理、后处理、决策、总线发送和执行器动作。供应商展示的“模型推理8毫秒”,可能只覆盖其中一段。
验收时应在链路两端打时间戳,并统一时钟源。若相机、边缘主机和控制器时钟不同步,日志看起来完整,却无法判断延迟发生在哪一段。IEEE 1588 PTP、硬件触发或设备厂商提供的同步机制,需要在方案阶段确认。
平均时延意义有限。至少要记录P50、P95、P99和最大值,并在高温、满负载、存储写入、网络拥塞等条件下重复测试。重载设备可能连续工作十几个小时,十分钟跑分无法暴露内存泄漏、热降频和队列堆积。
硬实时安全功能原则上不应只依赖通用AI推理。紧急制动、限位和碰撞保护应有独立安全链路,AI可以提前识别风险,却不能成为唯一保护层。即使AI主机死机,安全PLC或安全控制器也应能把设备带入安全状态。
三、内存容量够用,不等于内存系统够用
多模态模型和多路视频首先压垮的往往是内存带宽。摄像头帧缓冲、点云、模型权重、KV Cache、地图和日志同时读写,峰值算力再高也可能因为等待数据而闲置。
需要核对四组数据:可用内存容量,持续带宽,CPU/GPU/NPU之间是否支持零拷贝,共享内存发生争用时的性能。若视频解码后必须在多个处理器之间反复复制,延迟和功耗都会上升。供应商应展示目标管线中的实际带宽占用,而不只是芯片手册上的理论值。
容量评估要包含最坏情况。模型常驻内存之外,还要计算双版本更新、临时张量、异常缓存和系统服务。采用A/B分区升级时,新旧模型可能短时间同时存在。现场若需要保存故障前后几十秒的原始数据,存储和内存缓冲也要单独预算。
对于视觉语言动作模型,不能只按参数量估算。图像Token数量、上下文窗口和连续对话状态会使显存或统一内存占用波动。应给每类任务设置上下文上限和超时,避免一个低优先级诊断任务拖垮实时管线。
四、传感器和控制接口必须按现场逐项核对
重载机器人接口多,且不少不是消费电子常见接口。摄像头可能使用GMSL、MIPI CSI、GigE Vision或USB3;激光雷达和雷达使用以太网、CAN FD;编码器、力传感器和执行器可能依赖EtherCAT、PROFINET、Modbus或厂商私有总线。
选型表上写“支持以太网”和“支持CAN”远远不够。需要确认端口数量、速率、时间同步、驱动版本、内核兼容性、隔离和浪涌保护。若必须通过外置桥接芯片扩展接口,要把额外延迟、故障点和供货风险算进去。
摄像头还要测试断连重连。现场线缆受到弯折、振动或电磁干扰时,偶发丢帧很常见。系统应能识别某一路传感器失效,隔离故障并恢复服务,而不是因为驱动阻塞拖死整条管线。
控制总线应与AI数据网络分区。大量视频上传或远程运维流量不能抢占控制报文。若平台只有一套网络接口,至少要通过VLAN、QoS和独立交换路径保障控制流量;更稳妥的方案是物理隔离。
五、热设计要按“持续功耗”验收
边缘平台标称功耗常来自典型负载,机箱设计却要面对持续推理、视频解码和高环境温度叠加。矿山、港口和钢铁现场的机柜内部温度可能远高于实验室,粉尘还会堵塞风道。
供应商应给出不同环境温度下的持续性能曲线,包括何时开始降频、降频后吞吐下降多少、最高结温以及保护策略。只提供TDP而没有整机热阻和散热条件,无法用于工程设计。
风冷结构要考虑滤网维护周期和风扇寿命。无风扇方案减少了运动部件,却要求更好的导热路径和安装界面。机箱与车体或机器人本体之间的导热条件必须实际测量,不能默认金属外壳自然就能散热。
温度测试至少覆盖冷启动、长时间满载、频繁启停和太阳直射等情形。测试时记录温度、频率、功耗、推理延迟和错误率,确认系统没有通过悄悄降帧来维持表面稳定。
六、电源、振动与电磁兼容决定设备能否活下来
重载设备供电并不干净。电机启动、制动回馈和大功率执行器动作会造成电压跌落、浪涌和瞬态干扰。边缘主机应明确输入电压范围、保持时间、反接保护、浪涌等级和掉电处理方式。
突然掉电时,文件系统和模型分区不能损坏。关键日志应使用追加写或事务机制,必要时配置超级电容或小型UPS完成安全关机。重启后系统要能判断上次任务状态,不能默认继续执行危险动作。
振动测试不能只看芯片。连接器、SSD、散热器、线束和焊点都是薄弱环节。应按设备实际安装方向和振动谱测试,并检查长期运行后的接触不良。可插拔消费级连接器若没有锁紧结构,不适合直接上车。
电磁兼容方面,要关注无线通信、大功率变频器和焊接设备造成的干扰。传感器误码、时间同步漂移和网络重传可能比主机直接死机更难排查,因为它们会表现为AI模型“偶尔判断错误”。
七、软件栈要能冻结、复现和回滚
工业部署最怕“开发机能跑,量产机不能复现”。操作系统、内核、驱动、推理运行时、模型编译器和容器组件必须形成版本清单。每次升级都要知道改变了什么,能够在故障后恢复到上一套已验证版本。
模型转换是高风险环节。量化、算子融合和编译优化可能改变输出分布。不能只确认模型成功加载,还要用固定测试集比较转换前后的精度、延迟和异常样本。对安全相关识别任务,应单独设置不可接受的退化门槛。
现场更新建议采用签名包、A/B分区和分批发布。先在少量设备上观察,再扩大范围。更新失败时自动回滚,断电后不能留下半套系统。模型、配置和软件应分别版本化,以便判断故障来自哪一层。
长期支持也要写进采购合同。芯片平台的BSP维护周期、漏洞修复、关键组件开源义务和停产通知,都会影响机器人十年左右的生命周期。消费电子式的一两年支持远远不够。
八、故障降级要在设计时写成状态机
边缘AI系统不可能永不失败,工程目标是失败后仍可控。需要逐项列出相机失效、NPU超时、模型进程崩溃、网络中断、定位丢失、磁盘满、温度过高和时钟异常时,机器人进入什么状态。
降级动作应与任务风险匹配。仓库AMR可以减速并驶向安全区;港口装卸设备可能需要完成当前吊具动作后停止;远程作业机械可能切换到人工遥控。简单粗暴地“全部急停”有时会制造新的危险。
看门狗要覆盖不同层级。硬件看门狗负责主机失响应,系统服务监测进程和资源,应用层监测模型输出频率与置信度。只要Linux还活着就认为系统正常,无法发现推理线程已经卡死。
异常恢复必须演练。拔掉网线、遮挡相机、制造磁盘满、限制风扇、杀死推理进程,观察系统是否按设计进入降级状态。故障注入比正常场景跑分更能说明平台成熟度。
九、安全与网络安全不能后补
机器人能移动重物,AI误判直接连接物理风险。风险分析应覆盖感知盲区、错误分类、对抗性标记、传感器污染和模型置信度失真,并明确哪些决策必须由规则、安全控制器或人员复核。
网络安全方面,设备身份、启动链、固件签名、端口关闭、远程访问和日志审计都应纳入基线。调试接口在量产设备上要关闭或受控,默认口令必须移除,证书应可轮换和吊销。
数据上传也要最小化。原始视频可能包含人员、工艺和客户信息。能在边缘生成结构化事件的,就不必长期回传全部画面;确需上传故障片段时,应有触发条件、保存期限和访问记录。
十、用生产验收替代一次性跑分
最终验收建议分为四层:芯片和模型基准、整机压力测试、机器人联调、现场连续运行。每层都有独立指标,不能用上一层的成绩替代下一层。
现场试运行至少统计任务成功率、人工接管率、P95/P99时延、传感器丢帧、异常恢复时间、非计划重启、温度降频时间、每百小时维护工时和单位任务能耗。连续运行周期应覆盖不同班次、天气或生产节拍。
还要建立“问题归属表”。一次任务失败究竟来自模型、传感器、计算平台、网络、控制器还是业务调度,应能通过统一时间线定位。没有可观测性,平台性能再高,现场团队也只能靠重启解决问题。
TOPS有用,它能帮助排除明显算力不足的平台。但重载机器人真正购买的是确定性:在规定环境里,持续完成任务;发生故障时,按预定方式降级;版本升级后,结果仍可复现。把这三件事验收清楚,边缘AI才从一块高算力板卡变成生产设备的一部分。