摘要:Black Forest Labs与mimic robotics发布FLUX-mimic,将FLUX 3视频模型中的物理世界表征用于机器人动作控制。该系统已在奥迪生产和物流场景中测试、部署。
**摘要:**Black Forest Labs与mimic robotics发布FLUX-mimic,将FLUX 3视频模型中的物理世界表征用于机器人动作控制。该系统已在奥迪生产和物流场景中测试、部署,覆盖零件装盘、电子控制单元插装、柔性密封件和线缆操作等任务。视频生成与工业机器人的边界开始发生变化:模型生成的不只是画面,它在训练过程中还学习了物体运动、接触关系、重量变化和因果过程。
视频生成模型,开始进入汽车生产线。
7月23日,Black Forest Labs与机器人公司mimic robotics公布FLUX-mimic。它以FLUX 3多模态模型为基础,在视频模型的中间表征上增加动作解码器,把模型对物理世界的理解转换成机械臂可以执行的动作。
按照两家公司的披露,FLUX-mimic已经在奥迪生产和物流场景中接受测试并投入部署,处理零件装盘、电子控制单元插入夹具、部件装配、密封件和线缆操作等任务。奥迪生产实验室表示,这套系统能够完成传统机器人难以处理的柔性物体操作。
这项进展值得关注,因为它连接了两条此前相对独立的技术路线。
一条是图像和视频生成,目标是生成更真实、更连贯的视听内容;另一条是具身智能,目标是让机器人理解环境、规划动作并操作物体。FLUX-mimic提出的判断是,这两类任务可以共享同一个模型底座。
视频生成模型学到了什么
生成一张静态图片,模型主要需要理解物体外观、空间位置和语义关系。
生成一段连续视频,要求明显更高。
模型需要保持人物、物体和场景的一致性,还要预测物体接下来会向哪里运动。一个杯子被推倒以后会倾斜、滑动或滚落;机械手抓住柔性线缆以后,线缆会弯曲、摆动并受到其他物体的阻挡。这些变化涉及运动、接触、重量、摩擦、形变和因果关系。
Black Forest Labs披露,FLUX 3从一开始便联合训练图像、视频和音频,其中视频预测占总训练计算成本的95%以上。公司认为,模型为了生成可信视频,必须学习物理过程,否则生成结果很快会出现穿模、漂移、物体消失和动作不连贯等问题。
这也解释了视频模型和机器人控制之间的连接。
机器人动作可以看成物理世界的另一种表达。视频画面记录物体发生了什么,机械臂动作描述机器人做了什么。画面、声音、机器人关节状态和执行动作,分别反映同一个物理过程的不同侧面。
模型已经能够预测物体在未来几帧中的状态变化,再增加一个动作解码器,就有机会反推出机器人应该怎样移动机械臂、调整夹爪并完成操作。
FLUX-mimic是怎么工作的
FLUX-mimic没有让视频模型直接输出机械臂控制指令。
它采用了“视频模型骨干网络加动作解码器”的结构。
FLUX 3首先接收摄像头画面,提取场景、物体、运动关系和未来状态等中间特征。轻量级动作解码器读取这些特征,再生成机械臂末端位置、姿态、夹爪状态和关节运动等控制信息。
这一思路延续了mimic robotics此前提出的Video-Action Model,即视频—动作模型。其研究论文将预训练视频模型与基于流匹配的动作解码器连接起来,利用视频模型内部的动态表征生成底层机器人动作。论文实验显示,与传统视觉—语言—动作模型相比,该方法在部分仿真和真实操作任务中取得了约10倍的数据效率,并将收敛速度提高约2倍。
FLUX-mimic把这条路线进一步扩大。
Black Forest Labs称,FLUX 3使用数千万小时通用视频学习世界动态,并加入数十万小时与人类、机器人操作相关的视频。动作预测加入训练后,模型的视频生成质量一度下降约10%,经过3500个训练步骤后恢复,同时保留了动作预测能力。
这说明视频生成和动作控制不一定需要两套完全分离的基础模型。它们可以共享视觉骨干网络,再通过不同的解码器分别生成视频、音频或者机器人动作。
它和传统VLA有什么区别
目前具身智能中较常见的路线是视觉—语言—动作模型,也就是VLA。
VLA通常从视觉语言模型出发。模型先理解摄像头画面和文字指令,再经过机器人数据微调,输出可执行动作。这类模型继承了互联网图文数据中的语义知识,能够识别物体、理解指令,并处理“把红色杯子放到左边托盘”之类的任务。
问题在于,大量图文数据是静态的。
图片可以告诉模型桌子上有什么,却很难完整表达一个柔性物体怎样弯曲、两个零件接触后怎样受力、夹爪抓偏以后应该怎样调整。VLA需要依靠相对有限的机器人轨迹数据补充这些物理动态。
Video-Action Model换了一个基础模型来源:先用大规模视频学习时间变化和物理动态,再利用较少的机器人示范数据建立视频表征与动作之间的映射。
这种方法并不意味着语言不再重要。语言仍然适合描述任务目标、操作步骤和约束条件。它带来的变化,是把机器人的低层动作控制建立在视频动态表征上,减少静态图文模型承担的物理推理压力。
为什么奥迪场景值得关注
汽车工厂已经大量使用工业机器人,但高自动化率不等于所有工作都适合传统自动化。
焊接、喷涂、搬运等任务通常具有位置固定、节拍稳定、动作重复的特点,适合通过离线编程、示教和专用夹具完成。柔性线缆、密封条、软管和不规则零件则存在形变大、状态不稳定、品种变化多等问题。
一旦车型、零件位置或材料状态发生变化,传统机器人程序可能需要重新调试,夹具和工位也可能需要调整。对产量较小、型号较多的任务,自动化改造成本可能高于人工操作成本。
FLUX-mimic在奥迪测试的任务包括:
- 将零件放入结构化托盘;
- 把电子控制单元插入紧配合夹具;
- 完成部件之间的装配;
- 处理密封件、线缆等柔性物体;
- 在抓取失败后重新调整并继续执行。
Black Forest Labs称,机器人在抓取失败时能够自行纠正、再次抓取并完成任务。这类恢复能力无法完全依靠预先编写的动作脚本覆盖,需要模型根据当前画面重新判断物体状态。
奥迪生产实验室负责人表示,相关机器人完成了传统机器人难以处理的柔性物体操作,可能用于辅助员工、提高效率并扩展柔性自动化。这里的价值不只是一台机器人完成一次演示,而是验证视频—动作模型能否进入有节拍、稳定性和安全要求的生产环境。
工业机器人的开发方式可能发生变化
传统工业机器人项目高度依赖工艺工程师。
工程师需要确定工位布局、坐标系、运动路径、速度、加速度、碰撞区间、夹爪动作和异常处理逻辑。产品变化以后,程序、夹具和视觉参数往往需要重新调整。
学习型机器人引入了另一种开发方式。
工程师可以通过遥操作、示范视频或少量真实动作数据,让机器人学习任务。通用视频模型提前提供对物体、运动和物理变化的基础认识,现场数据主要用于告诉模型“这个工位具体要完成什么”。
按照mimic-video论文的实验结果,视频模型预训练可以明显减少机器人任务所需的示范数据。FLUX-mimic还采用Self-Flow训练方法,希望让模型内部表征更容易被动作解码器读取。
这会影响工业机器人项目的成本结构。
未来项目成本可能从大量人工编程,逐步转向数据采集、模型适配、任务评测、边缘算力和安全验证。机器人仍需机械本体、传感器、控制器和工艺装备,但软件层会从固定程序扩展为可训练、可迭代的动作模型。
实时控制是一道硬门槛
机器人不能长时间等待模型推理。
机械臂执行抓取、插装和避障时,摄像头画面、模型计算和执行机构之间必须形成连续闭环。延迟过高会造成动作迟滞,甚至带来碰撞风险。
Black Forest Labs披露,经过优化后的FLUX-mimic骨干网络可在单张英伟达RTX 5090上,于80毫秒以内完成从输入画面到世界表征的计算;包括传感器、动作解码和执行链路后,系统反应时间约为101毫秒。
这个数据说明,大型视频模型并不一定只能运行在云端。通过缩小模型、优化中间表征、并行执行预测和机器人动作,视频—动作模型有机会部署在工厂现场的边缘GPU设备上。
但100毫秒级反应时间是否适合具体工位,还需要结合机器人速度、控制周期和安全等级判断。高速装配、精密运动控制和协作机器人安全响应,对延迟和确定性的要求并不相同。
现阶段还不能下哪些结论
FLUX-mimic展示了视频模型进入工业机器人的一条可行路线,但现有信息主要来自Black Forest Labs、mimic robotics及其合作方披露。
公开材料没有完整说明部署数量、连续运行时间、任务成功率、故障率、人工接管频率和单位工位成本。所谓“部署”可能涵盖试生产、验证工位和正式生产等不同阶段,不能直接理解为已经在奥迪全线大规模铺开。
研究论文中的10倍样本效率和2倍收敛速度,也是在特定模型、任务和数据设置下得到的结果。它说明视频模型具有潜力,但不能简单推导为所有工业机器人项目都能减少90%的训练数据。
工业现场还要解决安全认证、异常检测、碰撞保护、模型漂移、数据闭环和责任边界。学习型模型可以提供动作建议,安全PLC、机器人控制器和确定性保护逻辑仍然不可缺少。
对工业智能的启示
FLUX-mimic带来的第一个启示,是视频数据的产业价值可能被重新评估。
企业过去积累的监控录像、操作视频、维修记录和工艺演示,常被当作培训或追溯资料。随着视频—动作模型发展,这些数据可能成为机器人学习、工艺识别和异常恢复的重要训练资源。
第二个启示,是工业大模型需要与控制系统建立新的接口。
模型不能停留在生成文字和工艺建议。它要通过标准化动作接口、安全约束、数字孪生和机器人控制器,把高层任务逐步转换为可以验证的动作序列。
第三个启示,是仿真、中试和现场验证会更加重要。视频模型可以提供通用物理知识,但每个工厂的设备、工装、材料和安全边界都不同。模型需要先在仿真环境和数字孪生中测试,再进入机器人中试工位,最后通过小范围生产验证形成稳定版本。
第四个启示,是工业软件与机器人模型之间的边界会继续融合。
工艺知识库负责描述任务规则,仿真软件验证运动和受力,视觉模型识别现场状态,动作模型生成机器人轨迹,安全系统负责约束和回滚。单一模型无法包办整套工业系统,模型、工业软件和自动化控制需要形成协同架构。
结语
FLUX 3进入奥迪生产场景,说明视频生成模型的用途已经超出内容创作。
视频模型为了预测下一帧,必须学习物体怎样移动、接触、变形和相互作用。当这些物理表征能够被动作解码器读取,模型就可以从“预测世界会发生什么”,进一步走向“决定机器人应该做什么”。
具身智能的竞争,也因此多了一条技术路线。
机器人不只从机器人轨迹中学习动作,还可以从大规模视频中学习物理世界,再用少量现场数据适配具体工位。视频生成、世界模型和机器人控制,开始汇入同一个工业技术体系。
主要参考
- Black Forest Labs:《FLUX 3 x mimic: The Next Generation of Video-Action Models》,2026年7月23日。
- mimic robotics:《Introducing FLUX-mimic: Scaling Video-Action Models for General Purpose Dexterity》,2026年7月23日。
- Jonas Pai等:《mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs》,2025年12月。