Black Forest Labs 发布 FLUX 3 Action:一个 7B 开放权重世界动作模型,登顶 RoboLab-120

📌 One-Sentence Summary
Black Forest Labs 发布 FLUX 3 Action,一个 7B 开放权重世界动作模型,以 42.92% 的成功率登顶 RoboLab-120 排行榜,同时相比 Cosmos 3 Nano 等更大模型具备显著的速度优势。
📝 Summary
Black Forest Labs 推出了 FLUX 3 Action,一个 70 亿参数的开放权重世界动作模型(WAM),专为机器人控制设计。通过从摄像头输入和文本指令中联合预测未来视频帧和动作块,它在 RoboLab-120 基准测试上取得了最先进的性能(42.92%),尽管参数比 NVIDIA 的 Cosmos 3 Nano 少 56%,却领先 6.1 个百分点。该模型通过架构优化和蒸馏技术,解决了 WAM 精度与视觉-语言-动作(VLA)速度之间的传统权衡问题,提供三个检查点以平衡推理速度和任务成功率。它支持通过 Hugging Face LeRobot 和 NVIDIA Jetson 部署,但根据 FLUX Kommunity 许可证,商业使用受到限制。
💡 Main Points
以更高效率实现最先进性能
FLUX 3 Action 在 RoboLab-120 上以 42.92% 的任务成功率排名第一,超越 16B 参数的 Cosmos 3 Nano 6.1 个百分点,同时参数少 56%,展现了世界建模中卓越的参数效率。
通过蒸馏优化速度-精度权衡
该版本包含三个检查点(Base、Guidance-distilled、Step-distilled),允许开发者在最高精度或最高 4 倍推理速度之间选择。Step-distilled 版本在工作站 GPU 上的运行速度显著快于 π0.5,解决了以往 WAM 的计算成本障碍。
多模态预训练的关键作用
训练严重依赖视频数据(超过 95% 的 token)和混合动作对齐视频。消融研究表明,如果没有这种广泛的预训练,DROID 任务上的性能降至 1% 以下,突显了通用视觉理解对有效机器人控制至关重要。
实际部署限制与许可
虽然可通过 FP8 量化在消费级硬件(RTX 5090)上部署,但该模型在 BF16 下需要约 32GB 显存。它根据 FLUX Kommunity 许可证发布,仅允许非商业使用,限制了即时企业采用,但鼓励通过 LeRobot 进行研究集成。
💬 Key Quotes
在 RoboLab-120 排行榜上,它以 42.92% 的任务成功率排名第一。
这比 Cosmos 3 Nano 领先 6.1 个百分点,且参数少 56%。
没有它,仅 DROID 训练在 RoboLab 上保持在 1% 以下。有了预训练,相同协议达到了 11.6%。
该模型输出关节目标,没有内置速度、力或工作空间限制。你的应用必须强制执行这些限制。
📊 Article Meta
AI Screening: 86
Source: MarkTechPost
Author: Asif Razzaq
Category: 人工智能
Language: 英文
Read Time: 4 min
Word Count: 961
Tags:
AI 与智能应用 , 模型发布 , 具身智能 , 开放权重模型 , 模型评测与基准
楼主辛苦了,内容很有参考价值。
看标题就点进来了,内容果然没让人失望。