Black Forest Labs 发布 FLUX 3 Action:一个 7B 开放权重世界动作模型,登顶 RoboLab-120

星海拾光AI 前沿📡 BestBlogs·AI高分精选⭐ 862026-09-25633 阅读💛 170 收藏
Black Forest Labs 发布 FLUX 3 Action:一个 7B 开放权重世界动作模型,登顶 RoboLab-120

📌 One-Sentence Summary

Black Forest Labs 发布 FLUX 3 Action,一个 7B 开放权重世界动作模型,以 42.92% 的成功率登顶 RoboLab-120 排行榜,同时相比 Cosmos 3 Nano 等更大模型具备显著的速度优势。

📝 Summary

Black Forest Labs 推出了 FLUX 3 Action,一个 70 亿参数的开放权重世界动作模型(WAM),专为机器人控制设计。通过从摄像头输入和文本指令中联合预测未来视频帧和动作块,它在 RoboLab-120 基准测试上取得了最先进的性能(42.92%),尽管参数比 NVIDIA 的 Cosmos 3 Nano 少 56%,却领先 6.1 个百分点。该模型通过架构优化和蒸馏技术,解决了 WAM 精度与视觉-语言-动作(VLA)速度之间的传统权衡问题,提供三个检查点以平衡推理速度和任务成功率。它支持通过 Hugging Face LeRobot 和 NVIDIA Jetson 部署,但根据 FLUX Kommunity 许可证,商业使用受到限制。

💡 Main Points

以更高效率实现最先进性能

FLUX 3 Action 在 RoboLab-120 上以 42.92% 的任务成功率排名第一,超越 16B 参数的 Cosmos 3 Nano 6.1 个百分点,同时参数少 56%,展现了世界建模中卓越的参数效率。

通过蒸馏优化速度-精度权衡

该版本包含三个检查点(Base、Guidance-distilled、Step-distilled),允许开发者在最高精度或最高 4 倍推理速度之间选择。Step-distilled 版本在工作站 GPU 上的运行速度显著快于 π0.5,解决了以往 WAM 的计算成本障碍。

多模态预训练的关键作用

训练严重依赖视频数据(超过 95% 的 token)和混合动作对齐视频。消融研究表明,如果没有这种广泛的预训练,DROID 任务上的性能降至 1% 以下,突显了通用视觉理解对有效机器人控制至关重要。

实际部署限制与许可

虽然可通过 FP8 量化在消费级硬件(RTX 5090)上部署,但该模型在 BF16 下需要约 32GB 显存。它根据 FLUX Kommunity 许可证发布,仅允许非商业使用,限制了即时企业采用,但鼓励通过 LeRobot 进行研究集成。

💬 Key Quotes

在 RoboLab-120 排行榜上,它以 42.92% 的任务成功率排名第一。

这比 Cosmos 3 Nano 领先 6.1 个百分点,且参数少 56%。

没有它,仅 DROID 训练在 RoboLab 上保持在 1% 以下。有了预训练,相同协议达到了 11.6%。

该模型输出关节目标,没有内置速度、力或工作空间限制。你的应用必须强制执行这些限制。

📊 Article Meta

AI Screening: 86

Source: MarkTechPost

Author: Asif Razzaq

Category: 人工智能

Language: 英文

Read Time: 4 min

Word Count: 961

Tags:

AI 与智能应用 , 模型发布 , 具身智能 , 开放权重模型 , 模型评测与基准

#AI 与智能应用# 模型发布# 具身智能# 开放权重模型# 模型评测与基准

文章评论(2)

陈皮话梅糖9 分钟前

楼主辛苦了,内容很有参考价值。

回复
林观澜2 小时前

看标题就点进来了,内容果然没让人失望。

回复