Sakana Fugu Max 与 Fugu Ultra v2 发布:用编排把 AI 推理成本打到 elite 模型的五分之一
一句话结论
AI 行业十年都在一条轴上赛跑:造更大更贵的基础模型。但真实任务的前沿是二维的——一轴能力、一轴成本。给一次简单数据查询派上万亿参数模型不是智能,是浪费。Sakana AI 本次同时发布两个 AI 编排引擎版本:Fugu Max 把成本轴推到新低(输出价比 Sonnet 5、GPT 5.6 Terra、Kimi K3 低 40-60%),Fugu Ultra v2 把能力轴推到新高(八基准五个最佳),核心方法论相同——编排一组可替换的开放模型,比单打独斗的任何模型都强。

两个版本,一套架构
Fugu Max 和 Fugu Ultra v2 不是两个产品,是同一套编排架构面向两种任务的优化:
- Fugu Max 回答的问题是:在尽可能低的成本下,能交付的最好输出是什么?适合大批量、对成本敏感的 AI 推理工作负载。
- Fugu Ultra v2 回答的问题是:在复杂多步任务上,能达到的绝对最高能力是什么?适合自动研究、全栈软件开发这类质量优先场景。
从 4 月 Beta 起这个引擎五个月走了五步:Beta 验证多智能体编排可以作为统一基础模型运作;6 月 GA 版证明编排层能在高难度基准上对标闭源旗舰;7 月加入网络安全与 Claude Code 接口的领域特化;8 月接入 NVIDIA Nemotron 开放模型并支撑日常消费级用量;9 月就是本次的双版本发布。每一步都在验证同一件事:编排稳定优于孤立模型,且可替换的智能体池天然保证供应链韧性。
Fugu Max:更多模型、更少花费
Fugu Max 扩大了可编排的 AI 模型池,接入迄今最大规模的开放权重与专用模型组合(含 NVIDIA Nemotron 系列)。做法是动态路由:把每个任务分发给能解决它的最精简模型,用零散小模型协作换来旗舰级结果。

三个硬数字:
- 性能上,Fugu Max 在六个基准拿到综合最佳,包括 Terminal Bench 2.1、GPQAD、AA-LCR、GDP.pdf、AutomationBench 和 SWEFish。
- 成本上,定价每百万输入 token 2 美元、输出 token 6 美元,输出单价比 Sonnet 5、GPT 5.6 Terra、Kimi K3 低 40-60%。
- 效率上,Fugu Max 在十个基准中的七个上扩展了成本-性能帕累托前沿,输出性能超出既有的单模型效率包络线。

关键点在于:Fugu 是架构不是单一模型,所以这个前沿点位可以按领域调优和扩展。选型视角看,如果 AI 应用的大头是日常推理与批量任务,Fugu Max 的打法是「性能接近精英模型、成本只有五分之一到二分之一」。
Fugu Ultra v2:能力上限继续抬升
压成本不等于封顶能力。Fugu Ultra v2 在需要持续推理复杂视觉与结构化数据的任务上拉开差距:
- SWEFish(Sakana 内部真实编码挑战基准)登顶,验证实际编码任务的表现。
- Chartography(视觉推理与数据解读)得分 48.3,超过 Opus 5 的 27.3 和 Fable 5 的 29.5。
- DeepSWE(真实软件工程基准)得分 74.3,胜过单 token 成本高 3-5 倍的模型。

总结口径:八个基准中五个最佳或并列最佳,七个进前二。值得注意的是,这些成绩是在智能体池中没有 Fable 5、Fable 5.1、GPT-6-Astra 的情况下取得的——编排一组可替换的开放与专用模型,就能在闭源生态之上输出,同时把用户从供应商锁定、API 吊销、地缘动荡和突然断服的风险里摘出来。
怎么接入
两个版本都走 OpenAI 兼容 API。如果已经在跑 Fugu,升级到 Max 或 Ultra v2 只需改一个参数,无需迁移——新架构、同一套 API。技术细节在官方技术报告(arXiv:2606.21228),入口是 sakana.ai/fugu/ 产品页。
选型判断给到位:预算敏感、任务批量大的选 Fugu Max;复杂推理、质量优先的选 Fugu Ultra v2;两者背后是同一套「编排优于单模型」的架构赌注——未来最有能力的 AI 不会来自单个巨型模型,而来自聪明的集体编排。
原文信息
- 作者:Sakana AI
- 发布时间:2026-09-11 原文地址:
这篇文章分析得很透彻,收藏了!
实测过类似工具,作者说的基本属实。
很有价值的分享,感谢整理。
看完了,收获满满,期待更多更新。