OpenRouter Fusion 复合模型:多模型辩论一次调用,深度研究最高 69 分
一句话结论
一句话概括官方口径:Fusion 做的是”把多模型审议变成一个模型工具”;成本大约是同一提示单次补全的 4-5 倍、耗时 2-3 倍;使用定位是复杂研究、专家评审和高风险决策的选择性升级路径。
Fusion 是 OpenRouter 推出的复合模型:把你的提示同时发给一组专家模型并行作答,再由裁判模型对比所有回答、标出共识与分歧,最后合成一份最终答案。深度研究基准上前沿面板拿到 69.0%,代价是成本约 4-5 倍、耗时 2-3 倍——它是给”答错代价高”的任务准备的选择性升级路径,不是日常对话的替代品。

Fusion 是什么
Fusion 的定位是复合推理系统:当模型判断当前任务值得更多分析时,调用 Fusion 工具进入多模型审议。多个模型并行回答同一条提示,裁判对比这些回答并产出结构化分析,再由原模型写出最终响应。
这与单模型调用有本质区别:单次调用只走一条推理路径,Fusion 把多条推理路径、多个来源选择和多种解读汇进同一份回答。
Fusion 与 OpenRouter 的自动路由(auto-routing)解决的是不同问题。自动路由按任务类型挑一个模型;Fusion 是组合多个模型并融合它们的答案,可能产出比任何单个评审模型都更强的结果。
工作机制:四阶段流水线
-
调用模型评估提示。使用 Fusion 时,别名解析为一个模型并挂载 Fusion 工具,模型可以直接作答,也可以在任务需要时调用 Fusion。
-
评审团并行工作。1 到 8 个参与模型独立回答提示,每个评审都可以使用 OpenRouter 的网页搜索和网页抓取工具查找最新资料。
-
裁判对比回答。官方文档称这一角色为 analyst(分析员)。裁判识别共识、矛盾、部分覆盖、独有洞察和盲区,把对比结果作为结构化分析返回。
-
调用模型写答案。原模型接收裁判的分析,据此产出返回给应用的响应。
裁判做的是对比而非简单投票:三个模型重复同一条无依据的说法,并不自动让这条说法变对;裁判也能标出只出现在一个回答里的有价值观点,或所有评审都漏掉的缺口。
质量提升从哪来
Fusion 受益于模型间的多样性和同一模型多次运行间的差异。不同模型可能选择不同方法、注意到不同约束、检索到不同来源;即使同一个模型跑两次,也会走出不同的推理路径、发起不同的工具调用。
OpenRouter 验证了第二种效应:让 Claude Opus 4.8 与另一个 Opus 4.8 配对、用同款模型做合成,融合配置在 DRACO 基准上拿到 65.5%,单跑 Opus 4.8 是 58.8%。6.7 个百分点的提升说明,即使没有模型多样性,对比与合成过程本身也贡献了可观的增益。
多模型集成是成熟技术,Fusion 的产品价值在于工程化:一个模型标识符或服务端工具,就把评审团、裁判、工具和合成循环全部装进一次调用,不用自己搭建维护这套编排。
实测数字:什么时候赢、什么时候不赢
在 Perplexity AI 的深度研究基准 DRACO 上:
-
预算面板(Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro):约 64.7%,对比 Claude Fable 5 单模型约 65.3%
-
前沿面板:69.0%,超过 Fable 5 单模型
-
Fable 的成绩基于 100 题中的 93 题(内容过滤所致),直接对比略有偏差
两点必须注意:DRACO 衡量的是深度研究能力,不是编码或日常对话;Fusion 的合成增益最集中在研究分析类提示上,不要把这里的差距外推到所有任务。
成本账:单次更贵,单任务可能更省
Fusion 要付多次模型调用加裁判的钱,单次请求 token 消耗高于单模型调用。但真正该算的是”每次正确答案的成本”:如果一次 Fusion 调用直接给出对的答案,而便宜模型要三次尝试加一次重跑加一个人工核对,整任务算下来 Fusion 反而更省。算总账,不算单次请求的价格。Fusion 模型页面有当前定价。
延迟:2-3 倍
Fusion 调用耗时通常是标准单模型调用的两到三倍。评审团并行跑,不用逐个等,但要等最慢的评审、再等裁判。这个延迟基本排除了聊天、自动补全等实时路径。
非确定性是设计使然
评审团加合成步骤意味着同一提示多次运行可能得到不同结果——这是有意设计,不是缺陷。对一次性研究任务无妨;对需要可复现输出的场景(评测套件、回归测试、今天与昨天对比的检查)就是实际问题。
按官方 FAQ 口径:Fusion 与单模型的差距只在深度研究类任务上成立,不构成”Fusion 全面替代 Fable”的结论;输出级融合(output-level deliberation)指的是组合多个模型的输出而非参数,这也是它区别于传统模型融合研究的地方。
什么时候用、什么时候跳过
最强的生产模式是选择性升级:常规工作让模型直接处理,少数值得额外审视的提示才调用 Fusion。
用 Fusion 的场景:
-
高风险研究型提示:研究问题、专家评审、方案对比、尽调摘要——准确性优先、事后纠错成本高
-
你本来就要手动问好几个模型再自己对比:Fusion 干的就是这件事,且裁判对比比人工翻看更稳定
跳过 Fusion 的场景:
-
延迟敏感或高并发的交互路径:用户在等回复,2-3 倍延迟不可接受,如客服机器人、行内代码补全
-
需要可复现的工作负载:评测、回归套件、CI 里检查输出是否变化的流水线
-
单个中档模型已经答对的简单任务:分类、抽取、短改写、格式转换,上评审团纯属浪费成本和延迟
怎么用
零代码路径:打开 Fusion Lab(openrouter.ai/fusion),选预设,输入一条你已知有难度的提示,对比融合结果与当前生产模型的输出,看事实错误是否更少、覆盖是否更全、人工修改是否更少。界面里还能先搭自定义面板再迁移到应用。
API 路径:把当前模型标识符换成 openrouter/fusion,不带额外配置时用默认 Quality 面板、由模型自行决定是否审议。进阶写法:
import os
from openai import OpenAI
client = OpenAI(
base_url="https://openrouter.ai/api/v1",
api_key=os.environ["OPENROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="openrouter/fusion",
messages=[{
"role": "user",
"content": "Compare three approaches to multi-tenant data isolation.",
}],
tool_choice="required",
extra_body={
"plugins": [{
"id": "fusion",
"preset": "general-budget",
"model": "~openai/gpt-latest",
}]
},
)
print(response.choices[0].message.content)
preset 选 curated 面板;嵌套的 model 字段选裁判,用 Fusion 别名时也选写最终响应的模型;tool_choice 设为 required 强制每次调用 Fusion。当前通用预设三档:
-
general-high:最强全能面板
-
general-budget:更便宜的评审配前沿裁判
-
general-fast:面板按相近响应时间优化
也可以把 openrouter:fusion 服务端工具挂到自己的外层模型上,适合同一模型要同时访问 Fusion 和应用其他工具的场景。
结论
Fusion 给难提示提供了”多次尝试加结构化对比”。研究和高风险决策里,这种额外审视值回票价;它的成本、延迟和输出波动也是真实存在的。上手建议:从真实工作负载里挑一条最难的提示,用”每次可接受结果的成本”而不是模型单价去对比 Fusion 与你现在的模型。
原文信息
- 作者:OpenRouter 官方博客
- 发布时间:2026-09-10 原文地址:
看标题就点进来了,内容果然没让人失望。
支持作者,持续关注中。
刚好最近在找这方面的资料,太及时了。
收藏了,以后慢慢研究。
这个观点很中肯,深有同感。
楼主辛苦了,内容很有参考价值。
很有价值的分享,感谢整理。