OpenRouter Fusion 复合模型:多模型辩论一次调用,深度研究最高 69 分

采集助手AI 前沿2026-09-171 阅读

一句话结论

一句话概括官方口径:Fusion 做的是”把多模型审议变成一个模型工具”;成本大约是同一提示单次补全的 4-5 倍、耗时 2-3 倍;使用定位是复杂研究、专家评审和高风险决策的选择性升级路径。

Fusion 是 OpenRouter 推出的复合模型:把你的提示同时发给一组专家模型并行作答,再由裁判模型对比所有回答、标出共识与分歧,最后合成一份最终答案。深度研究基准上前沿面板拿到 69.0%,代价是成本约 4-5 倍、耗时 2-3 倍——它是给”答错代价高”的任务准备的选择性升级路径,不是日常对话的替代品。

Fusion 流水线:一条提示并行发给多个带网络工具的评审模型,经裁判模型汇合成最终答案

Fusion 是什么

Fusion 的定位是复合推理系统:当模型判断当前任务值得更多分析时,调用 Fusion 工具进入多模型审议。多个模型并行回答同一条提示,裁判对比这些回答并产出结构化分析,再由原模型写出最终响应。

这与单模型调用有本质区别:单次调用只走一条推理路径,Fusion 把多条推理路径、多个来源选择和多种解读汇进同一份回答。

Fusion 与 OpenRouter 的自动路由(auto-routing)解决的是不同问题。自动路由按任务类型挑一个模型;Fusion 是组合多个模型并融合它们的答案,可能产出比任何单个评审模型都更强的结果。

工作机制:四阶段流水线

  1. 调用模型评估提示。使用 Fusion 时,别名解析为一个模型并挂载 Fusion 工具,模型可以直接作答,也可以在任务需要时调用 Fusion。

  2. 评审团并行工作。1 到 8 个参与模型独立回答提示,每个评审都可以使用 OpenRouter 的网页搜索和网页抓取工具查找最新资料。

  3. 裁判对比回答。官方文档称这一角色为 analyst(分析员)。裁判识别共识、矛盾、部分覆盖、独有洞察和盲区,把对比结果作为结构化分析返回。

  4. 调用模型写答案。原模型接收裁判的分析,据此产出返回给应用的响应。

裁判做的是对比而非简单投票:三个模型重复同一条无依据的说法,并不自动让这条说法变对;裁判也能标出只出现在一个回答里的有价值观点,或所有评审都漏掉的缺口。

质量提升从哪来

Fusion 受益于模型间的多样性和同一模型多次运行间的差异。不同模型可能选择不同方法、注意到不同约束、检索到不同来源;即使同一个模型跑两次,也会走出不同的推理路径、发起不同的工具调用。

OpenRouter 验证了第二种效应:让 Claude Opus 4.8 与另一个 Opus 4.8 配对、用同款模型做合成,融合配置在 DRACO 基准上拿到 65.5%,单跑 Opus 4.8 是 58.8%。6.7 个百分点的提升说明,即使没有模型多样性,对比与合成过程本身也贡献了可观的增益。

多模型集成是成熟技术,Fusion 的产品价值在于工程化:一个模型标识符或服务端工具,就把评审团、裁判、工具和合成循环全部装进一次调用,不用自己搭建维护这套编排。

实测数字:什么时候赢、什么时候不赢

在 Perplexity AI 的深度研究基准 DRACO 上:

  • 预算面板(Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro):约 64.7%,对比 Claude Fable 5 单模型约 65.3%

  • 前沿面板:69.0%,超过 Fable 5 单模型

  • Fable 的成绩基于 100 题中的 93 题(内容过滤所致),直接对比略有偏差

两点必须注意:DRACO 衡量的是深度研究能力,不是编码或日常对话;Fusion 的合成增益最集中在研究分析类提示上,不要把这里的差距外推到所有任务。

成本账:单次更贵,单任务可能更省

Fusion 要付多次模型调用加裁判的钱,单次请求 token 消耗高于单模型调用。但真正该算的是”每次正确答案的成本”:如果一次 Fusion 调用直接给出对的答案,而便宜模型要三次尝试加一次重跑加一个人工核对,整任务算下来 Fusion 反而更省。算总账,不算单次请求的价格。Fusion 模型页面有当前定价。

延迟:2-3 倍

Fusion 调用耗时通常是标准单模型调用的两到三倍。评审团并行跑,不用逐个等,但要等最慢的评审、再等裁判。这个延迟基本排除了聊天、自动补全等实时路径。

非确定性是设计使然

评审团加合成步骤意味着同一提示多次运行可能得到不同结果——这是有意设计,不是缺陷。对一次性研究任务无妨;对需要可复现输出的场景(评测套件、回归测试、今天与昨天对比的检查)就是实际问题。

按官方 FAQ 口径:Fusion 与单模型的差距只在深度研究类任务上成立,不构成”Fusion 全面替代 Fable”的结论;输出级融合(output-level deliberation)指的是组合多个模型的输出而非参数,这也是它区别于传统模型融合研究的地方。

什么时候用、什么时候跳过

最强的生产模式是选择性升级:常规工作让模型直接处理,少数值得额外审视的提示才调用 Fusion。

用 Fusion 的场景:

  • 高风险研究型提示:研究问题、专家评审、方案对比、尽调摘要——准确性优先、事后纠错成本高

  • 你本来就要手动问好几个模型再自己对比:Fusion 干的就是这件事,且裁判对比比人工翻看更稳定

跳过 Fusion 的场景:

  • 延迟敏感或高并发的交互路径:用户在等回复,2-3 倍延迟不可接受,如客服机器人、行内代码补全

  • 需要可复现的工作负载:评测、回归套件、CI 里检查输出是否变化的流水线

  • 单个中档模型已经答对的简单任务:分类、抽取、短改写、格式转换,上评审团纯属浪费成本和延迟

怎么用

零代码路径:打开 Fusion Lab(openrouter.ai/fusion),选预设,输入一条你已知有难度的提示,对比融合结果与当前生产模型的输出,看事实错误是否更少、覆盖是否更全、人工修改是否更少。界面里还能先搭自定义面板再迁移到应用。

API 路径:把当前模型标识符换成 openrouter/fusion,不带额外配置时用默认 Quality 面板、由模型自行决定是否审议。进阶写法:

import os

from openai import OpenAI

client = OpenAI(
    base_url="https://openrouter.ai/api/v1",
    api_key=os.environ["OPENROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="openrouter/fusion",
    messages=[{
        "role": "user",
        "content": "Compare three approaches to multi-tenant data isolation.",
    }],
    tool_choice="required",
    extra_body={
        "plugins": [{
            "id": "fusion",
            "preset": "general-budget",
            "model": "~openai/gpt-latest",
        }]
    },
)

print(response.choices[0].message.content)

preset 选 curated 面板;嵌套的 model 字段选裁判,用 Fusion 别名时也选写最终响应的模型;tool_choice 设为 required 强制每次调用 Fusion。当前通用预设三档:

  • general-high:最强全能面板

  • general-budget:更便宜的评审配前沿裁判

  • general-fast:面板按相近响应时间优化

也可以把 openrouter:fusion 服务端工具挂到自己的外层模型上,适合同一模型要同时访问 Fusion 和应用其他工具的场景。

结论

Fusion 给难提示提供了”多次尝试加结构化对比”。研究和高风险决策里,这种额外审视值回票价;它的成本、延迟和输出波动也是真实存在的。上手建议:从真实工作负载里挑一条最难的提示,用”每次可接受结果的成本”而不是模型单价去对比 Fusion 与你现在的模型。

原文信息

  • 作者:OpenRouter 官方博客
  • 发布时间:2026-09-10 原文地址: