AI风向

【AI风向】OpenRouter 发布「Fusion」模型融合:3个便宜模型组合竟然打败了 Fable 5

单个最强模型的时代正在终结——用 Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro 的组合,成本减半,表现仅差 Fable 5 不到1%。

事件概述

6月12日,OpenRouter 正式发布 Fusion——一种模型输出融合技术。它不是简单的结果投票或模型蒸馏,而是一种通过「合成调度器(Synthesizer)」将多个模型的推理结果融合为统一输出的新范式。这篇博文由 OpenRouter 的 Brian Thomas 撰写,详细披露了 DRACO 基准测试的结果。

Fusion 的工作流程是:先将同一个任务并行分发到多个基础模型,各模型独立推理后,再由一个「合成模型」(当前使用 Opus 4.8)对多个输出进行综合、排序、去重和融合,最终生成一份整合后的答案。这相当于组建了一支 AI「专家会诊团」,每个专家从不同角度解题,会诊结果自然优于任何单一专家的判断。

在 DRACO 基准测试(100个深度研究任务)中,不同模型组合的表现差距非常直观:

组合 得分
🥇 Fable 5 + GPT-5.5(由 Opus 4.8 合成) 69.0%
🥇 Opus 4.8 + GPT-5.5 + Gemini 3.1 Pro 68.3%
🥈 Opus 4.8 + GPT-5.5 67.6%
Claude Fable 5(单模型) 65.3%
Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro(由 Opus 4.8 合成) 64.7%
— DeepSeek V4 Pro(单模型) 60.3%
— GPT-5.5(单模型) 60.0%

最值得关注的亮点在表格第五行:一个总成本仅约 50% 的「预算面板」组合(Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro),不仅全面碾压了 GPT-5.5 和 DeepSeek V4 Pro 等单模型,而且与当前最强模型 Fable 5 的差距不到 1个百分点——要知道 Fable 5 的 API 价格是这个组合的 2-3 倍。说白了,你花一半的钱,得到的效果几乎一样好。

为什么重要

第一,模型融合正在成为「打不过就加入」的新范式。 过去一年,大家的注意力都集中在「哪个模型最强」——Fable 5 还是 GPT-5.5?DeepSeek V4 Pro 还是 Gemini 3?Fusion 的答案是:不用选,全都要。

Fusion 的工作方式是:将同一个任务分发给多个模型,每个模型独立推理,然后由一个「合成器」(当前 Fusin 的合成器是 Opus 4.8)综合各模型的输出,取长补短,生成最终结果。这类似于一个有多个专家的会诊制度——每个专家有自己的特长,综合意见比任何单个专家的判断都更可靠。

第二,在 Fable 5 禁令的背景下,此发现格外关键。 就在本周,由于 Amazon 向美国政府报告了 Anthropic Fable 5 的安全漏洞,白宫对 Fable 5 发布了使用禁令。AWS、Azure 等云平台已开始限制 Fable 5 的部署。依赖单一闭源模型的创业者面临巨大的供应链风险。

Fusion 模式从根本上解决了这个问题:你不依赖任何一家供应商。如果 Fable 5 被封,用 GPT-5.5 + DeepSeek V4 Pro + Gemini 3 的组合即可替代,且性能相差无几。

第三,组合的「边际收益递减曲线」非常友好。 从数据看:2个模型(Opus 4.8 + GPT-5.5)得分为 67.6%,3个模型(+ Gemini 3.1 Pro)提升到 68.3%,4个模型(进一步 + Fable 5)反而降到 67.1%。这意味着 2-3 个精心挑选的模型组合就达到了收益最大化,再盲目加模型反而有害——因为合成器的排序和去重能力有限。

对 AI 创业者的行动建议

1. 立即测试你的模型组合策略。 不要只用一个 API 供应商。OpenRouter Fusion 提供了现成的组合方案,但你自己也可以尝试:DeepSeek V4 Pro 擅长代码和逻辑推理,Kimi K2.6 擅长中文长文本理解,Gemini 3 Flash 速度最快——三者组合覆盖了日常开发中的大部分场景。

2. 重新评估你的 API 预算。 如果你的团队正在使用 Fable 5 或 GPT-5.5 做批量任务,测试一下用预算面板(Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro)能否达到同等的输出质量。如果差距在可接受范围内,每月 API 开支能减少 40-60%。

3. 拥抱「多模型架构」思维。 未来不是哪个模型最强的问题,而是如何组合现有模型的问题。这类似于前端开发从「单一框架」走向「微前端」的演进——用正确的工具做正确的事,而不是用一个工具做所有事。

4. 警惕 Fable 5 的内容过滤限制。 数据显示,Fable 5 在 100 个测试任务中有 7 个因内容过滤器阻止执行而未能完成——甚至包括正常的深度研究类任务。相比之下,无内容过滤或内容过滤较少的模型(如 DeepSeek V4 Pro)没有这个问题。

一句话总结

OpenRouter Fusion 证明了一件事:2026 年的 AI 竞争规则已经改变——不再是追最强的单一模型,而是搭最聪明的模型组合。 选择大于努力,在模型层面同样适用。


AI创业 #OpenRouterFusion #模型融合 #一人公司 #AI风向 #20260614