单个最强模型的时代正在终结——用 Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro 的组合,成本减半,表现仅差 Fable 5 不到1%。
事件概述
6月12日,OpenRouter 正式发布 Fusion——一种模型输出融合技术。它不是简单的结果投票或模型蒸馏,而是一种通过「合成调度器(Synthesizer)」将多个模型的推理结果融合为统一输出的新范式。这篇博文由 OpenRouter 的 Brian Thomas 撰写,详细披露了 DRACO 基准测试的结果。
Fusion 的工作流程是:先将同一个任务并行分发到多个基础模型,各模型独立推理后,再由一个「合成模型」(当前使用 Opus 4.8)对多个输出进行综合、排序、去重和融合,最终生成一份整合后的答案。这相当于组建了一支 AI「专家会诊团」,每个专家从不同角度解题,会诊结果自然优于任何单一专家的判断。
在 DRACO 基准测试(100个深度研究任务)中,不同模型组合的表现差距非常直观:
| 组合 | 得分 |
|---|---|
| 🥇 Fable 5 + GPT-5.5(由 Opus 4.8 合成) | 69.0% |
| 🥇 Opus 4.8 + GPT-5.5 + Gemini 3.1 Pro | 68.3% |
| 🥈 Opus 4.8 + GPT-5.5 | 67.6% |
| — Claude Fable 5(单模型) | 65.3% |
| ⭐ Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro(由 Opus 4.8 合成) | 64.7% |
| — DeepSeek V4 Pro(单模型) | 60.3% |
| — GPT-5.5(单模型) | 60.0% |
最值得关注的亮点在表格第五行:一个总成本仅约 50% 的「预算面板」组合(Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro),不仅全面碾压了 GPT-5.5 和 DeepSeek V4 Pro 等单模型,而且与当前最强模型 Fable 5 的差距不到 1个百分点——要知道 Fable 5 的 API 价格是这个组合的 2-3 倍。说白了,你花一半的钱,得到的效果几乎一样好。
为什么重要
第一,模型融合正在成为「打不过就加入」的新范式。 过去一年,大家的注意力都集中在「哪个模型最强」——Fable 5 还是 GPT-5.5?DeepSeek V4 Pro 还是 Gemini 3?Fusion 的答案是:不用选,全都要。
Fusion 的工作方式是:将同一个任务分发给多个模型,每个模型独立推理,然后由一个「合成器」(当前 Fusin 的合成器是 Opus 4.8)综合各模型的输出,取长补短,生成最终结果。这类似于一个有多个专家的会诊制度——每个专家有自己的特长,综合意见比任何单个专家的判断都更可靠。
第二,在 Fable 5 禁令的背景下,此发现格外关键。 就在本周,由于 Amazon 向美国政府报告了 Anthropic Fable 5 的安全漏洞,白宫对 Fable 5 发布了使用禁令。AWS、Azure 等云平台已开始限制 Fable 5 的部署。依赖单一闭源模型的创业者面临巨大的供应链风险。
Fusion 模式从根本上解决了这个问题:你不依赖任何一家供应商。如果 Fable 5 被封,用 GPT-5.5 + DeepSeek V4 Pro + Gemini 3 的组合即可替代,且性能相差无几。
第三,组合的「边际收益递减曲线」非常友好。 从数据看:2个模型(Opus 4.8 + GPT-5.5)得分为 67.6%,3个模型(+ Gemini 3.1 Pro)提升到 68.3%,4个模型(进一步 + Fable 5)反而降到 67.1%。这意味着 2-3 个精心挑选的模型组合就达到了收益最大化,再盲目加模型反而有害——因为合成器的排序和去重能力有限。
对 AI 创业者的行动建议
1. 立即测试你的模型组合策略。 不要只用一个 API 供应商。OpenRouter Fusion 提供了现成的组合方案,但你自己也可以尝试:DeepSeek V4 Pro 擅长代码和逻辑推理,Kimi K2.6 擅长中文长文本理解,Gemini 3 Flash 速度最快——三者组合覆盖了日常开发中的大部分场景。
2. 重新评估你的 API 预算。 如果你的团队正在使用 Fable 5 或 GPT-5.5 做批量任务,测试一下用预算面板(Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro)能否达到同等的输出质量。如果差距在可接受范围内,每月 API 开支能减少 40-60%。
3. 拥抱「多模型架构」思维。 未来不是哪个模型最强的问题,而是如何组合现有模型的问题。这类似于前端开发从「单一框架」走向「微前端」的演进——用正确的工具做正确的事,而不是用一个工具做所有事。
4. 警惕 Fable 5 的内容过滤限制。 数据显示,Fable 5 在 100 个测试任务中有 7 个因内容过滤器阻止执行而未能完成——甚至包括正常的深度研究类任务。相比之下,无内容过滤或内容过滤较少的模型(如 DeepSeek V4 Pro)没有这个问题。
一句话总结
OpenRouter Fusion 证明了一件事:2026 年的 AI 竞争规则已经改变——不再是追最强的单一模型,而是搭最聪明的模型组合。 选择大于努力,在模型层面同样适用。
