一个真实的账单:某人用 Claude Opus 5 写单元测试,月账单 $1,200。换成 GPT-5-mini 后降到 $180,测试通过率只降了 3%。今天分享一套可复制的模型路由策略,让你的 AI Agent 知道什么时候该用"大脑",什么时候该用"本能"。
你为什么需要模型路由
2026 年 7 月的 AI 模型市场是这样的:
| 模型 | 输入价格 ($/1M tokens) | 输出价格 | 适合场景 |
|---|---|---|---|
| Claude Opus 5 | $15 | $75 | 复杂架构设计、安全审计 |
| Claude Fable 5 | $3 | $15 | 代码审查、技术写作 |
| GPT-5.6 | $12.5 | $50 | 综合推理、长篇生成 |
| GPT-5-mini | $0.75 | $3 | 分类、格式化、简单脚本 |
| DeepSeek V4 | $2.75 | $14 | 性价比推理、中文内容 |
| Qwen 3.8 Max | $2 | $8 | 中文理解、长上下文 |
价格跨度是 7-20 倍。 但多数 AI Agent 的实现方式却是:所有任务都用同一个模型。
这就像你请了一个时薪 $500 的高级顾问,让他帮你整理文件夹。他当然能做,但你破产的速度会比回本更快。
模型路由(Model Routing)要解决的正是这个问题:根据任务难度自动选择最合适的模型——用低成本模型处理简单任务,只在真正需要时才调用昂贵的推理模型。
三层路由架构
经过 3 个月的实战迭代,我总结出了一个可复制的三层架构:
┌─────────────────────────────────────────┐
│ Layer 1: 规则路由 │
│ · 关键词匹配(如 "格式转换" → mini) │
│ · 代码行数阈值(<50行 → mini) │
│ · 已缓存结果复用 │
│ · 命中率: ~40% · 成本: 极低 │
└─────────────────────────────────────────┘
↓ 未命中
┌─────────────────────────────────────────┐
│ Layer 2: 分类器路由 │
│ · 轻量模型分类任务难度 (1-5级) │
│ · Level 1-2 → mini 模型 │
│ · Level 3-4 → 标准模型 │
│ · Level 5 → 推理模型 │
│ · 命中率: ~95% · 成本: 极低 │
└─────────────────────────────────────────┘
↓ 分类器不确定
┌─────────────────────────────────────────┐
│ Layer 3: 级联兜底 │
│ · 先用 mini 模型尝试 │
│ · 输出质量检查(置信度/完整性) │
│ · 不通过 → 升级到更强模型 │
│ · 成本: 偶有 double-run,但可控 │
└─────────────────────────────────────────┘
Layer 1 不消耗任何 token——纯规则匹配。比如 "帮我格式化这段 JSON"、"给这 3 个函数写注释" 这类任务,闭着眼睛都知道用 mini 模型。
Layer 2 消耗约 200 tokens 做分类(用 mini 模型本身),但能避免 95% 的"高射炮打蚊子"。
Layer 3 是最后的保险——宁可多花一次 mini 调用的钱,也不错派任务。
Hermes Agent 实战配置
在 Hermes Agent 中实现模型路由,核心是通过 profiles 和 skills 的组合。每个 profile 绑定不同的模型,skill 里声明任务的复杂度等级。
步骤 1:创建分层 profiles
# ~/.hermes/profiles/fast/config.yaml
name: fast
model: gpt-5-mini
# 用于 Layer 1 规则命中 + Layer 2 分类器
# ~/.hermes/profiles/standard/config.yaml
name: standard
model: claude-fable-5
# 用于中等复杂度任务:代码审查、文档编写、bug 修复
# ~/.hermes/profiles/reasoning/config.yaml
name: reasoning
model: claude-opus-5
# 用于高复杂度:架构设计、安全分析、多步推理
步骤 2:编写智能路由 Skill
# ~/.hermes/profiles/default/skills/smart-router.md
---
name: smart-router
description: 智能任务路由 - 根据复杂度选择模型
---
## 路由规则
### 直接路由(不消耗分类 token)
以下关键词命中任一,直接用 fast 模型:
- 格式化、转换、翻译(简单句子)、提取列表
- 函数注释、变量重命名、import 排序
- 生成 mock 数据、写 README 草稿
### 需要分类器判断
其余任务先由 fast 模型打分(1-5):
- 1-2:继续用 fast 模型完成
- 3-4:切换到 standard 模型
- 5:切换到 reasoning 模型
### 分类 Prompt 模板
"请评估以下任务的复杂度(1-5):
1=简单格式化/翻译/注释 2=有明确规则的代码修改
3=需要理解业务逻辑 4=涉及多文件/多步骤协作
5=需要深度推理/架构决策/安全审查
任务描述:{user_prompt}
只回复数字。"
步骤 3:成本对比 - 真实案例
这是我运营「AI创业内参」一个月的实际数据:
| 任务类型 | 日均调用 | 优化前模型 | 优化后模型 | 月省费用 |
|---|---|---|---|---|
| 热点标题抓取 | 24次 | Claude Fable 5 | GPT-5-mini | $28 → $3 |
| 文章排版格式化 | 4次 | Claude Fable 5 | GPT-5-mini | $9 → $1 |
| 初稿写作 | 3次 | Claude Opus 5 | GPT-5.6 | $195 → $82 |
| SEO 标签生成 | 8次 | GPT-5.6 | GPT-5-mini | $38 → $5 |
| 代码审查 | 2次 | Claude Opus 5 | Claude Fable 5 | $65 → $13 |
| 架构设计讨论 | 1次 | Claude Opus 5 | Claude Opus 5 | $33 → $33 |
月总计:优化前 $368 → 优化后 $137,下降 62.8%。
关键洞察:代码审查和初稿写作的模型降级几乎没有感知到的质量损失。Claude Fable 5 审查代码的能力在 90% 的场景下与 Opus 5 持平,而价格只有 1/5。
进阶技巧:缓存优先路由
在 Layer 1 之上,还可以加一层缓存判断:
# 伪代码:缓存感知路由
def route_task(prompt: str) -> str:
# 1) 语义哈希匹配:相似任务复用缓存
cache_key = semantic_hash(prompt)
if cached := cache.get(cache_key):
if cache_hit_confidence(cached, prompt) > 0.9:
return cached # 零成本
# 2) 规则路由
if matches_simple_pattern(prompt):
return call_model("gpt-5-mini", prompt)
# 3) 分类器路由
difficulty = classify(prompt)
model = select_model(difficulty)
result = call_model(model, prompt)
# 4) 写入缓存
cache.set(cache_key, result)
return result
语义缓存不是简单的字符串匹配。用 embedding 向量计算相似度,当两次请求的语义相似度 > 0.95 时直接复用结果。对于热点监控这种高频重复场景,缓存命中率可以达到 30-40%。
三个常见误区
误区 1:"便宜的模型质量差"
GPT-5-mini 在结构化输出(JSON、Markdown、代码块)上的准确率与 GPT-5.6 的差距不到 2%。差的是开放域推理和创意写作。大部分 Agent 任务正好是结构化输出。
判断方法:如果你的任务「有标准答案或可验证结果」(代码能跑就是能跑、格式对就是对的),用 mini 模型。
误区 2:"分类器本身消耗 token,不如直接用推理模型"
分类消耗 ~200 tokens(约 $0.00015),一次推理模型调用消耗 ~2000 tokens(约 $0.15)。就算分类器准确率只有 80%,也远比分错 5 次任务的损失小。
误区 3:"所有模型输出都一样"
实测对比(同一段 Go 代码的 bug 修复):
- GPT-5-mini:修复了显而易见的 nil pointer,耗时 2.3s,成本 $0.002
- Claude Opus 5:不仅修复了 nil pointer,还发现了 3 个并发安全问题和 1 个资源泄漏,耗时 18.7s,成本 $0.38
这不是"谁更好"的问题——这是"这个任务值不值得 $0.38"的问题。 如果是一个内部工具脚本,$0.002 的方案就够了。如果是支付系统的核心代码,$0.38 是必须花的。
行动清单:今天就落地
- 审计你的 Agent 调用日志(15分钟)
- 列出过去 7 天所有模型调用
- 标记每个调用的"实际需要复杂度"(1-5)
-
计算浪费成本 = 用了推理模型但复杂度 ≤2 的调用
-
创建分层 profiles(10分钟)
bash hermes profile create fast --model gpt-5-mini hermes profile create standard --model claude-fable-5 hermes profile create reasoning --model claude-opus-5 -
实现分类 prompt(20分钟)
- 复制上方的分类模板到 skill
- 在你的主工作流开头插入分类步骤
-
运行 3 天,手动抽查分类准确性
-
设置成本监控(5分钟)
- 大多数 LLM 平台有 usage dashboard
- 设置月度预算告警(建议从 $200/月起步)
- 每周检查一次模型使用分布
总结
模型路由不是火箭科学,但它能实实在在地从账单上砍掉 60-80% 的费用。核心就三件事:
规则兜底简单任务 → 分类器路由中等任务 → 级联兜底复杂任务
你的 AI Agent 不需要永远用最聪明的脑子——它需要的是知道什么时候该省着用。
