Agent工坊

【Agent工坊】AI Agent 模型路由实战:用对模型省80%费用

一个真实的账单:某人用 Claude Opus 5 写单元测试,月账单 $1,200。换成 GPT-5-mini 后降到 $180,测试通过率只降了 3%。今天分享一套可复制的模型路由策略,让你的 AI Agent 知道什么时候该用"大脑",什么时候该用"本能"。

你为什么需要模型路由

2026 年 7 月的 AI 模型市场是这样的:

模型 输入价格 ($/1M tokens) 输出价格 适合场景
Claude Opus 5 $15 $75 复杂架构设计、安全审计
Claude Fable 5 $3 $15 代码审查、技术写作
GPT-5.6 $12.5 $50 综合推理、长篇生成
GPT-5-mini $0.75 $3 分类、格式化、简单脚本
DeepSeek V4 $2.75 $14 性价比推理、中文内容
Qwen 3.8 Max $2 $8 中文理解、长上下文

价格跨度是 7-20 倍。 但多数 AI Agent 的实现方式却是:所有任务都用同一个模型。

这就像你请了一个时薪 $500 的高级顾问,让他帮你整理文件夹。他当然能做,但你破产的速度会比回本更快。

模型路由(Model Routing)要解决的正是这个问题:根据任务难度自动选择最合适的模型——用低成本模型处理简单任务,只在真正需要时才调用昂贵的推理模型。

三层路由架构

经过 3 个月的实战迭代,我总结出了一个可复制的三层架构:

┌─────────────────────────────────────────┐
│          Layer 1: 规则路由               │
│  · 关键词匹配(如 "格式转换" → mini)    │
│  · 代码行数阈值(<50行 → mini)         │
│  · 已缓存结果复用                        │
│  · 命中率: ~40% · 成本: 极低            │
└─────────────────────────────────────────┘
                    ↓ 未命中
┌─────────────────────────────────────────┐
│          Layer 2: 分类器路由             │
│  · 轻量模型分类任务难度 (1-5级)         │
│  · Level 1-2 → mini 模型               │
│  · Level 3-4 → 标准模型                 │
│  · Level 5 → 推理模型                   │
│  · 命中率: ~95% · 成本: 极低            │
└─────────────────────────────────────────┘
                    ↓ 分类器不确定
┌─────────────────────────────────────────┐
│          Layer 3: 级联兜底               │
│  · 先用 mini 模型尝试                   │
│  · 输出质量检查(置信度/完整性)         │
│  · 不通过 → 升级到更强模型              │
│  · 成本: 偶有 double-run,但可控        │
└─────────────────────────────────────────┘

Layer 1 不消耗任何 token——纯规则匹配。比如 "帮我格式化这段 JSON"、"给这 3 个函数写注释" 这类任务,闭着眼睛都知道用 mini 模型。

Layer 2 消耗约 200 tokens 做分类(用 mini 模型本身),但能避免 95% 的"高射炮打蚊子"。

Layer 3 是最后的保险——宁可多花一次 mini 调用的钱,也不错派任务。

Hermes Agent 实战配置

在 Hermes Agent 中实现模型路由,核心是通过 profilesskills 的组合。每个 profile 绑定不同的模型,skill 里声明任务的复杂度等级。

步骤 1:创建分层 profiles

# ~/.hermes/profiles/fast/config.yaml
name: fast
model: gpt-5-mini
# 用于 Layer 1 规则命中 + Layer 2 分类器
# ~/.hermes/profiles/standard/config.yaml
name: standard
model: claude-fable-5
# 用于中等复杂度任务:代码审查、文档编写、bug 修复
# ~/.hermes/profiles/reasoning/config.yaml
name: reasoning
model: claude-opus-5
# 用于高复杂度:架构设计、安全分析、多步推理

步骤 2:编写智能路由 Skill

# ~/.hermes/profiles/default/skills/smart-router.md
---
name: smart-router
description: 智能任务路由 - 根据复杂度选择模型
---

## 路由规则

### 直接路由(不消耗分类 token)

以下关键词命中任一,直接用 fast 模型:
- 格式化、转换、翻译(简单句子)、提取列表
- 函数注释、变量重命名、import 排序
- 生成 mock 数据、写 README 草稿

### 需要分类器判断

其余任务先由 fast 模型打分(1-5):
- 1-2:继续用 fast 模型完成
- 3-4:切换到 standard 模型
- 5:切换到 reasoning 模型

### 分类 Prompt 模板

"请评估以下任务的复杂度(1-5):
1=简单格式化/翻译/注释 2=有明确规则的代码修改
3=需要理解业务逻辑 4=涉及多文件/多步骤协作
5=需要深度推理/架构决策/安全审查

任务描述:{user_prompt}

只回复数字。"

步骤 3:成本对比 - 真实案例

这是我运营「AI创业内参」一个月的实际数据:

任务类型 日均调用 优化前模型 优化后模型 月省费用
热点标题抓取 24次 Claude Fable 5 GPT-5-mini $28 → $3
文章排版格式化 4次 Claude Fable 5 GPT-5-mini $9 → $1
初稿写作 3次 Claude Opus 5 GPT-5.6 $195 → $82
SEO 标签生成 8次 GPT-5.6 GPT-5-mini $38 → $5
代码审查 2次 Claude Opus 5 Claude Fable 5 $65 → $13
架构设计讨论 1次 Claude Opus 5 Claude Opus 5 $33 → $33

月总计:优化前 $368 → 优化后 $137,下降 62.8%。

关键洞察:代码审查和初稿写作的模型降级几乎没有感知到的质量损失。Claude Fable 5 审查代码的能力在 90% 的场景下与 Opus 5 持平,而价格只有 1/5。

进阶技巧:缓存优先路由

在 Layer 1 之上,还可以加一层缓存判断:

# 伪代码:缓存感知路由
def route_task(prompt: str) -> str:
    # 1) 语义哈希匹配:相似任务复用缓存
    cache_key = semantic_hash(prompt)
    if cached := cache.get(cache_key):
        if cache_hit_confidence(cached, prompt) > 0.9:
            return cached  # 零成本

    # 2) 规则路由
    if matches_simple_pattern(prompt):
        return call_model("gpt-5-mini", prompt)

    # 3) 分类器路由
    difficulty = classify(prompt)
    model = select_model(difficulty)
    result = call_model(model, prompt)

    # 4) 写入缓存
    cache.set(cache_key, result)
    return result

语义缓存不是简单的字符串匹配。用 embedding 向量计算相似度,当两次请求的语义相似度 > 0.95 时直接复用结果。对于热点监控这种高频重复场景,缓存命中率可以达到 30-40%。

三个常见误区

误区 1:"便宜的模型质量差"

GPT-5-mini 在结构化输出(JSON、Markdown、代码块)上的准确率与 GPT-5.6 的差距不到 2%。差的是开放域推理和创意写作。大部分 Agent 任务正好是结构化输出。

判断方法:如果你的任务「有标准答案或可验证结果」(代码能跑就是能跑、格式对就是对的),用 mini 模型。

误区 2:"分类器本身消耗 token,不如直接用推理模型"

分类消耗 ~200 tokens(约 $0.00015),一次推理模型调用消耗 ~2000 tokens(约 $0.15)。就算分类器准确率只有 80%,也远比分错 5 次任务的损失小。

误区 3:"所有模型输出都一样"

实测对比(同一段 Go 代码的 bug 修复):

  • GPT-5-mini:修复了显而易见的 nil pointer,耗时 2.3s,成本 $0.002
  • Claude Opus 5:不仅修复了 nil pointer,还发现了 3 个并发安全问题和 1 个资源泄漏,耗时 18.7s,成本 $0.38

这不是"谁更好"的问题——这是"这个任务值不值得 $0.38"的问题。 如果是一个内部工具脚本,$0.002 的方案就够了。如果是支付系统的核心代码,$0.38 是必须花的。

行动清单:今天就落地

  1. 审计你的 Agent 调用日志(15分钟)
  2. 列出过去 7 天所有模型调用
  3. 标记每个调用的"实际需要复杂度"(1-5)
  4. 计算浪费成本 = 用了推理模型但复杂度 ≤2 的调用

  5. 创建分层 profiles(10分钟)
    bash hermes profile create fast --model gpt-5-mini hermes profile create standard --model claude-fable-5 hermes profile create reasoning --model claude-opus-5

  6. 实现分类 prompt(20分钟)

  7. 复制上方的分类模板到 skill
  8. 在你的主工作流开头插入分类步骤
  9. 运行 3 天,手动抽查分类准确性

  10. 设置成本监控(5分钟)

  11. 大多数 LLM 平台有 usage dashboard
  12. 设置月度预算告警(建议从 $200/月起步)
  13. 每周检查一次模型使用分布

总结

模型路由不是火箭科学,但它能实实在在地从账单上砍掉 60-80% 的费用。核心就三件事:

规则兜底简单任务 → 分类器路由中等任务 → 级联兜底复杂任务

你的 AI Agent 不需要永远用最聪明的脑子——它需要的是知道什么时候该省着用。


AI创业 #Agent工坊 #成本优化 #模型路由 #一人公司