Agent工坊

【Agent工坊】Claude Code 6·15计费分拆:5步配置优化,月省$200

13天后(6月15日),Anthropic正式将Claude Code的非交互模式从订阅池剥离为独立计费。Pro用户只有$20月配额——若不优化,一次重度session就可能烧光。

事件回顾:什么是6·15计费分拆?

5月13日,Anthropic通过官方帮助中心悄悄发布了一条更新:从2026年6月15日起,Claude Agent SDK、claude -p、Claude Code GitHub Actions、以及所有通过Agent SDK认证的第三方工具(OpenClaw、Hermes、Conductor等),将不再共享你的Claude订阅用量池。

取而代之的是一个独立月配额,按API标准价格计费:

订阅等级 月费 Agent SDK月配额
Pro $20/月 $20
Max 5x $100/月 $100
Max 20x $200/月 $200
Team Standard $25/座 $20/座
Team Premium $130/座 $100/座

关键规则:配额月底清零不滚动,超出的部分要么按API价格扣费(需开启"Usage Credits"),要么直接被拒绝。

哪些场景受影响?一句话判断标准——"如果Claude session在运行过程中没有人类盯着每一步,那它几乎肯定要走新配额。"

具体包括:
- claude -p "修复这个bug" ——非交互CLI模式
- CI/CD中的Claude Code GitHub Actions
- 通过Agent SDK跑的定时任务
- OpenClaw/Hermes等第三方Agent的无人值守会话
- Claude Code的--agent模式(自动多轮推理)

不受影响的是:你在终端里盯着看的交互式Claude Code、claude.ai网页聊天、Claude Cowork。

你的真实账单:三种典型场景测算

在动手优化之前,先搞清楚你的用量会落在哪个区间。以下是基于Anthropic API定价的实际测算:

API参考价格(每100万token):
- Haiku 4.5: $1输入 / $5输出
- Sonnet 4.6: $3输入 / $15输出
- Opus 4.7: $5输入 / $25输出

场景一:独立开发者(轻度Agent)

  • 每月跑50次claude -p代码修复 + 20次Agent SDK任务
  • 每次平均30K输入 + 5K输出,用Sonnet 4.6
  • 成本:30K × $3/1M ≈ $0.09 + 5K × $15/1M ≈ $0.075 = $0.165/次
  • 70次/月 × $0.165 = ~$12/月
  • 结论:Pro的$20配额足够,有余量

场景二:重度Claude Code用户(日常Agent)

  • 每天5次claude -p会话,每次150K tokens(含系统提示词重发)
  • 用Sonnet 4.6
  • 单次成本:150K × $3/1M = $0.45 输入 + 10K × $15/1M = $0.15 输出 = $0.60/次
  • 150次/月 × $0.60 = $90/月
  • 结论:Pro不够,需要Max 5x($100配额刚好覆盖)

场景三:Agent重度用户(Opus驱动)

  • 每天3次深度Agent会话,每次500K tokens,用Opus 4.7
  • 单次成本:500K × $5/1M = $2.50 + 30K × $25/1M = $0.75 = $3.25/次
  • 90次/月 × $3.25 = $292/月
  • 结论:即使Max 20x的$200也不够,需要拆分到Direct API

计算公式模板(保存为 claude_cost_calc.py):
```python

每月Agent成本估算

sessions_per_month = 150
avg_input_tokens = 150_000
avg_output_tokens = 10_000
model_input_price = 3 # Sonnet 4.6: $3/M
model_output_price = 15 # Sonnet 4.6: $15/M

cost_per_session = (avg_input_tokens / 1_000_000) * model_input_price + \
(avg_output_tokens / 1_000_000) * model_output_price
monthly = sessions_per_month * cost_per_session
print(f"月预估成本: ${monthly:.0f}")
```

5步配置优化(收藏级实操指南)

第1步:领取你的配额(6月15日前必做)

Anthropic会在6月15日前发送claim邮件。不领取 = 完全放弃Agent SDK配额。 这是最关键的一步:

  1. 留意注册邮箱中来自Anthropic的claim邮件(预计6月8日前后发出)
  2. 点击邮件链接,登录Claude账户完成领取
  3. 之后每月自动刷新,无需重复操作

如果你用的是Team/Enterprise方案,管理员需要统一操作。务必在6月14日前通知IT确认。

第2步:设置"Usage Credits"开关(影响最大的一步决策)

登录 claude.ai/settings/billing,找到新增的「Usage Credits」开关:

  • 开启:超出$20/$100/$200配额的用量按API价格继续扣费
  • 关闭:配额耗尽后Agent请求直接拒绝(返回错误)

推荐策略:开启,但配合第3步的模型路由和第5步的任务预算——让它在99%的情况下不走超额计费,但不会因为突发任务而中断。

第3步:配置Prompt Caching(省钱幅度最大:70-90%)

Agent场景最大的成本黑洞是什么?每次请求都要重发整个系统提示词。

Claude Code的系统提示词动辄20K-40K tokens。一个Agent session运行10轮对话,系统提示词就被发送了10次,而实际上只需要第一次。

配置方法(在 .claude/settings.json 或代码中):

{
  "prompt_caching": {
    "enabled": true,
    "cache_breakpoints": 3,
    "min_cacheable_tokens": 1024
  }
}

在Claude Code CLI中,可以用 --cache 参数启用:

# 缓存系统提示词和项目上下文
claude -p "review PR #42" --cache

# Agent模式同样生效
claude --agent "实现用户登录模块" --cache

实测效果:对于典型的Agent编程场景(40K系统提示词 + 60K上下文),开启caching后输入成本从$0.30降到$0.04,节省87%。

# Agent SDK 中配置缓存
import anthropic

client = anthropic.Anthropic()
response = client.messages.create(
    model="claude-sonnet-4-6-20250514",
    system=[
        {
            "type": "text",
            "text": "You are an expert Python developer...",
            "cache_control": {"type": "ephemeral"}  # ← 关键
        }
    ],
    messages=[{"role": "user", "content": "Write a test for..."}],
    max_tokens=4096
)
# 第二次调用时系统提示词走缓存,输入价格降至$0.30/M

第4步:模型三级路由(80%的任务用Haiku就够了)

不是所有Agent任务都需要Opus 4.7的推理能力。一个简单的分类、格式化、或代码补全任务,Haiku 4.5能以1/5的价格完成。

建立你的模型路由规则:

# claude_router.py — 按任务复杂度自动选模型
def route_model(task: str) -> str:
    """简单任务走Haiku,中等走Sonnet,复杂走Opus"""
    simple_keywords = ["format", "lint", "rename", "comment", 
                       "summarize", "classify", "extract"]
    complex_keywords = ["architecture", "design", "refactor",
                        "debug race condition", "security audit",
                        "optimize algorithm"]

    task_lower = task.lower()

    if any(kw in task_lower for kw in complex_keywords):
        return "claude-opus-4-7-20250514"
    elif any(kw in task_lower for kw in simple_keywords):
        return "claude-haiku-4-5-20250514"
    else:
        return "claude-sonnet-4-6-20250514"

# 使用示例
model = route_model("优化数据库查询性能")
claude -p "优化数据库查询性能" --model {model}

Claude Code CLI直接指定模型

# 简单格式化:用Haiku($1/M 输入)
claude -p "格式化这段代码: $(cat messy.py)" --model claude-haiku-4-5-20250514

# 日常编程:用Sonnet($3/M 输入)
claude -p "添加这个API端点的单元测试" --model claude-sonnet-4-6-20250514

# 架构设计:用Opus($5/M 输入)
claude -p "设计这个微服务的消息队列架构" --model claude-opus-4-7-20250514

成本对比:同样10万token输入,Haiku $0.10 vs Opus $0.50——差了5倍。

如果你70%的任务可以走Haiku,月Agent成本能从$90降到$22,直接让Pro的$20配额从不够变成刚好。

第5步:配置任务级预算(防止失控循环)

Agent最大的财务风险不是正常用量,而是失控循环。一个递归出bug的Agent可能在10分钟内烧掉$50。

在系统中硬编码预算上限:

Claude Code CLI方式

# 限制单次session最多花$2
claude -p "重构整个代码库" --max-cost 2.00

# 限制最大token数(约等于$0.50预算,Sonnet 4.6)
claude -p "检查所有API端点的安全性" --max-tokens 32000

Agent SDK方式

import anthropic
import time

MAX_SESSION_COST = 2.00  # 硬上限
cost_so_far = 0.0
PRICES = {"claude-sonnet-4-6-20250514": (3, 15)}  # (输入$, 输出$)/1M tokens

def run_with_budget(client, system_prompt, task, model):
    global cost_so_far
    messages = [{"role": "user", "content": task}]

    for turn in range(30):  # 最多30轮
        if cost_so_far >= MAX_SESSION_COST:
            print(f"⚠️ 预算耗尽 (${cost_so_far:.2f}/${MAX_SESSION_COST:.2f}),中断session")
            break

        response = client.messages.create(
            model=model,
            system=system_prompt,
            messages=messages,
            max_tokens=4096
        )

        in_price, out_price = PRICES[model]
        turn_cost = (response.usage.input_tokens / 1_000_000) * in_price + \
                    (response.usage.output_tokens / 1_000_000) * out_price
        cost_so_far += turn_cost

        messages.append({"role": "assistant", "content": response.content[0].text})

        if "[DONE]" in response.content[0].text:
            break

    return messages, cost_so_far

进阶策略:三重省钱组合拳

组合1:Prompt Caching + Haiku路由 + 预算帽

这三招叠加的效果不是加法,而是乘法:

策略 单独效果 叠加效果
无优化 $90/月基线 -
仅Prompt Caching $32/月(-64%) -
仅Haiku路由 $22/月(-76%) -
Caching + Haiku - $8/月(-91%)
Caching + Haiku + 预算帽 - $6/月(-93%)

从$90到$6——这就是配置优化的力量。

组合2:Direct API兜底方案

如果你每月Agent用量已经稳定超过$200,不要硬撑Max 20x。订阅费$200 + 超额API价格 > 纯API价格。正确的做法:

  1. 保留Pro($20/月)用于交互式Claude Code和claude.ai聊天
  2. 所有Agent流量走Direct API Key,设置月度预算告警
  3. 在API控制台设置硬上限(如$150/月),到达后自动切断
# 在 ~/.claude/config 中配置API key模式
# Agent任务通过环境变量指定使用Direct API
export ANTHROPIC_API_KEY="sk-ant-xxx"
claude -p "自动化测试生成" --api-key $ANTHROPIC_API_KEY

时间线检查清单

日期 行动 完成
现在-6月8日 审计当前Agent SDK用量(拉一个月数据)
6月8日前后 领取Anthropic claim邮件中的配额
6月10日前 配置prompt caching + 模型路由规则
6月13日前 设置Usage Credits开关 + 任务级预算
6月14日前 通知团队/CI负责人,更新所有workflow
6月15日 计费分拆生效,监控首日用量
6月22日 检查一周实际花费 vs 预估,调优参数

总结

Anthropic这次计费分拆的本质,是把"AI Agent算力补贴"变成了"用多少付多少"。这不是坏事——明确的价格信号让我们能精准优化。

三句话记住:
1. 6月15日前必领配额,不领等于放弃
2. 开启Prompt Caching + 模型路由 = 节省70-90%
3. 给每个Agent session设预算帽,防止一夜破产

对于一人公司和独立开发者,这个变化反而是机会:那些不优化的团队会被账单打醒,而你用这套配置方案,Pro的$20月费就能覆盖大部分Agent需求。


AI创业 #ClaudeCode #Agent工坊 #成本优化 #一人公司