13天后(6月15日),Anthropic正式将Claude Code的非交互模式从订阅池剥离为独立计费。Pro用户只有$20月配额——若不优化,一次重度session就可能烧光。
事件回顾:什么是6·15计费分拆?
5月13日,Anthropic通过官方帮助中心悄悄发布了一条更新:从2026年6月15日起,Claude Agent SDK、claude -p、Claude Code GitHub Actions、以及所有通过Agent SDK认证的第三方工具(OpenClaw、Hermes、Conductor等),将不再共享你的Claude订阅用量池。
取而代之的是一个独立月配额,按API标准价格计费:
| 订阅等级 | 月费 | Agent SDK月配额 |
|---|---|---|
| Pro | $20/月 | $20 |
| Max 5x | $100/月 | $100 |
| Max 20x | $200/月 | $200 |
| Team Standard | $25/座 | $20/座 |
| Team Premium | $130/座 | $100/座 |
关键规则:配额月底清零不滚动,超出的部分要么按API价格扣费(需开启"Usage Credits"),要么直接被拒绝。
哪些场景受影响?一句话判断标准——"如果Claude session在运行过程中没有人类盯着每一步,那它几乎肯定要走新配额。"
具体包括:
- claude -p "修复这个bug" ——非交互CLI模式
- CI/CD中的Claude Code GitHub Actions
- 通过Agent SDK跑的定时任务
- OpenClaw/Hermes等第三方Agent的无人值守会话
- Claude Code的--agent模式(自动多轮推理)
不受影响的是:你在终端里盯着看的交互式Claude Code、claude.ai网页聊天、Claude Cowork。
你的真实账单:三种典型场景测算
在动手优化之前,先搞清楚你的用量会落在哪个区间。以下是基于Anthropic API定价的实际测算:
API参考价格(每100万token):
- Haiku 4.5: $1输入 / $5输出
- Sonnet 4.6: $3输入 / $15输出
- Opus 4.7: $5输入 / $25输出
场景一:独立开发者(轻度Agent)
- 每月跑50次
claude -p代码修复 + 20次Agent SDK任务 - 每次平均30K输入 + 5K输出,用Sonnet 4.6
- 成本:30K × $3/1M ≈ $0.09 + 5K × $15/1M ≈ $0.075 = $0.165/次
- 70次/月 × $0.165 = ~$12/月
- 结论:Pro的$20配额足够,有余量
场景二:重度Claude Code用户(日常Agent)
- 每天5次
claude -p会话,每次150K tokens(含系统提示词重发) - 用Sonnet 4.6
- 单次成本:150K × $3/1M = $0.45 输入 + 10K × $15/1M = $0.15 输出 = $0.60/次
- 150次/月 × $0.60 = $90/月
- 结论:Pro不够,需要Max 5x($100配额刚好覆盖)
场景三:Agent重度用户(Opus驱动)
- 每天3次深度Agent会话,每次500K tokens,用Opus 4.7
- 单次成本:500K × $5/1M = $2.50 + 30K × $25/1M = $0.75 = $3.25/次
- 90次/月 × $3.25 = $292/月
- 结论:即使Max 20x的$200也不够,需要拆分到Direct API
计算公式模板(保存为
claude_cost_calc.py):
```python每月Agent成本估算
sessions_per_month = 150
avg_input_tokens = 150_000
avg_output_tokens = 10_000
model_input_price = 3 # Sonnet 4.6: $3/M
model_output_price = 15 # Sonnet 4.6: $15/Mcost_per_session = (avg_input_tokens / 1_000_000) * model_input_price + \
(avg_output_tokens / 1_000_000) * model_output_price
monthly = sessions_per_month * cost_per_session
print(f"月预估成本: ${monthly:.0f}")
```
5步配置优化(收藏级实操指南)
第1步:领取你的配额(6月15日前必做)
Anthropic会在6月15日前发送claim邮件。不领取 = 完全放弃Agent SDK配额。 这是最关键的一步:
- 留意注册邮箱中来自Anthropic的claim邮件(预计6月8日前后发出)
- 点击邮件链接,登录Claude账户完成领取
- 之后每月自动刷新,无需重复操作
如果你用的是Team/Enterprise方案,管理员需要统一操作。务必在6月14日前通知IT确认。
第2步:设置"Usage Credits"开关(影响最大的一步决策)
登录 claude.ai/settings/billing,找到新增的「Usage Credits」开关:
- 开启:超出$20/$100/$200配额的用量按API价格继续扣费
- 关闭:配额耗尽后Agent请求直接拒绝(返回错误)
推荐策略:开启,但配合第3步的模型路由和第5步的任务预算——让它在99%的情况下不走超额计费,但不会因为突发任务而中断。
第3步:配置Prompt Caching(省钱幅度最大:70-90%)
Agent场景最大的成本黑洞是什么?每次请求都要重发整个系统提示词。
Claude Code的系统提示词动辄20K-40K tokens。一个Agent session运行10轮对话,系统提示词就被发送了10次,而实际上只需要第一次。
配置方法(在 .claude/settings.json 或代码中):
{
"prompt_caching": {
"enabled": true,
"cache_breakpoints": 3,
"min_cacheable_tokens": 1024
}
}
在Claude Code CLI中,可以用 --cache 参数启用:
# 缓存系统提示词和项目上下文
claude -p "review PR #42" --cache
# Agent模式同样生效
claude --agent "实现用户登录模块" --cache
实测效果:对于典型的Agent编程场景(40K系统提示词 + 60K上下文),开启caching后输入成本从$0.30降到$0.04,节省87%。
# Agent SDK 中配置缓存
import anthropic
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-sonnet-4-6-20250514",
system=[
{
"type": "text",
"text": "You are an expert Python developer...",
"cache_control": {"type": "ephemeral"} # ← 关键
}
],
messages=[{"role": "user", "content": "Write a test for..."}],
max_tokens=4096
)
# 第二次调用时系统提示词走缓存,输入价格降至$0.30/M
第4步:模型三级路由(80%的任务用Haiku就够了)
不是所有Agent任务都需要Opus 4.7的推理能力。一个简单的分类、格式化、或代码补全任务,Haiku 4.5能以1/5的价格完成。
建立你的模型路由规则:
# claude_router.py — 按任务复杂度自动选模型
def route_model(task: str) -> str:
"""简单任务走Haiku,中等走Sonnet,复杂走Opus"""
simple_keywords = ["format", "lint", "rename", "comment",
"summarize", "classify", "extract"]
complex_keywords = ["architecture", "design", "refactor",
"debug race condition", "security audit",
"optimize algorithm"]
task_lower = task.lower()
if any(kw in task_lower for kw in complex_keywords):
return "claude-opus-4-7-20250514"
elif any(kw in task_lower for kw in simple_keywords):
return "claude-haiku-4-5-20250514"
else:
return "claude-sonnet-4-6-20250514"
# 使用示例
model = route_model("优化数据库查询性能")
claude -p "优化数据库查询性能" --model {model}
Claude Code CLI直接指定模型:
# 简单格式化:用Haiku($1/M 输入)
claude -p "格式化这段代码: $(cat messy.py)" --model claude-haiku-4-5-20250514
# 日常编程:用Sonnet($3/M 输入)
claude -p "添加这个API端点的单元测试" --model claude-sonnet-4-6-20250514
# 架构设计:用Opus($5/M 输入)
claude -p "设计这个微服务的消息队列架构" --model claude-opus-4-7-20250514
成本对比:同样10万token输入,Haiku $0.10 vs Opus $0.50——差了5倍。
如果你70%的任务可以走Haiku,月Agent成本能从$90降到$22,直接让Pro的$20配额从不够变成刚好。
第5步:配置任务级预算(防止失控循环)
Agent最大的财务风险不是正常用量,而是失控循环。一个递归出bug的Agent可能在10分钟内烧掉$50。
在系统中硬编码预算上限:
Claude Code CLI方式:
# 限制单次session最多花$2
claude -p "重构整个代码库" --max-cost 2.00
# 限制最大token数(约等于$0.50预算,Sonnet 4.6)
claude -p "检查所有API端点的安全性" --max-tokens 32000
Agent SDK方式:
import anthropic
import time
MAX_SESSION_COST = 2.00 # 硬上限
cost_so_far = 0.0
PRICES = {"claude-sonnet-4-6-20250514": (3, 15)} # (输入$, 输出$)/1M tokens
def run_with_budget(client, system_prompt, task, model):
global cost_so_far
messages = [{"role": "user", "content": task}]
for turn in range(30): # 最多30轮
if cost_so_far >= MAX_SESSION_COST:
print(f"⚠️ 预算耗尽 (${cost_so_far:.2f}/${MAX_SESSION_COST:.2f}),中断session")
break
response = client.messages.create(
model=model,
system=system_prompt,
messages=messages,
max_tokens=4096
)
in_price, out_price = PRICES[model]
turn_cost = (response.usage.input_tokens / 1_000_000) * in_price + \
(response.usage.output_tokens / 1_000_000) * out_price
cost_so_far += turn_cost
messages.append({"role": "assistant", "content": response.content[0].text})
if "[DONE]" in response.content[0].text:
break
return messages, cost_so_far
进阶策略:三重省钱组合拳
组合1:Prompt Caching + Haiku路由 + 预算帽
这三招叠加的效果不是加法,而是乘法:
| 策略 | 单独效果 | 叠加效果 |
|---|---|---|
| 无优化 | $90/月基线 | - |
| 仅Prompt Caching | $32/月(-64%) | - |
| 仅Haiku路由 | $22/月(-76%) | - |
| Caching + Haiku | - | $8/月(-91%) |
| Caching + Haiku + 预算帽 | - | $6/月(-93%) |
从$90到$6——这就是配置优化的力量。
组合2:Direct API兜底方案
如果你每月Agent用量已经稳定超过$200,不要硬撑Max 20x。订阅费$200 + 超额API价格 > 纯API价格。正确的做法:
- 保留Pro($20/月)用于交互式Claude Code和claude.ai聊天
- 所有Agent流量走Direct API Key,设置月度预算告警
- 在API控制台设置硬上限(如$150/月),到达后自动切断
# 在 ~/.claude/config 中配置API key模式
# Agent任务通过环境变量指定使用Direct API
export ANTHROPIC_API_KEY="sk-ant-xxx"
claude -p "自动化测试生成" --api-key $ANTHROPIC_API_KEY
时间线检查清单
| 日期 | 行动 | 完成 |
|---|---|---|
| 现在-6月8日 | 审计当前Agent SDK用量(拉一个月数据) | ☐ |
| 6月8日前后 | 领取Anthropic claim邮件中的配额 | ☐ |
| 6月10日前 | 配置prompt caching + 模型路由规则 | ☐ |
| 6月13日前 | 设置Usage Credits开关 + 任务级预算 | ☐ |
| 6月14日前 | 通知团队/CI负责人,更新所有workflow | ☐ |
| 6月15日 | 计费分拆生效,监控首日用量 | ☐ |
| 6月22日 | 检查一周实际花费 vs 预估,调优参数 | ☐ |
总结
Anthropic这次计费分拆的本质,是把"AI Agent算力补贴"变成了"用多少付多少"。这不是坏事——明确的价格信号让我们能精准优化。
三句话记住:
1. 6月15日前必领配额,不领等于放弃
2. 开启Prompt Caching + 模型路由 = 节省70-90%
3. 给每个Agent session设预算帽,防止一夜破产
对于一人公司和独立开发者,这个变化反而是机会:那些不优化的团队会被账单打醒,而你用这套配置方案,Pro的$20月费就能覆盖大部分Agent需求。
