你的Agent能力越强,闯祸的破坏力就越大。Forge用8B本地模型把工具调用可靠性从个位数提升到84%,Sonnet 4.6从85%到98%——开源、自托管、5分钟部署。
痛点:Agent的强大是一把双刃剑
三天前我在跑自动化热点扫描流水线,一个配置错误让 Agent 连续调了 GitHub API 200+ 次,触发限流被封了半小时。损失不大,但让我想起 HN 上那个 860 分的热帖——某团队的 AI Agent 删了生产数据库。
这不是段子。Agent的能力正在指数级增长:Claude Code 可以跨文件重构、Hermes Agent 能自主执行多步工作流、OpenClaw 支持多 Agent 协作。但每增加一种能力,就增加一个出错的可能。
传统方案的问题:
- 靠 prompt 约束:"请小心操作"——Agent 心情好时听,不好时照样删库
- 靠事后审计:数据库没了才发现问题——太晚了
- 靠人工审查:一人公司哪来的人审查每个 Agent 操作
Forge Guardrails 的思路完全不同:在工具调用执行前拦截,不符合规则的就拒绝。
Forge Guardrails 是什么
Forge 是一个自托管的 LLM 工具调用可靠性层。它不替代你的 Agent(Claude Code、Hermes、OpenClaw 都可以对接),而是在 Agent 和外部工具之间插入一个"安全检查点"。
Agent 说要调工具
↓
Forge 拦截,用 Guardrail 规则检查
↓
┌───┴───┐
✅ 放行 ❌ 拒绝(返回原因)
↓
工具执行
核心能力数据
| 场景 | 无 Forge | 有 Forge(8B 本地模型) | 提升 |
|---|---|---|---|
| Qwen 8B 本地模型 | 个位数% | 84% | 从不可用到可用 |
| Sonnet 4.6 旗舰模型 | 85% | 98% | 逼近人类审查水平 |
| Llama 4 Scout | 低 | 显著提升 | 小模型也能安全做 Agent |
关键洞察:Forge 的最大价值不是给 Claude Sonnet 再加 13 个百分点(虽然也很有用),而是让小模型从"不敢用"变成"放心用"。对一人公司来说,这意味着可以用更便宜的模型跑更复杂的 Agent 工作流。
5 分钟快速部署
Forge 是纯 Python 项目,部署极其简单:
# 1. 克隆仓库
git clone https://github.com/forge-guardians/forge.git
cd forge
# 2. 安装依赖(推荐虚拟环境)
python -m venv .venv
source .venv/bin/activate
pip install -e .
# 3. 启动 Guardrails 服务
forge serve --model guard # 使用内置 8B guard 模型
启动后,Forge 监听 http://localhost:8800,提供标准 MCP 协议接口。
接入 Claude Code(最常用)
Claude Code 原生支持 MCP Server。在 Claude Code 的配置文件中加入:
// ~/.claude/claude_desktop_config.json 或项目的 .mcp.json
{
"mcpServers": {
"forge-guardrails": {
"command": "forge",
"args": ["serve", "--model", "guard", "--port", "8800"],
"env": {
"FORGE_POLICY": "strict"
}
}
}
}
重启 Claude Code 后,每次工具调用都会自动经过 Forge 的检查。
接入 Hermes Agent
Hermes Agent 通过 Plugin 方式接入:
# plugins/forge_guard/__init__.py
from hermes.plugin import HermesPlugin, PluginContext
class ForgeGuardPlugin(HermesPlugin):
name = "forge_guard"
version = "1.0.0"
async def activate(self, ctx: PluginContext):
# 注册工具调用拦截钩子
ctx.register_tool_interceptor(
name="forge-safety-check",
endpoint="http://localhost:8800/v1/check",
policy={
"deny_destructive": True, # 拒绝破坏性操作
"require_confirmation": [ # 高风险操作需确认
"file_delete",
"db_drop",
"rm_rf",
"sudo"
],
"max_file_size_mb": 100, # 文件大小上限
"allowed_domains": [ # 网络请求白名单
"api.github.com",
"hn.algolia.com"
]
}
)
实战:写三条你最需要的 Guardrail 规则
Forge 用 YAML 定义规则,语法直观:
# forge_rules.yaml
rules:
# 规则1:禁止删除操作(除非显式确认)
- name: no-destructive-without-confirm
pattern: "rm |delete|drop|truncate|DROP"
action: require_confirmation
message: "⚠️ 检测到破坏性操作,需要人工确认"
# 规则2:限制 API 调用频率
- name: rate-limit-api-calls
pattern: "api\\.|fetch\\(|requests\\."
action: throttle
max_per_minute: 30
message: "⏱️ API 调用过快,已限速"
# 规则3:敏感文件保护
- name: protect-sensitive-files
pattern: "\\.env|\\.secret|credentials|password|token"
action: deny
message: "🔒 敏感文件禁止 Agent 直接操作"
这三条规则覆盖了一人公司 90% 的 Agent 安全事故场景:
- 规则1 防删库(最常见的人祸)
- 规则2 防 API 被封(监控类 Agent 的常见问题)
- 规则3 防凭证泄露(安全基线)
代理模式:Forge 的最高阶玩法
Forge 支持"代理模式"(Proxy Mode),不只是拦截,还能自动修正:
# 代理模式示例
- name: auto-fix-dangerous-command
pattern: "rm -rf /"
action: proxy # 不是拒绝,而是改写
rewrite: "echo 'Blocked: rm -rf / is not allowed. Use safe alternatives.'"
当 Agent 尝试执行 rm -rf / 时,Forge 不会直接拒绝(可能导致 Agent 困惑),而是替换成一个无害的 echo 命令,Agent 以为执行成功了,实际什么都没有被删除。
设计哲学:拒绝会让 Agent 困惑并可能反复重试;改写让 Agent "以为"执行了,流程继续但零风险。这对长流程自动化尤其重要。
对 AI 创业者的启示
1. Agent 安全正在从"最好有"变成"必须有"
HN 上连续出现高热度 Agent 安全事故讨论(860分「Agent 删了生产数据库」→ 676分 Forge Guardrails → Bad Agent 反思文章),说明市场正在形成共识:Agent 能力越强,安全越重要。
2. Forge 让"小模型做大事"变得可行
一人公司最关心的永远是成本。Forge 让 Qwen 8B(几乎免费)也能达到 84% 的工具调用可靠性,这意味着:
- 高频任务(如监控、定时检查)可以用小模型 + Forge,成本几乎为零
- 复杂任务用大模型 + Forge,达到 98% 可靠性
- 不再需要"所有任务都用最贵模型"的浪费
3. Agent 安全工具本身是创业机会
Forge 是开源基础设施,但在它之上可以做很多事情:
- 垂直场景的 Guardrail 规则包(如金融 Agent、医疗 Agent 的安全规则)
- Agent 行为审计 SaaS(给企业客户的 Agent 操作做合规记录)
- Forge 托管服务(免部署、即开即用)
立即行动
- 5 分钟内跑起来:
git clone+pip install+forge serve,三个命令就够了 - 先上三条规则:禁止删除、API 限流、敏感文件保护——覆盖 90% 场景
- 接入你正在用的 Agent:Claude Code 改 JSON 配置,Hermes 写一个 Plugin,OpenClaw 用 MCP 协议
- 观察一周日志:看看 Forge 拦截了什么操作,据此调整规则
本文基于 Forge Guardrails 开源项目(676 points HN, May 19 2026)撰写。项目地址:github.com/forge-guardians/forge
