Agent工坊

【Agent工坊】Hermes v0.18 裁判官版本:三招教你让AI自己学会新技能、自己证明任务完成

217K GitHub Star、~700个P0/P1全部清零——Hermes Agent上线仅5个月,v0.18 "The Judgment Release" 带来了三个一人创业者的效率倍增器。

为什么你应该关心这个版本

7月1日,Nous Research发布了Hermes Agent v0.18.0——代号"The Judgment Release"(裁判官版本)。名字有两层含义:第一,团队在12天内把整个仓库的~700个P0/P1问题全部清零;第二,Agent本身学会了"自我判断"——不光说"我做了",还能证明"做对了"。

对AI创业者来说,v0.18有三个立即可用的杀手级功能:

  1. /learn:一句话教会Hermes一个新技能,不需要手写Markdown模板
  2. /goal:设定完成标准,Agent自己跑测试验证,不再"我觉得修好了"
  3. delegate_task 后台并发:一次派发多个子任务,你去干别的,回来收结果

这三招加起来,等于把一个"高级对话机器人"变成了"会学习、会自我检验、能并行工作的AI员工"。

第一招:/learn — 一句话教会AI新技能

以前怎么教Hermes新技能?

旧版本(v0.17及之前)的作者流程是:

# 1. 在 ~/.hermes/profiles/default/skills/ 下创建目录
mkdir -p ~/.hermes/profiles/default/skills/my-workflow
# 2. 手写一个 Markdown 文件
vim ~/.hermes/profiles/default/skills/my-workflow/skill.md
# 3. 按模板填 name, description, triggers, instructions...

你是不是连模板长什么样都要去翻文档?

现在:对Hermes说一句话就够了

# 方式1:用刚才走过的流程教它
/learn 把我刚才做的"每天早上8点自动抓取GitHub trending,筛选AI相关项目,
        生成日报发到Telegram"这个流程学会

# 方式2:指向一个目录
/learn /home/agent/projects/my-deploy-workflow/

# 方式3:指向一个URL
/learn https://docs.example.com/my-ci-cd-process

Hermes会自动:
- 分析你做了什么或指向了什么
- 提炼出可复用的步骤
- 按CONTRIBUTING.md规范写入skill文件
- 下次你提到相关任务时,自动加载这个skill

实战演示:创建"AI内参日报"Skill

假设你每天早上要做这样的日报流程:

# 传统做法:手动跑4个命令
web_search "AI news 2026" | tee daily_scan.txt
python3 summarize.py daily_scan.txt > report.md
python3 format_for_telegram.py report.md
python3 send_telegram.py --chat-id @my_channel --file report.md

现在只需:

# 第一次执行完整流程时,Hermes会跟着你做
# 完成之后:
/learn 把刚才的"抓AI新闻→摘要→格式化→发Telegram"学会,命名为ai-daily-brief

之后每天早上只需要:

/ai-daily-brief

Hermes会自动调用web_search、Python脚本、Telegram API,按你教它的顺序执行。

为什么这对一人公司至关重要

一人创业者最大的瓶颈是知识无法复用。今天写了一篇SEO文章,明天又要从头来。/learn 就是你的"流程记录员"——每做一次任务,自动沉淀成可复用的技能。你的AI团队会自己长大。

关键数据:v0.18.0版本共关闭~1950个issue/PR,其中370+位社区贡献者参与。/learn/journey模块由核心团队@teknium1和@OutThisLife主导开发(#51506, #52372, #55555)。

第二招:/goal — 让AI自己证明"任务真的完成了"

AI最大的谎言:"我觉得修好了"

用Claude Code或Cursor写过代码的人都经历过:

你: 修复这个登录bug
AI: 已修复!(改了3行代码)
你: 你运行测试了吗?
AI: 抱歉,我没有运行测试。让我现在运行...
     【测试失败:还有2个相关用例未通过】

这是AI Agent的根本问题:LLM说"done"不等于真的done

Hermes v0.18的解决方案:完成合约(Completion Contract)

# 设定完成标准——用可验证的条件定义"完成"
/goal "重构user_auth模块,保持所有37个已有测试通过,API响应时间<200ms"

# 指定验证命令
/goal pre_verify "pytest tests/test_user_auth.py -v && python benchmark_api.py --threshold 200"

# 让目标在后台运行
/goal wait

Hermes会:
1. 开始工作,修改代码
2. 自己跑pytest验证
3. 检查测试结果——不通过就继续改
4. 跑性能基准测试
5. 只有所有条件都满足时才报告"完成"

完成合约的实际价值

对比一下传统Agent和v0.18的区别:

场景 传统Agent Hermes v0.18 + /goal
重构代码 "我改好了"(测试没跑) 跑完37个测试,全绿才报告
写API "功能实现了"(超时500ms) benchmark验证<200ms才停
配环境 "依赖装好了"(有版本冲突) pip check通过才结束
Cron脚本 "应该能跑"(没测试) 实际执行验证成功

核心变化:从"模型说做完"变成"证据说做完"。这对一人公司意味着——你的AI员工可以独立完成需要质量保证的任务,而不只是生成代码。

这个机制的PR由@teknium1和@OutThisLife贡献(#50501, #52285, #55413, #53552)。

第三招:delegate_task 后台并发 — 一个人管一支AI部队

旧版:一次一个子任务,你得等着

# v0.17的delegate_task:串行执行
delegate_task(goal="调研竞品A", ...)  # 等5分钟
delegate_task(goal="调研竞品B", ...)  # 再等5分钟
delegate_task(goal="调研竞品C", ...)  # 再等5分钟
# 总计:15分钟,你一直在等

新版:全部并发,你不等

# v0.18的delegate_task:并行fan-out
delegate_task(
    goal="调研这5家竞品的产品、定价、用户评价,每个生成300字报告。
          完成后合并为一份竞品分析总报告",
    fan_out=5,  # 同时派出5个子Agent
    background=True  # 后台运行,不阻塞你的对话
)
# 你可以继续问别的问题,5个Agent在后台同时工作
# 全部完成后,Hermes自动合并结果,一条消息呈现

在CLI和TUI中,状态栏会实时显示子Agent的进度:

[=====>    ] 竞品A: 调研中... (2/5)
[========> ] 竞品B: 撰写报告... (3/5)  
[===>      ] 竞品C: 搜索中... (1/5)
[=========] 竞品D: 完成 ✓
[====>     ] 竞品E: 分析定价... (2/5)

一人公司的典型并发场景

场景1: 内容生产
├── 子Agent 1: 搜AI热点 + 写大纲
├── 子Agent 2: 搜竞品文章 + 提取差异化角度
├── 子Agent 3: 生成配图prompt
└── 主Agent: 合并结果 + 写全文

场景2: 代码审查
├── 子Agent 1: 安全审查
├── 子Agent 2: 性能审查
├── 子Agent 3: 代码风格审查
└── 主Agent: 合并审查报告

场景3: 市场调研
├── 子Agent 1: 爬取ProductHunt AI分类
├── 子Agent 2: 分析HN讨论热度
├── 子Agent 3: 扫描GitHub trending
├── 子Agent 4: 检查Reddit社区评价
└── 主Agent: 多维交叉分析报告

这个功能的PR由@teknium1贡献(#49734)。

额外赠送:MoA(多模型委员会)像选模型一样简单

v0.18把Mixture-of-Agents从一种"模式开关"变成了一等公民模型

# 之前:需要切换到MoA模式
/moa on
# 然后再提问...

# 现在:直接选一个MoA预设,就像选GPT或Claude一样
/model select moa/my-council
# "my-council"可能包含:GPT-5 + Claude 4 + Grok + DeepSeek
# 然后正常提问即可

更厉害的是——你能看到每个模型的思考过程

🤖 GPT-5 的观点:
  [完整的推理过程...]

🤖 Claude 4 的观点:
  [完整的推理过程...]

🤖 Grok 的观点:
  [完整的推理过程...]

📊 综合结论(GPT-5合成):
  [结合三方观点的最终答案,实时流式输出]

对创业者来说,这意味着:做重大决策时可以同时咨询4个顶级AI,看它们的推理过程,再收一个综合建议——而且就跟选模型一样简单。

快速上手指南

升级到v0.18

# 如果已安装
hermes update

# 或全新安装
curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash

# 确认版本
hermes --version
# 应输出: Hermes Agent v0.18.2 (v2026.7.7.2)

三招速成

# 1. 教它一个技能(做完一个流程后)
/learn 把我刚才的流程学会,命名为deploy-check

# 2. 设定可验证的目标
/goal "写一个REST API,所有12个端点的单元测试通过,coverage>80%"

# 3. 并发派活
# 在对话中说:
"同时帮我:A)查Hermes最新版本号 B)查OpenClaw最新版本号 C)查Claude Code最新版本号
 三个都完成后合并成一行版本对比表"

记住这些命令

命令 作用 适用场景
/learn <内容> 一句话创建可复用技能 任何重复性流程
/goal <描述> 设定带验证标准的长期任务 需要质量保证的编码任务
/goal wait 把goal放到后台 长任务不想等
/journey 查看Agent的知识成长时间线 检查/管理Agent学会了什么
/model select moa/ 选多模型委员会 需要深度分析的重要决策
delegate_task(fan_out=N) 并行派N个子Agent 多任务同时处理

总结

Hermes v0.18 "The Judgment Release"的核心可以总结为三句话:

  1. /learn 让你的AI团队自己成长——每次使用都在积累可复用的技能
  2. /goal 让你的AI团队自己证明——不再相信"我做好了",只相信通过的测试
  3. 后台并发 让你一个人当十个用——派活之后不用等,回来收结果

对AI创业者来说,这些功能不是锦上添花——它们是从"AI辅助工具"到"AI员工"的关键跨越

217K GitHub Star、370+贡献者、P0/P1清零——这是一个值得你升级的版本。


AI创业 #HermesAgent #Agent工坊 #一人公司 #AI工具

数据来源:Hermes Agent v0.18.0 Release Notes, Hermes Agents Blog