Claude Code /goal 命令
一句话:设定可衡量的完成条件,Claude 跨多轮自动跑活直到达成,由独立 Haiku 评估器每轮判断目标是否满足。Anthropic 2026-05-12 在 Claude Code v2.1.139 引入。OpenAI Codex 几乎同期推出对应命令。
目录
- 1.
/goal是什么 - 2. 它解决什么问题
- 3. 内部机制:独立评估器循环
- 4. 用法与实战例子
- 5. 限制与最佳实践
- 6. Claude Code
/goalvs OpenAI Codex/goal - 7. 与本知识库其他章节的关联
- 附:来源与时间线
1. /goal 是什么
Claude Code 内置的长任务自动执行斜杠命令。你给一个”完成条件”,Claude 不再做完一轮就停,而是反复迭代直到条件满足。
类比:以前的 Claude 是给老板”做完一件事汇报一次”,老板得反复说”继续 / 再改”。
/goal让老板直接给 KPI:达成才下班。
跟 Claude Code 之前的 5 大扩展机制(Skill / MCP / CLI / SubAgent / Hook)不是同一层东西:那 5 个是给 Claude 装能力,/goal 是改变 Claude 的工作节奏——从”一问一答”变”目标驱动循环”。
2. 它解决什么问题
老流程的痛点
你说:"修复所有测试"
↓
Claude 改一些 → 跑测试 → 还有错 → 停下汇报
↓
你说:"继续"
↓
Claude 改一些 → ... → 停下汇报
↓
你说:"继续"(第 N 次)
人需要反复督促。本质上是:Claude 没有”目标达成”的判断能力,所以默认做完一轮就停,等下一句指令。
/goal 之后
你说:/goal 所有测试通过 + 覆盖率 ≥ 80%
↓
Claude 改 → 跑测试 → 还有错 → 自己接着改
↓
... 循环 ...
↓
评估器:达成了 → 停下,告诉你"任务完成"
人只在起点和终点介入,中间循环全自动。
3. 内部机制:独立评估器循环
这是 /goal 最关键也最值得借鉴的设计——评估器是另一个独立模型,不是主 Claude 自评。
流程图
你说 /goal <完成条件>
↓
┌──────────────────────────────────┐
│ 主 Claude(Opus / Sonnet) │
│ 根据当前状态干一轮活 │
└──────────────────────────────────┘
↓
┌──────────────────────────────────┐
│ 评估器(Haiku,独立调用) │
│ 判断:完成条件达成了吗? │
└──────────────────────────────────┘
↓
┌───┴───┐
达成? 没达成
│ │
停止 回到主 Claude 再干一轮
│
告诉你"任务完成"
为什么用 Haiku 当评估器
- 便宜:每轮都要评估,Haiku 比 Opus 便宜一个数量级
- 够用:判断”条件达成与否”是简单二元判断,不需要主模型那种深度推理
- 独立:跟主模型分开调用,避免”自己评自己”的偏差——这是这个设计最核心的洞察
为什么”独立评估”很重要
人和 LLM 都有”自评偏差”——评估自己刚做的事时会偏宽容(看 LLM 典型失败模式 § 自我汇报偏差)。
行业共识原话:
“the executor must never judge its own integrity — meaning the judge should ideally be a separate model/agent invocation rather than the same session self-assessing”
翻译:“做事的人永远不该评估自己——裁判应该是另一个模型或 agent 调用,而不是同一个会话自评。”
/goal 是这条原则在工具层面的官方落地。
4. 用法与实战例子
4.1 命令格式
/goal <完成条件描述>
完成条件最多 4000 字符。任务结束后会自动清除。
4.2 实战例子
例 1:测试驱动开发
/goal 让 tests/auth/ 下所有测试通过,pytest 退出码为 0
Claude 会自己改代码 → 跑测试 → 看哪些没过 → 再改,循环到全过。
例 2:批量 lint 修复
/goal 修复 src/**/*.ts 里所有 ESLint 错误,最多 20 轮停止
最多 20 轮 是显式 turn 上限——防死循环兜底。
例 3:知识库批量整理(结合本库特色)
/goal 跑 bidirectional-link-check skill 检查全库引用,
修复所有断链 + 补齐缺失的反向引用,最终该 skill 输出 0 错
这种以前要反复督促”继续修”的活,/goal 一句话搞定。
例 4:跨文件迁移
/goal 把 src/ 下所有 callback 风格的函数改成 async/await,
不破坏现有测试
5. 限制与最佳实践
硬限制
| 项 | 数值 |
|---|---|
| 最低版本 | Claude Code v2.1.139(你的 v2.1.150 支持) |
| 完成条件最大长度 | 4000 字符 |
| 订阅要求 | Pro / Max / Team / Enterprise / Cloud API |
| 同时进行的 goal 数 | 1 个/会话 |
| 跨会话恢复 | 支持(--resume / --continue) |
成本警示
每轮都会跑一次 Haiku 评估 + 主模型继续干活。长任务可能:
- 跑十几轮甚至几十轮
- 累计 token 消耗大
- 早期用户报告:一天可烧几十美元
→ 务必加 turn 上限(“最多 N 轮停止”)。
完成条件设计原则
条件必须可衡量——评估器是 LLM 而非编译器,但越接近”机器可判定”,准确率越高。
| 反例(模糊) | 正例(可衡量) |
|---|---|
| 让代码更好 | pytest 退出码 0 + 覆盖率 ≥ 80% |
| 修复 bug | issue #123 描述的复现路径不再触发报错 |
| 整理知识库 | README 索引与实际文件 100% 一致 + 无断链 |
| 性能优化 | API p95 延迟从 800ms 降到 ≤ 200ms |
不适合的场景
- 简单一次性任务(写个函数、问个概念)→ 直接用,别
/goal,开销大 - 目标模糊的探索(“研究下这个库”)→
/goal评估器没法判断 - 需要人类审美判断(“页面好看一点”)→ Haiku 评不准
适合的场景
- 测试套件变绿
- 批量代码重构(明确的 before/after 规则)
- 文档/数据清洗(“全部满足 X 规范”)
- 长循环修复任务(一直跑直到错误清零)
6. Claude Code /goal vs OpenAI Codex /goal
两家在 2026 年春几乎同时推出 /goal:
| 维度 | Claude Code /goal | OpenAI Codex /goal |
|---|---|---|
| 发布时间 | 2026-05-12(v2.1.139) | 2026 年 4 月底(先发) |
| 评估器 | Haiku 4.5 | 未公开 |
| 跨会话恢复 | --resume / --continue | 支持 |
| 移动端 | Claude Code Mobile 已集成 | 已集成 |
| UX | 几乎一致 | 几乎一致 |
| 内部实现 | 不同 | 不同 |
行业现象:CLI agent 工具开始互相借鉴特性。Codex 先有
/goal,Anthropic 跟进;之前 MCP 是 Anthropic 提出、OpenAI/Google 跟进。多家工具相互”参考”已经是常态——选 CLI 时更关心生态厚度而非”独家功能”。
详见:多CLI联动。
7. 与本知识库其他章节的关联
| 主题 | 文档 | 关系 |
|---|---|---|
| Claude Code 实战速查 | Claude Code 实战速查.md | /goal 是本库 Claude Code 命令集的最新补充;该笔记的”高频命令一览”应加入此条 |
| Claude Code 扩展生态 | Claude Code 扩展生态.md | 扩展生态讲 Skill/MCP/CLI/SubAgent/Hook 五大机制;/goal 是这些之外的长任务原语,跟扩展机制是不同层 |
| LLM 典型失败模式 | LLM典型失败模式.md | /goal 的”独立评估器”设计是对自我汇报偏差的工程化防御 |
| Eval 测评体系 | Eval测评体系.md | /goal 的 Haiku 评估器本质是 LLM-as-Judge 在生产环境的落地——同样的模式在 Eval 测评里讨论过 |
| Harness 工程 | Harness工程与Agent解剖.md | /goal 是 Harness 在”长任务自治”维度的新机制——给 Agent 加了”目标驱动循环”的控制流 |
| 多 CLI 联动 | 多CLI联动.md | Codex 先有 /goal、Anthropic 跟进——是多 CLI 时代功能互鉴的典型案例 |
附:来源与时间线
- 2026 年 4 月底:OpenAI 在 Codex CLI 引入
/goal(5 个 PR 落地) - 2026-05-12:Anthropic 在 Claude Code v2.1.139 引入
/goal - 2026-05-26:本笔记落地
主要来源:
- Claude Code Release Notes(v2.1.139)
- Anthropic 官方文档
- 社区评测博客(explainx.ai / amitray.com / smolkin.org / geeky-gadgets.com)
- 2026-05-26 与 Claude 会话中的搜索整合