Claude Code /goal 命令

一句话:设定可衡量的完成条件,Claude 跨多轮自动跑活直到达成,由独立 Haiku 评估器每轮判断目标是否满足。Anthropic 2026-05-12 在 Claude Code v2.1.139 引入。OpenAI Codex 几乎同期推出对应命令。


目录


1. /goal 是什么

Claude Code 内置的长任务自动执行斜杠命令。你给一个”完成条件”,Claude 不再做完一轮就停,而是反复迭代直到条件满足

类比:以前的 Claude 是给老板”做完一件事汇报一次”,老板得反复说”继续 / 再改”。/goal 让老板直接给 KPI:达成才下班。

跟 Claude Code 之前的 5 大扩展机制(Skill / MCP / CLI / SubAgent / Hook)不是同一层东西:那 5 个是给 Claude 装能力/goal改变 Claude 的工作节奏——从”一问一答”变”目标驱动循环”。


2. 它解决什么问题

老流程的痛点

你说:"修复所有测试"
   ↓
Claude 改一些 → 跑测试 → 还有错 → 停下汇报
   ↓
你说:"继续"
   ↓
Claude 改一些 → ... → 停下汇报
   ↓
你说:"继续"(第 N 次)

人需要反复督促。本质上是:Claude 没有”目标达成”的判断能力,所以默认做完一轮就停,等下一句指令。

/goal 之后

你说:/goal 所有测试通过 + 覆盖率 ≥ 80%
   ↓
Claude 改 → 跑测试 → 还有错 → 自己接着改
   ↓
... 循环 ...
   ↓
评估器:达成了 → 停下,告诉你"任务完成"

人只在起点终点介入,中间循环全自动。


3. 内部机制:独立评估器循环

这是 /goal 最关键也最值得借鉴的设计——评估器是另一个独立模型,不是主 Claude 自评

流程图

你说 /goal <完成条件>
       ↓
┌──────────────────────────────────┐
│  主 Claude(Opus / Sonnet)      │
│  根据当前状态干一轮活             │
└──────────────────────────────────┘
       ↓
┌──────────────────────────────────┐
│  评估器(Haiku,独立调用)        │
│  判断:完成条件达成了吗?         │
└──────────────────────────────────┘
       ↓
   ┌───┴───┐
  达成?    没达成
   │        │
  停止     回到主 Claude 再干一轮
   │
告诉你"任务完成"

为什么用 Haiku 当评估器

  • 便宜:每轮都要评估,Haiku 比 Opus 便宜一个数量级
  • 够用:判断”条件达成与否”是简单二元判断,不需要主模型那种深度推理
  • 独立:跟主模型分开调用,避免”自己评自己”的偏差——这是这个设计最核心的洞察

为什么”独立评估”很重要

人和 LLM 都有”自评偏差”——评估自己刚做的事时会偏宽容(看 LLM 典型失败模式 § 自我汇报偏差)。

行业共识原话:

“the executor must never judge its own integrity — meaning the judge should ideally be a separate model/agent invocation rather than the same session self-assessing”

翻译:“做事的人永远不该评估自己——裁判应该是另一个模型或 agent 调用,而不是同一个会话自评。”

/goal 是这条原则在工具层面的官方落地。


4. 用法与实战例子

4.1 命令格式

/goal <完成条件描述>

完成条件最多 4000 字符。任务结束后会自动清除。

4.2 实战例子

例 1:测试驱动开发

/goal 让 tests/auth/ 下所有测试通过,pytest 退出码为 0

Claude 会自己改代码 → 跑测试 → 看哪些没过 → 再改,循环到全过。

例 2:批量 lint 修复

/goal 修复 src/**/*.ts 里所有 ESLint 错误,最多 20 轮停止

最多 20 轮 是显式 turn 上限——防死循环兜底。

例 3:知识库批量整理(结合本库特色)

/goal 跑 bidirectional-link-check skill 检查全库引用,
修复所有断链 + 补齐缺失的反向引用,最终该 skill 输出 0 错

这种以前要反复督促”继续修”的活,/goal 一句话搞定。

例 4:跨文件迁移

/goal 把 src/ 下所有 callback 风格的函数改成 async/await,
不破坏现有测试

5. 限制与最佳实践

硬限制

数值
最低版本Claude Code v2.1.139(你的 v2.1.150 支持)
完成条件最大长度4000 字符
订阅要求Pro / Max / Team / Enterprise / Cloud API
同时进行的 goal 数1 个/会话
跨会话恢复支持(--resume / --continue

成本警示

每轮都会跑一次 Haiku 评估 + 主模型继续干活。长任务可能:

  • 跑十几轮甚至几十轮
  • 累计 token 消耗大
  • 早期用户报告:一天可烧几十美元

务必加 turn 上限(“最多 N 轮停止”)。

完成条件设计原则

条件必须可衡量——评估器是 LLM 而非编译器,但越接近”机器可判定”,准确率越高。

反例(模糊)正例(可衡量)
让代码更好pytest 退出码 0 + 覆盖率 ≥ 80%
修复 bugissue #123 描述的复现路径不再触发报错
整理知识库README 索引与实际文件 100% 一致 + 无断链
性能优化API p95 延迟从 800ms 降到 ≤ 200ms

不适合的场景

  • 简单一次性任务(写个函数、问个概念)→ 直接用,别 /goal,开销大
  • 目标模糊的探索(“研究下这个库”)→ /goal 评估器没法判断
  • 需要人类审美判断(“页面好看一点”)→ Haiku 评不准

适合的场景

  • 测试套件变绿
  • 批量代码重构(明确的 before/after 规则)
  • 文档/数据清洗(“全部满足 X 规范”)
  • 长循环修复任务(一直跑直到错误清零)

6. Claude Code /goal vs OpenAI Codex /goal

两家在 2026 年春几乎同时推出 /goal

维度Claude Code /goalOpenAI Codex /goal
发布时间2026-05-12(v2.1.139)2026 年 4 月底(先发)
评估器Haiku 4.5未公开
跨会话恢复--resume / --continue支持
移动端Claude Code Mobile 已集成已集成
UX几乎一致几乎一致
内部实现不同不同

行业现象:CLI agent 工具开始互相借鉴特性。Codex 先有 /goal,Anthropic 跟进;之前 MCP 是 Anthropic 提出、OpenAI/Google 跟进。多家工具相互”参考”已经是常态——选 CLI 时更关心生态厚度而非”独家功能”。

详见:多CLI联动


7. 与本知识库其他章节的关联

主题文档关系
Claude Code 实战速查Claude Code 实战速查.md/goal 是本库 Claude Code 命令集的最新补充;该笔记的”高频命令一览”应加入此条
Claude Code 扩展生态Claude Code 扩展生态.md扩展生态讲 Skill/MCP/CLI/SubAgent/Hook 五大机制;/goal 是这些之外的长任务原语,跟扩展机制是不同层
LLM 典型失败模式LLM典型失败模式.md/goal 的”独立评估器”设计是对自我汇报偏差的工程化防御
Eval 测评体系Eval测评体系.md/goal 的 Haiku 评估器本质是 LLM-as-Judge 在生产环境的落地——同样的模式在 Eval 测评里讨论过
Harness 工程Harness工程与Agent解剖.md/goal 是 Harness 在”长任务自治”维度的新机制——给 Agent 加了”目标驱动循环”的控制流
多 CLI 联动多CLI联动.mdCodex 先有 /goal、Anthropic 跟进——是多 CLI 时代功能互鉴的典型案例

附:来源与时间线

  • 2026 年 4 月底:OpenAI 在 Codex CLI 引入 /goal(5 个 PR 落地)
  • 2026-05-12:Anthropic 在 Claude Code v2.1.139 引入 /goal
  • 2026-05-26:本笔记落地

主要来源

  • Claude Code Release Notes(v2.1.139)
  • Anthropic 官方文档
  • 社区评测博客(explainx.ai / amitray.com / smolkin.org / geeky-gadgets.com)
  • 2026-05-26 与 Claude 会话中的搜索整合