2026-05-04:Agent 知识体系闭环——一次完整工作流复盘


基本信息

  • 日期: 2026-05-04
  • 主题: 围绕”AI Agent”主题,从 5 张课程截图出发,搭建一个互相引用、贯穿可读的小型知识子集
  • 关键词: Agent、Harness Engineering、数据飞轮、模型训练、Eval、知识库工程、贯穿性测试

探索背景

最近看一门讲 AI Agent 的课程,截了 5 张幻灯片,想把它们消化成自己的笔记。

但这次的目标不只是”看懂 → 抄进知识库”。我想验证一种工作流:

能不能让 Claude Code 帮我把零散的截图,沉淀为一个”前后呼应、可被检索、不会引用扑空”的小知识体系?

回答是:能,但需要一套规则约束。 这篇日志记录的就是那套规则。


工作流时间线

Day 1(5/01)
  ├─ 输入:图 1 + 图 2(Agent 发展轨迹 + 套娃关系)
  ├─ 产出:Agent发展轨迹四阶段.md(§1-§9)
  └─ 学到:四阶段不是替代而是包裹

Day 1(同日)
  ├─ 输入:图 3(Agent 五层架构)
  └─ 复用:发现已有 Harness工程与Agent解剖.md § 4 已覆盖
           → 没有重复落盘,只在 README 加可搜性关键词

Day 1(同日)
  ├─ 输入:图 4(Agent 架构师 = 啥)
  ├─ 评价:6.5/10(造词警告 + 漏掉反馈层)
  └─ 产出:在 Agent发展轨迹四阶段.md 追加 § 10 职业视角

Day 2(5/02)
  ├─ 提问:"状态机 / 数据飞轮 是什么"
  └─ 产出:在 § 10.7 加术语速查(含 ASCII 图)

Day 4(5/04)
  ├─ 提问:"数据飞轮和蒸馏有关系吗"
  ├─ 产出:00_核心概念/模型训练技术速查.md(487 行)
  ├─ 贯穿性测试:发现 3 处问题(虚标引用 / 顺序矛盾 / 概念归属)
  └─ 修复:3 处全部回填

Day 4(同日)
  ├─ 任务:补全 DeepSeek.md 的训练层
  ├─ 产出:DeepSeek.md 从 270 行 → 440 行
  │       新增 GRPO / R1 多阶段 / R1-Distill 三章
  └─ 反向回填:之前"训练层待补全"的引用全部改成正向引用

Day 4(同日)
  ├─ 任务:开始写 Eval 测评体系
  ├─ 产出:06_Agent工程/Eval测评体系.md(499 行)
  └─ 反向回填:§ 10.4 "Eval 体系搭建" 加锚链接

Day 4(同日,本文)
  └─ 元认知沉淀:把整套工作流抽成方法论

产出清单

#文件类型规模
106_Agent工程/Agent发展轨迹四阶段.md新增~600 行(含 § 10 职业视角 + § 10.7 术语速查)
200_核心概念/模型训练技术速查.md新增487 行
301_模型架构/DeepSeek.md补全270 → 440 行(+170 行训练层)
406_Agent工程/Eval测评体系.md新增499 行
504_探索日志/2026-05-04_Agent知识体系闭环.md新增(本文)元认知沉淀
6README.md多次同步索引保持”索引 = 实际”

总计落盘内容 ≈ 2200 行 Markdown


方法论提炼(最核心的部分)

这是这次工作流里真正值得复用的几条规则。下次做类似事情可以直接照搬。

法则 1:先看已有再写新的(避免重复落盘)

每次想动笔前,先 grep 一遍现有文档

  • 图 3”五层架构图”差点被独立落盘
  • 检查后发现 Harness工程与Agent解剖.md § 4 已经覆盖
  • 结论:只在 README 加关键词,不重复

✅ 收益:避免知识库变成”互不相识的同义文集”。

法则 2:术语速查内嵌而非单建

小术语(如”状态机”、“数据飞轮”)不要单建文档,作为”内嵌速查节”挂在所属主文档

  • “状态机 + 数据飞轮”作为 § 10.7 速查节,挂在 Agent 发展轨迹四阶段下
  • 用锚点链接从主表格直接跳转
  • 结论:知识库不会膨胀成几十篇微小术语文档

✅ 收益:浏览体验流畅,搜索一次定位。

法则 3:发现空洞 → 标记 → 后续填实

临时不能补全的引用,先用”待补全”标记,而不是虚标内容

  • 写《模型训练技术速查》时,引用 DeepSeek.md 涉及 RFT/蒸馏,但实际没覆盖
  • 错误做法:硬编上”用了 RFT、蒸馏、MoE”(虚标,会扑空)
  • 正确做法:写”该笔记侧重架构层,训练层可与本文交叉补全”
  • 后续补全 DeepSeek.md 后,再回头把”待补全”改成正向引用

✅ 收益:知识库永远不会有”骗人的链接”。

法则 4:贯穿性测试是必须的最后一步

写完任何文档,都要做一次”小白通读”模拟

1. 验证所有跨文档目标文件存在
2. 验证所有锚点能命中(GitHub 锚点规则:去标点 + 转小写 + 空格变 -)
3. 抽查与已有文档的概念归属是否一致
4. 检查内部章节顺序是否前后矛盾
5. 评估对小白的可读性

这次测试发现并修复了 3 处一致性瑕疵:

  • DeepSeek.md 引用虚标
  • 比喻表与流水线顺序相反
  • Constitutional AI 在 § 3.5 和 § 7.4 归属冲突

✅ 收益:上线即终态,不会留”半夜想起还要去补”的遗憾。

法则 5:双向引用,不要单向链接

两篇文档互相引用时,A → B 和 B → A 都要建

  • 数据飞轮 → 训练技术(§ 10 数据飞轮关系)
  • 训练技术 → 数据飞轮(§ 11 关联章节)
  • DeepSeek 训练层 → 训练速查(4 处反向引用)
  • 训练速查 → DeepSeek(§ 11 正向引用)

✅ 收益:从任意一篇都能游进整个网络。

法则 6:README 索引 = 知识库的”主页”

每次落盘 / 大改后立刻同步 README

  • 简介里加可搜关键词(如”五层架构图(编排层 / 记忆层 / 大模型 / 执行层 / 反馈层)”)
  • 加粗重要术语(让目录扫一眼能定位)
  • README 是”未来的自己”找东西的入口

✅ 收益:6 个月后回来看,仍能秒定位。

法则 7:分块落盘 + 持续汇报

每完成一块就汇报一次,不要”憋一个大版本”

  • 写 Eval 文档时:先汇报章节规划 → 落盘 → 同步 README → 反向回填 → 贯穿测试 → 最终汇报
  • 每一步都有可见输出
  • 用户能随时打断、改方向

✅ 收益:避免长时间静默 / 卡死,避免方向跑偏。

法则 8:评价不是简单接受,要带锐度

看到课程 PPT / 流行图,先评分再吸收

  • 图 4 “Agent 架构师”:6.5/10,指出造词 + 漏反馈层
  • 图 1 / 图 2:质量高,直接吸收
  • 图 5 “五层架构”:和现有内容重复,标记不收录

✅ 收益:知识库不被”高大上的口号”污染。


知识库结构变化(前后对比)

之前(5/01 之前)

06_Agent工程/
└── Harness工程与Agent解剖.md     ← 唯一一篇

00_核心概念/
├── Transformer.md
├── 注意力机制.md
└── 上下文窗口与Token计费.md

01_模型架构/
└── DeepSeek.md (架构层 only)

之后(5/04)

06_Agent工程/                    ← 三篇成铁三角
├── Harness工程与Agent解剖.md     (结构剖面 / 五层架构)
├── Agent发展轨迹四阶段.md  🆕    (史观 / 职业视角 / 术语)
└── Eval测评体系.md  🆕           (质量保障 / 落地路径)

00_核心概念/
├── Transformer.md
├── 注意力机制.md
├── 上下文窗口与Token计费.md
└── 模型训练技术速查.md  🆕       (训练侧全景)

01_模型架构/
└── DeepSeek.md ✨               (架构 + 训练完整)

关系网

        Eval测评体系
       (反馈 / 质量)
          ↑    ↓
  Agent发展轨迹  ←——→  Harness工程与Agent解剖
   (史观 / 飞轮)        (结构 / 五层)
          ↓
   模型训练技术速查
   (SFT / RLHF / 蒸馏)
          ↓
      DeepSeek
   (架构 + 训练实战)
          ↓
      Transformer / 注意力机制
        (底层引擎)

每个箭头都是真实存在的跨文档引用,且锚点都已验证。


几个值得复盘的关键决策

决策 1:图 3 不单独落盘

情境:用户给了”Agent 五层架构图”。 冲动选择:建一篇《AI Agent 五层架构详解》。 实际选择:检查发现已有覆盖 → 只加 README 关键词。 复盘:✅ 正确。重复落盘是知识库腐烂的开始。

决策 2:术语速查内嵌而非单建

情境:“数据飞轮 / 状态机”两个术语。 冲动选择:建《Agent 工程术语速查》。 实际选择:作为 § 10.7 内嵌进 Agent发展轨迹四阶段。 复盘:✅ 正确。术语量还不够多,单建会显得空洞。等积累到 30+ 术语再单建。

决策 3:模型训练技术单建到 00_核心概念

情境:用户问”数据飞轮和蒸馏的关系”。 冲动选择:在数据飞轮节继续追加。 实际选择:单建《模型训练技术速查》到 00_核心概念。 复盘:✅ 正确。蒸馏不只是飞轮的工具,是大模型训练的通用技术,归属”核心概念”更合适。

决策 4:DeepSeek 不再开新文件,而是补全旧的

情境:要补 DeepSeek 的训练层。 冲动选择:建《DeepSeek-R1 训练揭秘》。 实际选择:在原有 DeepSeek.md 加创新三/四/五。 复盘:✅ 正确。同一个模型主题应该聚合在一个文件,避免”DeepSeek-V3”、“DeepSeek-R1”、“DeepSeek-Math”碎片化。


我的理解(元认知层面)

知识库不是”文档的集合”,而是”概念的网络”

判断知识库质量的不是”有多少篇文档”,而是”任意两篇之间能不能通过链接走到”

这次工作让我深刻意识到:单独看每篇文档质量都还行,但如果互相不引用,整个库就是”一堆同义信息的搬运”,价值很低。

铁三角(Harness / 发展轨迹 / Eval)和双层关联(飞轮 ↔ 训练技术 ↔ DeepSeek 实战)这次建起来,知识库才真正”活”了。

Claude Code 在知识库工作上的边界

它擅长

  • 模板化生成(章节骨架、对比表、ASCII 图)
  • 一致性检查(锚点、链接、术语归属)
  • 反向引用回填(不会忘记”我之前在哪里说过待补全”)
  • 风格保持(多文档语气统一)

它不擅长(要人来兜):

  • 价值判断(哪张图值得吸收、哪张该批评)
  • 决策方向(单建 vs 内嵌)
  • 真实经验注入(“这个 PPT 是培训课造词”这种行业洞察)

理想分工:人定方向 + 做评价;Claude 做执行 + 做一致性维护。

时间复利感受

这一次的 2200 行内容,拆开看是 4 篇文档。但未来的我重新打开任意一篇时,能 5 分钟内重建整张关系图——这是普通笔记做不到的。

笔记的价值不在写完那一刻,而在未来回看时还能不能用


疑问与待探索

  • 知识库工程化的下一步:能不能让 CI 自动跑”贯穿性测试”?(检查每次 commit 的链接、锚点)
  • Eval 体系自身的 Eval:怎么知道我建的 eval set 是好 eval set?
  • R1 之后的推理模型演进:o3、Qwen-QwQ、Kimi K1.5 有什么新东西
  • 我自己什么时候真正动手做一个 Agent?理论已够,缺实战
  • 是否要建一个”已批评”清单(培训课 PPT 评分 + 红榜/黑榜)

下次继续的可选方向

用法:下次想继续推进时,直接看这一节,挑一个方向开干。

方向 A:用方法论 8 条作为”消化新素材”的 SOP ✅ 已实现

状态更新(2026-05-05):本方向已落地为 Claude Code Skill: .claude/skills/knowledge-base-curator/SKILL.md

下次提到”整理截图 / 沉淀 PPT / 消化课程笔记”等关键词时,Claude 会自动激活本 Skill 并按 8 法则执行。无需手动提醒。

触发场景:以后再看到新 AI 课程截图、论文、公众号文章,想把它沉淀进知识库。

怎么用:不要从零摸索流程,把 § 方法论提炼 的 8 条当成 checklist 走一遍:

【SOP:消化新素材进知识库】
□ 法则 1:先 grep 已有,看现有文档是否已覆盖(避免重复)
□ 法则 2:小术语内嵌速查节,不单建(避免文档膨胀)
□ 法则 3:暂时补不全的引用 → 标记"待补全",不要虚标
□ 法则 4:写完跑贯穿性测试(链接、锚点、概念归属)
□ 法则 5:双向引用,不要单向链接
□ 法则 6:同步 README,加可搜关键词
□ 法则 7:分块落盘 + 持续汇报,不憋大版本
□ 法则 8:先评分再吸收,不照单全收口号化 PPT

💡 SOP = Standard Operating Procedure,标准操作流程,即”操作清单”。

优势:流程已被验证(这次工作就是按这套法则走出来的),照做即可,省脑力。


方向 B:动手实战——搭一个最小 Agent Demo

触发场景:理论已经够多了,想验证一下”看懂了”和”会做”是两回事。

目标:做一个最小可运行 Agent,把这次学到的概念全用一遍。

最小可行 Demo 建议

组件用什么对应到本库哪一节
模型Claude Haiku(便宜)模型训练技术速查 § 5(蒸馏的产物)
ReAct 循环自己写 30 行 PythonAgent 发展轨迹四阶段 § 2
工具1 个 Web 搜索 + 1 个文件读写Harness 解剖 § 4 执行层
状态机简单的 enum 状态枚举发展轨迹 § 10.7.1
EvalPromptfoo + 10 题 eval setEval 测评体系 § 9.1

产出建议:在 03_应用实践/ 下新建子目录 03_应用实践/最小Agent实战/,含 README.md + agent.py + eval.yaml

预期收获

  • 验证”概念懂 ≠ 会做”
  • 理解状态机为啥重要(Agent 第一次卡死你就懂了)
  • 第一次跑通 Eval 的成就感

方向 C:体系化补充更深的 ML 细节

触发场景:想从”知道是什么”到”知道为什么”。

候选主题(按优先级):

主题为什么补归属
PPO 算法详解RLHF 章节只说了”贵难训”,没讲为啥00_核心概念/
MoE 路由与负载均衡DeepSeek.md 只讲了原理,没讲工程实现01_模型架构/
位置编码(RoPE / ALiBi)已在待探索清单里00_核心概念/
Layer Normalization / RMSNorm已在待探索清单里00_核心概念/
GRPO 完整数学推导DeepSeek.md 只给了直觉,没给公式01_模型架构/ DeepSeek.md 加节

推荐起点PPO 算法详解——它是理解 RLHF / GRPO 的钥匙,补完后整个”模型训练技术速查”会从”概念清单”升级为”原理理解”。


方向 D:知识库工程化——给知识库做 CI

触发场景:知识库越来越大,担心未来引用扑空、锚点失效,想让”贯穿性测试”自动化。

目标:把这次手动跑的”贯穿性测试”变成自动脚本。

最小可行方案

# scripts/check_links.py
# 1. 扫描所有 .md 文件
# 2. 提取所有 [text](path#anchor) 形式的链接
# 3. 验证目标文件存在
# 4. 验证锚点(按 GitHub Anchor 规则计算)能命中目标章节
# 5. 输出失败列表

进阶

  • 加 git pre-commit hook,每次 commit 前自动跑
  • 把”待探索”复选框统计出来,README 自动更新进度
  • 给每篇文档生成一个”被引用次数”指标(识别孤岛文档)

为什么值得做:随着知识库扩到 30+ 篇,手动维护成本会指数级上升。早建工具,越早受益


方向 E:建立”评分清单”——AI 课程 / PPT 红黑榜

触发场景:每次看课程/PPT 时已经在心里评分,但没沉淀下来

目标:建一个 05_技术基础/ 或新建 07_素材评测/ 目录,记录看过的课程、PPT、公众号文章的红黑榜。

字段建议

字段例子
来源某某 AI 训练营 PPT 第 X 节
主题”Agent 架构师定义”
评分6.5/10
优点控制面/执行面/状态层借云原生术语
缺点漏掉反馈层、“博弈”用词炫技
是否吸收吸收部分(已沉淀进 § 10.4)

为什么有价值

  • 避免被同一类内容重复带偏
  • 形成自己的”内容鉴赏力”——以后一看就知道哪些 PPT 是真东西、哪些是营销
  • 外溢价值:可以做成内容供其他学习者参考

选哪个方向的判断指引

想动手做点什么实物    → B(最小 Agent Demo)
想理论补到底层        → C(PPO / MoE / RoPE 等)
想让知识库自动化      → D(CI 工具)
想训练自己内容鉴赏力  → E(红黑榜)
看到新课程/论文要消化 → A(按 SOP 走)

相关链接

这次工作流产出的所有文档

已有相关文档(被本次工作引用)

配套规则

  • 项目根 CLAUDE.md — 关于双层结构与决策树
  • ~/.claude/CLAUDE.md(用户级全局规范) — 关于”不卡死”、“先落盘后扩展”等流程规范

更新记录

日期更新内容
2026-05-04初次创建,沉淀 Agent 知识体系搭建工作流