模块9:系统化优化与评估
难度:⭐⭐⭐⭐⭐ 专业进阶 | 建议时长:2-4小时
目标:学会像做产品优化一样优化提示词,而不是靠感觉瞎改。
9.1 提示词优化不是“玄学”
很多人优化提示词时只会说:“我感觉这版更好。” 这不够。真正稳定的做法是:明确评价标准、做版本对比、记录结果。
9.2 先定义“好”的标准
不同任务,“好”的定义不同。常见评估维度包括:
- 准确性:有没有答错
- 完整性:关键点有没有漏
- 结构性:是否易读、易用
- 稳定性:多次运行是否差不多
- 成本:长度、耗时、调用成本
9.3 最简单的 A/B 测试法
版本 A:原始提示词
版本 B:增加示例与格式要求
用同一组测试样本跑两版,
对比输出的准确性、结构性和稳定性。你要对比的是“同样输入下,哪个版本整体表现更好”。
9.4 建立测试集
如果一个提示词你准备长期使用,就应该准备一组代表性样本:
- 典型样本
- 边界样本
- 容易出错样本
这样每次改 prompt 后都能快速回归验证。
9.5 常见优化方向
- 补充背景
- 增加示例
- 收紧输出格式
- 加上“不要做什么”
- 把复杂任务拆成多轮
9.6 优化记录模板
【任务】
【旧版本 Prompt】
【新版本 Prompt】
【测试样本】
【结果对比】
【结论】是否上线替换9.7 不要只看“某一次特别惊艳”
真正值得上线的 prompt,不是某次超神,而是多数情况下都稳。平均表现 比“偶尔惊艳”更重要。
9.8 一个最小评估闭环
1. 先定义任务成功标准
2. 选 5-10 个测试样本
3. 跑旧版 Prompt
4. 跑新版 Prompt
5. 对比准确性、结构性、稳定性
6. 记录结论,决定是否替换
9.9 常见误区
- 只用一个样本测试,然后误以为优化成功
- 把“更长”误当成“更好”
- 只看主观感觉,不记录测试依据
- 优化 prompt 却不改评估标准,导致方向飘忽
9.10 课后练习
建议给你目前最常用的 1 个提示词做一次正式 A/B 测试,哪怕只准备 5 个样本也比“凭感觉”强很多。做这件事时,推荐一边看 速查手册 的框架选择与速修部分,一边参考练习题集的 Level 4 题目。
本章小结
✅ 优化提示词要先定义评价标准
✅ 用 A/B 测试而不是凭感觉
✅ 为高价值任务建立固定测试集
✅ 看平均稳定性,不只看单次高光
✅ Prompt 优化,本质上是一种产品迭代过程