Prompt 工程方法论
0 / 5 节 · 0%
退出
1 节 / 共 5第一章 · 方法 已验证可复现

从直觉试错到方法论

大部分人写 prompt 的方式是:改一改,试一试,感觉好了就上。这节讲怎么脱离这个循环。

可复现前提: 只需要一个表格工具和 20 条真实样本,不需要任何框架。

问题:凭感觉调,会越调越差

我们有过一次真实教训。一个分类 prompt 连续调了两周,每次改完手动试三五条,都"感觉更好了"。两周后接上评测集一跑——准确率比两周前低了 6 个点

原因是每次只看三五条,改动其实是在过拟合那几条。

最小可用的评测集:20 条就够起步

不需要一开始就搞几百条。20 条真实样本 + 一张表格,就能立刻脱离瞎调状态:

# 输入 期望输出 v1 v2 v3
1 ... 分类A
2 ... 分类B
3 ... 分类A

关键是每一版都跑全部 20 条,而不是只跑你正在修的那条。第 3 条那种"修好了 A 却弄坏了 B"的情况,只有跑全量才看得见。

三条工作纪律

  1. 一次只改一个变量。 同时改角色描述和输出格式,结果变好了你也不知道是哪个起的作用。
  2. 保留每一版。 存成 prompt-v1.txtv2.txt,分数记在表里。回退很常见。
  3. 样本来自真实日志。 自己编的样本会系统性地偏简单。

从 20 条到 120 条

跑顺之后再扩,扩的原则是补盲区:把每次失败的真实案例加进去。我们的评测集就是这么从 20 条长到 120 条的,每一条背后都是一次真实的错误。

下一节

有了评测集,下一步是学会写结构化的 prompt。

4.7/ 5
3 位同事评分
这篇实践你能照着复现吗?给它打个分:
每人一次,可随时修改