这节给出我们团队统一在用的五段式模板,以及每段的写法要点。
可复现前提: 模板文件在 templates/system-prompt.md,配套的 120 条评测集可验证改动效果。
模板
# 职责
<一句话:这个角色负责什么,产出什么>
# 工作流程
1. <可验证的步骤>
2. <可验证的步骤>
# 判定标准
- <量化的、可判定的规则>
# 输出格式
<直接给结构样例,不要用文字描述>
# 示例
## 正例
输入:<...>
输出:<...>
## 反例
输入:<...>
错误输出:<...>
为什么错:<...>每段的要点
职责段: 写做什么,不写"你很专业"。我们做过对照实验,删掉所有身份形容词后评测分数完全不变。
流程段: 每步都要可验证。"仔细分析用户意图"不可验证,"先判断问题属于 A/B/C 哪一类,输出类别再继续"可验证。
判定标准段: 把所有"好/差""合适/不合适"换成数字或明确条件。
输出格式段: 给样例。文字描述在长会话里会漂移。
示例段: 至少一正一反。反例要说明为什么错——只给"这是错的"效果差很多。
一个实测数据
同一个代码审查任务,自由写法 vs 五段式模板,120 条评测集:
| 版本 | 格式合规率 | 判定准确率 | 平均长度 |
|---|---|---|---|
| 自由写法 | 74% | 0.79 | 变化大 |
| 五段式 | 99% | 0.91 | 稳定 |
格式合规率的提升几乎全部来自"输出格式给样例"这一条。