3 篇实践带有这个标签。
把「感觉变好了」变成 recall@k 和 MRR:标注集怎么建、指标怎么选、回归怎么跑。
端到端成功率之外,还要看轨迹质量:工具选对没、步数是否冗余、失败是否诚实。
为什么「多试几次」不是方法:建立最小评测集,让每次改动都有依据。