半年里我们评估了 14 个 AI 工具,最后留下 4 个。这篇是那张评估表,以及每一项背后被坑的经历。
可复现前提: 这是一份决策清单,不是代码。表格模板见 templates/tool-eval.md,照着填一遍约 30 分钟。
八个问题
1. 数据出不出内网?
第一个问题,也是最容易一票否决的。我们的规矩:涉及客户数据的场景,只考虑能私有部署或有明确数据处理协议的工具。
2. 断网还能不能干活?
有个工具我们用了一个月,某次上游服务抖动,整个组的构建流程全卡住。任何进入关键路径的工具,必须有降级方案。
3. 输出能不能被验证?
如果它的输出只能靠人肉眼判断对错,那它就没法进自动化流程。能不能写断言,是能不能规模化的分水岭。
4. 学习成本多久回本?
我们的经验阈值:如果一个工具需要超过半天的学习才能上手,那它必须能每周省下至少 2 小时,否则不划算。
5. 出问题时能不能查?
有没有日志、能不能重放、失败原因是否可读。一个黑盒工具在出事时会让排查时间翻倍。
6. 退出成本多高?
数据能不能导出、配置是不是标准格式、有没有厂商锁定。我们吃过一次亏:某工具的配置是私有格式,迁移时 200 多条规则全靠手抄。
7. 谁来维护?
每个引入的工具都要有明确的负责人。没有 owner 的工具三个月后必然荒废,还留下一堆没人敢动的配置。
8. 能不能小范围试?
能不能先在一个项目、一个人身上试两周。不能小范围试的工具,风险要额外打折。
评分表
每项 0–2 分,满分 16。我们的线是:
| 总分 | 结论 |
|---|---|
| ≥ 13 | 直接小范围试点 |
| 9–12 | 记录下来,等需求更明确再看 |
| < 9 | 明确拒绝,并写清原因存档 |
"写清原因存档"这一条容易被忽略但很重要——半年内同一个工具被不同的人提了三次,有存档就不用重新讨论一遍。
实际数据
14 个工具的评分分布:≥13 分的 4 个(全部试点,3 个留用),9–12 分的 6 个,<9 分的 4 个。
留用率 75% 说明这张表的门槛设得基本合适。之前没有这张表时,我们试点过的工具留用率大概只有三成。
评论与复现反馈 1
这条我们非研发侧也适用。上次某个翻译工具挂了,整个交付流程停了半天,之后就加了人工兜底。