已验证实战案例
重排(rerank)实测调优
在混合检索之后加一层重排,top-1 准确率再提 11 个点,代价是 40ms 延迟。
共 23 篇。每一篇都标注了作者、评分与是否被他人验证过可复现。
在混合检索之后加一层重排,top-1 准确率再提 11 个点,代价是 40ms 延迟。
长会话里该保留什么、该压缩什么、该丢什么——三种策略的实测对比。
任务拆解、中间状态、失败重试——把 12 步的流程跑到 90% 成功率。
纯向量检索搜不到精确的错误码和产品名,混合检索把 recall 拉高 9 个点。
工具描述怎么写、参数怎么设计、什么时候该拆成两个工具——五条实测出来的原则。
换代不是重写:哪些能直接搬、哪些必须重调,以及迁移检查清单。
中文技术文档场景下四个嵌入模型的召回与成本对比,含维度与量化的取舍。
固定长度、按句、按结构、按语义四种切法在同一份文档上的召回对比。
同一个输入跑十次结果不一样?三个手段把格式合规率做到 99%。
用三个真实需求判断该上 RAG、该上长上下文,还是干脆该做微调。