AI知识库上线后,最常见的误区是用几次演示对话判断效果。演示能说明系统可以回答问题,却不能证明它在不同问题、不同版本和不同数据质量下仍然可靠。

先建立覆盖真实场景的问题集
评估问题不能全部由开发人员随手编写。应该收集真实搜索词、客服问题、业务工单和历史错误案例,并按照简单问题、组合问题、模糊问题和不在知识库中的问题分类。
检索命中率和答案准确率不同
检索命中率表示系统是否找到了相关片段,答案准确率表示最终回答是否正确。检索到了错误片段,可能产生流畅但错误的答案;没有检索到片段,模型也可能凭常识猜测。
- 检索是否包含真正相关的文档;
- 片段是否完整保留上下文;
- 排序第一的结果是否最有用;
- 答案是否只使用了允许的证据。
引用准确率要单独检查
有引用不代表引用正确。评估时要检查引用是否真的支持结论、来源是否属于当前版本、引用位置是否对应具体段落。如果答案说了多个结论,最好让每个重要结论都能追溯到来源。
测试知识库没有答案的情况
优秀的知识库系统不仅要会回答,还要知道什么时候不能回答。当问题超出资料范围、文档已经过期或证据互相冲突时,系统应明确说明不确定性,而不是编造一个看似完整的答案。
人工抽检应该怎么做
人工抽检不需要阅读所有结果,可以按场景、风险和失败类型分层抽样。高风险问题全部检查,普通问题随机抽检,新增文档和新版本上线初期提高抽检比例。
版本对比比单次分数更重要
修改切片规则、Embedding模型、重排模型或提示词后,应使用同一套问题集对比新旧版本。除了总分,还要观察哪些问题变好、哪些问题变差,避免平均分提升却损害关键业务场景。
建立可执行的评估表
- 问题与场景;
- 期望答案或关键事实;
- 相关来源文档;
- 检索结果和最终答案;
- 引用是否完整;
- 错误类型和改进建议。
不要只优化模型
知识库效果不好,原因可能是文档过期、标题不清、切片过大、元数据缺失或权限过滤错误。评估结果要回到数据源和检索链路,不能把所有问题都归因于模型能力。
总结
AI知识库评估应同时看检索、答案、引用和拒答。建立真实问题集,持续做版本对比和人工抽检,才能知道系统是真的更可靠,还是只是回答看起来更流畅。
评论 0