准确性是系统工程
客服 AI 的准确性由数据、检索、生成、兜底四个环节共同决定,任何一环出问题都会体现在回答上。优化不能只盯模型。
先建评测集,量化每个环节的准确率,再逐个击破。
数据环节
知识库要覆盖高频问题、内容要最新、口径要统一。同一个问题在不同文档里有不同答案,是准确率杀手。
数据清理比提示词优化更值得优先投入。
检索与生成环节
检索环节要保证正确答案进入上下文;生成环节要约束模型「只基于资料回答,资料不足就明说」。两个环节各设评测指标。
对高价值问题(价格、政策、退款),可以设置规则校验:回答里必须包含关键数字或条件。
- 检索命中率:标准答案是否进入候选
- 忠实度:回答是否基于召回内容
- 完整性:是否漏答了问题里的每个点
- 合规性:敏感问题的回答是否符合规范
兜底策略
不确定时诚实告知、转人工、提供官方链接,都比编造答案好。
准确率的天花板不是模型,而是你敢不敢让 AI 说「我不知道」。
高价值问题的规则兜底
价格、退款、政策类问题,不要只靠模型生成。先让规则层检查回答里是否包含关键数字、条件和适用场景,缺失就自动转人工或返回标准答案。
规则兜底的成本很低,却能把最敏感问题的出错率压到最低。
如何跟踪回答质量
给每条回答打质量标记:基于资料、部分基于资料、超出资料。标记可以靠模型自动评估加人工抽样校准,重点跟踪「超出资料」的比例。
这个比例突然上升,通常意味着知识库覆盖下降或提示词约束失效,需要立即排查。
质量跟踪不是看一个平均分,而是看错误类型的分布变化。
回答质量的用户反馈
在回答下方提供轻量反馈入口:「有帮助 / 没帮助 / 回答有误」,并允许用户补充说明。反馈数据比纯模型评估更接近真实感受。
「没帮助」的样本要定期人工复核,区分是内容错误、表达不清还是问题本身超出范围。
用户反馈是质量体系的最后一环,没有它,评测就缺少现实校准。