先建评测集,再谈上线
AI 应用和传统应用最大的区别是:没有编译错误,也不代表正确。模型可能语法完美但内容全错,所以必须用评测集定义「什么是好」。
评测集的第一批样本应该来自真实用户输入,而不是团队想象的问题。
三层评测体系
第一层是自动评测:用规则和模型打分检查事实性、格式、相关性。第二层是人工抽检:每周抽 20-50 条真实会话,由熟悉业务的人标注。第三层是线上监控:跟踪完成率、重试率、转人工率和投诉。
三层缺一不可:自动评测快速,人工抽检准确,线上监控反映真实。
- 自动评测:格式校验、关键词命中、模型打分
- 人工抽检:业务专家每周标注真实样本
- 线上监控:完成率、重试率、放弃率、投诉率
评测维度要具体
「回答好不好」无法评测,要拆成可判断的维度:是否基于给定资料、是否完整回答、是否包含幻觉、语气是否合适、格式是否正确。
每个维度独立打分,才能定位问题出在检索、提示词还是模型。
让评测成为发布流程的一部分
每次模型升级、知识库更新、提示词改动,都先跑一遍评测集,分数不降再发布。
没有评测的 AI 项目,每次改动都是一次赌博。
评测集从哪里来
第一批样本来自三个地方:历史真实会话、客户反馈的典型案例、运营手动整理的边界问题。数量不是关键,覆盖真实分布才是关键。
每周把线上新出现的问题补充进评测集,让它跟随产品一起成长,而不是一次性建完就停。
人工抽检怎么做
每周固定抽 20-50 条真实会话,由熟悉业务的人按四个维度打分:信息是否准确、是否完整、语气是否合适、格式是否合规。
抽检不是挑错,而是发现模式:如果连续几周「不完整」占比最高,说明问题在上下文或检索,不在模型。
抽检结果写成一页摘要发给团队,让每个人都知道质量在变好还是变差,以及下一步改哪里。
抽检与评测的关系
离线评测集是「固定的体检表」,人工抽检是「随机的现场检查」。两者样本来源不同:评测集偏稳定回归,抽检偏真实分布。
当抽检发现的问题在评测集里没有覆盖时,就把它补充进评测集;当评测集分数下降但抽检正常时,检查评测集是否脱离了真实分布。
两条线互相校准,质量体系才不会失真。