返回全部文章
智能应用开发

AI 应用的质量评测怎么做

没有评测集就上线,等于蒙着眼睛发布。评测不是加分项,是 AI 应用的工程底线。

2026-07-163 分钟阅读评测质量保障LLM

先建评测集,再谈上线

AI 应用和传统应用最大的区别是:没有编译错误,也不代表正确。模型可能语法完美但内容全错,所以必须用评测集定义「什么是好」。

评测集的第一批样本应该来自真实用户输入,而不是团队想象的问题。

三层评测体系

第一层是自动评测:用规则和模型打分检查事实性、格式、相关性。第二层是人工抽检:每周抽 20-50 条真实会话,由熟悉业务的人标注。第三层是线上监控:跟踪完成率、重试率、转人工率和投诉。

三层缺一不可:自动评测快速,人工抽检准确,线上监控反映真实。

  • 自动评测:格式校验、关键词命中、模型打分
  • 人工抽检:业务专家每周标注真实样本
  • 线上监控:完成率、重试率、放弃率、投诉率

评测维度要具体

「回答好不好」无法评测,要拆成可判断的维度:是否基于给定资料、是否完整回答、是否包含幻觉、语气是否合适、格式是否正确。

每个维度独立打分,才能定位问题出在检索、提示词还是模型。

让评测成为发布流程的一部分

每次模型升级、知识库更新、提示词改动,都先跑一遍评测集,分数不降再发布。

没有评测的 AI 项目,每次改动都是一次赌博。

评测集从哪里来

第一批样本来自三个地方:历史真实会话、客户反馈的典型案例、运营手动整理的边界问题。数量不是关键,覆盖真实分布才是关键。

每周把线上新出现的问题补充进评测集,让它跟随产品一起成长,而不是一次性建完就停。

人工抽检怎么做

每周固定抽 20-50 条真实会话,由熟悉业务的人按四个维度打分:信息是否准确、是否完整、语气是否合适、格式是否合规。

抽检不是挑错,而是发现模式:如果连续几周「不完整」占比最高,说明问题在上下文或检索,不在模型。

抽检结果写成一页摘要发给团队,让每个人都知道质量在变好还是变差,以及下一步改哪里。

抽检与评测的关系

离线评测集是「固定的体检表」,人工抽检是「随机的现场检查」。两者样本来源不同:评测集偏稳定回归,抽检偏真实分布。

当抽检发现的问题在评测集里没有覆盖时,就把它补充进评测集;当评测集分数下降但抽检正常时,检查评测集是否脱离了真实分布。

两条线互相校准,质量体系才不会失真。

参考资料

NEXT

有类似的项目想法?

从一次免费的想法梳理开始,把 AI 想法变成可验证、可上线的产品。

预约沟通看看作品
KEEP READING

继续阅读

2026-08-05智能应用开发

Web AI 应用的技术选型:稳定优先于炫技

AI 应用的技术栈没有标准答案,但有一条原则:让团队最容易长期维护的组合,才是最好的组合。

阅读全文
2026-07-29智能应用开发

流式输出的用户体验:从打字机到渐进式结果

流式输出不只是视觉特效,它决定了用户能否理解 AI 正在做什么、还要等多久。

阅读全文
2026-07-23智能应用开发

让模型输出可靠的结构化数据

模型输出不可靠时,问题往往不在模型,而在没有把输出约束成结构。

阅读全文