三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

MerchantOps-KBQA 实践(十二):RAG 评估集、expected_source 与 Bad Case

MerchantOps-KBQA 实践(十二):RAG 评估集、expected_source 与 Bad Case

RAG 评估不应只看“回答读起来像不像”。对于商户运营知识库,更先要确认系统是否进入正确领域、是否引用正确版本、是否在知识不足时拒答。

一、评估数据

项目维护 10 条评估问题、5 个 Bad Case 和 5 份 Runbook,五个知识领域各有可验证样本。每条问题记录expected_source,用于检查 Metadata 过滤和来源引用。

二、校验内容

GET /api/assessment和离线校验器检查字段完整性、预期领域、Bad Case 编号与 Runbook 覆盖。它们验证数据和链路是否自洽,不把静态样本结果包装成线上准确率。

三、典型 Bad Case

  • 过期规则:提示人工确认最新版本。
  • 相似门店混淆:不能把其他对象的资料带入答案。
  • 缺少周期或口径的指标问题:不能擅自推导结论。

先用 Bad Case 暴露边界,再决定是否调整阈值或文档,是比盲目追求“回答更多”更稳妥的迭代方式。

← 返回列表