叶小钗

分享个RAG客服系统,带你读懂什么是数据飞轮和AI的可观测性

AI训练营7期,1月28日开班,欢迎咨询

前面我们提到过,在 RAG 系统中,真正决定效果上限的,不是模型本身,而是数据工程。

在 AI 客服这个场景下,相比法律、医疗等领域,业务严肃性明显更低。这意味着:

  1. 数据允许存在一定程度的不完整;
  2. 用户问题往往口语化、情绪化、甚至表达不清;
  3. 知识库不可能一开始就覆盖所有问题;

当知识库中存在信息缺失、AI 无法回答的问题时,这些问题本身并不是失败案例,而是后续优化的重要输入。这也是我引入数据飞轮策略的原因:

Image

今天我们就来简单聊聊,什么是数据飞轮系统:

数据飞轮

数据飞轮本质上是一种持续反馈的闭环机制:

通过从用户交互中不断收集数据 → 处理 → 优化 → 再反哺系统 让 AI 在真实业务中越用越准

在 AI 客服场景中,数据飞轮的目标并不是「把所有问题都收进知识库」,而是:

  1. 识别哪些问题值得沉淀;
  2. 降低人工参与成本;
  3. 持续补全真正有价值的知识缺口;

下面我会结合实际系统设计,介绍在 AI 客服中,如何对低置信度问题进行收集,并持续优化知识库。

一、置信度的意义

在前文我们提到过,AI 客服的第一步是 意图识别。当用户提问后:

  1. 系统会先给问题打标签(例如:产品咨询);
  2. 在对应标签下,进行 向量召回;
  3. 每条召回结果,都会有一个 置信度(score);

这个置信度,代表的是:

  1. 用户问题 与 知识库内容 的语义匹配程度;
  2. 分值越高,说明命中越精准;
  3. 分值越低,往往意味着知识库存在缺失或覆盖不足;

二、低置信度阈值与异步处理

在系统中,我将 置信度阈值 设置为 0.5:

  1. 当召回置信度 ≥ 0.5: → 直接走正常回答流程;
  2. 当召回置信度 < 0.5: → 认为当前知识库匹配度较低;

此时,系统会异步处理这条问题数据,进入数据飞轮流程。

三、用于数据整理的提示词设计

以下是我在系统中使用的提示词,用于对用户原始问题进行结构化处理:

你是智能客服的知识运营助手。你要把“用户原话”整理成可入库的标准问题,并尝试与候选问题合并。
目标:
1) 去噪:去掉情绪、口语、无关碎片,只保留核心诉求
2) 标准化:输出“真实意图”的标准问题,用中文,尽量像FAQ标题
3) 合并:判断是否与候选问题同一意图;如果是,返回 matched_question_id;否则返回 null
4) 初步解答:基于标准问题给出一段中文初步解答;如果信息不足,说明需要用户补充哪些信息
约束:
- normalized_question 必须是单行文本,长度不超过 120 字
- 如果候选列表里没有同一意图的问题,matched_question_id 必须为 null
- 只返回严格 JSON,不要输出多余内容
候选问题(JSON数组):
%s1
用户原话:
%s2
输出JSON:
{
"normalized_question": "string",
"matched_question_id": 123,
"ai_suggested_answer": "string"
}

四、问题标准化

模型会基于上述提示词,完成两件关键事情:

  1. 生成一个示例答案;
  2. 将用户原始问题标准化;

例如:用户原话: “我在日本,用 +81 的手机号能不能注册啊?不行我就换国内的”,整理后的标准问题为:“国外手机号(非中国大陆)是否支持平台注册?”

这一步在信息检索领域中,通常被称为 Question Canonicalization(问题规范化):

Image

五、数据入库与前后台分工

处理完成后的数据,会进入入库流程,用户端:

  1. 负责数据采集;
  2. 低置信度问题自动进入待处理队列;

后台管理端:

  1. 人工审核;
  2. 决定是否写入知识库;

六、问题审核

不是所有问题都值得沉淀,在后台中,人工需要先对问题进行审核:

Image

当看到某条问题的召回置信度低于 0.5 时,需要判断:

  1. 是否为正常业务问题;
  2. 是否存在垃圾信息、无意义输入或不当言论;
  3. ...

同时,也并不是所有问题都适合入库:

  1. 低频问题不值得沉淀;
  2. 强时效性问题会自然过期;
  3. 模型误判为“低置信度”的情况一定存在;

只有审核通过的问题,才会进入向量化流程。这里系统也设置了相似问题出现的次数,可以根据问题出现次数,判断重要性:

Image
Image

七、效果验证

完成向量化后,知识库中会新增一条元数据:

Image

当下次出现语义相近的问题时:

  1. 向量检索会命中这条新数据;
  2. AI 客服能够给出更贴合的回答;

在召回痕迹表中,可以直观看到优化效果:

Image

初始召回分数只有 0.422。 而在数据飞轮运行一段时间后:

Image

可以明显看到召回置信度来到了0.8以上,召回质量有了显著提升。

结语

其实,经过这里简单的介绍,我相信大家对于什么是数据飞轮,应该如何做数据飞轮,数据飞轮有什么价值就已经很清楚了。在真实业务中,AI 客服一定会遇到:

  1. 奇怪但合理的问题;
  2. 业务边缘场景;
  3. 用户表达极不标准的问题;
  4. ...

如果系统是静态知识库,这些问题只会反复出现、反复答错。而引入数据飞轮后:

  1. 知识库会在真实业务中不断被补全;
  2. AI 客服的回答质量,会随着使用时间自然提升;
  3. 人工只参与“关键判断”,而不是重复劳动;

这里大家也看出来了:AI 客服不是一次性工程,而是一个“被真实用户不断训练”的系统。

低置信度问题并不是系统失败, 而是下一轮知识进化的起点。

真正成熟的 AI 客服系统,一定不是靠“一开始就把知识写全”, 而是靠 数据飞轮 + 人工兜底 + 长期运行, 在业务中不断逼近最优解。

今天文章比较简单,大家轻松阅读吧...

点击上方卡片关注叶小钗公众号,查看下方二维码,添加我个人微信:

Image

往期推荐

《系统性:如何进入AI行业?》

《万字:Agent概述》

《万字:理解LangChain》

《万字:个人IP,包教包会》

《万字:RAG实战技巧,包教包会》

《万字:聊聊微调》


《2025年终总结》

《AI学习路线图》

《AI团队组织结构该如何设计?》

《生产级别的RAG系统》