分享个RAG客服系统,带你读懂什么是数据飞轮和AI的可观测性
AI训练营7期,1月28日开班,欢迎咨询
前面我们提到过,在 RAG 系统中,真正决定效果上限的,不是模型本身,而是数据工程。
在 AI 客服这个场景下,相比法律、医疗等领域,业务严肃性明显更低。这意味着:
数据允许存在一定程度的不完整; 用户问题往往口语化、情绪化、甚至表达不清; 知识库不可能一开始就覆盖所有问题;
当知识库中存在信息缺失、AI 无法回答的问题时,这些问题本身并不是失败案例,而是后续优化的重要输入。这也是我引入数据飞轮策略的原因:
今天我们就来简单聊聊,什么是数据飞轮系统:
数据飞轮
数据飞轮本质上是一种持续反馈的闭环机制:
通过从用户交互中不断收集数据 → 处理 → 优化 → 再反哺系统 让 AI 在真实业务中越用越准
在 AI 客服场景中,数据飞轮的目标并不是「把所有问题都收进知识库」,而是:
识别哪些问题值得沉淀; 降低人工参与成本; 持续补全真正有价值的知识缺口;
下面我会结合实际系统设计,介绍在 AI 客服中,如何对低置信度问题进行收集,并持续优化知识库。
一、置信度的意义
在前文我们提到过,AI 客服的第一步是 意图识别。当用户提问后:
系统会先给问题打标签(例如:产品咨询); 在对应标签下,进行 向量召回; 每条召回结果,都会有一个 置信度(score);
这个置信度,代表的是:
用户问题 与 知识库内容 的语义匹配程度; 分值越高,说明命中越精准; 分值越低,往往意味着知识库存在缺失或覆盖不足;
二、低置信度阈值与异步处理
在系统中,我将 置信度阈值 设置为 0.5:
当召回置信度 ≥ 0.5: → 直接走正常回答流程; 当召回置信度 < 0.5: → 认为当前知识库匹配度较低;
此时,系统会异步处理这条问题数据,进入数据飞轮流程。
三、用于数据整理的提示词设计
以下是我在系统中使用的提示词,用于对用户原始问题进行结构化处理:
你是智能客服的知识运营助手。你要把“用户原话”整理成可入库的标准问题,并尝试与候选问题合并。
目标:
1) 去噪:去掉情绪、口语、无关碎片,只保留核心诉求
2) 标准化:输出“真实意图”的标准问题,用中文,尽量像FAQ标题
3) 合并:判断是否与候选问题同一意图;如果是,返回 matched_question_id;否则返回 null
4) 初步解答:基于标准问题给出一段中文初步解答;如果信息不足,说明需要用户补充哪些信息
约束:
- normalized_question 必须是单行文本,长度不超过 120 字
- 如果候选列表里没有同一意图的问题,matched_question_id 必须为 null
- 只返回严格 JSON,不要输出多余内容
候选问题(JSON数组):
%s1
用户原话:
%s2
输出JSON:
{
"normalized_question": "string",
"matched_question_id": 123,
"ai_suggested_answer": "string"
}
四、问题标准化
模型会基于上述提示词,完成两件关键事情:
生成一个示例答案; 将用户原始问题标准化;
例如:用户原话: “我在日本,用 +81 的手机号能不能注册啊?不行我就换国内的”,整理后的标准问题为:“国外手机号(非中国大陆)是否支持平台注册?”
这一步在信息检索领域中,通常被称为 Question Canonicalization(问题规范化):
五、数据入库与前后台分工
处理完成后的数据,会进入入库流程,用户端:
负责数据采集; 低置信度问题自动进入待处理队列;
后台管理端:
人工审核; 决定是否写入知识库;
六、问题审核
不是所有问题都值得沉淀,在后台中,人工需要先对问题进行审核:
当看到某条问题的召回置信度低于 0.5 时,需要判断:
是否为正常业务问题; 是否存在垃圾信息、无意义输入或不当言论; ...
同时,也并不是所有问题都适合入库:
低频问题不值得沉淀; 强时效性问题会自然过期; 模型误判为“低置信度”的情况一定存在;
只有审核通过的问题,才会进入向量化流程。这里系统也设置了相似问题出现的次数,可以根据问题出现次数,判断重要性:
七、效果验证
完成向量化后,知识库中会新增一条元数据:
当下次出现语义相近的问题时:
向量检索会命中这条新数据; AI 客服能够给出更贴合的回答;
在召回痕迹表中,可以直观看到优化效果:
初始召回分数只有 0.422。 而在数据飞轮运行一段时间后:
可以明显看到召回置信度来到了0.8以上,召回质量有了显著提升。
结语
其实,经过这里简单的介绍,我相信大家对于什么是数据飞轮,应该如何做数据飞轮,数据飞轮有什么价值就已经很清楚了。在真实业务中,AI 客服一定会遇到:
奇怪但合理的问题; 业务边缘场景; 用户表达极不标准的问题; ...
如果系统是静态知识库,这些问题只会反复出现、反复答错。而引入数据飞轮后:
知识库会在真实业务中不断被补全; AI 客服的回答质量,会随着使用时间自然提升; 人工只参与“关键判断”,而不是重复劳动;
这里大家也看出来了:AI 客服不是一次性工程,而是一个“被真实用户不断训练”的系统。
低置信度问题并不是系统失败, 而是下一轮知识进化的起点。
真正成熟的 AI 客服系统,一定不是靠“一开始就把知识写全”, 而是靠 数据飞轮 + 人工兜底 + 长期运行, 在业务中不断逼近最优解。
今天文章比较简单,大家轻松阅读吧...
点击上方卡片关注叶小钗公众号,查看下方二维码,添加我个人微信: