一家连锁餐饮企业上线了智能客服Agent。第一天就翻车了——有顾客问”你们门店有没有包间”,Agent直接回答”有的,包间免费使用”。实际上他们只有两家店有包间,而且需要最低消费。
顾客到店后跟店长大吵一架,差点发小红书曝光。事后排查发现,知识库里的门店信息混入了竞品的描述,标注规范也没统一,Agent根本分不清哪条信息是自己的。
这就是不做数据治理的代价。Agent上线前,这7项数据治理你必须跑完。
前四项:数据清洗、标注规范、权限分级、脱敏处理
第一项,数据清洗。说白了一句话:垃圾进,垃圾出。你给Agent喂的数据如果有重复、过时、矛盾的内容,它输出的答案一定是乱的。清洗要做什么?去重——同一条知识出现5个版本,AI不知道用哪个。纠错——价格表更新了但旧表没删,Agent报错价。补全——产品信息缺字段,Agent回答时信息不完整。
不做数据清洗的后果很直接:Agent上线第一天就给用户错误信息。上面那个餐饮案例就是典型——竞品信息混进了知识库,因为清洗时没人核对来源。
第二项,标注规范。你的数据需要有人标注”这条是对的””这条过期了””这条只适用于VIP客户”。没有统一标注规范,Agent没法区分信息的适用场景。建议建一个标注模板:每条知识标注来源、生效日期、适用范围、优先级。看起来麻烦,但上线后省的调试时间是标注时间的5倍。
第三项,权限分级。不是所有数据都该让Agent对外说。你的内部成本价、客户名单、员工薪酬,这些信息Agent碰都不能碰。权限分三级:公开可答、内部可见、禁止访问。权限不做分级,Agent可能把内部数据说给客户听,那就不是技术问题而是安全事故了。
第四项,脱敏处理。训练和测试用的数据里,凡是涉及个人信息的都要脱敏。手机号、身份证号、银行卡号,必须替换成虚拟数据。截至2026年8月,《个人信息保护法》的执法越来越严,不脱敏直接用真实数据训练,一旦泄露就是法律风险。
后三项:知识库构建、测试集准备、监控埋点
第五项,知识库构建。知识库不是把文档往里一扔就完事了。你得把PDF、Word、Excel里的内容结构化:产品手册拆成一条条FAQ,操作流程拆成步骤,价格表做成分级标签。一家50人公司的知识库,至少要花2周时间整理,别想着一晚上搞定。
不做知识库构建的后果:Agent回答问题时东拼西凑,逻辑混乱,用户体验差。你见过那种答非所问的AI客服吧?八成是知识库没做好。
第六项,测试集准备。上线前必须准备100到300条测试问答,覆盖常见问题、边界情况、异常输入。每一条都要有人工标注的正确答案。Agent跑完测试集后,对比正确率低于85%的不能上线。
不做测试集的后果:你根本不知道Agent上线后会犯什么错。等用户投诉了才知道它答错了,那是拿真实用户当测试小白鼠。我见过一家公司图省事跳过测试集,上线第一周被用户截图传了微博,品牌形象损失远超测试成本。
第七项,监控埋点。Agent上线后你需要知道:每天被问很多的问题是什么?哪类问题答错了?用户满意度怎么变化?这些数据靠埋点采集。不做监控埋点的后果:Agent出了问题你都不知道,等用户跑光了才反应过来。建议上线第一天就开始看监控数据,头两周每天复盘。
七项治理的时间投入和优先级
这7项不是平行关系,有先后顺序。我建议的推进顺序:
第一周做数据清洗和标注规范,把地基打好。第二周做权限分级和脱敏处理,确保合规底线。第三周构建知识库,这是耗时较多的环节。第四周准备测试集并跑测,同时埋好监控点。
总投入大概20到30个工作日,一家50人公司配2到3人的数据治理小组。听起来不少,但比起上线翻车的代价,这个投入是值的。北京这边已经有不少企业因为跳过数据治理导致Agent项目搁浅,返工成本是前期治理成本的3倍以上。
说白了,Agent开发七分靠数据三分靠代码。数据准备好了,开发就是顺水推舟。数据没准备好,代码写得再漂亮也白搭。
需要相关服务?联系我们免费咨询
九五星球企服提供公司注册、代理记账、商标注册、财税咨询、高新申报、网站开发等一站式企业服务。可以先免费咨询看看,觉得合适再合作,不推销。
免费小工具推荐:
联系方式:
- 电话/微信:18910232032
- 扫码添加专业经营合规顾问,免费咨询 ↓