去年十一月份有个做家居用品电商的客户来找我,他的公司年订单量大概三万单,售后团队五个人,每月光工资社保就要花四万多。他看到网上铺天盖地的Agent宣传,说AI客服能解决百分之八十的售后问题,问我能不能用Agent把售后团队砍掉,一年省五十万人工成本。我当时没有直接回答他,因为这种事光看别人怎么说没用,得拿自己公司的数据说话。于是我提了个方案:用两周时间做一组对比实验,人工客服和Agent同时上线,处理真实客户问题,最后拿数据来决定。
这个客户还挺爽快,说行,你帮我搭。我用Dify搭了个售后Agent,接入了他们的退换货政策、物流查询接口、产品FAQ知识库和工单系统。Agent负责在微信客服渠道自动回复客户,人工团队照常在电话和旺旺渠道工作。两周结束后我拉了数据,结果比我想象中复杂得多——Agent在某些维度上确实碾压人工,但在另外几个场景里,AI的表现让人直摇头。客户的老板看完数据后改了主意,没有直接砍人,而是调整了人机协作的方式。
今天我就把这个实验的全过程写出来,包括怎么搭的Agent、跑了什么数据、哪些场景AI能做、哪些场景AI做不了、最终怎么设计人机协作方案的。如果你也在考虑用Agent替代客服团队,这篇文章能帮你少走弯路,别光听厂商PPT吹。
做Agent项目这两年我最大的感受就是,厂商演示和真实上线之间隔着一道巨大的鸿沟。下面我把实验的关键发现拆开来聊,你看完心里就有数了。
实验怎么搭的——Agent和人工同时跑两周
先说实验设计。这个客户的售后渠道有三个:电话、旺旺(阿里旺旺)、企业微信客服号。我把企业微信客服号给Agent接管,电话和旺旺继续由人工团队处理。这样设计的考虑是,企业微信渠道以文字为主,适合Agent处理,同时三个渠道的客户群体相似,具有可比性。
Agent的技术架构我用Dify搭建,选Dify而不是Coze的原因是这个客户对数据安全要求高,需要私有化部署。大模型用的是通义千问-plus,理由是中文理解能力够用、API价格便宜(每百万Token输入约4元、输出约12元),而且阿里云的合规资质齐全。知识库方面,我把客户的退换货政策文档、产品使用FAQ、物流查询接口都接了进去,总共灌了一百二十多篇文档。
Agent的工作流程是这样的:客户发消息进来,Agent先判断意图——是查物流、问退换货、问产品参数、还是投诉。判断完意图后,如果是查物流,直接调物流API返回结果;如果是退换货,先查客户的订单状态和退换货政策,判断符不符合条件,符合就自动发起退换货流程,不符合就转人工;如果是产品参数咨询,从知识库里检索答案;如果是投诉或者情绪激动的客户,直接转人工处理。
人工团队这边也做了配合,五个人分成两组:A组三人继续处理电话和旺旺渠道,B组两人作为企业微信渠道的”人工兜底”,Agent处理不了的问题转给B组。这样设计的好处是,如果Agent出了问题,客户不会被晾在一边。
实验跑了两周,第一天到第十四天。前三天是磨合期,主要发现Agent知识库召回率不行,调了两次切片策略和Embedding模型。第四天开始稳定运行,正式计入数据统计。最终统计周期是十一天(第四天到第十四天),这个数据量足够说明问题。
费用方面给你算一笔:Dify私有化部署用了客户自己的一台4核8G云服务器(每月约180元),大模型API两周花了大约320元(日均约25万Token消耗),知识库向量数据库用Qdrant开源版没花钱。搭Agent的人力成本是我和助手两人干了三天,如果找外包大概在五千到八千的量级。也就是说,这个实验的搭建总成本不到一万块钱,对于年订单三万单的电商公司来说,试错成本完全可以接受。
实验数据——哪些维度Agent碾压了人工,哪些被吊打
十一天的统计数据出来了,我把核心指标列在下面,你一看就明白。
总对话量:企业微信渠道Agent处理了2,847次客户对话,电话加旺旺人工处理了3,156次。两个渠道的日均对话量差不多,每天各约两百多次,可比性没问题。
第一个维度是平均首次响应时间。Agent的平均首次响应时间是2.3秒,人工的平均是47秒。这个差距太大了,Agent几乎是秒回,人工客服光看到消息再打字就需要时间,旺旺上还好,电话渠道光排队就平均等了三十多秒。客户看到Agent两秒就回复了,体验感非常好,好几个客户在评价里说”回复速度比之前快了十倍”。
第二个维度是问题解决率。这里要分类看。简单问题(查物流、查订单状态、问退换货政策、问产品参数)Agent的解决率达到了89%,也就是说百分之八十九的简单问题Agent一次回复就搞定了,不需要转人工。人工团队在简单问题上的解决率是96%,比Agent高了七个点,差距不算大。但考虑到Agent一秒不休息地处理了将近两千五百个简单问题,人工只处理了一千多个,效率差距是巨大的。
复杂问题(涉及多轮沟通的退换货纠纷、产品质量投诉、物流异常处理)情况就反过来了。Agent的复杂问题解决率只有31%,也就是说十个人找来处理复杂问题,Agent只能搞定三个,剩下七个还得转人工。人工团队在复杂问题上的解决率是78%,差距将近五十个百分点。
第三个维度是客户满意度。我在每次对话结束后发了一条满意度评价(满意/一般/不满意),最终数据:Agent渠道的满意度是82%,人工渠道是91%。差距九个百分点,看起来Agent落后不少,但如果你把简单问题和复杂问题拆开看,数据更有意思——简单问题上Agent满意度91%,跟人工持平;复杂问题上Agent满意度只有54%,人工是88%。这说明Agent在简单问题上客户很满意,复杂问题上是拖了后腿。
第四个维度是成本。Agent两周的运营成本大概160元(API费用加服务器分摊),折合每个对话成本约5.6分钱。人工团队五人两周的工资社保大约2万元,折合每个对话成本约6.3元。单看每个对话的处理成本,Agent比人工便宜了一百多倍。但这里有个陷阱,后面我会说。
数据摆出来后,客户的老板愣了半天,说”这么说来Agent确实能替代大部分人工,但复杂问题搞不定,怎么办?”这就是实验最有价值的地方——它告诉你Agent不是全能的,也不是没用的,关键是怎么用它。
Agent搞不定的三类客户沟通——别让AI硬扛
实验跑完之后,我把Agent处理失败、被迫转人工的案例全过了一遍,发现失败集中在三类场景。这三类场景你如果想让Agent硬扛,只会把客户搞炸,最终损失的是你的口碑和复购率。
第一类是退换货纠纷。有个客户买了一套收纳盒,收到发现有两个裂了,拍了照片发给客服要求退换货。Agent按照退换货政策判断,商品签收超过7天不支持无理由退换,建议联系物流理赔。但实际情况是,客户签收当天就发现了破损,只是那几天出差没来得及联系客服,签收时间超过7天不是客户的问题。Agent不懂得变通,死板地按政策回复,客户火气一下就上来了,连发了十几条消息骂人。最后B组人工客服接手,看了照片和签收记录,判断确实是物流暴力分拣导致的破损,走了售后补发流程,客户才消了气。
这个案例暴露的核心问题是:Agent的政策判断是刚性的,不懂得结合实际情况灵活处理。退换货政策写了”签收超过7天不支持无理由退换”,但Agent不懂得区分”客户拖延了7天才来”和”客户当天就发现但出差了7天才来”这两种情况。这种判断需要理解客户的处境,目前的AI还做不到可靠的水平。
第二类是情绪化的投诉客户。有个客户买了个置物架,安装时发现少了一颗螺丝,在旺旺上连发了二十多条语音消息,情绪非常激动。Agent收到语音后先做ASR转文字,然后判断意图,识别出客户在投诉少配件,回复了一段标准话术”亲爱的客户您好,非常抱歉给您带来不便,请联系客服热线处理”。这段回复有三个问题:一是太官方太冷冰冰,客户本来就火大,看到这种模板回复更火大;二是没有直接解决问题,让客户再打电话等于踢皮球;三是没识别出客户的核心诉求是”赶紧补发螺丝”而不是”听你说对不起”。人工客服接手后,第一句话就是”姐您别急,螺丝我今天给您补发顺丰,明天到”,客户情绪立刻就缓和了。
情绪化客户处理的关键在于:先安抚情绪,再解决问题,顺序不能反。Agent现在的问题是它只识别”问题”不识别”情绪”,或者说它识别了情绪但不知道怎么用同理心去回应。这不是调prompt能解决的,是AI共情能力的本质短板。短期内不要指望Agent能替代人工去安抚愤怒的客户。
第三类是需要跨系统操作的问题。有个客户要求把之前一个订单的商品改地址发到另一个城市,这个操作需要同时改ERP里的发货地址、通知仓库重新打单、联系物流公司改目的地。Agent只接了ERP的查询接口没有写入权限,理论上可以加写入权限,但安全隐患太大——让AI自动改ERP数据,万一理解错了客户意图,改错一个地址就是一单物流事故。这种需要判断加操作加确认的场景,目前还是人工更可靠。
所以我的建议是:这三类场景不要让Agent硬扛,直接设成”转人工”触发条件。Agent的价值不是替代所有人工,而是把人工从简单重复的问题中解放出来,让有限的人力集中处理复杂问题。
人机协作怎么设计——不是替代是重新分工
实验数据出来后,客户的老板原本想砍掉三个人只留两个,我拦住了。不是说不该砍人,是不能乱砍。我给他设计了一个人机协作的方案,核心思路是”Agent做漏斗,人工做兜底”,把人力配置从”五个人全干”调整为”Agent处理百分之八十的简单问题,三个人处理剩余百分之二十的复杂问题加所有渠道”。
具体分工是这样的:Agent在企业微信渠道全量接管,简单问题直接处理,复杂问题和情绪化客户自动转人工,转接时间不超过5秒。旺旺渠道也上Agent,但所有投诉类对话直接转人工不等AI尝试。电话渠道纯人工,不上Agent,因为电话客服的情绪安抚价值AI替代不了。
人力调整方面,五个人减到三个:一个专职处理退换货纠纷(这类问题最多也最需要判断力),一个处理物流异常和产品投诉(需要跨系统协调),一个轮班处理旺旺和电话的常规咨询。三个人加上Agent,能覆盖原来五个人加七百多块钱客服软件的工作量。
这个方案跑了一个月后的数据:客户满意度从82%升到了87%(Agent加了兜底后复杂问题满意度上来了),人力成本从每月四万出头降到两万五左右,加上Agent每月的运营成本约八百块,总成本降了百分之三十八。老板还算满意,但不是他想象中那种”砍掉五个人省五十万”的爽快。
我跟他说的原话是:Agent不是替代你的售后团队,是帮你把售后团队从低价值重复劳动里解放出来。你的客服每天花百分之六十的时间回答”我的快递到哪了””这个能退吗””尺寸是多少”这种问题,这些时间本来应该用在处理真正的客户纠纷和维护大客户关系上。Agent把这些低价值问题接走后,你的人力可以做更有价值的事——比如主动回访高客单价客户提升复购率,这才是Agent带来的真正价值。
另外说几个实操层面的注意点。Agent搭建时知识库一定要干净,我见过不少企业直接把客服话术文档一股脑灌进去,结果Agent检索到的是过时的政策版本,给客户回复了错误的退换货规则。正确做法是知识库文档要有版本标记,定期清理失效文档,每次政策变更后同步更新Agent知识库。这个维护工作量不大,但如果不做,Agent的准确率会随着时间推移越来越低。
还有一点关于Agent的对话设计。很多人把Agent的prompt写得太长太复杂,恨不得把所有规则都塞进system prompt里。其实prompt应该聚焦在角色定义和边界约束上,具体业务规则放在知识库里让Agent检索,不要硬塞进prompt。我帮客户调prompt的时候发现,把两百行的system prompt精简到五十行后,响应速度提升了百分之三十,准确率反而高了——因为prompt太长时大模型会”注意力分散”,容易忽略关键规则。
最后说一下成本。这个实验的Agent搭建成本不到一万块,月运营成本约八百块(API加服务器)。对于年订单三万单以上、有五人以上客服团队的电商企业来说,做一组类似的对比实验成本完全可控。关键是别盲目相信厂商宣传的”替代百分之八十”,要拿自己公司的真实数据说话。每个企业的客服场景不一样,你的退换货政策复杂度、产品SKU数量、客户群体特征都会影响Agent的实际表现。花一周时间做个小规模实验,远比花大价钱买一个不确定的承诺靠谱。
需要相关服务?联系我们免费咨询
九五星球企服提供公司注册、代理记账、商标注册、财税咨询、高新申报、网站开发等一站式企业服务。可以先免费咨询看看,觉得合适再合作,不推销。
免费小工具推荐:
联系方式:
- 电话/微信:18910232032
- 扫码添加专业经营合规顾问,免费咨询 ↓