Agent上线不是终点:3个指标告诉你效果好不好,怎么调

北京一家做SaaS的公司,花了一个月开发了一个客服Agent,上线那天团队都很兴奋。用了两周,老板问:效果怎么样?没人答得上来。日志看了一遍,调用次数不少,但客户满意度没涨,投诉反而多了几单。到底哪里出了问题,谁也说不清。

问题出在哪?上线的时候谁都没想过要监控什么指标。Agent跑起来了不等于跑好了,没有指标就没有判断依据,等于盲飞。

Agent上线只是开始,你得盯住几个关键数字,才知道它到底在帮忙还是在帮倒忙。

三个核心指标你得盯住

Agent上线后,真正能反映效果的指标不是”调用了多少次”,而是以下三个:

第一个,任务完成率。你的Agent是干什么的,它有没有把这件事干完?比如客服Agent,客户问了一个问题,Agent回答了,客户满意地走了——这叫完成。如果Agent回答了但客户又转人工了,或者客户问了两遍同样的问题,说明没解决。任务完成率等于成功完成的对话数除以总对话数。行业里做得好的Agent,这个数字能到75%以上。低于50%,说明你的Agent有根本性问题,可能是提示词写错了,也可能是知识库没覆盖到常见问题。

第二个,回答准确率。Agent回答了,但回答得对不对?这个比完成率更细。完成率看的是”客户满不满意”,准确率看的是”答案对不对”。有些客户不懂行,Agent给了个错误答案客户也满意地走了,但后面会出事。准确率的测量方法:抽样100条对话,人工标注哪些回答是正确的,算个比例。初期建议每周抽50条,稳定后每月抽100条。准确率低于80%的Agent,基本没法放心用。

第三个,人工接管率。有多少对话最终转给了人工?这个数字直接反映Agent的真实能力。如果10个客户里有6个到底还是转人工,那你的Agent基本上是个摆设。人工接管率控制在15%以内比较健康,超过30%就该认真查查原因了。

发现问题怎么调

指标盯住了,发现问题怎么办?别一上来就推翻重来,先定位问题在哪一层。

如果任务完成率低,先看提示词。你的Agent系统提示词里有没有说清楚它的职责边界?我们见过一个客服Agent,提示词就写了一句”你是客服,请回答客户问题”,太泛了,Agent什么都想答,什么都答不好。改成”你是XX公司的客服,只回答产品使用问题和售后政策问题,超出范围的引导客户转人工”,完成率从42%涨到68%。

如果准确率低,查知识库。Agent回答靠的是知识库里的内容,知识库不对、不全、或者格式混乱,准确率就上不去。常见的问题是:知识库只有PDF文档,Agent检索时拿不准该取哪段内容。建议把知识库拆成问答对的形式,一条问题对应一条答案,Agent检索效率高很多。另外检查一下知识库的更新频率——产品改了但知识库没更新,Agent就会给出过时的答案。

如果人工接管率高,看的是转接逻辑。你的Agent在什么情况下转人工?有些Agent设置得太保守,稍微拿不准就转人工,导致人工接管率居高不下。适当调高Agent的自信阈值——允许它在70%把握的情况下直接回答,只在低于50%时才转人工,接管率能降一截。当然这要看业务,金融、医疗这种容错率低的场景,宁可多转人工也别瞎答。

监控工具怎么搭

盯指标不能靠人肉翻日志,得有工具。

基础的方案:在Agent的调用链里加日志埋点。每次对话记录:用户问了什么、Agent怎么回的、有没有转人工、客户后续有没有再问同样的问题。这些日志存到数据库里,每天跑个简单的统计脚本,出三个指标的数据。一个开发花两三天就能搭起来,成本极低。

进阶方案:用LangSmith或Dify内置的监控面板。LangSmith能追踪Agent的每一步推理过程,看到它调用了哪些工具、检索了什么内容、最终怎么得出的答案。Dify的监控面板能看对话量、满意度评分、错误率。这些工具省了你自建监控的功夫,但有的要付费,月费从几百到几千不等。

还有一个容易被忽略的点:定期让真人扮演客户去测你的Agent。每月安排一两个人,用不同的问题去”为难”Agent,看看边界case的表现。自动化指标再好看,也测不出来Agent遇到刁钻问题时的真实反应。北京有家企业每个月搞一次”Agent找茬会”,全员出题考Agent,发现的问题比数据分析多得多。有个Agent在指标面板上准确率92%,但真人测了30个刁钻问题,发现其中8个答得离谱——这些case在自动抽样里根本抽不到。

说到底,Agent是个需要持续调优的东西,不是上线就完了。你花在监控和调优上的时间,应该不少于开发时间的一半。没有监控的Agent,跟闭着眼睛开车没区别——你觉得在往前走,但可能早就偏了。

还有个实操建议:建一个”问题对话”收集机制。当Agent回答被转人工、或者客户在对话里表达了不满(比如出现”不对””不是这个””你说错了”这类关键词),自动把这条对话存到一个单独的列表里。每周安排人把这些”失败对话”过一遍,分类记录失败原因——是提示词不够清楚,还是知识库缺了这块内容,还是Agent的推理逻辑有bug。按类型统计后,优先解决占比高的那类问题。这个机制比单纯看指标数字更直观,因为你能直接看到Agent”犯了什么蠢”,改起来有的放矢。

调优是个持续活,别指望一次调好就万事大吉。业务在变、用户在变、知识库在更新,Agent也得跟着变。建议每月做一次指标复盘,每季度做一次全面评估。把上线时的基线指标记下来,跟后续每个月的数据对比,看趋势是往上走还是往下掉。趋势往下掉的时候,往往不是Agent变差了,而是业务环境变了——比如产品更新了功能但知识库没跟上、客户问的问题类型发生了偏移。及时发现这些变化,及时调整,Agent才能越用越准。

还有个容易踩的坑:监控本身也会误导你。如果你的Agent接的是低频场景——比如每天就十几条对话——那一个月下来样本量也就三四百条,抽样准确率的时候随机性很大,一个月的波动不代表趋势。这种情况下别急着调,多看两个月再判断。反过来,高频场景(每天上千条对话)的数据波动更有参考价值,一周的异常就可以定位问题了。监控指标要跟样本量结合起来看,别被小样本的偶然波动牵着鼻子走。

上线前还有个准备工作别漏了:设定基线指标。Agent刚上线的头三天数据会很不稳定——用户还没适应新的交互方式、Agent的知识库还没跑全、边界case集中爆发。别拿这三天的数据当基线,建议上线两周后的数据作为基线指标,后续每个月都跟这个基线对比。基线指标至少记录三个数字:任务完成率、回答准确率、人工接管率。有了基线,后面所有调优的效果才有参照——你说准确率提升了10%,得有个基线数字来证明这个提升是真实的。

还有个实操细节:监控仪表盘尽量做成可视化的。别给老板看Excel表格,他们没耐心看数字。搞个简单的仪表盘页面,三个指标用数字大字+趋势曲线展示,绿色代表达标、黄色代表警戒、红色代表异常。老板一眼能看到Agent在不在正常工作,你也好汇报。这个仪表盘不用做得多精美,用Grafana或者自己写个HTML页面都行,重点是让指标一目了然。


需要相关服务?联系我们免费咨询

九五星球企服提供公司注册、代理记账、商标注册、财税咨询、高新申报、网站开发等一站式企业服务。可以先免费咨询看看,觉得合适再合作,不推销。

官网:www.95planet.com

免费小工具推荐:

联系方式:

  • 电话/微信:18910232032
  • 扫码添加专业经营合规顾问,免费咨询 ↓
扫码添加微信免费咨询