“上线两周,准确率才41%,客户投诉堆成山,老板让我下周解决。”北京一家做企业服务的CTO跟我倒苦水。他团队花了三个月开发客服Agent,用了GPT-4o,prompt写了200多行,自测的时候感觉挺好。一到线上全崩了——该回答的不回答,不该回答的乱编,用户问”代理记账多少钱”,它回”请咨询您的专属顾问”。
说白了,问题不在模型,在prompt。我花了两天帮他改prompt,准确率从41%拉到67%。怎么做到的?4个方法,一个一个说。正在做Agent调优的团队,这套打法直接能抄。
方法一——Few-shot示例不是越多越好,是越像越好
很多人写prompt喜欢塞一堆示例,觉得示例越多模型越懂。其实错了。你塞10个示例,其中8个跟实际用户问题差了十万八千里,模型反而被带偏了——它学到的不是”怎么回答”,而是”怎么编造示例那种腔调”。
正确的做法是什么?从真实对话日志里挑3到5个高频问题,每个配标准答案,直接放进prompt。北京那家企业的客服日志里,”代理记账价格”和”经营范围变更”两个问题占了咨询量的60%。我把这两个问题的标准回答做成示例放进去,光是这一步,准确率就从41%涨到52%。
关键是示例要”像”——像真实用户会问的问题,不是你坐在办公室里想出来的。用户怎么说话,你的示例就怎么写。有人问”代理记账一年多少钱”,你的示例就别写”请告知贵司代理记账服务之年度费用”。口语化,真实,模型才能对上用户的频率。
方法二——角色约束加输出格式,一个都不能松
很多人prompt里写了”你是一个专业的客服代表”,然后呢?没有然后了。模型不知道”专业”意味着什么。得把角色约束具体化:你能回答什么、不能回答什么、回答格式是什么。
我给那家企业加了一段约束:”你是95星球企服的客服Agent。只回答公司注册、代理记账、商标注册、财税咨询相关问题。超出范围的,回复’这个问题需要人工客服为您解答,正在为您转接’。回答必须包含:结论+理由+下一步建议,三段式。”
就这一段约束,解决了两个大问题:一是模型不再乱编它不知道的信息——遇到范围外的问题直接转人工,而不是硬编;二是输出格式统一了,前端好解析,用户体验也好了。准确率从52%涨到58%。你别小看角色约束,很多Agent翻车就是因为prompt太松,模型不知道边界在哪,自然到处乱跑。
方法三——思维链分解,让模型先想再答
有些复杂问题,你让模型直接给答案,它容易翻车。比如用户问”我注册了一家北京的贸易公司,需要办理哪些资质?”这里面有好几步推理:先判断公司类型、再判断行业、再对应资质清单、再查地域特殊要求。一步到位的回答经常漏项或错项。
怎么办?让模型分步想。在prompt里加一句:”回答前先在内部完成以下推理步骤:1.确定用户公司类型和行业;2.列出该行业所需资质;3.检查是否有北京地域特殊要求;4.给出最终答案。”模型分步推理后,准确率从58%涨到63%。
这不是什么高深技术,就是让模型”想清楚了再说”,跟人一样——你让客服直接回答多步问题,也容易答漏。思维链的本质是给模型一个推理框架,让它别跳步。北京的企业做Agent,遇到多步推理场景,这个方法一定加上。
方法四——负样本对抗,专治”一本正经地胡说”
最后一个方法效果出奇的好。你在prompt里加几组”错误回答示例”,明确告诉模型”这种回答是错的,别这么答”。比如:”错误示例:用户问代理记账价格,回答’具体价格请咨询顾问’。正确做法:直接给出起步价区间并说明影响因素,再引导用户使用价格计算器。”
模型看了负样本,就知道哪些回答方式不能用了。北京那家企业加了5组负样本,准确率从63%涨到67%。说句实在话,67%不算高,但对于客服Agent来说已经可以上线了,剩下的用人工兜底。
你别指望prompt调优能到95%,那不现实。但41%到67%,60%的提升幅度,省了重新选模型和微调的时间和成本,值了。北京这边做Agent的团队越来越多,prompt工程这块的投入产出比远高于换模型。先改prompt,改不动再考虑微调,别本末倒置。
需要相关服务?联系我们免费咨询
九五星球企服提供公司注册、代理记账、商标注册、财税咨询、高新申报、网站开发等一站式企业服务。可以先免费咨询看看,觉得合适再合作,不推销。
免费小工具推荐:
联系方式:
- 电话/微信:18910232032
- 扫码添加专业经营合规顾问,免费咨询 ↓