从需求分析到上线部署,Agent开发全流程拆给你看

去年底有个制造业老板找我,张口就说”我要做个AI智能体,帮我管客户和报价”。我问他想管什么客户、报什么价、谁在用、跟哪个系统对接,他一个都答不上来。不是他不懂业务,是他不知道做Agent之前该想清楚哪些事。他以为Agent开发就是找个程序员写代码,接个大模型API就搞定了。

我跟他磨了两周才把需求理清楚,然后技术选型又花了一周,数据准备花了三周,开发和调试用了五周,测试上线又花了两周。从需求到上线整整三个月。他后来说没想到这么复杂,我说是你之前想得太简单了。Agent开发的代码量大概占整个项目工作量的两成,剩下八成全在代码之外。

这个项目上线后跑了半年,帮他们把客户询盘响应时间从平均四小时压到了十五分钟,报价准确率从百分之七十拉到了百分之九十二。老板很满意,但过程中踩的坑够写一本手册。今天我把全流程拆开讲,想Agent的企业看完就知道每个阶段该干什么、会踩什么坑。

需求分析不是写PRD,是问对问题

Agent开发的需求分析跟传统软件开发完全不一样。传统软件你写PRD,把功能列清楚,交互流程画好,开发照着做就行。Agent是智能体,它的行为不是完全确定的——你给它同样的输入,它可能给出不同的输出。所以需求分析的重点不是定义功能,而是定义边界:Agent该做什么、不该做什么、做错了怎么办。

我做需求分析的时候会问客户五个问题。第一,这个Agent服务谁?客户自己用、员工用、还是客户用?不同使用者的容忍度完全不同,内部员工用容错率高一些,客户直接用对准确率要求极高。第二,Agent的核心任务是什么?不是泛泛的”管客户”,而是”自动回复客户询盘并生成初步报价”这种具体的、可验证的任务。第三,Agent需要跟哪些系统对接?CRM、ERP、企业微信、还是内部数据库?这决定了技术选型方向。第四,Agent的决策权限到哪?能不能自动发报价给客户,还是只能生成草稿等人审核?第五,错了怎么办?Agent给错了报价怎么办?有没有人工兜底的机制?

这五个问题问完,需求才算理清楚。我那个制造业客户一开始说”帮我管客户和报价”,问完五个问题变成了”面向外部客户的询盘回复Agent,核心任务是接收客户询盘消息、查询库存和价格、生成报价单草稿、由销售审核后发送。对接企业微信和内部ERP。报价错误率控制在百分之五以内,超出则转人工处理”。你看,从一句话变成了一段话,但每一步都明确了。

有个坑特别提醒:需求分析阶段一定要拉上实际使用者参与。我见过一个项目,需求是老板和产品经理关起门定的,Agent做好了一上线,一线销售说”这玩意儿生成的报价单格式跟我们用了五年的模板完全不一样,客户看了以为我们是皮包公司”。需求不是老板脑子里的想法,是一线使用者每天在干的事。把他们拉进来,让他们描述真实的工作流程,你的Agent才能解决真问题。

技术选型别只看API价格

需求定了就该选技术了。Agent开发的技术选型要解决三个问题:用什么大模型、用什么开发框架、用什么部署方式。这三个选择互相牵连,不能分开决定。

大模型选型,我建议从任务类型反推。如果Agent的核心任务是文本理解和生成,比如客服问答、文档摘要,国内的DeepSeek和通义千问完全够用,API成本低、中文能力强。如果涉及结构化数据提取和推理,比如从询盘消息里提取产品型号、数量、交货要求这些字段,GPT-4o和Claude的准确率明显高一截,但成本也高。我那个制造业客户做的是询盘回复加报价生成,涉及自然语言理解和结构化数据提取,我给他选了混合方案:意图识别和回复生成用DeepSeek,结构化数据提取用GPT-4o,两个模型各干各的活。

开发框架选型,市面上主流的就三条路。LangChain适合有技术团队的企业,灵活度高但学习曲线陡,光搞清楚它的Chain和Agent抽象就要一周。Dify适合零代码团队,拖拽搭建、可视化编排,上手快但定制化受限。Coze介于两者之间,有代码节点也有可视化编排,适合有一定技术能力的团队。我给制造业客户选了LangChain,因为他们有一个能写Python的开发者,而且询盘回复流程涉及条件分支和外部API调用,需要灵活的代码控制。如果你团队没有写代码的人,别硬上LangChain,Dify虽然功能受限但能把Agent跑起来,总比没人维护强。

部署方式有三种:本地部署、云API调用、混合部署。本地部署数据安全但需要GPU服务器,成本高。云API调用成本低但有数据泄露风险——你的客户数据要发给第三方大模型API,合同里有保密条款的话需要额外处理。我给制造业客户选了云API调用加数据脱敏,把客户名称和联系方式在发送给大模型之前替换成代号,大模型返回结果后再还原。这个脱敏层加起来不复杂,但能规避大部分数据安全风险。

数据准备是最容易被跳过的一步

Agent上线后效果好不好,百分之六十取决于数据准备。我见过太多项目,需求分析做了、技术选型做了、代码也写了,上线一跑发现Agent答非所问,根因全是数据没准备好。数据准备包含三件事:知识库搭建、示例对话收集和业务规则文档化。

知识库是Agent的大脑。你的Agent要能回答客户问题,它得有知识储备。我那个制造业客户的知识库包含三部分:产品手册(产品型号、参数、价格表)、FAQ库(过去三年客户问得最多的问题和标准答案)、业务流程文档(询盘处理流程、报价审批规则、交付周期标准)。这三部分数据从哪来?产品手册从ERP导,FAQ从企业微信聊天记录里翻,业务流程从SOP文档里摘。数据采集花了一周,清洗和结构化又花了两周。知识库不是把文档往里一扔就完了,得切片——把长文档切成一个一个两百到四百字的知识块,每块解决一个具体问题。切片太大,AI检索不准;切片太小,上下文丢失。我经过反复测试,两百到四百字的切片在询盘回复场景下检索准确率最高。

示例对话收集是什么意思?你得给Agent看几十到上百组真实的对话样本——客户怎么问、销售怎么回。这些样本有两个用途:一是用于few-shot prompt,在系统提示词里嵌入几组示例对话,让Agent知道应该怎么说话;二是用于测试,上线前拿这些样本跑一遍看Agent的回答跟人工回答差多少。我帮客户从企业微信里导出了三百组历史询盘对话,清洗后留了一百二十组高质量样本。这一百二十组样本是整个项目最值钱的数据资产,没有它Agent就是无源之水。

业务规则文档化是很多人忽略的。Agent不是只有大模型就够了,它还需要业务规则来约束行为。比如”报价低于八折必须转人工审批””库存不足的产品不能在报价单里显示有货””新客户首次报价必须附带公司资质文件”——这些规则不是大模型能自己推断的,你得写成规则文档喂给它。我用的是规则引擎加自然语言混合的方式:硬性规则用代码写死,柔性规则用自然语言描述嵌入prompt。硬性规则保证不出大错,柔性规则让Agent的行为更自然。

开发调试和测试上线

前面三步做完了,开发反而是最快的一步。我那个制造业客户的Agent核心代码不到两千行Python,一周就写完了。真正耗时的是调试。Agent调试跟传统软件调试完全不同——传统软件的bug是确定性的,复现条件固定;Agent的bug是概率性的,同样的问题可能十次里只错一次,而且每次错的方式还不一样。

我调试Agent有一套流程:先跑离线测试,把一百二十组示例对话灌进去,对比Agent回答和人工回答的差异。差异大的标注出来,分析原因。原因通常是三类:知识库切片不对、prompt描述不清晰、或者业务规则缺失。知识库切片不对就重新切,prompt不清晰就改措辞,规则缺失就补规则。一轮调完再跑一遍,看差异有没有缩小。我跑了五轮才把准确率从百分之六十五拉到百分之九十二。每轮调整两到三个点,看着慢但没有捷径。

测试上线有两个阶段。灰度测试阶段,Agent只对内部员工开放,让他们扮演客户跟Agent对话,收集反馈。这个阶段通常会暴露一批你在离线测试中发现不了的问题——真实用户的提问方式千奇百怪,你那一百二十组样本覆盖不到。灰度测试跑了两周,收集了八十条新对话样本,补充进知识库和测试集。然后才是正式上线,先开放给百分之二十的客户,观察一周无重大问题后全量开放。上线后我留了一个紧急开关——一旦Agent连续三次回答被销售标记为”不合格”,自动切换到人工模式,避免错误输出影响客户关系。

Agent上线不是终点,是起点。我给客户定了每月一次的效果复盘,看AI引用率、回答准确率、人工接管率三个指标。第一个月人工接管率百分之二十八,第三个月降到百分之十五,第六个月稳定在百分之八。你看,Agent越用越准,因为每次人工接管都产生新的训练数据,持续喂回知识库和prompt优化。Agent开发是个持续迭代的事,不是交付完就不管了。在北京,想做Agent的企业越来越多了,但真正能落地的项目不到三成,差就差在前面的需求分析和数据准备上。想动手之前先聊聊,帮你避掉至少一半的坑。


需要相关服务?联系我们免费咨询

九五星球企服提供公司注册、代理记账、商标注册、财税咨询、高新申报、网站开发等一站式企业服务。可以先免费咨询看看,觉得合适再合作,不推销。

官网:www.95planet.com

免费小工具推荐:

联系方式:

  • 电话/微信:18910232032
  • 扫码添加专业经营合规顾问,免费咨询 ↓
扫码添加微信免费咨询