Agent上线后答非所问?别急着换模型,先查知识库切片对不对

北京一家做财税服务的公司,搭了个客服Agent,喂了整套公司服务手册进去——少说300页文档。上线第一天,老板自己测:问”小规模纳税人季度销售额超过30万怎么申报”,Agent回答了一大段关于增值税税率的内容,跟问题沾边但不对口。老板急了,觉得是模型不行,让技术团队换了个更贵的大模型,结果还是答非所问。

后来我们介入排查,发现问题压根不在模型上。技术团队把300页文档灌进知识库的时候,用的是默认配置——每500个字切一刀。这个切法把一个完整的申报流程从中间截断了,前半段在A切片,后半段在B切片。Agent检索到A切片,只看到了流程的前半截,回答自然残缺。

说白了,知识库切片没做好,你用再贵的模型也白搭。

知识库切片是什么,为什么决定了Agent的回答质量

先解释一下什么叫切片。Agent做RAG的时候,不是把整份文档一次性丢给大模型——文档太长,模型处理不了,费用也受不了。做法是把文档切成一小段一小段的,每段几百字。用户提问的时候,先把问题向量化,去知识库里检索最相关的几段,再把这几段连同问题一起发给模型,模型基于这几段内容回答。

切片就是这”切成小段”的动作。切得好,每段内容完整且语义聚焦,检索到就是精准的。切得不好,一段内容被拦腰截断、上下文丢了,模型拿到的信息是碎片化的,回答自然不准。

这个事有多关键?我们做过对比测试。同一份文档、同一个模型、同一组测试问题,用默认的固定长度切片(每500字一刀),回答准确率在55%左右。换成按段落语义切片后,准确率拉到了83%。光改切片策略,准确率涨了将近30个百分点。换一个更贵的模型,准确率也就涨5到8个百分点。你说切片重不重要?

那家财税公司的问题就出在这。他们的服务手册里有一段完整的”季度申报操作指南”,从判断销售额是否超30万,到填表步骤,到提交方式,一共写了800字。默认切片每500字一刀,第一刀切在前500字,把”判断销售额”和”填表步骤的前半部分”放进了A切片,把”填表步骤的后半部分”和”提交方式”放进了B切片。用户问”超过30万怎么申报”,检索到的是A切片,里面有判断逻辑但申报步骤不完整,模型只能根据残缺信息硬答,当然答非所问。

三种切片策略对比:固定长度、按段落、按语义

切片策略不是只有一种,主流的有三种,各有适用场景。你得知道什么时候用哪种。

第一种,固定长度切片。最简单粗暴,按固定字符数切,比如每500字一刀。优点是实现成本低,大部分RAG框架默认就是这个。缺点也很明显——它不看内容边界,一个完整的段落、一个操作步骤、一段对话,随时可能被截断。适合什么场景?内容结构简单、段落短小、信息密度均匀的文档。比如FAQ列表、短消息记录。但你拿它切长篇业务手册,就是在赌运气。

第二种,按段落切片。以文档的段落、章节、小标题作为切分边界。一段切一刀,不拆段。优点是每段内容语义完整,不会被拦腰截断。缺点是段落长度不均匀——有的段落可能只有50字,有的可能有2000字。太短的信息量不够,太长的超过模型上下文窗口又得二次切分。适合什么场景?结构清晰的文档,比如有明确小标题的产品手册、分章节的操作指南。那家财税公司的服务手册有明确的小标题结构,用按段落切片就比固定长度好得多。

第三种,按语义切片。用语义分析模型判断内容边界,在语义转换点切分。比如一段内容从”政策说明”转到”操作步骤”的时候切一刀,而不是按字数或段落。优点是每个切片在语义上高度聚焦,检索精准度最高。缺点是实现复杂、有计算开销——你得加载一个语义分割模型,或者用专门的切片服务。适合什么场景?对回答准确率要求高、文档内容复杂的项目。比如法规解读、技术文档、多主题混合的内容库。

我的建议是分层用。简单文档(FAQ、短消息)用固定长度就行。结构化文档(产品手册、操作指南)用按段落。高精度场景(法规解读、专业咨询)用按语义切片。别一刀切,按内容类型匹配策略。

切片优化的4个实操技巧

选对策略只是第一步,具体操作上还有几个技巧能让检索效果再提一档。

第一个技巧,设置重叠区间。切片之间留一段重叠内容——比如每个切片500字,前后各重叠100字。这样即使一个完整信息被切在边界上,重叠区间能保证相邻切片里有冗余信息,不至于上下文断裂。重叠区间一般设切片长度的10%到20%比较合适。太大浪费存储和检索成本,太小起不到作用。

第二个技巧,给切片加元数据标签。每个切片存的时候不仅存正文,还挂上来源标签——比如”来源:服务手册第三章第二节”、”文档类型:操作指南”、”更新时间:2026-08-15″。检索的时候可以先按元数据过滤,再在过滤后的切片里做语义检索。比如用户问的是”申报操作”,你可以先过滤出文档类型为”操作指南”的切片,再在里面检索,准确率比在全库里检索高得多。

第三个技巧,混合粒度切片。同一份文档做两套切片:粗粒度(按章节切,每段1000到2000字)和细粒度(按段落切,每段200到500字)。检索时先在粗粒度切片里找最相关的章节,再在对应的细粒度切片里做精准检索。这种两阶段检索在长文档场景下效果很好,既有全局定位又有局部精准。

第四个技巧,问答对单独切片。如果你的知识库里有FAQ问答对(问答形式的文档),别和普通文档混在一起切。把每个问答对作为一个独立切片存,检索的时候直接匹配。因为问答对的语义结构和普通段落不一样——问题是”查询”,答案是”内容”,混在一起切反而会干扰检索。单独管理问答对切片,准确率提升很明显。

那家财税公司后来怎么改的?我们把300页服务手册重新做了切片。操作指南类内容用按段落切片,FAQ问答对单独提取成独立切片,法规解读类内容用按语义切片。加了15%的重叠区间,每个切片挂了来源章节和文档类型的元数据标签。改完后同一组测试问题,准确率从55%拉到了85%。模型没换,API费没涨,纯粹是切片策略的功劳。

上线后怎么持续监控切片效果

切片不是一劳永逸的。知识库在扩充、内容在更新,切片效果会跟着数据量增长而变化。你得有监控手段。

最基础的监控:记录Agent每次回答时检索到了哪些切片、检索置信度是多少。如果某个切片频繁被检索但用户反馈”回答不对”,说明这个切片的内容跟用户需求不匹配,要么内容有误,要么切片边界不合理。这种切片要重点排查和优化。

进阶一点:定期做一批标注好的测试问答对——比如50到100个典型问题和对应的正确答案——每周跑一轮,看准确率有没有掉。掉了就排查是哪些切片出了问题。新内容加进知识库后,尤其要跑测试,确认新切片没有干扰原有检索效果。

还有个常见问题:知识库越大,检索越不准。这叫”信号稀释效应”——相关切片被大量不相关切片稀释了,检索的时候排在后面了。500条切片的时候检索很准,涨到5000条就不行了。解决办法是对知识库做分库管理——按主题、按产品线分库存,检索的时候先确定查哪个库,再在库内检索。比一个5000条的大库乱搜好得多。

说句总结的话:Agent项目里,切片策略和模型选择是两个独立变量。模型决定了”理解能力的天花板”,切片决定了”输入信息的质量”。信息质量差,模型再强也巧妇难为无米之炊。做Agent开发,别光盯着模型参数较劲,花时间在知识库切片上,投入产出比比换模型高得多。


需要相关服务?联系我们免费咨询

九五星球企服提供公司注册、代理记账、商标注册、财税咨询、高新申报、网站开发等一站式企业服务。可以先免费咨询看看,觉得合适再合作,不推销。

官网:www.95planet.com

免费小工具推荐:

联系方式:

  • 电话/微信:18910232032
  • 扫码添加专业经营合规顾问,免费咨询 ↓
扫码添加微信免费咨询