Agent开发的安全边界:企业数据怎么防止泄露给第三方大模型

你的企业数据正在”裸奔”,你知道吗?

说句实在的,现在企业搞AI应用、做Agent开发,第一反应都是”这个功能能不能实现””那个流程能不能自动化”。很少有人先问一句:我的企业数据会不会泄露?

你得明白,Agent(智能体)本质上就是一个”中间人”。它一头连着你的企业内部系统——ERP、CRM、财务软件、OA系统,里面全是客户资料、合同信息、财务报表、商业机密;另一头连着第三方大模型的API,比如OpenAI、Claude、文心一言、通义千问。数据从你这头进去,经过大模型处理,再返回结果给你。这个过程中,你的数据去了哪里、被谁看过、有没有被存下来,你真的清楚吗?

2024年3月,三星电子就栽过这个跟头。有员工把公司内部的半导体机密数据喂给了ChatGPT做代码优化,结果这些敏感信息直接进入了OpenAI的训练数据池。三星发现后紧急禁止员工使用ChatGPT,但损失已经造成了。类似的事情,国内也发生过——某金融公司的员工把客户征信报告上传到某国产大模型做”智能分析”,结果被监管部门点名批评。

说实话,Agent开发数据安全这个问题,大企业会重视,中小企业反而更容易掉以轻心。”我们就几个人用,能出什么事儿?”——这种想法最危险。数据泄露不分企业大小,一旦发生了,该承担的法律责任一点不会少。

九五星球企服去年给一个做跨境电商的客户搭建客服Agent,接入的是某国产大模型API。测试阶段我们发现,API返回的回复里偶尔会”夹带”其他企业的信息——明显是大模型在训练时”记住”了别的用户数据。这家客户当场决定放弃云API方案,改用本地化部署。

Agent开发中的数据泄露,通常有这3条路径

数据泄露不是”会不会发生”,而是”以什么方式发生”。在Agent开发场景下,常见的泄露路径有3条,每一条都防不胜防。

路径一:Prompt泄露。你让Agent处理一段客户投诉记录,这段记录就作为Prompt(提示词)的一部分发给了大模型API。大模型为了给出回答,需要”读取”这段内容。问题是,很多大模型API提供商会在后台记录这些Prompt,用于模型优化、质量监控,甚至被人工审核员查看。你的客户投诉记录,可能被千里之外的某个审核员看了一遍。更可怕的是,有些模型会把Prompt数据混入训练集——今天喂进去的客户资料,明天可能就出现在给别人的回答里。

路径二:上下文记忆泄露。Agent通常需要多轮对话来完成一个任务。比如一个销售Agent,第一轮问”客户A的联系方式”,第二轮问”给客户A发报价单”,第三轮问”客户A的上次成交记录”。这些对话内容会作为”上下文”一起发给大模型,大模型靠上下文来保持对话连贯性。但你想想——同一时刻,大模型可能在处理几百个企业的请求,它的”记忆”会不会串台?

现实中确实有这种情况。某企业在使用某大模型API时,发现Agent偶尔会返回其他企业的业务术语——明显是上下文”污染”了。虽然概率不高,但一旦发生,商业损失不可估量。

路径三:日志和缓存泄露。Agent系统通常会在本地记录操作日志——”某年某月某日,Agent查询了客户B的订单信息”。这些日志文件如果存储不当,被黑客窃取、被离职员工拷走、甚至被云服务商的员工访问,都是泄露风险。另外,很多Agent框架为了提升响应速度,会把大模型的返回结果缓存一段时间。缓存里的内容如果包含敏感数据,就等于在企业服务器上留了一份”副本”。

本地化部署:把数据关在自己的”院子”里

应对数据泄露风险,最有效的手段之一就是本地化部署。说白了,就是把大模型装在自己的服务器上,数据不出企业内网。

现在的开源大模型已经很成熟了。Llama 3、Qwen 2、ChatGLM 3这些模型,在参数量70亿到700亿的范围内,性能完全能满足大多数企业Agent的需求。一台配置好一点的本地服务器(比如8张RTX 4090或者2张A100),就能跑起一个700亿参数的模型。

本地化部署的好处很明显:数据从企业系统出发,在本地服务器上处理,结果返回给企业系统——全程不离开企业内网。没有第三方API,没有云端传输,没有Prompt被记录的风险。泄密的路径直接被切断了一大半。

但本地化部署也有代价:成本高、维护难、需要技术团队。一台能跑大模型的服务器,硬件成本十几万到几十万不等;模型的部署、调优、更新,需要懂AI的工程师;模型版本迭代了,你还得自己跟进。对于没有技术团队的小企业来说,这门槛不低。

折中方案也有。比如私有化云服务——把模型部署在私有云或专属云环境里,云服务商只提供算力,不接触数据。阿里云、华为云、腾讯云都有这类服务。数据仍然在”你的地盘”上,但不用自己买硬件、雇运维。

数据脱敏:给敏感信息”戴口罩”

不是每家企业都有条件本地化部署。如果你必须用第三方API,那至少要做好数据脱敏——在数据发给大模型之前,把敏感信息替换成代号或假数据。

具体怎么做?举个例子。你让Agent分析一份客户合同,合同里有客户真实姓名”张三”、身份证号”11010119900101XXXX”、银行账户”6222XXXXXXXXXXXX”。发给大模型之前,先走一遍脱敏程序:”张三”变成”客户A”,身份证号变成”ID_001″,银行账户变成”BANK_001″。

大模型处理的是脱敏后的内容,返回的结果也是基于脱敏数据的。Agent拿到结果后,再在本地做反脱敏——把”客户A”换回”张三”,把”ID_001″换回真实身份证号。大模型从头到尾没见过真实数据。

脱敏的规则要根据业务场景定。财务数据脱敏和客户数据脱敏,规则不一样。有些字段可以哈希处理(变成不可逆的乱码),有些字段可以用假名替换,有些字段可以直接删除(如果Agent用不到的话)。

说实话,脱敏方案的技术实现不难,难的是制定脱敏规则。哪些字段算敏感?脱敏到什么程度不影响Agent的工作效果?这些需要业务部门和IT部门一起商量。九五星球企服在给客户做Agent开发的时候,通常会先画一张”数据敏感度地图”,把所有可能经过Agent的数据列出来,分级标注敏感度,再针对性制定脱敏策略。

权限隔离:不是所有员工都能”调戏”Agent

数据泄露不全是技术问题,很多时候是人的问题。你给全公司开放了一个AI Agent,Sales部门的员工用它查客户信息,HR部门的员工也用它查客户信息——后者根本没有业务需要看客户合同,但他就是能看。这就是权限设计出了问题。

Agent系统的权限隔离,要跟企业现有的权限体系打通。谁能调哪个Agent、能访问哪些数据、能执行哪些操作,必须有明确的边界。建议用RBAC(基于角色的访问控制)模型:先定义角色(销售、客服、财务、管理员),再给每个角色分配权限,最后把员工归入角色。

比如销售Agent,普通销售员只能查自己负责的客户,销售经理可以查团队全部客户,但都不能看财务数据。财务Agent,只有财务部门的人能访问,而且只能访问跟记账、报税相关的数据,不能看客户联系方式。

还有一个容易被忽略的点:Agent的操作日志必须全量记录,而且要定期审计。“某员工在某时某刻通过Agent查询了某客户的银行流水”——这种记录要保存至少6个月。万一出事了,你能追溯是谁、什么时候、干了什么。

选API供应商的时候,安全条款比功能更重要

如果你最终选择用第三方大模型API,那签合同的时候别只盯着功能和价格看。数据安全条款才是重点。

至少要看清楚这5点:第一,API供应商会不会把企业的Prompt数据用于模型训练?第二,数据在传输过程中是不是全程加密(TLS 1.3以上)?第三,数据在供应商服务器上的存储期限是多长?第四,供应商有没有通过等保三级、ISO 27001这些安全认证?第五,合同里有没有明确的数据泄露赔偿责任?

国内的大模型API服务商,比如百度智能云、阿里云、腾讯云,一般在企业服务协议里会明确承诺”不将用户数据用于模型训练”,而且都通过了等保三级认证。国外的API服务商,条款差异就比较大了,建议找法务仔细看。

说白了,Agent开发数据安全不是一个”要不要做”的选择题,而是一个”怎么做”的必答题。你企业里的客户资料、财务数据、商业机密,值多少钱?Agent能给你省多少人工成本?这两个数字一对比,你就知道安全投入值不值了。

说句实在的,现在不做安全防护的企业,不是在省钱,是在赌运气。赌赢了省点小钱,赌输了可能就是灭顶之灾。你得想清楚。


需要相关服务?联系我们免费咨询

九五星球企服提供公司注册、代理记账、商标注册、财税咨询、高新申报、网站开发等一站式企业服务。可以先免费咨询看看,觉得合适再合作,不推销。

官网:www.95planet.com

免费小工具推荐:

联系方式:

  • 电话/微信:18910232032
  • 扫码添加专业经营合规顾问,免费咨询 ↓
扫码添加微信免费咨询