AI智能体和检索增强生成(RAG,一种把检索到的资料加入模型响应上下文的方法),让敏感数据可流经的位置远多于单看回答所能察觉的范围。一份文档可能进入检索库、提示词、模型的工作上下文以及所连接的工具,却从未出现在最终回答中。因此,安全工作的首要问题不只是AI系统说了什么,而是其数据从何而来、去往何处。

评估回答之前,先追踪数据

AI工作流可能在多个环节引入专有资料。训练数据集中可能包含内部记录或源代码。用户可能在提示词(即发给模型的指令)中输入机密片段。系统指令和政策文件也可能提供并不打算向所有用户开放的内部上下文。RAG会从内部文档、电子表格或数据库中提取资料,放入模型生成响应所用的上下文。AI智能体是借助模型选择并调用工具的系统,可以查询数据库、运行代码或调用外部服务。一个智能体还可能接连启动其他智能体。

每条路径对应不同的暴露问题。员工是否把敏感资料粘贴进未经批准的聊天机器人,而这些资料又可能被用于模型训练?检索系统是否让应用程序能够访问受限文件?智能体是否把信息传给了其他工具或智能体?未经授权在内部部署的AI,即所谓影子AI,一旦绕过既有的审查与管控,会带来新的挑战。一项研究发现,31%的组织曾遭遇与AI事件直接相关的数据隐私侵犯。

一条发光的数据线从机密文档出发,穿过向量存储、AI核心和所连接的工具

▲ 跨检索与工具的数据连续性

传统的数据防泄漏(DLP)工具监控的是文件和常规网络流量中的敏感信息。当源文本被转换为嵌入(存储在向量数据库中的数值表示),或数据经由智能体的连续操作流转时,这类工具可能无法察觉。仅仅找出正在使用的AI应用,并不能确定哪些敏感记录进入了这些应用,以及之后发生了什么。

实现可见性的两条路径

务实的检查会把AI工作负载(即应用程序和数据处理系统)与员工(即与这些系统交互的人)分开看待。两者都需要监控、追踪,并以清晰易懂的方式呈现结果。

流向 监控 追踪 呈现
工作负载 AI应用、RAG数据摄取和向量数据库 源文本转为向量的变化及后续传输 来源、转换和去向的映射图
员工 涉及AI应用的上传与下载 复制粘贴操作,以及原始文件与衍生文件之间的关系 员工如何使用和分享AI输出

对于工作负载,应把RAG数据摄取、AI应用和向量存储视为同一流程中相互关联的部分来检查,并将源文档与其转换后的表示及下游去向关联起来。对于员工,应观察可信文件与AI应用之间的数据流动。当有人以敏感原件为基础创建新文档时,要保留父子文件关系,避免丢失原始文件的分级信息。

服务器数据流与员工文档操作汇聚到展示关联文件的统一视图中

▲ 系统与员工使用的联合监控

任何一条路径单独来看都不完整。智能体发现工具能识别模型、提示词和被调用的工具,却无法显示底层文件的敏感程度。终端DLP可能看到员工设备上的活动,却看不到完整的RAG管道。云端和本地数据发现工具能够对存储库进行分类,却可能遗漏之后把数据带入AI系统的交互。目标是把这些视角连接起来,而不是把任何一个仪表盘当作完整的记录。

调查需要连接哪些环节

统一查看数据沿袭(即信息源自何处、如何变化、最终落在何处的记录),可以支撑三项相互关联的能力:

  1. 持续发现与分类: 在相关数据源中识别个人身份信息、受保护的健康信息、财务数据和知识产权。
  2. 端到端追踪: 在检索、向量化转换、模型使用、智能体工具和衍生文件之间保持关联。
  3. 结合情境的调查: 综合分析用户角色、数据敏感程度和传输去向,评估可能的暴露风险。

跨系统的策略执行和统一的控制台有助于整合这些能力。自动化、结合情境的调查可以把分析时间从数周缩短到数分钟。基于同一套数据流证据生成的报告,可以为落实EU AI Act、GDPR、SOC 2、HIPAA和ISO 27001的相关要求提供支持。

从绘制数据流向图开始

列出进入训练数据集、提示词、检索存储库和系统指令的敏感输入。然后把每项输入与可能处理它的应用、员工和智能体工具关联起来,记录转换过程和去向,而不只是最终回答。检查现有的智能体、终端和存储库工具能否提供打通的视图,并执行一致的策略。一条从来源到去向可追溯的路径,能让安全团队在继续使用AI的同时,找到发现暴露风险的起点。