AWS Machine Learning Blog · 2026/10/7 18:34:44
AWS 推出实时 ACL 校验机制:解决 RAG 企业级权限泄露难题
Amazon Quick 与 Bedrock Knowledge Bases 联合推出实时访问控制列表(ACL)执行方案,旨在解决企业 RAG 应用中的权限泄露风险。该方案在查询时直接向 SharePoint、Google Drive 等权威源验证用户权限,确保 AI 生成的答案仅包含用户有权访问的内容。
报道全文原始报道全文
本文目录13 个章节
企业组织正在采用检索增强生成(RAG)技术,以从 Microsoft SharePoint、Google Drive 和 Atlassian Confluence 等公司知识源中挖掘洞察。然而,这些知识源包含受复杂权限结构管控的敏感信息。确保 AI 生成的答案尊重这些权限,是企业 AI 领域最具挑战性的难题之一。
在本文中,我们将探讨 Amazon Quick 和 Amazon Bedrock Knowledge Bases 如何通过实时访问控制列表(ACL)强制执行来解决这一挑战,即在查询时直接通过权威数据源验证权限。
业务问题
考虑以下场景:一位 SharePoint 站点所有者为其组织创建了一个知识库。来自多个部门的团队成员使用 AI 助手从该知识库获取答案。关键要求是,每位团队成员只能接收其有权访问的文档所产生的 AI 洞察。
这是一个普遍存在的企业级挑战。组织希望在保持现有安全态势不受影响的前提下,实现 AI 驱动洞察的普惠化访问。如果 AI 响应中出现一份未经授权的文档,可能会泄露机密战略文件、未公开的财务数据或敏感的 HR 信息。
为什么现有方法不足
一种常见的 RAG 访问控制方法采用“复制并过滤”策略来执行文档级权限。其典型工作流程如下:
- 数据源连接器(例如 SharePoint 连接器)在定期同步任务中拉取 ACL。
- ACL 从数据源复制到索引中,并存储为属性。
- 在查询时,AI 系统将登录用户映射到存储的 ACL 属性,并据此过滤结果。
虽然这种方法表面上看起来合理,但它存在三个根本性弱点。
问题 1:AI 系统并非事实来源
在该模型中,AI 系统独立承担权限执行职责,但并非权限的权威来源。这要求数据连接器能够准确地在各种数据源之间复现复杂的、特定于源系统的 ACL(访问控制列表)逻辑。每个数据源都有其独特的权限模型。在数十个连接器之间映射继承层级、组成员关系、条件访问策略以及拒绝规则,是一项极易出错的工作。
问题 2:过时的权限导致安全漏洞
通常,数据连接器支持按需运行或按客户定义的调度计划运行的拉取式同步。这些 AI 解决方案中的 ACL 仅是上一次同步运行时的时间快照。虽然某些解决方案采用基于事件的更新机制,但这并不具备普适性。例如,像 Confluence 这样的数据源在组成员关系发生变化时并不会发出事件通知。在两次同步之间,已被撤销访问权限的用户仍可能从他们本不应再查看的文档中获得 AI 生成的答案。
问题 3:数据源功能的不断演变
数据源会定期更改或引入新的内容访问控制机制。SharePoint 中新增的权限功能或 Google Drive 共享模型的变更,都可能导致 ACL 映射逻辑出现缺口。在连接器完成更新之前,这可能会造成内容暴露的风险。
AWS 的解决方案:实时 ACL 执行
为了应对上述挑战,我们在 Amazon Quick 和 Amazon Bedrock Knowledge Bases 现有的检索前 ACL 过滤基础上,实施了实时 ACL 检查作为额外的安全层。通过在查询时直接向权威来源验证权限,确保系统执行的是最新的访问控制策略。这种方式避免了对可能过时或映射错误的 ACL 数据的依赖。
架构概览
下图展示了我们的混合方法,该方法兼顾了语义搜索的性能与实时的安全能力。
图 1:Amazon Quick 和 Amazon Bedrock Knowledge Bases 的实时 ACL 执行架构,结合了检索前过滤(第一阶段)与针对权威来源的实时验证(第二阶段)
工作原理:以 Google Drive 为例
当用户向使用 Google Drive 知识库的 Amazon Quick 代理提交查询时,系统会在两个阶段强制执行访问控制:
第一阶段:检索前过滤
Amazon Quick 针对向量索引执行语义搜索,以查找最相关的文档片段。系统会应用已存储在索引中的访问控制列表(ACL)。这会生成一个初步的候选文档集合。此阶段是必要的,因为对索引中的每个文档进行实时 API 调用在大规模场景下成本过高。
第二阶段:实时验证
Amazon Quick 通过调用 Google Drive API 实时验证候选文档。它使用管理员提供的服务账号凭证,通过身份模拟(impersonation)生成特定于用户的访问令牌。Google Drive 维护着与每个文档关联的访问控制列表的真实来源(source of truth)。用户无权访问的文档将从检索结果集中排除。只有经过验证且获得授权的文档片段才会作为上下文传递给大语言模型(LLM)。模型利用这些知识生成响应。
这种两阶段方法在性能与安全性之间取得了平衡。它利用缓存的 ACL 提高效率,同时通过实时检查确保正确性。除了 ACL 强制实施外,Amazon Bedrock 还提供了负责任的 AI 控制措施。这些措施包括用于内容过滤的 Amazon Bedrock Guardrails、用于减少幻觉的基础性检查(grounding checks),以及可配置的安全策略,帮助组织负责任地部署生成式 AI 应用程序。
这对您的组织为何重要
这种方法带来三大关键优势:
- 始终最新的权限 – 在使用 RAG 产品时,不再存在同步周期之间的安全缺口。如果员工的访问权限被撤销,这一变化将在瞬间而非数小时或数天内反映在 AI 响应中。
- 扩展的信心 – 组织可以扩大其知识库覆盖范围,因为他们知道无论数据源如何,每次查询都会通过实时 ACL 检查向权威来源验证权限。
- 降低运营负担 – 您无需担心同步频率问题。
客户对此的评价
“当我们着手评估适合组织的 AI 解决方案时,我们的安全与合规团队明确了首要优先级:确保同事只能看到其有权访问的信息。这是一项基本要求,但许多平台难以以有意义的方式解决这一问题。Amazon Quick 在实时访问控制方面的方法给出了明确答案,并在整个评估过程中展现了令人瞩目的严谨性。这使我们的内部评审委员会有信心推进项目,并为我们未来思考 AI 治理奠定了坚实基础。” — Jamahl Wiggins, Sr. Specialist – M365 Innovation, Mondelēz International
Mondelēz International 已在四个区域为其超过 35,000 名员工部署了 Amazon Quick。
结论
在这篇文章中,我们探讨了 Amazon Quick 和 Amazon Bedrock Knowledge Bases 如何通过实施实时 ACL(访问控制列表)强制执行,来解决企业面临的一项关键安全挑战。双层 ACL 架构在查询时直接向权威源验证权限,从而确保 AI 生成的回答仅包含用户有权访问的内容。
如需开始使用,请访问 Amazon Quick 和 Amazon Bedrock Knowledge Bases。
