2026 年,您采购团队发出的每一份 AI 供应商安全问卷,本质上都是一份治理文件:它决定您的数据可以流向哪里、哪些第四方可以触碰它、以及是否有模型正在悄悄用您的客户数据学习——而大多数问卷,问的还是 2019 年 SaaS 时代的老问题。
为什么 AI 供应商会击穿经典第三方风险模型
经典供应商风险评估有一个隐含假设:产品是稳定的——厂商交付某个版本,评估一次,结论一两年内有效。AI 产品把这个假设的每一条都打破了。API 背后的模型可以在您不受控的版本更替中被替换;模型可以通过一次静默更新或安全重训改变行为——语气、拒答模式、事实可靠性都变;在某些合同条款与配置下,您的提示词和上传文件可能进入厂商的训练语料;而一个 AI 产品往往串联多个模型与数据服务、跨越多个司法辖区——您签的「一个供应商」,实际是一条供应链。
后果在泄露数据里已经显形。IBM《数据泄露成本报告》(2025)估计全球平均成本约 440 万美元,而源自第三方或供应链入侵的泄露,识别与遏制时间一贯更长——因为受害方对别人的环境没有可见性。Gartner(2025)反复估计,第三方相关安全事件是增长最快的泄露类别之一。监管也在追赶这个模式:欧盟 AI 法案自 2024 年起的分阶段义务落在部署者头上,金管局(2024 年起)把外包 AI 视同外包业务对待,数据保护机构则越来越多地追问:谁、在哪里、依据什么合法基础处理了什么。
这个框架暴露的组织性失败是边界问题,不是工具问题:安全团队管问卷,AI 采用常由业务部门刷信用卡完成,数据治理夹在中间。据我们观察,多数中型企业日常在用的 AI 工具中,相当比例从未经过任何评估。下文的框架只坚持一条设计原则:问卷的价值等于它的执行机制——每个问题都必须对应一条合同条款、一个技术控制,或者一条放弃的理由。
评估的基本单位不再是供应商,而是数据流。先问您某个具体字段的数据能流到哪里,其余每个问题都会随之变得具体。
问卷第一部分:数据驻留与留存
从决定未来任何一次事故影响半径的问题问起:数据物理上和法律上住在哪里,会存多久。
驻留。分别问四件事:推理发生在哪里(处理端点跑在哪些区域)、存储在哪里、备份在哪里、有数据访问权限的支持人员坐在哪里。这是四个不同的答案,不分开问,厂商就会混着答。对总部在香港的企业,实操标准是:默认区域内处理与存储,跨境传输仅限列明辖区并具备书面传输机制。而且要把答案钉进合同——「我们通常支持区域内处理」不是答案,写明您所在租户处理区域的条款才是。
留存。留存问题有三层,常规问卷习惯合并成一层问,而这三层的区别直接改变您的风险敞口。输入留存:提示词、上传文件、查询在处理完成后保留多久?输出留存:响应是否被记录?运营留存:日志、遥测、错误堆栈,以及最常被忽略的备份——备份有自己的生命周期,且常在另一个区域。每一层都要拿到书面答案:保留多少天、能否按需删除、删除是否经过验证、是否在承诺时限内传导至备份。一个说不出每层具体天数的厂商,等于告诉您它的数据生命周期处于失控状态。
| 问题 | 合格答复长什么样 | 模糊答复在掩饰什么 |
|---|---|---|
| 推理在哪里运行? | 写明您租户的区域并有合同承诺 | 「全球基础设施智能调度」 |
| 输入保留多久? | 按数据类型写明天数;可按请求删除并验证 | 「仅在必要期限内保留」 |
| 备份存放在哪里? | 同区域或列明清单;写明备份删除窗口 | 不回答——备份通常比生产删除活得更久 |
| 谁能访问生产数据? | 具名岗位数量、背景审查、访问留痕 | 「访问受限制」——受谁限制?在哪里留痕? |
问卷第二部分:子处理者与「是否拿您的数据训练」
这两个话题制造的合同摩擦最大,也理应最大——您的数据正是在这里获得您控制之外的生命。
子处理者。AI 产品几乎必然是一条链:您签约的厂商可能调用基础模型供应商、向量数据库服务、转写服务、云平台,还有一个装着您工单截图的客服系统。要求提供完整的子处理者清单——主体名称、处理目的、处理地点——以及比清单本身更重要的两项权利:变更提前通知(30 天是可操作的标准)并有权提出异议;安全义务向下传导,让厂商而非您为它的第四方承担合同责任。每年复审清单,并在每次收到变更通知后复审。一个说不清自身链条的厂商,不是一个您能在监管或保险方面替您辩护的厂商。
训练用途。问题不是「你们用客户数据训练吗」——这是一棵决策树。依次问:(1)我们的内容——提示词、文件、查询、反馈——是否被用于模型训练或微调,默认开启还是可选加入?(2)若不用于训练,是否用于其他模型改进,包括人工审阅、提示词分析或评测集?(3)若存在人工审阅,谁来审、依据什么保密条款、我们能否退出?(4)租户隔离是否做到位,保证我们的内容永远不会出现在其他客户的输出里?每个「是」都需要对应的合同边界、技术机制与退出选项。2026 年多数企业的默认姿态是:零训练用途、退出人工审阅、非训练承诺落成书面合同——因为厂商的产品开关和路线图,永远比合同变得快。
大湾区语境下的跨境细节值得单独一句:一家在一个辖区训练、在另一个辖区提供服务的厂商,可能合法地把您的内容途经您的数据政策从未设想过的地方。因此驻留(第一部分)与训练(第二部分)必须联合作答——「我们不用您的数据训练,但推理时会途经三大洲」同样不是干净答案。
访问控制:SSO、RBAC 与您真正能验证的原则
访问类问题是唯一可以技术验证而不必听信陈述的部分,因此是整份评估里性价比最高的环节。
SSO 与身份。对接您自有身份提供商的 SAML 或 OIDC 单点登录,对任何接触内部数据的工具都应不可妥协——它把离职回收从「提工单然后祈祷」变成自动完成,并把认证日志放进您自己拥有的系统里。要问清哪些 SSO 能力锁在哪个定价档位:厂商普遍把 SAML 留给企业版、让中型客户用共享密码,而这条档位分界线本身就是一个您应有意识做出的风险决策。SCIM 或自动化账号开通能把闭环补全;没有它,您的 SSO 与厂商内部的访问控制几个月内就会漂移脱节。
RBAC 粒度。「管理员和普通用户」不叫基于角色的访问控制。该问的是:角色能否按数据域限定(该团队只见自己的数据)、按动作限定(查看、导出、管理),以及按 AI 特有能力限定——因为在 AI 产品里,模型访问本身就是一类访问权限。谁能创建或编辑提示词?谁能把新的数据源接进模型?谁能导出对话历史?一个所有用户都能把任意数据源挂到任意查询上的产品,实际上让每个用户都成了数据管理员——无论市场材料里的 RBAC 页写了什么。
审计日志。日志标准与任何严肃安全项目相同:可还原性——谁、在何时、从哪里、对哪份数据做了什么,覆盖认证事件、数据访问、导出、管理变更与模型交互。要问清日志存在哪里、保留多久、能否流式接入您自己的 SIEM、是否不可篡改。如果日志保留期短于您的事故调查周期,您是在用自家取证能力为厂商省存储费。
泄露历史、事件响应与厂商存续能力
安全问卷惯于问「你们是否发生过泄露」,也惯于收到表格设计者想收到的答案。更好的问题才有更好的信号。请厂商概述过去 24 个月的安全事件,包括未遂事件与负责任披露报告——能坦然讨论事故的厂商,有事故文化;对一切都回答「没有」的厂商,只有表格文化。要确认通报时限与您的监管时钟对齐:按香港数据保护预期与 2026 年的合同惯例,厂商对您的通知必须快到让您能履行自己的下游义务——24 至 72 小时是值得写进合同的合理区间。
事件响应成熟度体现在细节里:是否有具名的安全负责人、经过演练的响应预案、漏洞赏金或外部渗透测试计划(并附可供查阅的摘要报告),以及 SOC 2 Type II 或 ISO 27001 认证——且报告或适用性声明可供实际查阅,而不只是被引用。证书本身不如您阅读证书背后内容的权利重要。针对 AI 特有的事件类别,还要问厂商如何处理模型滥用举报(其产品被用于欺诈或造假)与模型失效报告——一个对自己模型出错毫无预案的 AI 厂商,对自己产品的思考深度远不及您对风险的思考深度。
厂商存续能力补全最后一块拼图,因为 AI 工具领域增长最快的风险不是入侵而是弃守:一家拿了融资的初创转型、宣布弃用产品,您的数据和工作流就留在一个正在清算的平台上。IBM(2025)关于供应链的结论在这里要换个读法——代价最高的第三方风险不一定入侵,有时是托管权的丧失。要求您能合理获取的财务稳健性指标、机器可读格式的数据导出保证,以及对小厂商的源代码或数据托管谈话。如果答案开始含糊,那本身也是信号。
评分表:把答复变成决策
问卷产出文本,评分表产出决策。权重按「失守时的爆炸半径」分配,而非按「是否容易验证」。下表权重对应接触敏感内部数据的工具的常见企业姿态——请按自身情境调整,但训练用途与数据驻留应始终是权重最高的两项,因为它们是事后最难补救的。
| 评估域 | 权重 | 5 分——强 | 3 分——可接受 | 1 分——不通过 |
|---|---|---|---|---|
| 您数据的训练用途 | 25% | 合同约定不训练、租户隔离、已验证 | 默认不训练、可退出 | 默认用于训练,或答复含糊 |
| 数据驻留与留存 | 20% | 区域写进合同;按数据类型写明天数 | 仅政策文档写明区域;留存答复不完整 | 无区域承诺;「必要期限」 |
| 子处理者 | 15% | 完整清单、30 天变更通知、义务下传 | 提供清单;无变更通知权 | 无法列明链条 |
| SSO / RBAC | 15% | 您的档位含 SAML/OIDC+SCIM;AI 专属角色限定 | 有 SSO;仅两级角色 | 共享凭证访问;无角色模型 |
| 审计日志 | 10% | 不可篡改、可接入 SIEM、保留期覆盖调查周期 | 日志可导出;保留期有限 | 日志仅厂商可见或缺失 |
| 事件响应 | 10% | 已演练预案、合同约定 24–72 小时通报、证据可查阅 | 有预案;通报时限未约定 | 无具名负责人;一概回答「没有」 |
| 厂商存续能力 | 5% | 托管/导出保证;资金可持续 | 有导出文档;稳健性无法验证 | 无导出承诺 |
再给两条表格装不下的评分规则。第一,任何单一评估域得 1 分,整体结论封顶为「仅限试点且须补偿控制」或「拒绝」——一个训练用途条款没谈清楚的好产品,依然是没谈清楚。第二,每一步都以证据压倒陈述:一份政策 PDF 记 2 分,一条合同条款记 3 分,一次技术验证(您亲自查验日志、发起一次真实删除请求并跟踪到底)记 5 分。评分表最大的失灵是奖励口才好的厂商;验证是唯一的解药。
红旗信号、补偿控制与评估节奏
有些答案应该直接终结对话。从业者公认的红旗清单:拒绝或无法在合同中承诺不对您的数据进行训练;没有子处理者清单或变更通知权;留存期只用「必要期限」表述;您购买的档位不含 SSO 而工具又接触内部数据;您无法访问审计日志;宣称 SOC 2 但报告不可查阅;以及一切读起来像营销文案而非安全文档的答复模式。
并非每面红旗都要终结关系——有些应该重塑关系。对「想要但还不能完全信任」的厂商,补偿控制的套路是:用政策和网络控制把工具限定在非敏感数据域;禁用文件上传、把用途限定在结构化查询;跑在专属租户上,接入您的 SSO 与日志流;并设定一个与厂商补齐缺口挂钩的复评日期。把取舍写成书面、加上时限,交给想要这个工具的业务负责人——风险接受只有在具名责任人承担时才合法。
最后是节奏,因为评估结论会衰减。斯坦福 HAI(2025)记录了 AI 市场压力下模型与产品更替的速度;对一个行为可能月月变化的品类,年度问卷周期太慢。可操作的 2026 年节奏是:首次签约前全面评估;日志与配置持续自动化复查;每次收到通知即复核子处理者清单;每六个月对高权重域(训练用途、驻留、留存)做简化复评;产品重大变更、被收购或档位调整时全面复评。Gartner(2025)估计,随着 AI 采用深化,第三方事件将持续攀升——把供应商评估当作常设控制而非采购闸门的企业,才能抢在监管之前知道答案。