FDE 项目的数据安全、权限与合规
企业 AI 项目从数据分类、供应商评估、自动化决策到生成内容标识的实操检查框架,附中国现行权威来源。
先说结论
安全合规不是“数据不出境”或“加一个人工审核”就结束。FDE 至少要回答五个问题:
- 处理什么数据,目的和必要性是什么?
- 数据会经过哪些系统、模型、地区和子处理者?
- 谁能访问、修改、导出和删除?
- 模型出错、越权或被攻击时如何发现和止损?
- 适用哪些行业、地区和公司制度,谁做最终法律判断?
重要说明:本页是项目检查框架,不构成法律意见。法规适用取决于服务对象、部署地区、数据类型、行业和具体功能。高风险项目应由法务、隐私、安全和业务负责人共同审查。内容核验日期:2026-08-05。
一、先画清数据流
不要从“选哪个模型”开始。先画一张数据流图,标出:
- 数据来源、字段、主体和业务目的
- 是否包含个人信息、敏感个人信息、商业秘密或重要数据
- 数据进入模型前做了什么清洗、脱敏或匿名化
- 模型供应商、云服务商、插件、日志和监控分别能看到什么
- 数据存储地区、保留期限、备份位置和删除方式
- 输出会写回哪个系统,由谁使用,是否影响个人权益
如果连数据流都画不清,就无法可靠回答“是否出境”“谁能访问”或“供应商是否会留存”。
二、中国场景下的四类重点规则
1. 个人信息与自动化决策
《个人信息保护法》要求个人信息处理具有明确、合理目的,并与目的直接相关;涉及自动化决策时,还要求透明、公平、公正。对个人权益有重大影响的决定,个人有权要求说明,并有权拒绝仅通过自动化决策作出决定。
对招聘筛选、授信、保险定价、员工考核等功能,项目至少应设计:
- 明确告知处理目的、主要逻辑和影响
- 非必要字段不进入模型,敏感字段单独评估
- 对不同群体进行差异影响和误差检查
- 提供人工渠道、解释渠道和异议处理流程
- 保存模型版本、输入依据、输出、人工修改和最终决定
权威原文:《中华人民共和国个人信息保护法》。
2. 数据跨境不是简单的“一律禁止”
敏感数据优先采用可控的数据位置和处理方案是稳妥的工程原则,但“数据不得出境”不是所有企业 AI 项目的统一法律结论。
2024 年《促进和规范数据跨境流动规定》根据数据类型、处理者身份、数量和业务情形,规定了免予申报、安全评估、个人信息出境标准合同或认证等不同路径。项目必须先确认:
- 是否真的发生向境外提供数据
- 是否包含个人信息、敏感个人信息或重要数据
- 是否属于关键信息基础设施运营者
- 数量门槛和例外情形如何适用
- 自贸区负面清单或行业规则是否相关
权威原文:国家网信办《促进和规范数据跨境流动规定》。
3. 面向公众的生成式 AI 服务
如果项目向中国境内公众提供生成文本、图片、音频或视频的服务,应进一步判断《生成式人工智能服务管理暂行办法》等规则是否适用。内部研发、纯企业内部使用和面向公众服务的合规边界不能混为一谈。
需要关注的事项包括训练数据与知识产权、个人信息、投诉举报、违法内容处置、安全评估或算法备案等。具体义务应由法务结合服务形态判断。
权威原文:《生成式人工智能服务管理暂行办法》。
4. 生成合成内容标识
《人工智能生成合成内容标识办法》和强制性国家标准 GB 45438-2025 已于 2025 年 9 月 1 日实施。面向公众提供或传播 AI 生成合成内容时,需要核对显式标识、文件元数据中的隐式标识、用户声明和传播平台核验等要求。
营销内容流水线、图片/视频生成、公开问答和内容发布工具不能只写“遵守平台规则”,还要把标识能力纳入产品设计和导出流程。
权威原文:《人工智能生成合成内容标识办法》、GB 45438-2025 标准信息。
三、供应商与模型评估清单
采购或接入外部模型前,不要只问“数据是否用于训练”。至少确认:
| 维度 | 必问问题 |
|---|---|
| 数据使用 | 输入、输出、反馈和日志是否用于训练或产品改进?能否关闭? |
| 保留与删除 | 默认保留多久?备份何时删除?能否响应删除请求? |
| 数据位置 | 请求、日志、备份和支持人员分别在哪些地区? |
| 子处理者 | 还会经过哪些云、监控、审核或支持供应商? |
| 身份权限 | 是否支持 SSO、角色权限、服务账号和细粒度审计? |
| 安全能力 | 加密、密钥管理、漏洞响应、渗透测试和安全认证情况如何? |
| 模型变更 | 模型或安全策略升级是否通知?能否固定版本和回滚? |
| 退出机制 | 如何批量导出配置、评测集、日志和业务数据? |
| 事故责任 | 通知时限、支持级别、责任边界和赔偿约定是什么? |
供应商的“企业版”“不训练”或认证标识不能替代合同审查和实际架构验证。
四、AI 应用特有的安全测试
传统 Web 安全仍然适用,此外还要测试:
- 提示注入:文档、网页或用户输入能否诱导模型泄露指令或执行越权操作
- 越权检索:用户能否通过问法变化看到不属于自己的文档片段
- 工具越权:Agent 是否能绕过审批发送邮件、修改数据或触发付款
- 敏感信息泄露:输出、日志、错误信息和观测平台是否暴露秘密
- 不可靠输出:无依据回答、错误引用、错误计算和过度自信如何检测
- 模型变化:供应商升级模型后,关键任务是否出现回归
- 资源滥用:超长输入、循环调用和批量请求是否造成异常费用或拒绝服务
测试不能只用“正常问题”。要包含恶意输入、边界样本、权限切换、过期数据和供应商故障。
五、上线前最低控制线
- 数据流图、数据清单和处理目的已经确认
- 适用法律、行业规则与公司制度已有负责人判断
- 权限采用最小授权,生产与测试环境隔离
- 密钥不进入代码、Prompt、前端或普通日志
- 高风险动作有确定性校验、审批或人工复核
- 建立代表性评测集,并包含安全与公平性测试
- 日志能够回答“谁在何时用什么版本做了什么”
- 有监控、费用上限、熔断、降级和回滚方案
- 用户知道 AI 的能力边界、反馈方式和人工入口
- 数据删除、供应商退出和项目终止流程可执行
六、按场景增加控制
| 场景 | 额外重点 |
|---|---|
| 企业知识库 | 文档级权限继承、引用、过期内容、离职权限回收 |
| 招聘与 HR | 自动化决策说明、差异影响、异议渠道、简历保留期限 |
| 财务与采购 | 确定性规则复核、双人审批、金额与账户字段校验 |
| 法务与合规 | 律师复核、适用法域、版本日期、保密与法律责任声明 |
| 客服 | 身份验证、敏感操作转人工、对外承诺和投诉升级 |
| 营销内容 | 事实核验、版权、肖像与商标、生成合成内容标识 |
| 研发 Agent | 仓库最小权限、依赖与密钥扫描、沙箱、代码评审 |