PIIprivacycompliancerisk-assessmentdata-pipeline
PII 暴露风险评分卡:AI 管道自评估
一份包含 10 个评分风险因素的自评估评分卡,用于评估您的 AI 数据管道中的 PII 和 PHI 暴露情况。评估您的风险等级,在问题变成事故之前识别差距。
Edward Xi Yang
每个处理真实世界数据的 AI 管道都存在 PII 暴露风险。问题不在于您的管道是否处理个人身份信息——它几乎肯定在处理。问题在于您是否知道在哪里、有多少以及有哪些控制措施。
大多数团队以艰难的方式发现 PII 暴 露:合规审计、数据泄露或客户投诉。这份评分卡为您提供了一种结构化的方式,在这些事件迫使您采取行动之前评估您的风险。
该评估涵盖 10 个风险因素,每个因素从 1(最低风险)到 5(最高风险)评分。您的总分对应一个风险等级,并附有具体建议。整个评估需要 15 到 20 分钟,任何熟悉您数据管道架构的人都可以完成。
如何评分
对于以下 10 个风险因素中的每一个,阅读每个评分级别的描述,并选择最符合您当前情况的一个。请诚实——评分卡只有在反映现实而非愿望时才有用。
记录每个因素的评分,然后在最后汇总。
风险因素 1:数据源多样性
有多少不同的数据源为您的 AI 管道提供数据?
| 评分 | 描述 |
|---|---|
| 1 | 单一内部数据源,具有已知的数据模式 |
| 2 | 2-3 个内部数据源,格式一致 |
| 3 | 4-6 个数据源,内部和外部混合 |
| 4 | 7-15 个数据源,包括用户上传的内容 |
| 5 | 超过 15 个数据源,包括不受控的外部数据源 |
为什么重要: 每增加一个数据源,遇到意外 PII 的概率就会增加。用户上传的内容风险尤其高,因为您无法预测用户会包含什么个人信息。
风险因素 2:文档类型复杂性
您的管道处理哪些类型的文档?
| 评分 | 描述 |
|---|---|
| 1 | 仅结构化数据(数据库、具有定义模式的 API) |
| 2 | 结构化数据加干净的文本文件(CSV、JSON) |
| 3 | 结构化和半结构化的混合(PDF、Word 文档) |
| 4 | 非结构化文档,包括扫描的 PDF、带文字的图像 |
| 5 | 以上所有加上音频、视频或手写文档 |
为什么重要: PII 检测准确性在非结构化和扫描文档中显著下降。嵌入在图像或扫描质量差的 PDF 中的姓名、地址和身份证号码更难可靠地检测和编辑。