把指南转化为安全试用流程
在使用真实数据前,请先用合成示例完成这些步骤。勾选状态只保留在当前标签页。
先定义缺失值的语言
空单元格、NA、null、短横线和零不能互换。应逐字段记录源系统导出规则、问卷跳题逻辑以及是否真正必填。
NA 在一个数据集中可能表示不适用,在另一个数据集中可能是有效代码;脱离语境替换会静默破坏数据。
- 逐字段定义缺失标记。
- 区分零与不存在。
- 记录源系统版本。
正确解析 CSV,而不是相信视觉形状
带引号的逗号、转义引号和嵌入换行会破坏 split(',')。预检应处理引号、要求唯一表头,并在字段未闭合时明确停止。
对大文件抽样时要披露覆盖范围、选行方法和限制;样本干净不能证明全量数据干净。
从列缺失率走向共同缺失模式
某列百分之十为空并不能解释原因。城市和年龄在同一批行中同时缺失,可能指向特定来源渠道或条件表单步骤。
结合日期、来源和分群调查模式,同时避免不必要复制个人数据;因果结论仍需审查采集流程与抽样偏差。
把数据字典当作持续更新的契约
每个字段都需要名称、类型、单位、用途、敏感性、来源、负责人和保留规则。‘用于分析’过于宽泛,应写明该字段支持的决策或指标。
重复名称、无限期保留和无人负责的派生字段应进入发布门禁,并与代码、报告和隐私清单同步版本。
填补之前先记录不确定性
均值、中位数或众数填补可能改变分布和关联。完全随机缺失、受已观测变量影响的缺失和流程驱动缺失需要不同方法。
工具只展示缺失位置和模式;领域负责人决定填补、排除或重新采集,并保留原始值、方法、日期和回滚路径。
- 绝不覆盖原始数据。
- 报告不确定性影响。
- 以可复现方式记录决策。
本指南配套工具
下列工具为同一决策提供不同证据。请结合真实环境、合同或权威来源分别核验每项输出;先用合成数据复现流程,再记录人工验收标准与停止条件。
- CSV 缺失数据模式分析器
- 数据字段字典生成器
- CSV 列分析器
- 数据最小化决策矩阵
把指南转化为可重复的检查流程
请使用这套包含 4 个工具的检查计划来落实《理解 CSV 缺失数据并建立可审计的数据字典》。目标:深入指南:通过正确解析、数据字典、数据最小化和人工审批评估 CSV 缺失情况。 请先用安全示例代替真实数据,并记录每一步的预期结果与验收决定。
CSV 缺失数据模式分析器
- 准备
- CSV 缺失数据模式分析器的输入应为模式、标志,以及有代表性的匹配与不匹配文本。本次处理目标是:同时分析列和行的缺失模式,而不只是统计空值。处理敏感真实数据前,请先用合成示例确认格式。
- 执行
- 运行设备端处理。CSV 缺失数据模式分析器为实现“同时分析列和行的缺失模式,而不只是统计空值”采用以下可解释方法:模式仅在受限输入上运行,并显示匹配结果与风险信号。
- 验收检查
- 验收检查:接受CSV 缺失数据模式分析器的结果前,请完成使用正例、反例、空值、长文本和对抗性边界案例重新测试;核验证据应与“同时分析列和行的缺失模式,而不只是统计空值”这一目标一致。CSV 缺失数据模式分析器的使用边界:请在目标系统核验架构、编码和数据丢失假设。
- 预期输出
- CSV 缺失数据模式分析器完成后会提供匹配位置、捕获组以及需要复核的复杂度信号,并围绕“同时分析列和行的缺失模式,而不只是统计空值”组织结果。. 同时分析列和行的缺失模式,而不只是统计空值。
数据字段字典生成器
- 准备
- 数据字段字典生成器的输入应为符合工具字段说明且不含不必要个人数据的内容。本次处理目标是:将字段名、类型、用途、敏感性、来源和保留期整合为可审计字典。处理敏感真实数据前,请先用合成示例确认格式。
- 执行
- 运行设备端处理。数据字段字典生成器为实现“将字段名、类型、用途、敏感性、来源和保留期整合为可审计字典”采用以下可解释方法:输入依据公开规则进行结构化,未经用户操作不会发送到外部系统。
- 验收检查
- 验收检查:接受数据字段字典生成器的结果前,请完成人工检查必填字段、日期和数值、受众适配以及任何正式要求;核验证据应与“将字段名、类型、用途、敏感性、来源和保留期整合为可审计字典”这一目标一致。数据字段字典生成器的使用边界:请在目标系统核验架构、编码和数据丢失假设。
- 预期输出
- 数据字段字典生成器完成后会提供可编辑草稿、字段摘要和明确的下一步操作,并围绕“将字段名、类型、用途、敏感性、来源和保留期整合为可审计字典”组织结果。. 将字段名、类型、用途、敏感性、来源和保留期整合为可审计字典。
CSV 列分析器
- 准备
- CSV 列分析器的输入应为表头和行结构一致的 CSV、TSV、表格或分隔记录。本次处理目标是:在本地汇总列类型、缺失值、唯一性、范围与样本分布。处理敏感真实数据前,请先用合成示例确认格式。
- 执行
- 运行设备端处理。CSV 列分析器为实现“在本地汇总列类型、缺失值、唯一性、范围与样本分布”采用以下可解释方法:分隔符、引号、行边界和列边界会分别检查。
- 验收检查
- 验收检查:接受CSV 列分析器的结果前,请完成核对表头数量、行宽、引号转义,并在目标表格中打开代表性记录;核验证据应与“在本地汇总列类型、缺失值、唯一性、范围与样本分布”这一目标一致。CSV 列分析器的使用边界:请在目标系统核验架构、编码和数据丢失假设。
- 预期输出
- CSV 列分析器完成后会提供行列统计、规范化记录以及问题单元格位置,并围绕“在本地汇总列类型、缺失值、唯一性、范围与样本分布”组织结果。. 在本地汇总列类型、缺失值、唯一性、范围与样本分布。
数据最小化决策矩阵
- 准备
- 数据最小化决策矩阵的输入应为节、键和值结构有效的 INI / properties 文本。本次处理目标是:按目的、必要性、保留期与替代方案分类保留、删除或复核。处理敏感真实数据前,请先用合成示例确认格式。
- 执行
- 运行设备端处理。数据最小化决策矩阵为实现“按目的、必要性、保留期与替代方案分类保留、删除或复核”采用以下可解释方法:解析采用确定性规则,并保留字段与类型边界。
- 验收检查
- 验收检查:接受数据最小化决策矩阵的结果前,请完成将字段名、值类型、转义以及空值或 null 与源数据逐项比较;核验证据应与“按目的、必要性、保留期与替代方案分类保留、删除或复核”这一目标一致。数据最小化决策矩阵的使用边界:这只是预检查,不保证身份、安全或法规合规。
- 预期输出
- 数据最小化决策矩阵完成后会提供解析后的结构、字段指标和明确的语法问题,并围绕“按目的、必要性、保留期与替代方案分类保留、删除或复核”组织结果。. 按目的、必要性、保留期与替代方案分类保留、删除或复核。
CSV 缺失数据模式分析器适用以下边界:CSV 缺失数据模式分析器的使用边界:请在目标系统核验架构、编码和数据丢失假设。 如果未满足该条件,请勿把输出传递到工作流的下一步。
落实《理解 CSV 缺失数据并建立可审计的数据字典》时,请记录工具名称、所选设置、浏览器版本,以及“使用CSV 缺失数据模式分析器完成:同时分析列和行的缺失模式,而不只是统计空值”的接受或拒绝理由,而不是敏感内容。这样既能重复检查,也不会复制真实数据。