新建合成任务
ε 越小隐私保护越强、可用性越低。重要级数据要求开启差分隐私且 ε ≤ 5。
同一时间只运行一个任务,其余任务排队。
任务列表
| 任务 | 数据集 | 级别 | 可用性 | 隐私安全 | 判定 |
|---|
点击任务查看详情
新建用户
用户列表
| 用户 | 部门 | 角色 | 状态 | 最近登录 | 操作 |
|---|
审计日志
| 序号 | 时间 | 操作人 | 操作 | 对象 | 详情 | 哈希 |
|---|
这套系统解决什么问题
研发人员需要用接近真实的数据开发模型,但生产数据含有大量个人信息和敏感业务信息,直接进入工作室或测试环境风险很高,审批周期也长。本系统在受控环境内学习真实数据的统计规律,生成不对应任何真实个人的合成数据,并用可量化的指标证明两件事:合成数据好不好用、合成数据会不会泄露真实信息,再按数据级别给出出区结论。
角色与权限
| 角色 | 可以做什么 |
|---|---|
| 系统管理员 | 管理用户(新建、改角色、停用、重置密码),以及其他全部操作 |
| 数据使用人 | 提交合成任务、查看和导出自己获准的任务 |
| 数据复核人 | 查看全部任务,审批“人工复核”任务(不能审批自己提交的) |
| 审计员 | 只读查看全部任务、报告和审计日志 |
工作流程
- 数据画像:自动识别身份证号、手机号、车牌、姓名等直接标识,以及准标识和表间关系。
- 合成:直接标识一律重新生成(虚构号段);其余字段用贝叶斯网络或高斯 Copula 学习分布与关联,保留保单与理赔的父子关系。可选差分隐私。
- 可用性评估:单列分布、列间关联、表间关系,以及“用合成数据训练、在真实留出数据上测试”的模型效果。
- 隐私风险评估:直接标识泄露、完全复制、最近记录距离、成员推断攻击、唯一准标识命中,全部与“从未参与合成”的留出数据基线对比。
- 出区判定:按一般、敏感、重要、核心四级策略给出“自动放行 / 人工复核 / 不予放行”。
- 审计:登录、用户管理、任务创建、查看、复核、导出全程记录,日志为哈希链结构,任何篡改都可被发现。
局限
演示数据为程序生成的模拟数据。差分隐私为原型实现的近似版本;隐私指标基于抽样和特定攻击模型,只能说明“在这些攻击下风险较低”;判定阈值为示例,应由数据安全归口部门审定后使用。