返回
Pasteur: Scaling Privacy-Aware Data Synthesis
DOI:10.1007/978-3-032-05281-0_11.png)
摘要
En 中文
隐私感知数据合成是一个旨在通过生成镜像原始数据且不导致隐私泄露的合成数据来解放数据访问的领域。针对结构化数据的当前最先进算法在具有数百万行的表格数据集上表现良好,但在扩展到数亿行时会导致不可接受的运行时间。此外,由于数据的敏感性,实践者通常局限于单一服务器环境。本文介绍了框架Pasteur,旨在在单一服务器环境下线性扩展隐私感知数据合成。Pasteur通过针对合成的并行化方法、优化的内存表示以及加速的边际计算算法(隐私感知算法类中的瓶颈)实现了这一点。我们展示了Pasteur在16核CPU服务器上对包含10亿行(200 GB)的表格数据集进行预处理、合成和评估,耗时1小时。
Keyword:
Privacy-aware data synthesis
Synthetic data generation
Scalable algorithms
Memory optimization
Parallelization
期刊
A
IF:
0
论文数:
19
被引数:
0
机构
引用论文
PrivLava: Synthesizing Relational Data with Foreign Keys under Differential PrivacyPrivLava: 在差分隐私下合成具有外键的关系数据

