返回
Synthetic Tabular Data Validation: A Divergence-Based Approach
DOI:10.1109/ACCESS.2024.3434582.png)
摘要
En 中文
在使用表格数据的各个领域中,生成模型的使用不断增加,这凸显了对强大且标准化的验证指标的需求,以评估真实数据和合成数据之间的相似性。当前的方法缺乏统一的框架,并且依赖于多种多样且通常不确定的统计度量。差异量化了数据分布之间的差异,为验证提供了一个有希望的途径。然而,由于联合分布建模的复杂性,传统方法针对每个特征独立地计算散度。本文通过提出一种新颖的方法来解决这一挑战,该方法使用散度估计来克服边际比较的局限性。我们的核心贡献在于应用散度估计器来建立考虑真实数据和合成数据的联合分布的验证指标。我们利用概率分类器来近似数据集之间的密度比,从而可以捕获复杂的关系。我们专门计算了两个散度: 众所周知的Kullback-Leibler (KL) 散度和jensen-shannon (JS) 散度。KL divergence在该领域提供了一个既定的用途,而JS divergence是对称的和有界的,提供了一个可靠的度量。通过一系列具有不同分布复杂性的实验证明了这种方法的有效性。初始阶段涉及将估计的散度与简单分布的解析解进行比较,从而为准确性设定基准。最后,我们在真实世界的数据集及其相应的合成对应物上验证了我们的方法,展示了其在实际应用中的有效性。这项研究提供了一个重要的贡献,其适用性超出了表格数据,并有可能改善各个领域的综合数据验证。
Keyword:
Synthetic data
Measurement
Probabilistic logic
Estimation
Accuracy
Complexity theory
Reviews
Divergence
Kullback-Leibler
Jensen-Shannon
synthetic data generation
tabular data
validation
density ratio
期刊
IF:
3.6
论文数:
9.8W
被引数:
29.4W
机构
引用论文
Generating high-fidelity synthetic patient data for assessing machine learning healthcare software
NPJ DIGITAL MEDICINE
IF15.1
Effect of age as a continuous variable on survival outcomes and treatment selection in patients with extranodal nasal-type NK/T-cell lymphoma from the China Lymphoma Collaborative Group (CLCG)
AGING-US
IF3.9

