返回
Imputation classes for continuous incomplete data using semi-supervised cluster analysis
DOI:10.5351/KJAS.2026.39.1.035.png)
摘要
En 中文
由于各种原因,数据可能无法完全观测。当缺失数据机制为随机缺失时,可通过基于观测变量形成插补类来减少插补偏差。插补类可以利用其他观测变量生成,但当考虑大量变量时,插补类的数量会显著增加。为仅选择少量相关变量,已有建议利用基于树的算法创建插补类。然而,在处理高维数据时,这些技术仍可能导致插补类数量过多。因此,本研究提出采用半监督聚类算法形成插补类。基于生成数据和真实数据的模拟实验比较了所提技术与完全案例分析、不考虑插补类的插补方法以及利用基于树的算法的插补方法。模拟结果表明,所提方法相比其他方法能减少插补数据的偏差,并有效控制插补类的数量。
Keyword:
imputation
imputation class
clustering
semi-supervised algorithm

