返回
Hybrid Deep-Ensemble Network with VAE-Based Augmentation for Imbalanced Tabular Data Classification
DOI:10.3390/app151910360.png)
摘要
En 中文
背景:严重的类别不平衡限制了制造、金融和医疗领域可靠的表格AI应用。
方法:我们构建了一个模块化流水线,包括相关性感知排序;混合卷积神经网络(CNN)-Transformer-双向长短期记忆(BiLSTM)编码器;基于变分自编码器(VAE)的少数类增强;以及深度/树集成头(XGBoost和SVM支持向量机)。我们在相同协议下对SMOTE和ADASYN进行了基准测试。根据数据集调整焦点损失和集成权重。主要指标为精确率-召回率曲线下面积(AUPRC),以受试者工作特征曲线下面积(ROC AUC)为补充指标。合成数据保真度通过训练于合成数据/测试于真实数据(TSTR)效用、双样本可区分性(真实与合成分类器的ROC AUC)和最大均值差异(MMD2)进行量化。
结果:在五个数据集(SECOM、CREDIT、THYROID、APS和UCI)上,增强方法与数据相关:VAE在APS上表现最佳(AUPRC提升3.66个百分点,优于SMOTE),在CREDIT上具有竞争力(AUPRC提升0.10个百分点,优于无增强);SMOTE在SECOM上占优;无增强方法在THYROID和UCI上表现最佳。位置嵌入(PE)与排序在存在强局部相关性时有所帮助。集成方法通常偏好XGBoost,同时受益于混合编码器。效率分析和精简变体支持低延迟应用。
结论:出现了一种数据感知策略:当保真度高时优先选择VAE,在更平滑的少数类流形上使用SMOTE,当基线方法足够时无需增强;选择性应用PE/排序,并按数据集调整以实现稳健且可复现的部署。
Keyword:
imbalanced learning
variational autoencoder
ensemble learning
CNN-transformer-BiLSTM
focal loss
tabular data
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
A
IF:
2.5
论文数:
1.9K
被引数:
15.9W
机构
暂无机构信息
引用论文
Vibration-Based Anomaly Detection in Industrial Machines: A Comparison of Autoencoders and Latent Spaces基于振动的工业机器异常检测:自编码器与潜在空间的比较
Machines
IF0
The Precision-Recall Plot Is More Informative than the ROC Plot When Evaluating Binary Classifiers on Imbalanced Datasets在不平衡数据集上评估二元分类器时,精确召回率图比ROC图更具信息性
PLOS ONE
IF0
Gradient-based learning applied to document recognition基于梯度的学习在文档识别中的应用
PROCEEDINGS OF THE IEEE
IF25.9
CutMix: Regularization Strategy to Train Strong Classifiers With Localizable FeaturesCutMix: 训练具有可本地化特征的强分类器的正则化策略

