返回
Data Augmentation for Text Classification Using Autoencoders
DOI:10.1109/ACCESS.2025.3610157.png)
摘要
En 中文
深度学习模型极大地提升了各种自然语言处理任务的性能。然而,其有效性依赖于大规模数据集,而获取这些数据集可能较为困难。为缓解这一挑战,数据增强技术被用于通过生成合成样本人工扩充训练数据。通过丰富数据集,数据增强能增强模型泛化能力、减少过拟合并提升模型性能。本文研究了使用自编码器进行文本数据增强以提高文本分类模型性能的有效性。研究比较了四种类型的自编码器,即传统自编码器(AE)、对抗自编码器(AAE)、去噪对抗自编码器(DAAE)和变分自编码器(VAE)。对所有文档应用了基本文本预处理技术,包括小写转换、非字母数字字符移除和停用词移除。此外,还应用了基于标签的过滤,其中与BERT预测相矛盾的自动编码器输出被剔除。实验使用SST-2情感分类数据集进行,该数据集包含7,791个训练样本和1,821个测试样本。为更深入分析数据增强方法的影响,实验还针对包含100、200、400和1,000个样本的较小子集进行。对这些子集的数据增强采用1:1、1:2和1:4的比例。结果表明,基于AE的数据增强方法,特别是在1:1比例下,其准确率优于基线模型。这凸显了自编码器在提升NLP任务中文本分类结果方面的潜力。
Keyword:
Autoencoders
data augmentation
deep learning
text classification

