返回
Binary mask tuning on gradient: Towards multi-data question answering
DOI:10.1016/j.knosys.2025.113505.png)
摘要
En 中文
预训练语言模型已被广泛应用于问答任务。为在未见数据集上实现更好的泛化能力,先前的一些研究通常在多个数据集上训练单个模型。然而,由于不同数据集间的噪声和分布差异,模型在多个数据集上训练时倾向于过度调整其权重。这种偏离初始预训练状态的情况导致模型在特定数据上表现优异,但在其他数据集上过拟合。最终,模型丧失了对新数据的泛化能力。本文从约束模型权重的角度出发,提出了一种新颖的微调方法——二进制掩码调优(BMT)。我们采用一个精心设计的、与数据分布密切相关的二进制掩码向量,用于屏蔽反向传播产生的梯度,从而从巨大参数空间中实现对拟合数据所需子空间参数的精确对齐。该方法旨在通过更精准的微调来增强模型对数据分布的适应性并提高参数效率。我们的实验表明,BMT不仅有效缓解了模型过度调整权重的倾向,还在不同数据集的问答任务中更好地捕捉了跨数据集规律和特定数据集属性。
Keyword:
Multi-data fine-tuning
Question answering
Binary mask tuning
Few-shot transfer learning
期刊
K
IF:
7.6
论文数:
1.3W
被引数:
4.5W
机构
暂无机构信息

