arrow
返回

Binary mask tuning on gradient: Towards multi-data question answering

delete2025-06-01
delete0
PRE
AI
Z
Zhihua Wei *
P
Ping Zhu
苗
苗夺谦 (Duoqian Miao)
DOI:10.1016/j.knosys.2025.113505delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
预训练语言模型已被广泛应用于问答任务。为在未见数据集上实现更好的泛化能力,先前的一些研究通常在多个数据集上训练单个模型。然而,由于不同数据集间的噪声和分布差异,模型在多个数据集上训练时倾向于过度调整其权重。这种偏离初始预训练状态的情况导致模型在特定数据上表现优异,但在其他数据集上过拟合。最终,模型丧失了对新数据的泛化能力。本文从约束模型权重的角度出发,提出了一种新颖的微调方法——二进制掩码调优(BMT)。我们采用一个精心设计的、与数据分布密切相关的二进制掩码向量,用于屏蔽反向传播产生的梯度,从而从巨大参数空间中实现对拟合数据所需子空间参数的精确对齐。该方法旨在通过更精准的微调来增强模型对数据分布的适应性并提高参数效率。我们的实验表明,BMT不仅有效缓解了模型过度调整权重的倾向,还在不同数据集的问答任务中更好地捕捉了跨数据集规律和特定数据集属性。
Keyword:
Multi-data fine-tuning
Question answering
Binary mask tuning
Few-shot transfer learning

期刊

K
Knowledge-Based Systems
IF:
7.6
论文数:
1.3W
被引数:
4.5W

机构

暂无机构信息
引用论文

引用论文

err分享
err收藏
Adaptive weighted over-sampling for imbalanced datasets based on density peaks clustering with heuristic filtering
err2020-05-01
err0
PREAI
errXinmin Tao; Qing Li; Wenjie Guo; Chao Ren; Qing He; Rui Liu; JunRong Zou
err分享
err收藏
UNIFIEDQA: Crossing Format Boundaries with a Single QA System
err2020-01-01
err0
errOAAI
errDaniel Khashabi; Sewon Min; Tushar Khot; Ashish Sabharwal; Oyvind Tafjord; Peter Clark; Hannaneh Hajishirzi
err分享
err收藏
Transformers: State-of-the-Art Natural Language Processing
err2020-01-01
err0
errOAAI
errThomas Wolf; Lysandre Debut; Victor Sanh; Julien Chaumond; Clement Delangue; Anthony Moi; Pierric Cistac; Tim Rault; Remi Louf; Morgan Funtowicz; Joe Davison; Sam Shleifer; Patrick von Platen; Clara Ma; Yacine Jernite; Julien Plu; Canwen Xu; Teven Le Scao; Sylvain Gugger; Mariama Drame; Quentin Lhoest; Alexander Rush
err分享
err收藏
学者 查看更多内容