1
Return

Uncertainty-penalized reinforcement learning from human feedback with diversified reward LoRA ensembles

delete2025-12-10
delete0
PRE
AI
Y
Yuanzhao Zhai
Y
Yu Lei
H
Han Zhang
余月 cover
余月 (Yue Yu)
K
Kele Xu
D
Dawei Feng
B
Bo Ding
H
Huaimin Wang
DOI:10.1016/j.ipm.2025.104548delete
deleteOriginal
deleteOriginal request for help
deleteShare
deleteSave
Abstract

Abstract

En 中文
• Fine-tuning large language models to align with human preferences. • An uncertainty-aware reward modeling method utilizing diversified LoRA ensembles. • Uncertainty-penalized reinforcement learning from human feedback to mitigate overoptimization.

Journal

I
Information Processing and Management
IF:
6.9
Papers:
5.2K
Citations:
1.4W

Organization

N
National University of Defense Technology
Scholars:
3.3K
Papers: 1.0K
Citations: 8.2K
P
Peng Cheng Laboratory
Scholars:
1.7K
Papers: 1.7K
Citations: 2.0K
Cited Papers

Cited Papers

Citing Papers

Citing Papers