arrow
返回

Interactive Groupwise Comparison for Reinforcement Learning from Human Feedback

delete2025-11-01
delete0
delete
OA
AI
J
Jan Kompatscher *
D
Danqing Shi
G
Giovanna Varni
T
Tino Weinkauf
A
Antti Oulasvirta
DOI:10.1111/cgf.70290delete
delete原文链接
delete分享
delete收藏
查看原文
摘要

摘要

En 中文
强化学习人类反馈(RLHF)已成为使AI行为与人类偏好对齐的关键使能技术。在RLHF中收集数据的传统方式是通过成对比较:人类评估者被要求指出他们更偏好两个样本中的哪一个。我们提出了一种交互式可视化方法,能更充分地利用人类的视觉能力来比较和探索整个样本组。该界面包含两个关联视图:1)一个探索视图,展示所有采样行为的上下文概览,这些行为按层次聚类结构组织;2)一个比较视图,用于用户查询时显示两组选定的行为。用户可以通过在这两个视图之间迭代,高效地探索大型行为集。此外,我们设计了一种主动学习的方法,用于建议比较组。正如我们在六个模拟机器人任务中的评估所示,我们的方法将最终奖励提高了69.34%,并降低了错误率、改善了策略。我们开源了代码,该代码可以轻松集成到RLHF训练循环中,以支持人类-AI对齐的研究。
Keyword:
interaction
human-computer interfaces,visualisation
visual analytics
AI总结

AI总结

对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。

期刊

Computer Graphics Forum 封面图
Computer Graphics Forum
IF:
2.9
论文数:
562
被引数:
1.1W

机构

A
Aalto University
学者数:
1.6W
论文数: 1.5W
被引数: 2.1W
U
university of trento
学者数:
1.8K
论文数: 940
被引数: 0
R
royal institute of technology
学者数:
1.1K
论文数: 554
被引数: 0
学者 查看更多机构
引用论文

引用论文

err
IF0
err
err0
PREAI
err
err分享
err收藏
Active reward learning with a novel acquisition function
err2015-07-16
err39
PREAI
errDaniel, Christian; Kroemer, Oliver; Viering, Malte; Metz, Jan; Peters, Jan
err分享
err收藏
err分享
err收藏
err分享
err收藏
LifeFlow
err2011-05-07
err0
PREAI
errKrist Wongsuphasawat; John Alexis Guerra Gómez; Catherine Plaisant; Taowei David Wang; Meirav Taieb-Maimon; Ben Shneiderman
err分享
err收藏
Scalable Class-Centric Visual Interactive Labeling可扩展的面向类别的视觉交互式标注
err2025-06-01
err0
PREAI
errMatt,Matthias; Sedlakova,Jana; Bernard,Jürgen; Zeppelzauer,Matthias; Waldner,Manuela
err分享
err收藏
GestureAnalyzer
err2014-10-04
err0
PREAI
errSujin Jang; Niklas Elmqvist; Karthik Ramani
err分享
err收藏
学者 查看更多内容