arrow
返回

Implicit-bias-like patterns in reasoning models

delete2026-09-01
delete0
PRE
AI
M
Messi Ho Jun Lee *
C
Calvin K. Lai
DOI:10.1038/s42256-026-01300-1delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
内隐偏见是指自动心理过程,这些过程塑造感知、判断和行为。尽管以往关于大型语言模型(LLMs)偏见的研究主要关注输出,但本研究引入了推理模型内隐联想测试(RM-IAT),用于研究推理模型(即在生成响应前生成明确逐步推理的LLMs)中的偏见样处理差异。通过将推理标记计数作为计算努力指数进行测量,RM-IAT捕捉到类似于人类IAT中反应时差异的处理效率差异。在四个模型(o3-mini、DeepSeek-R1、gpt-oss-20b和Qwen3-8B)中,我们发现一致的证据表明,与联想不一致的任务所需的计算努力大于与联想一致的任务。Claude 3.7 Sonnet表现出相反的模式,通过主题分析将其与其独特的内部推理焦点(关于偏见和刻板印象)联系起来。我们还发现了与模型输出的聚合效度证据。RM-IAT效应预测了两个已知能捕捉LLMs在词语联想和决策任务中偏见的任务中的偏见。综合这些发现表明,RM-IAT捕捉了推理模型处理刻板信息方式中的有意义变化,并且这种变化预测下游模型行为。Lee和Lai研究了大型语言推理模型中的偏见样处理差异,发现对于大多数模型,处理刻板信息所需的计算努力少于处理反刻板信息。

期刊

Nature Machine Intelligence 封面图
Nature Machine Intelligence
IF:
23.9
论文数:
1.3K
被引数:
1.5W

机构

W
Washington University in St. Louis
学者数:
1.0K
论文数: 425
被引数: 0
R
rutgers university
学者数:
1.4K
论文数: 821
被引数: 0
引用论文

引用论文

err分享
err收藏
Implicit Social Cognition内隐社会认知
err2020-01-04
err218
PREAI
errGreenwald, Anthony G.; Lai, Calvin K.
err分享
err收藏
err分享
err收藏
Implicit Bias and Policing
err2016-01-08
err0
PREAI
errKatherine B. Spencer; Amanda K. Charbonneau; Jack Glaser
err分享
err收藏
The Mythical Number Two
err2018-04-01
err247
PREAI
errMelnikoff, David E.; Bargh, John A.
err分享
err收藏
Fitting Linear Mixed-Effects Models Using lme4使用lme4拟合线性混合效应模型
err2015-01-01
err6.0W
errOAAI
errBates, Douglas; Maechler, Martin; Bolker, Benjamin M.; Walker, Steven C.
err分享
err收藏
学者 查看更多内容