返回
Implicit-bias-like patterns in reasoning models
DOI:10.1038/s42256-026-01300-1.png)
摘要
En 中文
内隐偏见是指自动心理过程,这些过程塑造感知、判断和行为。尽管以往关于大型语言模型(LLMs)偏见的研究主要关注输出,但本研究引入了推理模型内隐联想测试(RM-IAT),用于研究推理模型(即在生成响应前生成明确逐步推理的LLMs)中的偏见样处理差异。通过将推理标记计数作为计算努力指数进行测量,RM-IAT捕捉到类似于人类IAT中反应时差异的处理效率差异。在四个模型(o3-mini、DeepSeek-R1、gpt-oss-20b和Qwen3-8B)中,我们发现一致的证据表明,与联想不一致的任务所需的计算努力大于与联想一致的任务。Claude 3.7 Sonnet表现出相反的模式,通过主题分析将其与其独特的内部推理焦点(关于偏见和刻板印象)联系起来。我们还发现了与模型输出的聚合效度证据。RM-IAT效应预测了两个已知能捕捉LLMs在词语联想和决策任务中偏见的任务中的偏见。综合这些发现表明,RM-IAT捕捉了推理模型处理刻板信息方式中的有意义变化,并且这种变化预测下游模型行为。Lee和Lai研究了大型语言推理模型中的偏见样处理差异,发现对于大多数模型,处理刻板信息所需的计算努力少于处理反刻板信息。
期刊
IF:
23.9
论文数:
1.3K
被引数:
1.5W

