返回
Human realignment
DOI:10.1007/s10506-026-09517-6.png)
摘要
En 中文
近期人工智能的进展使得将法律决策委托给机器或通过AI辅助增强人类裁决成为可能。我们以经典规范冲突——电车难题及类似道德两难问题——作为概念验证,考察了AI法律推理与人类判断的契合度。在基线实验中,我们发现GPT做出的决策与人类被试之间存在显著差异。这种错位对AI驱动的法律决策辅助工具提出了实质性担忧。我们研究了明确的规范指导是否能解决这种错位,但结果不一。GPT-3.5易受此类干预影响,但在面对道德两难时频繁拒绝做决策;GPT-4完全功利主义,实质上忽视以义务论为基础的指令;GPT-o3-mini忠实地执行该指令,但在被要求权衡义务论与功利主义考量时表现出不愿。我们用来自不同供应商的四款大型语言模型(LLM)重复了该实验。Claude-sonnet-4.6的回应最接近人类被试;Gemini-2.5-flash-lite对规范指令最为敏感;Llama-4-scout和Mistral-nemo存在强烈的功利主义偏见,且对规范干预反应不显著。至少在目前看来,明确的规范指令尚不足以完全使AI建议与公众或代其决策的立法者的规范信念重新对齐。
Keyword:
Large language models
Human-AI alignment
Rule of law
Moral dilemmas
Trolley problems
期刊
A
IF:
3.1
论文数:
58
被引数:
0

