arrow
返回

Prospect utility with hyperbolic tangent function

delete2025-05-30
delete0
delete
OA
AI
P
Patrick Adjei
S
Santiago Gomez-Rosero *
M
Miriam A. M. Capretz
DOI:10.1016/j.ijar.2025.109440delete
delete原文链接
delete分享
delete收藏
查看原文
摘要

摘要

En 中文
强化学习中的安全领域的一个分支是通过在马尔可夫决策过程(Markov Decision Process)框架内整合风险敏感性来实现。其目标是减轻可能导致严重负面结果的小概率事件。消除此类风险事件通常通过在预期回报上引入效用函数来实现;因此,根据不同结果的风险水平重塑奖励结构。时序差分学习(temporal difference learning)算法可以通过引入效用函数来捕捉风险。值得注意的是,此类效用函数根据期望的风险行为而呈现凸性或凹性。给定结果空间,并且根据风险敏感性模式,凹性效用可能促进风险规避行为,而凸性效用可能鼓励风险寻求策略。这种函数结构在前景理论(Prospect Theory)中得到展示,这促使了一种使用双曲正切函数(hyperbolic tangent function)的新颖形式化,称为PTanh。使用PTanh,进行了实验以评估边际递减属性对风险规避策略的影响。结论表明,边际与选择风险规避参数之间存在相关性。边际影响规避策略的有效性。当考虑边际时,PTanh在平均奖励与禁止状态率之比方面能表现出更优的结果。此外,通过实证证据表明,使用PTanh展示的策略实验可推广到前景形状(Prospect Shape)的其他效用。
Keyword:
Risk-sensitivity
Reliability and risk analysis
Reinforcement learning
Temporal difference
Prospect theory utility function
Hyperbolic tangent function
AI总结

AI总结

对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。

期刊

International Journal of Approximate Reasoning 封面图
International Journal of Approximate Reasoning
IF:
3
论文数:
3.0K
被引数:
5.1K

机构

W
Western Univ
学者数:
1.0K
论文数: 838
被引数: 162
引用论文

引用论文

err分享
err收藏
err分享
err收藏
Human-level control through deep reinforcement learning通过深度强化学习实现人类层面的控制
err2015-02-25
err0
PREAI
errVolodymyr Mnih; Koray Kavukcuoglu; David Silver; Andrei A. Rusu; Joel Veness; Marc G. Bellemare; Alex Graves; Martin Riedmiller; Andreas K. Fidjeland; Georg Ostrovski; Stig Petersen; Charles Beattie; Amir Sadik; Ioannis Antonoglou; Helen King; Dharshan Kumaran; Daan Wierstra; Shane Legg; Demis Hassabis
err分享
err收藏
Risk-sensitive reinforcement learning
err2002-01-01
err175
errOAAI
errMihatsch, O; Neuneier, R
err分享
err收藏
Risk-Sensitive Markov Decision Processes
err1972-03-01
err0
PREAI
errRonald A. Howard; James E. Matheson
err分享
err收藏
err分享
err收藏
没有更多内容