返回
Prospect utility with hyperbolic tangent function
DOI:10.1016/j.ijar.2025.109440.png)
摘要
En 中文
强化学习中的安全领域的一个分支是通过在马尔可夫决策过程(Markov Decision Process)框架内整合风险敏感性来实现。其目标是减轻可能导致严重负面结果的小概率事件。消除此类风险事件通常通过在预期回报上引入效用函数来实现;因此,根据不同结果的风险水平重塑奖励结构。时序差分学习(temporal difference learning)算法可以通过引入效用函数来捕捉风险。值得注意的是,此类效用函数根据期望的风险行为而呈现凸性或凹性。给定结果空间,并且根据风险敏感性模式,凹性效用可能促进风险规避行为,而凸性效用可能鼓励风险寻求策略。这种函数结构在前景理论(Prospect Theory)中得到展示,这促使了一种使用双曲正切函数(hyperbolic tangent function)的新颖形式化,称为PTanh。使用PTanh,进行了实验以评估边际递减属性对风险规避策略的影响。结论表明,边际与选择风险规避参数之间存在相关性。边际影响规避策略的有效性。当考虑边际时,PTanh在平均奖励与禁止状态率之比方面能表现出更优的结果。此外,通过实证证据表明,使用PTanh展示的策略实验可推广到前景形状(Prospect Shape)的其他效用。
Keyword:
Risk-sensitivity
Reliability and risk analysis
Reinforcement learning
Temporal difference
Prospect theory utility function
Hyperbolic tangent function
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
IF:
3
论文数:
3.0K
被引数:
5.1K
机构
引用论文
没有更多内容

