arrow
返回

Adaptive Incentive Design With Learning Agents

delete2025-12-12
delete0
PRE
AI
C
Chinmay Maheshwari
K
Kshitij Kulkarni
M
Manxi Wu
S
Shankar Sastry
DOI:10.1109/TAC.2025.3643351delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
本文提出了一种自适应激励机制,用于在玩家持续更新策略的环境中学习最优激励。该机制基于每个玩家的外部性(定义为玩家边际成本与运营商边际成本在各时间步长的差异)来更新激励。所提出的机制与玩家的学习动态相比,采用较慢的时间尺度更新激励,形成了一个双时间尺度耦合的动态系统。值得注意的是,该机制对玩家用于更新策略的具体学习动态保持无差别。我们证明,该自适应激励机制的任何不动点对应于最优激励机制,确保纳什均衡与社会最优策略一致。此外,我们提供了自适应机制收敛到不动点的充分条件。我们的结果适用于原子和非原子博弈。为验证所提出机制的有效性,我们在两类具有实际相关性的博弈中验证了收敛条件:1)原子聚合博弈;2)非原子路由博弈。
Keyword:
Adaptive incentive design
dynamical systems
game theory

期刊

IEEE Transactions on Automatic Control 封面图
IEEE Transactions on Automatic Control
IF:
7
论文数:
1.3W
被引数:
6.7W

机构

U
university of california berkeley
学者数:
1.4K
论文数: 811
被引数: 0
 
 johns hopkins university
学者数:
3.9K
论文数: 1.5K
被引数: 0
引用论文

引用论文

err分享
err收藏
Stackelberg Population Learning Dynamics
err2022-12-06
err0
PREAI
errEduardo Mojica-Nava; Jorge I. Poveda; Nicanor Quijano
err分享
err收藏
Steering No-Regret Learners to a Desired Equilibrium
err2024-07-08
err0
PREAI
errZhang,Brian Hu; Farina,Gabriele; Anagnostides,Ioannis; Cacciamani,Federico; McAleer,Stephen; Haupt,Andreas; Celli,Andrea; Gatti,Nicola; Conitzer,Vincent; Sandholm,Tuomas
err分享
err收藏
err
IF0
err
err0
PREAI
err
err分享
err收藏
A stability criterion for two timescale stochastic approximation schemes
err2017-05-01
err14
PREAI
errLakshminarayanan, Chandrashekar; Bhatnagar, Shalabh
err分享
err收藏
Higher order game dynamics
err2013-11-01
err0
errOAAI
errRida Laraki; Panayotis Mertikopoulos
err分享
err收藏
学者 查看更多内容