返回
Optimizing grid-interactive buildings demand response: Sequence-based decision-making multi-agent policy decomposition deep reinforcement learning
DOI:10.1016/j.enbuild.2025.116198.png)
摘要
En 中文
• 提出了一种新型多智能体强化学习框架。
• 该方法将价值分解与演员-评论家算法相结合。
• 明确引入了智能体之间的依赖关系。
• 通过逐个智能体的决策来优化建筑物之间的协作。
• 通过策略分解实现依赖关系下多智能体的分散执行。
Keyword:
multi-agent reinforcement learning
value decomposition
actor-critic algorithm
agent dependencies
policy decomposition

