返回
Miss-Triggered Content Cache Replacement Under Partial Observability: Transformer-Decoder Q-Learning
DOI:10.3390/math13193217.png)
摘要
En 中文
内容分发网络(CDNs)面临持续上升且不均衡的需求,对启发式缓存替换算法造成压力。强化学习(RL)具有前景,但大多数研究假设完全可观测的马尔可夫决策过程(MDP),在延迟、部分和噪声信号下并不现实。我们将缓存替换建模为部分可观测马尔可夫决策过程(POMDP),并提出基于Miss触发的缓存Transformer(MTCT)——一种采用自注意力编码近期历史的Transformer解码器Q学习代理。MTCT仅在缓存未命中时调用其策略,以使计算与信息性事件对齐,并使用延迟命中奖励来传递命中信息。一个紧凑的基于排名的动作集(默认12个动作)能够捕捉流行度-新颖度权衡,其复杂度与缓存容量无关。我们在真实数据集(MovieLens)和两个合成工作负载(Mandelbrot-Zipf、Pareto)上对MTCT进行评估,对比自适应替换缓存(ARC)、窗口化TinyLFU(W-TinyLFU)、经典启发式算法和双重深度Q网络(DDQN)。MTCT在大多数缓存大小下达到最佳或统计上相当的缓存命中率;例如,在MovieLens上M=600时,其命中率为0.4703(DDQN为0.4436,ARC为0.4513)。Miss触发的推理也降低了每轮训练的平均挂钟时间;Transformer推理非常适合现代硬件加速。消融实验支持CL=50,表明更精细的动作网格可提高稳定性和最终精度。
Keyword:
deep reinforcement learning
content cache replacement
transformer
POMDP
cache replacement
期刊
IF:
2.2
论文数:
2.9K
被引数:
3.6W
机构
引用论文
Multi-Agent Deep Reinforcement Learning for Cooperative Edge Caching via Hybrid Communication基于混合通信的多智能体深度强化学习协同边缘缓存
Innovative edge caching: A multi-agent deep reinforcement learning approach for cooperative replacement strategies创新性边缘缓存:一种用于合作替换策略的多智能体深度强化学习方法

