arrow
返回

Miss-Triggered Content Cache Replacement Under Partial Observability: Transformer-Decoder Q-Learning

delete2025-10-07
delete0
PRE
AI
H
H J Kim
T
Teh-Jen Sun
E
Eui‐Nam Huh *
DOI:10.3390/math13193217delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
内容分发网络(CDNs)面临持续上升且不均衡的需求,对启发式缓存替换算法造成压力。强化学习(RL)具有前景,但大多数研究假设完全可观测的马尔可夫决策过程(MDP),在延迟、部分和噪声信号下并不现实。我们将缓存替换建模为部分可观测马尔可夫决策过程(POMDP),并提出基于Miss触发的缓存Transformer(MTCT)——一种采用自注意力编码近期历史的Transformer解码器Q学习代理。MTCT仅在缓存未命中时调用其策略,以使计算与信息性事件对齐,并使用延迟命中奖励来传递命中信息。一个紧凑的基于排名的动作集(默认12个动作)能够捕捉流行度-新颖度权衡,其复杂度与缓存容量无关。我们在真实数据集(MovieLens)和两个合成工作负载(Mandelbrot-Zipf、Pareto)上对MTCT进行评估,对比自适应替换缓存(ARC)、窗口化TinyLFU(W-TinyLFU)、经典启发式算法和双重深度Q网络(DDQN)。MTCT在大多数缓存大小下达到最佳或统计上相当的缓存命中率;例如,在MovieLens上M=600时,其命中率为0.4703(DDQN为0.4436,ARC为0.4513)。Miss触发的推理也降低了每轮训练的平均挂钟时间;Transformer推理非常适合现代硬件加速。消融实验支持CL=50,表明更精细的动作网格可提高稳定性和最终精度。
Keyword:
deep reinforcement learning
content cache replacement
transformer
POMDP
cache replacement

期刊

Mathematics 封面图
Mathematics
IF:
2.2
论文数:
2.9K
被引数:
3.6W

机构

K
Kyung Hee University
学者数:
3.2K
论文数: 1.3K
被引数: 639
引用论文

引用论文

err
IF0
err
err0
PREAI
err
err分享
err收藏
Adaptive Software Cache Management
err2018-11-26
err0
PREAI
errGil Einziger; Ohad Eytan; Roy Friedman; Ben Manes
err分享
err收藏
Human-level control through deep reinforcement learning通过深度强化学习实现人类层面的控制
err2015-02-25
err0
PREAI
errVolodymyr Mnih; Koray Kavukcuoglu; David Silver; Andrei A. Rusu; Joel Veness; Marc G. Bellemare; Alex Graves; Martin Riedmiller; Andreas K. Fidjeland; Georg Ostrovski; Stig Petersen; Charles Beattie; Amir Sadik; Ioannis Antonoglou; Helen King; Dharshan Kumaran; Daan Wierstra; Shane Legg; Demis Hassabis
err分享
err收藏
RL-Cache
err2019-01-01
err0
PREAI
errVadim Kirilin; Aditya Sundarrajan; Sergey Gorinsky; Ramesh K. Sitaraman
err分享
err收藏
err
IF0
err
err0
PREAI
err
err分享
err收藏
学者 查看更多内容