arrow
返回

CMD: A Cache-Assisted GPU Memory Deduplication Architecture

delete
delete0
PRE
AI
W
Wei Zhao
D
Dan Feng
W
Wei Tong
X
Xueliang Wei
B
Bing Wu
DOI:10.1109/TCAD.2025.3552674delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
GPU中的大规模片外访问是主要的性能瓶颈。我们发现许多写入操作是重复的,这种重复可以分为inter-dup和intra-dup。其中,inter-dup表示不同内存块内容相同,而intra-dup表示一行中的所有4B元素均相同。在本工作中,我们提出了一种基于缓存的GPU内存去重架构,命名为cache-assisted GPU memory deduplicated(CMD),通过利用GPU应用中的数据重复性来减少片外访问。CMD包含三项关键设计贡献,旨在减少三种类型的访问:1)一种新颖的GPU内存去重架构,用于消除intra-dup和inter-dup行。我们设计了多种技术来管理重复块,以减少大规模片外写入;2)我们提出了一种基于缓存的读取方案,以减少对重复数据的读取。当L2缓存缺失需要读取重复块时,如果引用块已被加载到L2且处于干净状态,则无需访问片外DRAM即可将其复制到L2缺失的块中。对于intra-dup数据的读取,CMD使用片上元数据缓存获取数据;3)当缓存行被驱逐时,行中的干净扇区被失效处理,而脏扇区则被写回。然而,大多数只读驱逐块会从DRAM被重引用超过两次。因此,我们增加了一个全关联FIFO缓冲区,用于容纳只读(也是干净的)驱逐块,以减少重引用次数。实验表明,CMD可将片外访问减少31.01%,降低能耗32.78%,并提升性能42.53%。此外,CMD还能将内存密集型工作负载的性能提升57.56%。
Keyword:
Cache
compression
deduplication
graphics processing units (GPU)
memory

期刊

I
IEEE Transactions on Computer-Aided Design of Integrated Circuits and Systems
IF:
2.9
论文数:
668
被引数:
9.6K

机构

H
huazhong university of science and technology
学者数:
2.7W
论文数: 8.1K
被引数: 5
引用论文

引用论文

暂无论文信息