返回
摘要
En 中文
GPU中的大规模片外访问是主要的性能瓶颈。我们发现许多写入操作是重复的,这种重复可以分为inter-dup和intra-dup。其中,inter-dup表示不同内存块内容相同,而intra-dup表示一行中的所有4B元素均相同。在本工作中,我们提出了一种基于缓存的GPU内存去重架构,命名为cache-assisted GPU memory deduplicated(CMD),通过利用GPU应用中的数据重复性来减少片外访问。CMD包含三项关键设计贡献,旨在减少三种类型的访问:1)一种新颖的GPU内存去重架构,用于消除intra-dup和inter-dup行。我们设计了多种技术来管理重复块,以减少大规模片外写入;2)我们提出了一种基于缓存的读取方案,以减少对重复数据的读取。当L2缓存缺失需要读取重复块时,如果引用块已被加载到L2且处于干净状态,则无需访问片外DRAM即可将其复制到L2缺失的块中。对于intra-dup数据的读取,CMD使用片上元数据缓存获取数据;3)当缓存行被驱逐时,行中的干净扇区被失效处理,而脏扇区则被写回。然而,大多数只读驱逐块会从DRAM被重引用超过两次。因此,我们增加了一个全关联FIFO缓冲区,用于容纳只读(也是干净的)驱逐块,以减少重引用次数。实验表明,CMD可将片外访问减少31.01%,降低能耗32.78%,并提升性能42.53%。此外,CMD还能将内存密集型工作负载的性能提升57.56%。
Keyword:
Cache
compression
deduplication
graphics processing units (GPU)
memory
期刊
I
IF:
2.9
论文数:
668
被引数:
9.6K
机构
引用论文
暂无论文信息

