返回
WindowKV: Task-adaptive group-wise KV cache window selection for efficient LLM inference
DOI:10.1016/j.eswa.2026.134291.png)
摘要
En 中文
• WindowKV为保持KV一致性选择任务感知的连续语义窗口。
• 一种组内KV索引共享策略降低了开销并提升了效率。
• WindowKV使用12%的KV实现近满性能,并在LongBench和NIAH上表现优异。
Keyword:
Large language model
KV cache compression
Inference efficiency
期刊
IF:
7.5
论文数:
3.0W
被引数:
10.2W
机构
引用论文
暂无论文信息

