【MLsys 24】keyformer阅读笔记
文章名:Keyformer: KV Cache reduction through key tokens selection for Efficient Generative Inference 论文的关键:在vllm中,Decode的时候由于矩阵乘法和KV cache的存取,该阶段受限于memory bound 研究发现,在推理过程中,90%的attention权重关注于特定的token 这篇文章的工作就是通过一个新颖的评分函数来找到这些特定的token 在KV cache中就只保存这些特定的token 对于多embedding和多任务上,keyfromer能降低延迟,提高吞吐量,不丢失准确率 背景生成的新token会带来额外的KV cache,如MPT-7B 模型中,序列长度增加 16 倍(从 512 到 8K)会导致推理延迟增加 50 倍以上。推理总时间的约 40%(绿色突出显示)被 KV 缓存数据移动所消耗,还会延长其他操作所需的时间(蓝色显示)。当序列长度超过 8K 时,KV 缓存大小超过了模型大小。 ...