MLsys24 分类汇总
LLM 推理与服务优化 (LLM Inference and Serving Optimization) KV 缓存管理和优化 (KV Cache Management and Optimization) 这些论文聚焦于 KV 缓存的减少、量化或重用,以提升生成推理效率和降低内存消耗。 Keyformer: KV Cache reduction through key tokens selection for Efficient Generative Inference (Keyformer:通过高效生成推理的关键令牌选择来减少 KV 缓存) - Muhammad Adnan 等 ...