【MLsys 24】keyformer阅读笔记

文章名:Keyformer: KV Cache reduction through key tokens selection for Efficient Generative Inference 论文的关键:在vllm中,Decode的时候由于矩阵乘法和KV cache的存取,该阶段受限于memory bound 研究发现,在推理过程中,90%的attention权重关注于特定的token 这篇文章的工作就是通过一个新颖的评分函数来找到这些特定的token 在KV cache中就只保存这些特定的token 对于多embedding和多任务上,keyfromer能降低延迟,提高吞吐量,不丢失准确率 背景生成的新token会带来额外的KV cache,如MPT-7B 模型中,序列长度增加 16 倍(从 512 到 8K)会导致推理延迟增加 50 倍以上。推理总时间的约 40%(绿色突出显示)被 KV 缓存数据移动所消耗,还会延长其他操作所需的时间(蓝色显示)。当序列长度超过 8K 时,KV 缓存大小超过了模型大小。 ...

August 14, 2025 · 5 min

MLsys24 分类汇总

LLM 推理与服务优化 (LLM Inference and Serving Optimization) KV 缓存管理和优化 (KV Cache Management and Optimization) 这些论文聚焦于 KV 缓存的减少、量化或重用,以提升生成推理效率和降低内存消耗。 Keyformer: KV Cache reduction through key tokens selection for Efficient Generative Inference (Keyformer:通过高效生成推理的关键令牌选择来减少 KV 缓存) - Muhammad Adnan 等 ...

August 14, 2025 · 4 min

Hello Halo

Hello Halo如果你看到了这一篇文章,那么证明你已经安装成功了,感谢使用 Halo 进行创作,希望能够使用愉快。 相关链接官网:https://www.halo.run 文档:https://docs.halo.run 社区:https://bbs.halo.run 应用市场:https://www.halo.run/store/apps ...

August 14, 2025 · 1 min

aliyun ubuntu halo AirCloud最速传说

购买域名搜索点击阿里云域名注册服务 在此处搜索域名 英文中文都可以,然后选择购买,实名认证之后下单即可 下单后需要提交实名认证的模板,在域名列表->解析,会被要求去实名,上传身份证,大概要几个小时,认证后即可 需要对解析和管理分别进行配置 解析中配置好域名对着IP 管理中自定义DNS,然后在www中添加DNS对着IP 博客服务的区别 Hexo没有后端 Hego社区不太活跃 Typecho轻量级但是已经很老的框架了 Halo是java写的,很方便 Halo找了一圈,好像对latex不太支持 Hexo的stellar没找到加备案的地方,找了一圈,还是next把,简简单单的也挺好 更新,next渲染依托答辩,受不鸟了,toc渲染都不正确,fu'le Halo安装 1panle 安装先执行如下脚本安装docker: bash <(curl -sSL https://linuxmirrors.cn/docker.sh) 然后执行脚本安装1panel: bash -c "$(curl -sSL https://resource.fit2cloud.com/1panel/package/v2/quick_start.sh)"r 然后输入 IP+你设置的端口 就可以进入1panel的控制台了 ...

February 14, 2025 · 2 min