<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>MLsys24 on moyutianzun 的博客</title><link>https://moyutianzun.com/tags/mlsys24/</link><description>Recent content in MLsys24 on moyutianzun 的博客</description><generator>Hugo</generator><language>zh-cn</language><copyright>moyutianzun</copyright><lastBuildDate>Thu, 14 Aug 2025 15:51:24 +0800</lastBuildDate><atom:link href="https://moyutianzun.com/tags/mlsys24/index.xml" rel="self" type="application/rss+xml"/><item><title>MLsys24 分类汇总</title><link>https://moyutianzun.com/blog/mlsys24-fen-lei-hui-zong/</link><pubDate>Thu, 14 Aug 2025 15:51:24 +0800</pubDate><guid>https://moyutianzun.com/blog/mlsys24-fen-lei-hui-zong/</guid><description>&lt;h1 style="" id="llm-%E6%8E%A8%E7%90%86%E4%B8%8E%E6%9C%8D%E5%8A%A1%E4%BC%98%E5%8C%96-(llm-inference-and-serving-optimization)"&gt;&lt;strong&gt;LLM 推理与服务优化 (LLM Inference and Serving Optimization)&lt;/strong&gt;&lt;/h1&gt;&lt;p style=""&gt;&lt;/p&gt;&lt;h2 style="" id="kv-%E7%BC%93%E5%AD%98%E7%AE%A1%E7%90%86%E5%92%8C%E4%BC%98%E5%8C%96-(kv-cache-management-and-optimization)"&gt;&lt;strong&gt;KV 缓存管理和优化 (KV Cache Management and Optimization)&lt;/strong&gt;&lt;/h2&gt;&lt;p style=""&gt;&lt;/p&gt;&lt;p style=""&gt;这些论文聚焦于 KV 缓存的减少、量化或重用，以提升生成推理效率和降低内存消耗。&lt;/p&gt;&lt;ul&gt;&lt;li&gt;&lt;p style=""&gt;&lt;a href="http://www.moyutianzun.cn/2025/07/30/keyformer%E9%98%85%E8%AF%BB%E7%AC%94%E8%AE%B0/"&gt;Keyformer: KV Cache reduction through key tokens selection for Efficient Generative Inference&lt;/a&gt;&lt;/p&gt;&lt;ul&gt;&lt;li&gt;&lt;p style=""&gt; (Keyformer：通过高效生成推理的关键令牌选择来减少 KV 缓存) - Muhammad Adnan 等&lt;/p&gt;</description></item></channel></rss>