context engine note

Context Manager多模态数据的处理现在大模型系统的对话窗口和处理数据会产生大量的上下文,后续的qa往往会用到其中一部分上下文,所以建立有效的context engine是十分必要的。 NLP用时问戳标记上下文 一种常见的设计是在每条信息上附加时间戳,以保留其生成的顺序。这种方法由于简单且维护成本低,在聊天机器人和用户活动监控中广受欢迎。然而,该方法存在若干局限性。尽管时间戳能够保持时间顺序,但它们不提供语义结构,使得捕捉长程依赖关系或高效检索相关信息变得困难。随着交互数据的累积,序列呈线性增长,导致在存储和推理方面均面临可扩展性问题 ...

December 2, 2025 · 16 min

【LLM 必读综述】Speed Always Wins:LLM高效架构调查

题目:Speed Always Wins: A Survey on Efficient Architectures for Large Language Models 作者:孙伟高 上海人工智能实验室 github:https://github.com/weigao266/Awesome-Efficient-Arch 文章的主要目的通过分析449篇大模型的论文,汇总得到了以下能让大模型速度提升的方向: ...

August 27, 2025 · 7 min

如何最快速的找到最核心的几篇文章

做这期blog的动机很简单,分享一下自己如何快速的上手某个领域的论文。最核心的三个步骤我觉得分别是: 确定自己研究领域的key words,这里是要从上到下的,如LLM -> 微调 和 CoT 确定自己需要研究的题目,如 如何确定CoT的某个环节有益于微调中得到高的得分 根据“and”的检索思想,从小到大的进行检索 先检索key words,确定论文的范围 在页面内只看研究的问题是否符合自己的要求 快速确定自己需要的论文想要快速了解某个领域的论文,一个是问,问从业者,这是最快的,有人脉,直接问最核心的开发者,受益无穷,少走很多弯路。 ...

August 24, 2025 · 4 min

MLsys24 分类汇总

LLM 推理与服务优化 (LLM Inference and Serving Optimization) KV 缓存管理和优化 (KV Cache Management and Optimization) 这些论文聚焦于 KV 缓存的减少、量化或重用,以提升生成推理效率和降低内存消耗。 Keyformer: KV Cache reduction through key tokens selection for Efficient Generative Inference (Keyformer:通过高效生成推理的关键令牌选择来减少 KV 缓存) - Muhammad Adnan 等 ...

August 14, 2025 · 4 min