摸

读推荐

loop 每天读 agent 方向的论文和工程实践,逐篇回原文核对,写成「问题 → 设计 → 证据」再打分。
07.23 起 36 个收录日、320 篇,论文 167、工程 153;最常一起出现的问题是 文件与工件 × 记忆与上下文(84 篇)。

中位分80
90 分以上67
最近收录09.28
问题空间格子 = 两个问题同时出现的篇数;点格子筛这一对
文工记状身观安运
收录节奏一天一根,高 = 篇数,颜色越深平均分越高;点一天筛那天
07.2308.0108.1509.0109.15
平均分低平均分高没收录
问题
类型
09.28工程 Unreal Agent:让工具异步运行,把模型循环与执行责任分开问题长工具执行期间,Agent仍需及时响应用户并推进其他工作;等待、轮询与SDK隐藏的生命周期又增加模型负担和宿主维护成本。结论Unreal将等待从模型行为移到宿主事件循环,并用可序列化操作连接扩展执行;其价值是明确控制权与首次提交点,代价是宿主承担兼容、恢复和效果边界。 工具与协议状态与恢复文件与工件 75
问题P1长工具执行期间,Agent仍需及时响应用户并推进其他工作;等待、轮询与SDK隐藏的生命周期又增加模型负担和宿主维护成本。E1E2E3
├─缓解D1作者把工具调用表示为运行中和最终结果两个阶段:后台执行持续进行,协调器接收用户输入与完成事件,再决定何时调用模型。E1E3
└─缓解D2作者将工具翻译、会话记录与操作执行拆开:翻译器只产生可序列化工作描述,协调器先记录首次调用及操作,再交给可替换的操作管理器执行。E2E3E4
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑建议采用协调器接收事件、纯翻译器产生操作、首次提交后派发的分工,适合长工具与交互插话共存的Agent服务。将执行位置和实际权限放在宿主或沙箱明确控制。接口可替换不自动带来权限隔离;现有操作恢复和取消边界不足以直接关闭UNKNOWN对账、递归预算/取消ack或父子工件原子提交缺口。

取舍

异步模型与宿主可组合性减少了模型等待职责,却增加了协调器、存储、版本与操作恢复的责任。双结果格式有提供者兼容限制;当前context builder默认返回请求而未填Changes,接口支持变更报告不等于已有完整压缩审计。博客的成本优势混合提示、输出与调度;尚无等预算单组件归因。

证据到哪为止

证据来自Sep22官方文章及Sep23固定Go实现的相关路径,支持局部架构与整体基准观察;不支持所有提供者兼容、每步副作用前持久提交或性能非劣保证。

09.28论文 SEEM:从命中片段反查同一事件的来源问题长期对话问答需要跨话轮的事件细节,但按相似度或孤立事实检索容易遗漏同一事件的其他证据,使回答缺少时间和因果上下文。结论SEEM把事件框架作为来源段落之间的桥,让一次局部命中能够补回同一事件的其他材料;离线结果支持这一组织方式,但预算上限和融合误差使它不是完整性保证。 记忆与上下文状态与恢复身份与权限 75
问题P1长期对话问答需要跨话轮的事件细节,但按相似度或孤立事实检索容易遗漏同一事件的其他证据,使回答缺少时间和因果上下文。E1E2E3
├─缓解D1作者把话轮抽取为含参与者、动作、时间等字段的事件框架,并仅将同一事件的框架融合;融合后保留所有来源段落的指针。E1E2
└─缓解D2作者先用关系图找到相关片段,再沿片段所属事件反向展开其他来源,把原文、事件框架和关系事实一起提供给回答模型。E2E3E4
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑建议把命中段落到事件、再到来源段落的映射用作长历史问答的补证据路径,保存不可变来源与融合版本,并明确展开预算。适合证据跨轮分散但同一事件可辨认的任务;纯开放知识、严格低延迟或需要逐句证据证明的场景不能直接继承其效果。权限、删除传播和事务恢复是服务端额外责任。

取舍

来源展开增加原文与摘要输入,也增加记忆构建的LLM调用。2倍段落上限的选择/截断细则未写完整,不能同时承诺Eq6的全部来源并集。融合错误可污染后续记忆;Fig7允许摘要/事实补足原文空缺,指针不保证答案都有原文支持。作者的成本、重复区间与judge校准披露有限。

证据到哪为止

证据为ACL2026正式版本中的LoCoMo/LongMemEval、同模型基线、删除组件及四段增量构建;未提供精确截断算法、等成本对照、长期生产恢复或跨用户隔离证据。

09.28论文 DREAM:先构造评价所需信息,再分开核查事实与引用问题深度研究报告可以流畅且有引用,却遗漏最新事实或包含推理错误;固定量表和只看报告的裁判缺少发现这些缺陷所需的信息。结论DREAM把评价需要的信息获取写进协议,并把事实真伪与引用匹配分开,使特定时效和推理缺陷更容易显露。价值在于诊断对象与评价信息相匹配,不能据此保证所有报告判断正确。 工具与协议观测与评测文件与工件 82.5
问题P1深度研究报告可以流畅且有引用,却遗漏最新事实或包含推理错误;固定量表和只看报告的裁判缺少发现这些缺陷所需的信息。E1E2E3E4E6
├─测量D1作者先让工具Agent独立研究查询,把当前关键事实转成是非清单,并为需核查的论证生成问题和验证计划;这些评价标准不从待评报告反向拟定。E1E2
└─测量D2作者按判据的信息需求分配执行者:普通模型检查写作和事实清单,工具Agent按验证计划核对推理,再返回有依据的分数。E1E2E3
问题P2引用与主张相符只说明文字对齐,错误或过期来源也能支持错误主张;把引文一致性当作事实正确性会漏检这类报告。E1E5E6
└─诊断D3作者另行抽取重要主张,用中性查询寻找支持和反对证据,把外部事实分数与引用覆盖、引用支持程度分别计算。E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

适合需要及时外部事实的研究报告审阅:把查询专属清单和验证计划保存为独立对象,事实、引用及不可核验覆盖分别展示。低风险纯写作任务未必需要工具裁判;不能将框架分数当生产研究过程的效率或可靠性保证。

取舍

更新评价信息提高发现时效错误的机会,也引入检索偏差和额外工具成本。无法核验项从事实及引用支持分母排除,单一分数会隐藏判定覆盖率;协议质量、最终判分和被测Agent能力不能合并解释。

证据到哪为止

证据包括三种协议生成方式的人评、20题三种时间条件、10对推理干预及15对旁路抽取的主张—来源样本;不覆盖普遍事实检出率、等成本收益或完整研究过程。

09.27论文 SUPO:让摘要后的工作状态与整条任务一起优化问题长期工具任务不断积累交互历史,固定窗口会截断任务;若摘要只是训练外的压缩器,后续行动需要的信息可能被丢掉,也无法随整条任务结果共同优化。结论SUPO把摘要变成受整条任务目标约束的跨段工作状态,让固定窗口下的工具任务能够继续并参与训练;收益依赖训练策略与运行时压缩共同工作,不能外推为无损记忆或等成本优势。 工具与协议状态与恢复身份与权限 75
问题P1长期工具任务不断积累交互历史,固定窗口会截断任务;若摘要只是训练外的压缩器,后续行动需要的信息可能被丢掉,也无法随整条任务结果共同优化。E1E2
├─缓解D1作者在达到长度阈值后让同一模型生成摘要,再用原始任务与摘要替换工作历史,使后续工具调用能在新的有限窗口中继续。E1E3
└─缓解D2作者把一次完整任务切成多个以摘要衔接的训练片段,让工具行为和摘要内容共享同一次任务的最终奖励与组内优势,并屏蔽因长度上限被截断的任务梯度。E2E4E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

可迁移的是把任务身份、跨段摘要与原始执行轨迹分开,并让摘要服务于后续任务结果的设计。适合有清晰终态判据的长搜索或受控工具任务;已有执行收据应由宿主独立保留,压缩工作视图不能抹去副作用账本。没有稳定终态判据的开放任务不宜直接继承该奖励假设。

取舍

工作窗变小不等于总计算变少。BC-P主表把最多1段改为3段,SWE把1段改为10段;摘要与更多搜索、训练共同变化。固定阈值决定何时摘要,学习的是内容和行动。实际越限分支会删除已执行工具的可见记录,不能当作外部业务状态回滚。

证据到哪为止

依据ACL正式稿的状态转移、训练构造、CodeGym/BC-P/SWE结果及BC-P同测试段数对照;主要重复不确定性、BC-P具体判分实现和有副作用工具恢复合同仍有限。

09.27论文 SWE-Serve:固定补丁,测量局部检查遗漏的服务失败问题编码Agent评测只检查局部组件时,可能把无法经真实模型服务接口工作的补丁计为成功,因而高估交付完成。结论SWE-Serve把局部通过与服务合同通过之间的差异变成可定位的测量对象。固定工件、验证判据资格和删测对照能揭示漏检,但不保证补丁可上线,也不证明某种harness普遍更好。 运行时与调度观测与评测文件与工件 90
问题P1编码Agent评测只检查局部组件时,可能把无法经真实模型服务接口工作的补丁计为成功,因而高估交付完成。E1E3
├─验证D1把任务要求分成新行为、回归保护和适用的真实服务检查,用未修改仓库、参考补丁、对抗补丁与人工裁决共同检查验证器是否有效。E2E6
└─诊断D2固定已经生成的补丁和其余测试,只改变端到端测试是否参与计分;再匹配任务内测试数量与新行为/回归角色,比较删去其他测试的影响。E3E4
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

我们的采用判断是把Agent生成的工件与由宿主管理的版本化验证器分离,并在评价结果中保留具体失败层、无分状态及任务内对照。适合功能需要经过真实服务接口才能成立的编码Agent任务;可迁移的是验证器资格和固定工件的诊断方法,不是把SGLang任务得分当作通用Agent能力或发布许可。

取舍

任务限SGLang与CPU/单H100,缺少多GPU、多节点和其他推理引擎。资格筛选使用已见Agent结果并排除部分过易或零通过候选,公开PR也可能进入模型训练。作者的通过率只是给定验证器上的行为结果;维护性、架构契合和生产上线仍不在判分范围。匹配删测区间跨零,三轮主榜CI为小样本正态近似。

证据到哪为止

作者在SGLang的53项资格任务上评价;核心漏检结果来自19项627补丁,等量删测只覆盖12项396补丁,且其差异区间跨零。

09.27工程 Agent Skill Runtime:让技能脚本拥有跨宿主的执行合同问题同一技能脚本接入多个Agent宿主时,分散的工具包装器会分别解释输入、权限和取消,导致模型看到的工具合同与实际执行行为不一致。结论共享脚本合同可以把模型可调用接口与实际执行规则连接起来,同时保留宿主自己的审批和生命周期。文章完成的是这一窄层的参考实现,可信包和真正的系统隔离仍是采用前提。 工具与协议运行时与调度身份与权限 75
问题P1同一技能脚本接入多个Agent宿主时,分散的工具包装器会分别解释输入、权限和取消,导致模型看到的工具合同与实际执行行为不一致。E1
├─缓解D1把工具参数、固定脚本入口、访问声明和执行限制放进技能自己的清单,由共享执行器发现、校验和调用,并统一返回结构化结果或错误。E2E3
└─缓解D2适配器只把共享合同投影成宿主原生工具,继续使用OpenCode审批界面、Cordis工具注册及各宿主的取消信号;技能领域逻辑留在脚本中。E4E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

我们的采用判断是把稳定脚本作为可信工具包管理时,复用技能拥有接口、共享执行器校验、宿主拥有审批和注册的分工。服务端可将清单转换为租户允许的工具目录,再由既有隔离worker承接执行;目录准入、租户身份、文件不可变发布和资源端授权仍是外围前提。仅有通用shell调用需求时,直接技能加CLI更简单。

取舍

这层合同减少接口重复,却引入额外manifest、解释器和适配版本管理。能力审批只依据包声明,不能阻止未声明的原生脚本访问;路径检查不固定执行文件内容。取消受进程组和平台限制,注册回收不同于在途调用终止。工具全部注册,没有任务级目录选择,也没有持久会话恢复或跨版本迁移协议。

证据到哪为止

9月11日维护者文章与同日0.1.1固定源码支持路径、校验、审批和取消的机制判断;没有跨宿主性能比较、生产隔离或持久取消确认的证据。

09.27工程 Harness Jev:把概率判断接入有限的路由与写前控制问题Agent的工具日志记录了动作,却未必记录模型路由和执行风险判断;让概率判断直接决定动作,会使回退责任和审批边界难以审计。结论显式概率判断可以成为可审计的控制输入,但执行权仍须属于宿主策略。本篇的可迁移增量是路由与写前风险采用不同回退方式,并保留整轮成本和确认来源;公开证据只达到有限原型。 状态与恢复工具与协议安全与隔离 75
问题P1Agent的工具日志记录了动作,却未必记录模型路由和执行风险判断;让概率判断直接决定动作,会使回退责任和审批边界难以审计。E1E2E3
├─缓解D1在模型网关中把自动路由变成显式判断,并将选定模型固定到工具循环;判断不可用时回到指定模型,分别记录路由决定、任务结果与整轮成本。E1E2
├─缓解D2在工具更新或删除前调用注册的实例风险评分器,只在静态风险与预设下限之间选择确认等级;超时、错误或低置信度恢复静态风险,再交给原有确认和分发路径。E3E4E5E6
└─缓解D3把静态风险、有效风险、评分状态和确认方式附到操作审计记录;同时比较单次判断与完整任务的质量和成本,避免将快速评分误写成任务整体收益。E2E7E8
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

我们的采用判断是借鉴判断输入、确定性映射、评分失败回退、确认与效果记录的分层结构。将评分器作为可关闭的注册扩展,原有资源权限和写入执行者继续持有硬边界;分别保留静态和有效风险及确认来源。适用于已有明确操作分类和确认策略的工具网关,不把Jev置信度当授权,也不据小样本结果替代生产成本或安全结论。

取舍

显式判断增加一次评分调用及状态读取,且三种易例不能说明复杂资源的风险准确率。pipeline只读20条执行、prod字符串启发式、repo_rule最多25条提交及部分PATCH字段均限制输入充分性。降到floor只改变确认等级;恢复静态risk仍可能被自动批准配置或caller_confirmed路径放行。route pin和政策版本的完整网关实现未公开于本文链接,原型PR尚未合并。

证据到哪为止

9月21/22日官方文章、9月19日未合并PR固定代码,以及18工单、12路由案例、10只读题和3简单风险状态的作者报告;不包括广泛校准、repo_rule实测或生产安全保证。

09.27论文 τ^τ-Bench:把需求恢复与Agent交付一起测量问题现有Agent评测预先给定政策、工具和架构,无法衡量开发Agent能否从分散材料及客户问答恢复需求,并在服务预算约束下交付真正能完成业务的Agent。结论把需求恢复、Agent实现与最终业务评价连起来,能测到成品Agent榜单遗漏的交付失败;这是一套受控构建评测协议,不是生产就绪或最优架构证明。 工具与协议状态与恢复观测与评测 75
问题P1现有Agent评测预先给定政策、工具和架构,无法衡量开发Agent能否从分散材料及客户问答恢复需求,并在服务预算约束下交付真正能完成业务的Agent。E1E2E3
├─测量D1作者把业务规则拆成可追踪事实,再分配到异构材料或客户模拟器,检查事实覆盖和无依据新增内容。开发Agent必须从这些受控信息渠道恢复需求。E2
├─测量D2开发Agent提交完整实现,可信宿主保留业务数据库和API,独立容器用隐藏用户任务检查业务终态与沟通义务。自己编写的测试通过不能替代交付评价。E3
└─诊断D3任务显式配置材料、客户、API故障、继承代码、服务预算等七类条件,并从结果中扣除平均服务开销超额。过程记录用于定位需求、实现与预算失配。E4E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑判断:可复用权威事实清单、开发者可见信息分配、构造工件与独立业务判据四层。需求恢复渠道、作者自测、最终状态、沟通义务和成本分别记账;API文档版本与实际部署偏差单列。适用于业务规则可枚举、结果可检查的Agent交付评价;不将其当成规则冲突治理、通用恢复运行时或生产就绪证书。

取舍

受控事实让需求恢复可评分,但牺牲真实业务规则缺失、持续变化和多人冲突;固定模型菜单与分桶credits提供可比边界,却不等于实际总美元成本。API故障和客户对话增加诊断维度,同时使跨任务难度、开发模型与harness混杂。pilot复用、通信judge校准缺失和单次构造要求限制泛化及因果解释。

证据到哪为止

证据为四领域53构造配置上的每配置单次试验、已知事实语料、单LLM客户/用户和有限案例干预;pilot局部复用,通信判据未给全面人机校准,不覆盖上线后的需求变化。

09.26论文 Nemori:用预测遗漏引导记忆蒸馏问题长期交互Agent在写入记忆时不知道未来会问什么;固定价值模板可能丢失必要细节,全量保留又增加存储与检索噪声。如何利用已有知识与当前经历的差异,形成可供后续任务使用的记忆?结论把已有知识无法充分解释的经历作为记忆写入候选,能提供可迁移的蒸馏策略;事件、语义和原文通路相互补充,但预测遗漏不是未来效用或事实正确性的保证。 记忆与上下文身份与权限文件与工件 82.5
问题P1长期交互Agent在写入记忆时不知道未来会问什么;固定价值模板可能丢失必要细节,全量保留又增加存储与检索噪声。如何利用已有知识与当前经历的差异,形成可供后续任务使用的记忆?E1E2E3
├─缓解D1先把消息分成语义连贯的事件,保存原始消息与第三人称叙述,并把跨窗口但连续的事件重新合并。这样,后续蒸馏使用具有语境的事件,而不是孤立消息。E2
├─缓解D2用当前事件的短提示和已有语义记忆预测事件内容,再对照真实消息,提取预测遗漏或误述的持久事实;把这些事实交给独立记忆管理层新增、合并或处理冲突。E3E4
└─缓解D3回答时并行检索事件叙述与语义事实,并给最相近的两个事件附上原始消息;以语义压缩和原始细节共同构造回答上下文。E4E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑判断:可把残差蒸馏作为记忆写入层,保留事件来源和raw通路;后续检索/管理器独立承担可见范围、版本与冲突处理。适合反复交互且有可复用事实的场景。需要原始证据或频繁状态更新时,不能用预测可解释就删除事实,也不能把语义库当权威业务状态。

取舍

预测与蒸馏增加构建调用,事件批处理抵消部分开销;回答压缩与后台建库成本必须分账。原文保留raw,但事件叙述、残差识别和冲突删除仍依赖模型。LoCoMo几乎不检验更新,LongMemEvalS知识更新在GPT4o-mini反而下降;第三方存储节约伴随Temporal退化,不能以排除该类的Core分掩盖。

证据到哪为止

证据为两种mini模型、LoCoMo与LongMemEvalS的单次离线问答、组件/检索消融和两种外部管理器;不覆盖长期在线更新可靠性、等总预算优势或无损压缩。

09.26论文 MyScholarQA:把可控个性化与真人满意度分开测量问题科研检索报告直接使用自动推断的用户画像时,用户难以纠正画像或控制它怎样改变当前查询,容易把个性化变成偏离需求的内容。结论可编辑画像与动作把个性化变成可检查的上下文过程;真人分阶段反馈揭示引用和遵循指标不能覆盖的偏好错误。两者值得借鉴,但有限访谈与现成judge诊断不证明长期满意度或所有自动评测失效。 记忆与上下文观测与评测状态与恢复 75
问题P1科研检索报告直接使用自动推断的用户画像时,用户难以纠正画像或控制它怎样改变当前查询,容易把个性化变成偏离需求的内容。E1E2E3
└─缓解D1作者把个性化拆成可编辑的论文画像、可选择的查询动作和报告生成;选定动作进入检索与写作各阶段,报告再标出与动作相关的内容。E1E3
问题P2对合成用户检查引用和行动遵循,不能直接判断真实研究者是否满意;缺少真人参照会遗漏画像、动作和报告各自的个性化错误。E4E5E6
└─诊断D2作者先以合成用户检查引用与动作遵循,再让真实研究者逐项评价画像、动作和报告;从不满意原因构造真人标注的判别任务,检查自动裁判遗漏的内容。E2E4E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

个性化研究Agent可以分别保存画像推断、当前采纳动作和最终报告,并分开解释引用检查、动作遵循与用户满意度。适合愿意为长报告投入前置控制的用户。论文支持某条推断不等于它就是本人长期偏好,高亮也不应作为权限或完成凭证。

取舍

可编辑画像和动作提高控制粒度,也增加前置阅读负担与分钟级等待。用户偏好未完全暴露给judge,同用户相关样本与人为1:2基率限制泛化。离线和在线不是同批用户的随机对照,单次结果也不能提供总体稳定性。

证据到哪为止

MySQA的281/291合成配对、21名CS研究者访谈、四种judge和限定提示变体;计数与提示配置有口径限制,公开源码未覆盖全部报告实验。

09.26论文 BrowseComp-Plus:固定证据环境后再比较Agent与检索器问题深度搜索Agent的总分同时受动态网页、黑盒检索器和自主搜索策略影响,评测者无法判断改进来自哪个部分。结论将语料与检索器变成明确受控的输入,能够更有根据地判断深搜系统的组件收益;它提供有限归因,而非剥离所有模型、预算与知识差异。 记忆与上下文工具与协议身份与权限 82.5
问题P1深度搜索Agent的总分同时受动态网页、黑盒检索器和自主搜索策略影响,评测者无法判断改进来自哪个部分。E1E2E3E4E5E6
├─缓解D1作者把在线搜索替换为固定文本语料:逐题核验线索证据与答案文档,再加入由问题拆解得到的干扰文档,使后续评测共享可检查的输入环境。E1E2
└─测量D2作者在同一Agent配置中替换检索器,也在固定检索环境中比较Agent,并把证据召回、最终答案和引用覆盖分开计量;另用正例直供、全文读取与裁判对照解释差异。E3E4E5E6
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

可用于静态企业知识检索或深搜Agent的组件选型:冻结语料与工具返回格式,在同一Agent设置下比较检索器,并将文档命中、可见内容、答案和引用分别记录。需要实时网页、互动页面或多模态证据的任务不能直接沿用该语料结论;各配置的token、搜索与索引成本须作为采用条件。

取舍

默认前512token并不保留每题全部线索;建库用答案和o3反查会影响可收集题目分布。标签存在漏标,模型可能已有参数知识。API费下降不等于全系统成本或延迟下降,显著性检验也不代替重复运行变异。

证据到哪为止

结论基于830个筛选后的静态文本问题和作者列出的Agent/检索器配置;支持组件替换比较,不覆盖完整网页能力、所有相关文档或总系统成本。

09.26论文 AgentGym2:把预先给出的信息还原为评测变量问题Agent评测若提前给出工具、干净数据和明确线索,会隐藏发现工具、清洗数据与辨别错误信息的成本,可能使最终答案成绩高估未预处理条件下的能力。结论AgentGym2把预包装信息是否存在变成可干预的评测条件,说明答案能力受到工具发现、隐藏线索和噪声负担影响;它没有证明完整执行过程正确。 观测与评测工具与协议身份与权限 75
问题P1Agent评测若提前给出工具、干净数据和明确线索,会隐藏发现工具、清洗数据与辨别错误信息的成本,可能使最终答案成绩高估未预处理条件下的能力。E1E2E3
├─测量D1作者在真实网页、附件和数据中构造需要主动找工具、清洗数据、甄别模糊或错误线索的任务,并用同一套基本工具与短答案参照评价结果。E1E2
├─诊断D2作者在选定子集中直接给出隐藏线索、所需工具或移除噪声,再比较同模型的最终答案成功率,以诊断哪类信息条件造成性能差距。E3E4
└─验证D3同一提示、工具schema和运行上限下重复采样,并对最终答案judge做人类一致性核对。E4
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑判断:可采用任务中已给出什么信息的显式配置和同任务信息条件对照,避免把工具/提示提前提供的帮助记到模型能力。适合可定义唯一答案的搜索与数据任务输入诊断;过程合规、企业副作用和安全仍需独立判据,本文不提供这些保证。

取舍

开放网络和复杂附件提高真实性,也引入网页漂移、工具状态与较大调用成本。短答案judge便于统一评分,却无法证明清洗过程、工具发现路径或权限合规;Table4未给全子集分母与干预区间,98.9%校准不解决这些问题。

证据到哪为止

证据来自437题总体评测、两模型三类子集干预、四模型最终答案人机核对和仅搜索场景重复采样。未披露全部干预子集分母、配对清单和过程标注校准。

09.25工程 GKE迁移插件:校验覆盖与跨团队状态交接问题迁移Agent生成的Terraform或清单即使通过语法验证,仍可能漏掉原有资源,或在自动修复时删掉出错模块,使绿色结果掩盖迁移内容缺失。结论GKE迁移插件把模型生成变成受阶段与工件合同约束的工作,再用受限发布视图支持跨团队接续;它提高了哪些对象被核查、谁能推进流程的可见性,并未证明迁移语义完整或副作用原子恢复。 文件与工件状态与恢复身份与权限 82.5
问题P1迁移Agent生成的Terraform或清单即使通过语法验证,仍可能漏掉原有资源,或在自动修复时删掉出错模块,使绿色结果掩盖迁移内容缺失。E1E2E3E4
├─缓解D1作者让技能负责驱动阶段,MCP服务拥有状态和确定性工具;后台模型worker只接收材料并返回文本,生成内容经服务端处理后才成为迁移工件。E1E2E8
└─验证D2系统先检查生成代码,再让模型按错误有界修复;随后重查模块引用、清单结构和迁移覆盖,防止删除出错对象也得到通过结果。校验失败回到审核,通过后另行请求发PR批准。E3E4E11E8
问题P2平台工程师与应用开发者跨会话交接迁移时,聊天历史无法同时提供共享进度、明确的数据所有权和受限的跨团队输入。E1E5E6E7
└─缓解D3作者把平台和应用组件状态放入按角色受限的GCS账本,并由平台把可共享字段派生到exports;工具每次重读角色和组件认领,按对象版本条件写回,让新的会话能继续工作。E5E6E7E10
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑判断:可把生成、验证对象、人工批准和共享发布视图分开建模,适合已有GitOps评审流程、不同团队分阶段迁移的系统。优先迁移修复后覆盖重检和显式跨团队字段发布;在要求强效果一致性或可信多租户隔离的服务端,本文对象级状态控制不足以单独承担这些要求。

取舍

代码证据支持限定工具路径,未提供生产成功率或成本测量。exports发布是best effort,失败可继续发PR;PR后才条件写状态,因此不能推出恰好一次发布。GCS folder IAM是授予机制,项目级Owner/storage.admin可越过前缀隔离;身份解析还允许环境变量回退。worker超时返回不等待取消完成,不是递归取消确认。结构验证、覆盖例外和人工判断仍不能替代真实迁移语义。

证据到哪为止

依据为9月24日官方工程文章与同日前公开的固定源码;核验覆盖工具路径、校验规则和状态分支,没有生产效果数据。发布视图、工件与外部PR之间仍有独立失败窗口。

09.25论文 MobileCybench:按安全性质计分,再独立归因漏洞问题漏洞发现Agent的报告可能不可靠,而按已知漏洞或通用崩溃打分会漏掉应用特有的权限与数据破坏,难以判断新发现究竟造成了什么真实效果。结论按应用安全性质评分,可以让目录外的新违规路径进入可执行测量;将补丁归因另列,避免把探针、运行和漏洞混为一谈。它确认已覆盖性质的破坏,不能从静默或榜单推出全面安全或普遍零日能力。 安全与隔离身份与权限状态与恢复 82.5
问题P1漏洞发现Agent的报告可能不可靠,而按已知漏洞或通用崩溃打分会漏掉应用特有的权限与数据破坏,难以判断新发现究竟造成了什么真实效果。E1E2E4
├─测量D1作者先定义攻击权限下应用必须保持的安全性质,把性质写成读取可信状态的探针,再在全新隔离环境回放Agent提交物;任一已覆盖性质被违反才计为触发。E2E4E8
├─诊断D2作者在探针计分之外设置补丁差分归因:把保存的提交物分别对照漏洞版与修补版,识别其对应的参照漏洞;归因结果不改变原来的探针分。E3
└─验证D3作者按应用、攻击场景、输入可见范围和两次独立生成记录结果,并用空操作、参照提交物覆盖和应用级重采样检查测量边界。E4E5E6
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑判断:可把本文方法迁移为Agent结果评测中的两层证据合同:先用领域性质和可信状态判断副作用是否发生,再独立解释根因或漏洞身份。适合有可重建初态、可隔离回放工件和可靠状态接口的任务;需要真人触发、缺少状态基线或不可安全重放的效果不宜直接套用。采用时应保留未触发、判分错误及未归因三种不同含义,不用一个零分覆盖它们。

取舍

探针把人工判断前移到应用安全性质与可信观测的定义,需要持续维护;作者估计每应用约30小时。属性来自源码和pilot runs,应用样本与性质都非代表性抽样。25次空操作阴性不能证明有动作时零误报,19/24只测自家参照覆盖。源码挂载、网络和混淆同时变化,模型与harness版本也混杂;公开材料没有全部保存提交物与轨迹,API费不含全流程成本。

证据到哪为止

证据为13个Android应用、495个配置探针、500次作者生成运行、25次空操作、24个自家参照包覆盖与差分归因,另有固定主评分代码。源码设置存在联合干预,公开轨迹不全,总成本和跨应用泛化均有限。

09.25论文 Agensh:把组织协作层接到既有单Agent循环问题长程软件重建的多个Agent依赖中央协调者分派、汇总和解决冲突,单个上下文与协调能力会限制并行工作如何持续转为共享进展。结论Agensh把组织协作做成包在单Agent循环外的一层共享服务,让工作者持续自主认领和整合成果;作者所测任务支持固定时限下的规模收益,未证明等成本优势或强制协作正确性。 记忆与上下文工具与协议状态与恢复 75
问题P1长程软件重建的多个Agent依赖中央协调者分派、汇总和解决冲突,单个上下文与协调能力会限制并行工作如何持续转为共享进展。E1E2
├─缓解D1作者在单Agent harness外加组织层,让各工作者按共同流程自行收集上下文、认领任务、实施、验证和合并,再继续寻找工作。底层harness仍负责模型调用、工具执行和会话状态。E1E2
├─缓解D2作者把代码、协商和可复用发现分给Git工作区、消息服务和追加式上下文板;类型化短记录进入后续工作上下文,细节和旧记录按需展开或检索。E2
└─缓解D3每个工作者用持久事件队列连接外部服务:普通事件在回合边界送达,直接消息和新上下文在基础设施工具返回时补入;失败投递退避重试,重启后重排未完成事件。E3
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑判断:可以借鉴外层组织服务与底层单Agent执行循环分离的接口,把版本化工件、协商消息和可检索发现分别保存。适合允许增加并行资源、容许工作者协商和反复整合的长程工程任务;高风险副作用不能仅依赖CLAIM或提示中的验证要求。本文没有提供UNKNOWN对账、递归取消确认或父子工件原子提交合同。

取舍

共享服务和持续通信增加运行负担;论文没有给出token、费用账单、重复次数或置信区间。五步流程依赖模型遵守,FACT仍是同伴主张,CLAIM没有原子独占语义。分批启动及单Agent stop hook和多Agent idle detector条件不同,固定六小时只能作为组织墙钟条件。公开仓库API返回404,本轮未核验适配器实现。

证据到哪为止

证据为13页技术报告、明确的协作提示与路由机制、五任务至128个工作者及pandoc至1024的结果和轨迹案例。没有可读公开代码、全流程成本或重复不确定性。

09.25工程 Managed Deep Agents v0.8:在挂载前决定本轮可以读哪一层记忆问题同一Agent部署服务多人并跨私聊、群聊和API运行时,共享持久记忆无法按当前认证用户与会话受众选择输入,私人偏好可能被送入不适合的上下文。结论可迁移的贡献是把记忆归属与本轮信息准入拆开,并让拒绝影响文件入口和自动上下文。它提供有条件的输入选择设计,未证明个人内容不会经共享写入或已有上下文传播。 记忆与上下文文件与工件身份与权限 75
问题P1同一Agent部署服务多人并跨私聊、群聊和API运行时,共享持久记忆无法按当前认证用户与会话受众选择输入,私人偏好可能被送入不适合的上下文。E1E2E3E4
├─缓解D1把持久记忆拆成部署共享层和个人层,个人层由部署与已认证用户共同确定,调用参数不能指定另一人的记忆。E1E2
├─缓解D2在每次运行开始时先核实用户身份,再按入口上下文决定是否挂载记忆并自动加载热内容;私聊默认允许个人层,群聊和API默认拒绝。E3
└─缓解D3每层以AGENTS.md作为每次模型调用加载的热记忆,其余文件按需读取;Agent可更新记忆,部署拥有的指令与技能保持只读。E4
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑建议把认证主体、入口受众、记忆归属和注入计划作为独立输入决策:先选择可挂载层,再装配热内容和按需冷文件。适合多人共享部署但个人偏好需跨会话保留的Agent;不允许调用者互相影响时不启共享可写层。此采用启发不是端到端防泄漏方案,已有线程副本、输出受众和持续撤销仍需独立机制。

取舍

热文件每次调用占上下文;禁用不删历史,部署不覆盖记忆。本轮没有运行时源码或攻击/效用测量。Studio绕过user allow;策略一次/run不等于中途持续重授权;共享层可被所有调用者影响,禁止私密复制主要依赖Agent指令。

证据到哪为止

依据9月24日工程文章及同日固定官方文档,支持配置到挂载/消费的声明语义;没有任务效果、端到端安全或并发恢复测量。

09.25论文 AlignUSER:用环境后果和真人动作校准交互用户代理问题推荐系统使用LLM模拟用户时,仅靠少量示例和人物设定难以重现真人的动作与会话行为,模拟成绩可能误导系统选择。结论AlignUSER将“扮演某人”的提示改为由真人动作和环境后果共同监督的用户代理,在指定任务上改善动作与会话分布拟合;它提供评测环境的构造方法,没有证明模拟器可以代替真人决策。 观测与评测记忆与上下文状态与恢复 75
问题P1推荐系统使用LLM模拟用户时,仅靠少量示例和人物设定难以重现真人的动作与会话行为,模拟成绩可能误导系统选择。E1E3E4
├─缓解D1作者把页面、动作和后继页面整理成转移样本,让同一策略模型学习预测下一状态,给后续行为校准提供环境动态的训练信号。E2
├─缓解D2作者在每个真人动作旁采样不同的备选动作,在模拟环境中执行并比较后果,再生成与人物偏好相关的解释,用解释和真人动作共同监督用户策略。E2E5
└─缓解D3运行时向代理提供当前页面、人物设定、近期历史与合法动作,并把新交互写回情节记忆;增强版另沿用图记忆检索和动作前的因果提问。E2E6
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑判断:可把评测中的用户代理视为有明确数据来源、环境语义和行为参照的独立组件,用真人动作旁的环境反事实形成校准材料。适合能执行备选动作并持有相应真人日志的交互模拟;不把本文训练配方直接当生产用户分布,也不把增强版记忆机制或模型更换收益单独计入context增量。

取舍

代价集中在环境探索、反事实生成和策略训练;作者报告100,000个探索episode、8个epoch,增强版还增加检索与因果提问。时间切分存在,但目标评分、persona/记忆及55场私有A/B的隔离细节有限;GPT-4o真人感评分无本任务人工校准。图3相关性、表6动作拟合和表3主观真人感必须分开解释。

证据到哪为止

证据来自四类数据任务、OPeRA动作/会话指标、组件与反事实变体、55场私有A/B的页数相关及GPT-4o主观评分。真人校准、私有实验隔离和同预算成本证据仍有限。

09.24论文 EvoSafeHarness:按模型与领域生成安全控制,而非固定套用护栏问题固定安全harness在不同模型和工具领域间复用时,可能既拦不住有害动作,又误拒正常任务;自动搜索还会学到只对评测文件名或调用顺序有效的规则。结论安全harness的可迁移单位是动作关系及其执行时机,而不是一份跨模型通用的护栏清单。EvoSafeHarness展示了如何搜索这种部署专用组合;推荐的是有限接口内的生成与审查方法,不是通用安全保证。 观测与评测安全与隔离记忆与上下文 82.5
问题P1固定安全harness在不同模型和工具领域间复用时,可能既拦不住有害动作,又误拒正常任务;自动搜索还会学到只对评测文件名或调用顺序有效的规则。E1E2E3E4E5E6
├─缓解D1作者固定模型、工具和判分器,把自然语言策略与可执行拦截逻辑作为共同搜索对象;扩展可在调用前改写或拒绝动作、调用后处理结果,并保存每条轨迹的状态。E2
├─缓解D2候选进入评测前,由干净上下文中的审查器寻找改名、换位置或换顺序仍能保持攻击意图的绕过方式,再据此修订策略和代码。E3
└─缓解D3评测分别保存正常任务、直接攻击和间接攻击结果,并复用逐步扩大的样本前缀;只有统计上明显劣于无防御基线的候选才提前停止。E3E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

可迁移的是把领域安全关系、模型失效行为和具体hook位置分开建模:宿主定义不可改的工具/评测边界,搜索产物仅在声明的适配接口内改变策略、门控与轨迹状态。适合能明确描述动作效果的离线harness开发;不可把生成代码自动晋升为生产权限,也不能用请求一致性裁决直接有害请求。升级、回滚、UNKNOWN对账和父子完成原子性仍需独立协议。

取舍

搜索要信任领域规范、固定工具和评测边界,并支付一次性生成与审查成本。fresh-context仍是模型审查;候选可见task/threat metadata,论文没有完整字段与跨split模板去重审计。受限hook看不到无工具最终回答,近似移植基线及有限攻击族限制了泛化结论。 当前公开仓库未含最终生成bundle和逐实验配置,具体最终控制行为主要以论文机制与轨迹报告为依据。

证据到哪为止

证据来自三领域五victim的DTAP、ASB、AgentDojo到AgentDyn迁移、prompt-hook PAIR与候选档案。固定攻击族、近似基线、单次搜索和缺少完整元数据泄漏审计限定其外推。

09.24论文 CFRC:接任前冻结剩余目标,写入前核对完整方案问题多个模型接力处理有副作用的任务时,接任者既可能重做已确认的动作,也可能遗漏尚未完成的义务;单步工具检查发现不了从未提出的必要动作。结论可靠接任需要一个先于接任方案的剩余目标,以及真实写入前的整段检查。CFRC给出了这条合同相对的控制链,但原始任务是否完整仍取决于合同有没有漏项。 工具与协议状态与恢复观测与评测 82.5
问题P1多个模型接力处理有副作用的任务时,接任者既可能重做已确认的动作,也可能遗漏尚未完成的义务;单步工具检查发现不了从未提出的必要动作。E1E2E3E4E5E6
├─缓解D1作者在接任者提出方案前,从原请求、已接受历史和可信工具回执构造并冻结合同,分别写清必须保留的进展与尚未履行的义务。E2
├─缓解D2接任者先提交覆盖整个剩余任务的依赖图。宿主在任何真实写入前检查义务覆盖、参数来源和允许的效果,副本中的成功不算真实完成。E3E4
└─缓解D3获准方案执行时使用真实前驱回执绑定动态参数,并以仍然有效的实例证据确认义务完成;发生真实写入后的失败会结束当前执行段。E4E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

可把已有Agent交接点改成带版本的剩余合同:权威状态保存已接受绑定与效果,接任者只提交方案,宿主拥有准入与真实执行证据。适合工具效果和义务可以枚举检查的单次交接;开放式研究或无法完整表达副作用的工具不宜直接套用其完整性结论。生产系统仍需另外承担持久对账与并发隔离。

取舍

方法依赖可声明的工具效果、可核实例的真实回执和单执行段隔离。对话义务需要模型抽取,作者样本有6项漏提与2次错误完成。不可分叉环境仍须把动态依赖在写前表达清楚;写后失败无自动回滚,也没有持久UNKNOWN对账或递归取消协议。

证据到哪为止

五个工具基准、两个主要模型配对及三个跨提供方配对的作者结果,配套逐级消融和小样本合同审计;不涵盖生产故障对账、递归执行或任意语义请求的完备性。

09.24论文 MSI-Bench:把说话人范围、音频感知和回应克制分开测量问题多人共用语音助手时,回答流畅或工具格式正确并不能说明它把信息、约束、权限和披露范围归给了正确的人;单用户评测会漏掉这类行为错误。结论共享语音助手应分别测量信息归属、权限与披露、输入感知和是否该回应。MSI-Bench提供了可检查的场景判据与干预协议,诊断范围限于所测短场景和配置。 身份与权限工具与协议记忆与上下文 82.5
问题P1多人共用语音助手时,回答流畅或工具格式正确并不能说明它把信息、约束、权限和披露范围归给了正确的人;单用户评测会漏掉这类行为错误。E1E2
└─测量D1作者把短多人场景拆为说话人、角色、信息范围和预期动作,用独立的原子判据评价回答,并用确定性规则检查工具名称、参数和归属。E2E3E7
问题P2多人音频任务失败可能来自没听清、没有正确使用说话人范围,或在不该回应时开口;一个总成功率无法区分这些原因。E4E5
├─诊断D2作者在相同场景中把音频替换为带说话人标签的文本,并用同一组录音改变背景语音响度,分别观察输入条件变化后的行为与信息捕获。E4E5
└─测量D3作者增加提前截断和回答中插入旁人发话的探针,单独测量未被叫到时是否开口,以及无关插话后能否继续正确回答。E3E5E8
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

对多人Agent日志或语音输入管线,可借鉴按speaker/owner/scope/authority分开定义行为判据,再分层比较原始输入与清洁标注输入。克制与完成分别记分;工具输出匹配仍需与实际副作用分开,本文没有实现权限强制层。

取舍

固定合成场景有利于对照,却不能代替动态交互和外部副作用。文本替换同时改变感知和显式标签,不能拆分ASR、分人和记忆架构贡献。单次生成、有限人评和不同推理预算限制排名解释;编号规则与例子不一致需保留,不能将first appearance编号当已核实现合同。

证据到哪为止

依据1152个合成中英场景、九配置两模式文本替换、96英语音轨的SNR干预和216响应的人评;不证明新harness收益、实时系统安全或成本最优。

09.24论文 Fine-Mem:把局部保留反馈与长期检索奖励连到记忆操作问题记忆管理器连续增删改历史信息时,最终问答总分无法及时指出哪一步保存了有用内容,导致局部信息保留与长期任务效用难以同时优化。结论细粒度反馈可以同时照顾每步保留和最终检索效用;Fine-Mem支持这两类反馈组合训练记忆管理器,但其检索回溯只是信用代理。 记忆与上下文状态与恢复观测与评测 75
问题P1记忆管理器连续增删改历史信息时,最终问答总分无法及时指出哪一步保存了有用内容,导致局部信息保留与长期任务效用难以同时优化。E1E2
├─缓解D1作者为每个输入分块预先生成并核对局部问答,用更新后的记忆回答这些题,给当前记忆操作提供即时的信息保留反馈。E2
└─缓解D2作者给记忆项保留更新步标记,把最终问答得分分给检索到的记忆项,再回溯到对应步骤;这部分奖励与均匀分配的奖励混合,联合训练管理器。E3
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

可迁移的是记忆操作日志中的更新步与局部/全局反馈分账:把新信息是否留存、是否被检索、最终任务是否成功分别记录。适合有可核文本流和固定下游任务的离线记忆策略开发;不要把检索信用直接作为删除或提权依据,也不要把文中结果外推为线上多用户一致性。

取舍

CSR偏向可生成短事实题的内容,未必覆盖未来任务所需的关系或省略。EARA把检索到当作证据代理,无法把相关性变成因果使用;UPDATE步映射也不完整表达全部来源历史。组合收益伴随不同记忆量和训练预算,不能宣称等成本最优或每个组件独立提升准确率。

证据到哪为止

依据两个文本基准的所报配置、组件对照和模型替换;样本规模不均、训练预算不齐,无操作级因果效应或完整成本结论。

09.24论文 CIG:用演化的主张记忆测量对话信息增量问题多人讨论中,一句话是否增加信息取决于此前说过什么;长度、词语新颖性和礼貌程度难以区分新增理解与重复发言。结论CIG把“说了多少”改成“相对于已有主张增加了什么”,用动态参照、人类标注和上下文替换建立可检查的测量协议。它适合作为特定讨论场景的信息推进诊断,不能替代事实核验或任务完成判断。 记忆与上下文观测与评测文件与工件 75
问题P1多人讨论中,一句话是否增加信息取决于此前说过什么;长度、词语新颖性和礼貌程度难以区分新增理解与重复发言。E1E2E3
├─测量D1把每句话拆成带说话人和回合来源的原子主张,再按同一说话人的蕴含、重复或矛盾关系新增、修订或保留记忆,为下一句话建立动态参照。E2E7
└─验证D2让人类和模型在相同议题、记忆摘要与短上下文下评定信息增量,并替换历史表示、比较传统代理和人类评分,检查测量条件会怎样改变结果。E1E3E4E5
问题P2一句话可能包含多条质量不同的主张,整体信息增量不能直接由各主张和各维度的平均值解释。E6
└─诊断D3分别聚合一句话中的主张分数和信息维度分数,比较哪些组合更接近整体人评,并按主持人行为及随后回合观察信息增量变化。E6
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑建议在审议、讨论辅助或多Agent对话日志的离线分析中,借鉴来源主张、版本化知识参照和评分条件分账。保留原始话语、speaker、turn和变更记录,单列信息增量与事实正确、权限、业务任务成功;不要将新颖性高或记忆变化多直接变成在线奖励或完成判据。迁移到非审议任务时,含意范围轴及其权重需要重新定义,本文没有提供通用值。

取舍

记忆状态让参照可查询、可追溯,但抽取去除犹疑词并依赖蕴含判断,可能把不确定陈述压成更强主张;说话人归属不等于真值核验。每主张只保留一个目标会漏掉多重关系。人工参照本身看的是摘要,且选段偏向摘要有帮助的材料;过滤低一致性标注者后的α不能当原始总体可靠性。信息增量适合离线诊断,低分协调话语仍可能有用。

证据到哪为止

20场英文审议中的80个定向选段、摘要条件人评与多模型上下文对照、样本内代理相关/聚合分析,以及49句局部时延;不覆盖随机完整讨论、跨语言、在线Agent效用或主持干预因果效果。

09.24论文 Mnemis:用层级选择补充相似检索遗漏的记忆问题长期对话中的枚举和跨事件问题需要覆盖所有相关事实,局部相似度检索容易遗漏措辞不同的事件,导致答案不完整。结论Mnemis将记忆检索从单一相似度入口扩为相似与层级两路,作者离线对照支持两路互补。可迁移的是候选生成与最终输入裁剪的分工,完整召回、在线更新和等成本优势仍不在证据范围内。 记忆与上下文文件与工件身份与权限 75
问题P1长期对话中的枚举和跨事件问题需要覆盖所有相关事实,局部相似度检索容易遗漏措辞不同的事件,导致答案不完整。E1E2E3E4
├─缓解D1作者在底层记忆图上建立可多重归类的语义层级,让模型从较宽的类别逐步选择相关分支,补充与问题措辞不相近的记忆候选。E2E3
├─缓解D2作者把层级路线与相似度路线的候选合并,分别重排原始片段、实体含类别和关系,再按各类数量预算组成回答上下文。E3E4
└─缓解D3作者保留原始会话、实体、带时间的关系及回指会话的边,并在抽取时反思遗漏、去重和显式保留说话者实体。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑判断:适用于能保留原始会话、承担离线层级构建成本、且经常回答枚举或跨事件问题的记忆服务。可借鉴相似候选与结构候选分开生成、合并后再按类型限制输入的设计。在线高频更新、即时删除或严格等成本场景不能直接沿用作者结果;索引版本、删除和租户边界需要服务本身已有的明确合同。

取舍

层级构建和模型浏览增加成本;top-k只限制最终条目而非全局选择工作量。周期重建使更新有滞后,删除也需重建。模型类别选择仍可能遗漏,公开选择器的普通分支未显式走到实体层,因此不能把论文方法描述当成已核实完整在线实现。

证据到哪为止

证据来自两套离线记忆问答、LoCoMo的同模型路线消融与有限人工抽查;公开代码仅覆盖全局选择的局部路径,非在线一致性或完整生产系统验证。

09.23论文 The Pitfalls of KV Cache Compression:分开测量每条指令的压缩损失问题多条指令共用压缩缓存时,平均任务分掩盖了某条约束被优先丢弃,系统行为可能在业务指令仍有效时失去保密约束。结论压缩应按每条指令检查信息丢失和行为变化;已知跨度下的显式保留能改善部分取舍,但不是任意提示或在线Agent的可靠性保证。 身份与权限安全与隔离观测与评测 82.5
问题P1多条指令共用压缩缓存时,平均任务分掩盖了某条约束被优先丢弃,系统行为可能在业务指令仍有效时失去保密约束。E1E2E3
└─诊断D1分别检查各条指令的表现和缓存保留比例,再改变指令次序与驱逐策略,观察平均得分掩盖的选择性失效。E1E2E3
问题P2全局驱逐策略可能把缓存主要分给其中一条指令,开发者缺少在同一预算内保护其他指令的直接控制。E4E5E6
├─缓解D2在固定总缓存预算中先保留人工指定的关键防御词,再把剩余位置交给原策略选择。E4
└─缓解D3把上下文划为已知指令片段,按长度分配缓存并在片段内选择信息;部分策略同时改用片段内注意力评分。E5E6
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑判断:对于能控制离线KV驱逐的服务,把业务指令和治理约束分别作为信息保留与质量观测对象,可借鉴固定总预算下的分段保留。公平保留只约束信息选择;权限与副作用仍须由模型外组件执行,不能把低泄露分当作安全授权。

取舍

语义跨度须预先知道;白名单与分片选择有人工先验。ROUGE-L、未经人工校准的补充judge、未定义的±和不同子集比较限制解释;公平策略也并非在全部范围更优。

证据到哪为止

两模型、五类策略、541条修改IFEval与TREC补充;离线系统前缀、greedy输出,有限语义judge与H2O计时,未建立通用泄露率或不确定性保证。

09.23论文 Self-Healing Harness:把自写规则的临时试用与永久保留分开问题Agent为修复一次失败而自写规则时,规则可能改善当前任务却损害原本成功的行为;直接跨任务保留会让这种损害延续。结论外部准入把自写规则的长期权威与生成能力分开,保护案例能发现局部修复的附带回退;有限重放和弱forward仍不能保证累计规则集或外部副作用可靠。 工具与协议观测与评测文件与工件 82.5
问题P1Agent为修复一次失败而自写规则时,规则可能改善当前任务却损害原本成功的行为;直接跨任务保留会让这种损害延续。E1E2E3
├─缓解D1把运行中的失败通知和自写规则放入独立工作区,由Agent提议规则,由runtime决定规则能否跨任务保留。E1E2
└─验证D2候选规则先临时生效;可重放时同时检查目标改善和保护行为,无法重放时改用明确较弱的后续会话试用。E2E3
问题P2即使每条规则分别通过检查,积累后的规则集合仍可能伴随在线表现下降;候选通过率无法反映集合层退化。E4E5E6
└─诊断D3另行复查规则集合,并沿相同任务顺序比较有无harness的表现变化,区分单条准入与集合层退化。E4E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑采用判断:对可捕获回放案例、非对抗、文本规则工作区,可借鉴提议/临时/持久三阶段、晋级证据和验证路径标记。把replay与forward分别展示,保留原规则与原始轨迹;不要把规则退役解释为外部效果回滚,也不把此机制当权限隔离。

取舍

保护只有每轮至多两个未按语义排序的案例,forward没有保护组;候选临时执行可能已有不可逆影响。在线同流适应、单一seed及未隔离准入组件限制收益归因。额外评估与修复增加费用和同步等待。

证据到哪为止

非对抗文本规则;16组在线比较、有限捕获案例与五组分段遥测。核心诊断来自replay判退子集,整体收益未隔离准入组件。

09.23论文 IntentKV:按当前问题选择并整块保留上下文问题长材料问答削减KV缓存时,固定尾窗注意力可能混入无关背景,逐token保留又会拆散回答所需片段。结论问题条件的注意力选择与连续块保留能在固定缓存预算中减少关键信息丢失;当前证据支持单轮末尾问题,不支持持久记忆或通用效率保证。 记忆与上下文身份与权限文件与工件 75
问题P1长材料问答削减KV缓存时,固定尾窗注意力可能混入无关背景,逐token保留又会拆散回答所需片段。E1E2E3E4
├─缓解D1利用输入末尾注意力分布的变化找出问题后缀,让这部分token决定历史内容的重要性。E1E2E6
└─缓解D2在同一KV预算中选择高分连续块,连同高注意力位置附近的信息一起保留。E1E2E3
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑采用判断:在能访问模型注意力和KV的单次长材料任务中,可借鉴先界定当前信息需求、再按片段预算保留的原则。服务端若未来问题会改变,应保留可重新装载的原文;不把这次驱逐当持久记忆删除,也不把论文倍速写成SLO。

取舍

末尾问题假设和不可逆驱逐限制多轮;20样本注意力命中不验证语义意图识别。图表字段、源码定界启发式与纯解码计时存在差异,弱指向摘要未获一致收益。

证据到哪为止

四模型静态长上下文、同容量比较与双组件消融;20样本答案命中诊断。保留图表冲突、实现差异和计时范围限制。

09.22论文 OSWorld-Pro:让最终成败之外的子目标进展可核对问题桌面Agent即使最终交付成功,也可能在中途做大量无关动作;只检查最终文件无法说明它在哪个子目标停滞、错误来自哪里。结论最终交付能回答有没有做成,子目标过程参照还能指出在哪里停滞以及哪些努力没有推进。本文给出可审查的离线测量链,但过程裁判仍有分层误差,也依赖顺序任务结构。 文件与工件状态与恢复记忆与上下文 75
问题P1桌面Agent即使最终交付成功,也可能在中途做大量无关动作;只检查最终文件无法说明它在哪个子目标停滞、错误来自哪里。E1E10
├─测量D1作者把任务拆成顺序依赖的子目标,并让每一步依次标注目标、可行性、进展与首次完成,用人工复核建立过程参照。E2E4E9
├─验证D2作者让裁判读取完整轨迹,一次输出全程标签,再分别对照人类标注核对步骤、子目标和完成比例的误差。E3E7
└─诊断D3作者把过程标签汇总成动作进展和子目标投入,区分成功推进、可行却失败,以及在不可行目标上耗费步骤。E6E10
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑采用建议:在已有独立终态验收旁增加离线子目标审计,保留轨迹、子目标定义版本、各层标签及条件分母;将环境不可行、动作无进展和最终交付分账展示。只有步骤依赖明确、可获得人工参照且可承担全轨迹处理成本的任务适合直接借鉴;不要把离线标签直接接成自动取消或权限决定。

取舍

过程可解释性需要人工拆分子目标、复核标签以及读取完整轨迹的高上下文裁判。单调顺序规则限制回访和并行任务;可行性与进展判分弱于完成判分,限制下游故障诊断的精度。模型排行混合harness、reasoning和成本条件,不能用于纯模型或context因果归因。

证据到哪为止

证据来自305个人工整理桌面任务、67264步标注、人工独立复核和作者报告的judge及actor评测。完成94.3是条件F1;过程诊断受可行性61.9和进展74.7的误差影响。正式actor单次且系统配置不同,不能证明近分显著性、通用在线恢复或纯模型优劣。

09.22论文 根级授权静止:把递归取消、跨端消息与独立授权保留组成可检查合同问题长时Agent在收到取消确认后,已委托的任务、消息和提供方预备效果仍可能使用旧授权提交。逐端报告停止无法证明整条授权链已静止。结论在完整注册与可信屏障前提下,退休一份根授权可以被证明不再导致新提交,同时保留精确独立授权的工作。 身份与权限状态与恢复文件与工件 82.5
问题P1长时Agent在收到取消确认后,已委托的任务、消息和提供方预备效果仍可能使用旧授权提交。逐端报告停止无法证明整条授权链已静止。E1E2E3E4
├─解决D1作者先在持久账本退休根授权的旧epoch,再由每个效果提供方安装本地提交屏障,并为屏障前已接收的效果保留精确回执。E2E3
└─解决D3作者把提供方叶证书绑定到同一冻结清单,并逐一核对发送与终态确认的消息身份;缺失或冲突保留为无法判定,只有完整闭合才签发根级静止证书。E3E4
问题P2共享Agent可能同时拥有可替代授权和必须联合满足的授权。撤销一个根时,直接删除子树会误停独立授权工作,只删除根标签又可能继续使用旧权限。E2E5E6
└─解决D2作者用最小充分授权集合区分可替代授权与联合授权;共享工作只有在操作和效果范围不变、重新选中排除旧授权的当前支持后才能继续。E5E6
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

采用root/cut/leaf/token的持久身份与三态完成合同,在可控sink处设置fence;共享任务用不扩张操作的原子rebind继续。无法提供完整证据的远端保持未知,不把cancel成功当安全完成。

取舍

安全证书以完整中介、可信适配器、精确token和最小支持来源为代价;永久不透明端点会让签证永久不可用。已接收效果不能回滚,参考实现未给真实提供方集成与规模成本。

证据到哪为止

条件形式证明加本地文件账本、子进程竞态和作者报告的17案例/44变异;无真实跨提供方接入,证书不等于业务完成或回滚。

09.22论文 EvalMem:把记忆失败分层诊断,并在动态对话中控制可见事实问题记忆系统答错时,端到端分数不能区分事实没有写入、已经保存却未被检索到,还是模型拿到证据仍未正确使用;诊断检索自身漏召回还会把第二类误判成第一类。结论把记忆失败按实际信息通路拆开,同时以固定语义事实支持动态对话比较,比单一准确率提供更多可操作信息。 记忆与上下文状态与恢复工具与协议 80
问题P1记忆系统答错时,端到端分数不能区分事实没有写入、已经保存却未被检索到,还是模型拿到证据仍未正确使用;诊断检索自身漏召回还会把第二类误判成第一类。E1E2
└─诊断D1评测分别检查存储内容、原生检索结果及同一模型在oracle证据下的回答,再按条件屏蔽和多标签规则区分编码、检索与生成缺陷。E1E2
问题P2固定历史回放忽略Agent回复对后续对话和记忆的影响,但完全自由的动态对话又会让各系统看到不同事实,失去可比性。E3E7
└─测量D2动态评测固定隐藏世界状态、必须暴露的事实和会话末只读问题,让各Agent自由回应,同时追踪并补充尚未出现的必要事实。E3E7
问题P3诊断指出检索缺陷以后,仍需要检查同一记忆中的信息换一种检索表述是否有用,避免把分类标签误当成可操作的改进结论。E4E6
└─验证D3MemWiki只从系统自己的记忆导出建立带来源指针的辅助检索表述,再经原检索器、来源展开和重排送回固定数量的记录。E4E6
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑建议:Agent服务器将native回答、原生检索清单与只读诊断通道分账;仅诊断器可见参考证据。持续对话评测固定语义状态和暴露要求,保留on-policy交互,单独解释评审稳定性、系统变异和成本。MemWiki适用于已有记忆却难以取回的系统,不能替代写入正确性与权限控制。

取舍

诊断store搜索不是穷尽,4.4%残余MISS和同候选池人工审查限制编码归因。oracle回答改善只支持操作诊断,不保证唯一因果。MemWiki固定记录数未固定token或新增构建重排成本;五次复评只覆盖评审随机性。DynaMem是10persona合成任务;跨LoCoMo差异包含题型变化。

证据到哪为止

作者七个系统、三个任务集和模型条件下的诊断与干预;诊断召回、模拟世界和记录预算仍限制归因与外推。

09.22工程 Hermes:递归委托的超时、上下文与完成通知边界问题递归委托会持续等待自己的子任务,通用工具超时却可能先宣告失败;父Agent因此丢失结果并反复轮询仍在运行的后代。结论递归Agent需要把委托存活、父上下文容量和最终结果确认作为三个明确合同;本案例给出可定位的局部修复。 工具与协议记忆与上下文文件与工件 75
问题P1递归委托会持续等待自己的子任务,通用工具超时却可能先宣告失败;父Agent因此丢失结果并反复轮询仍在运行的后代。E1E2
└─缓解D1委托工具退出通用顺序调用超时,继续由委托自己的心跳、失活监视和子任务超时负责存活判断。E2
问题P2子Agent回传摘要时,若把累计token消耗当成父会话当前占用,摘要会长期被压到最小长度,父Agent只能依据残缺信息继续协调。E3
└─缓解D2摘要预算改用父Agent最近一次请求的实际prompt大小,扣除输出预留并在批次内分配;用量未知时只使用静态上限。E3
问题P3并行子任务的早期失败需要立即通知父Agent,但临时通知若共用最终结果的确认和去重身份,就可能让稍后的完整结果永远无法送达。E4E5
└─缓解D3失败子任务先发带任务索引的临时通知,最终结果保留独立的持久确认与去重路径。E4E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑建议:在可递归委托的服务端harness中明确唯一的存活管理者,以实际接收者上下文分配结果摘要,并把进度/失败提示与终态确认分开建模。迁移前提是已有持久最终结果通道;这些修复本身不提供公平并发预约、外部效果对账或递归取消确认。

取舍

移交超时责任仍依赖委托存活监视;临时失败通知可在进程崩溃时丢失。当前prompt预算是接收上下文估计,不能保证语义信息完整。人工handoff不是自动durable recovery,notice/final分离也未实现child artifact与parent completion原子提交。

证据到哪为止

证据是一次公开工程回溯、两份已合并PR代码及作者局部探针;不支持整体成功率、人工成本替代率或原子完成保证。

09.22工程 Cosmos DB Spec Kit扩展:让领域规则进入实现上下文问题编码Agent即使安装了数据库最佳实践命令,也可能自主跳过调用;知识没有进入实现上下文,插件安装成功便无法转成代码质量。结论扩展的价值取决于规则能否在需要时进入实现上下文。把选择后的规则内联到阶段hook能够减少自主跳过,但现有证据只支持有限的送达与流程改进,不能据此承诺更高整体成功率。 记忆与上下文文件与工件安全与隔离 75
问题P1编码Agent即使安装了数据库最佳实践命令,也可能自主跳过调用;知识没有进入实现上下文,插件安装成功便无法转成代码质量。E2E6
├─缓解D1扩展在实现前读取规格、计划与任务,挑选与当前访问模式有关的规则摘要并直接写入上下文,减少对Agent再次主动调用命令的依赖。E2E3E4
└─缓解D2扩展把实现前后hook设为非可选,并要求实现后的审查直接修改代码、按同一类别复查,保留未处理警告。E3E8
问题P2单独给模型规则后得到的合规分,不能说明同一扩展在完整自主开发流程中是否有效;内容价值、实际送达和应用结果容易被混成一个收益。E5E6E7
└─测量D3作者分别比较规则有无、原扩展与修改版的完整工作流,并结合轨迹调用率和行为测试结果判断内容是否有用、是否送达以及是否形成应用收益。E5E6E7
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑判断:可在服务端编码Agent中复用通用阶段循环,让领域扩展读取当前任务材料、选取并注入带版本的规则摘要,再由实现后审查给出修改及未处理警告。这里的版本记录是迁移建议。权限及外部副作用仍应由宿主既有机制控制,不能把模型自查当授权边界。运行观测应分别保留内容曝光、命令调用与任务结果,避免用安装数或局部合规分代替实际效用。

取舍

内联摘要提高送达覆盖,也使规则选择和修复依赖宿主阶段执行与模型判断。新版联合修改三处,不能拆出单个hook收益;实际应用对SDD无扩展基线仅有小幅差异。预览版本未给持久恢复、热更新隔离或不可绕过授权合同。

证据到哪为止

固定v0.2.0配置和提示、作者启发式规则测试、六场景中五个有提升空间场景的两模型SDD行为对照及调用轨迹;不含跨宿主强制执行、长期恢复或完整成本证明。

09.21工程 Browser Use:用持久代码与自主观察拆开浏览器能力和Agent循环问题浏览器Agent只能调用预设点击、输入和滚动动作时,跨步骤操作需要不断增加特例;动作组合被接口限制,长任务更依赖框架补丁。结论浏览器Agent的限制不只来自动作数量,还来自谁决定模型能观察到什么。持久代码和按需观察把两种选择交还给Agent,通用循环承接周转;宿主仍须承担执行隔离与外部效果恢复。 工具与协议状态与恢复文件与工件 75
问题P1浏览器Agent只能调用预设点击、输入和滚动动作时,跨步骤操作需要不断增加特例;动作组合被接口限制,长任务更依赖框架补丁。E2
├─缓解D1作者用保留变量和函数的代码执行环境替代固定动作菜单,让Agent自行组合、循环和复用浏览器操作。E2E4E5
└─缓解D3BrowserUsePi把浏览器代码执行接到Pi循环,复用循环和上下文处理,并分别暴露worker重置、部分结果与完成校验边界。E3E5E6E7E11
问题P2浏览器Agent若只收到预先抽取的可点击元素,页面上存在的控件也可能对模型不可见;模型无法主动换一种观察方式来补齐信息。E2E4
├─缓解D2作者开放DOM、截图、可访问性快照和浏览器调试协议,使Agent能根据缺失信息选择并生成下一次观察,而不必依赖唯一的预制页面表示。E2E4
└─缓解D3BrowserUsePi把浏览器代码执行接到Pi循环,复用循环和上下文处理,并分别暴露worker重置、部分结果与完成校验边界。E3E5E6E7E11
问题P3浏览器框架同时维护专用Agent循环时,还要独自承担压缩、取消和完成处理的错误,浏览器改进与长循环维护相互牵制。E3E5
└─缓解D3BrowserUsePi把浏览器代码执行接到Pi循环,复用循环和上下文处理,并分别暴露worker重置、部分结果与完成校验边界。E3E5E6E7E11
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑判断:在有隔离环境和宿主控制面的浏览器Agent中,将循环、持久代码执行和观察生成分成清楚接口,暴露stateReset、checkpoint和完成验证。适用前提是代码能力与浏览器权限可控;外部副作用对账及跨任务原子完成仍由服务端协议负责。

取舍

开放程序与观察减少接口特例,但增加代码执行权限、模型编程能力和观察预算责任。worker不是安全沙箱,取消只重置部分状态。作者工程对照小且多因素联动,不支持普遍成功率、费用或延迟结论。

证据到哪为止

机制由官方工程案例与固定Pi源码支持;token对照仅为Hermes的6任务、每格3次、特定模型和网站条件,不分离CDP、代码批处理与schema各自效应。

09.21工程 Kortix:替换Agent循环时保留权限与工具边界停止问题在已有Agent产品中替换执行循环时,新harness的消息、权限和停止行为可能偏离宿主已有语义,导致界面仍可用而控制边界失效。结论替换Agent循环需要显式迁移权限、消息和停止语义。Kortix给出了可检查的宿主/适配器分界与工具边界中断;其局部会话连续性不等于完整崩溃恢复或副作用撤销。 工具与协议身份与权限文件与工件 75
问题P1在已有Agent产品中替换执行循环时,新harness的消息、权限和停止行为可能偏离宿主已有语义,导致界面仍可用而控制边界失效。E1E2E3
├─缓解D1宿主保留认证、事件总线和环境服务,把Agent循环封装为具名端口后的适配器;会话启动时选择Pi,并在适配器内转换消息及接入原权限规则。E2E3E4E5
└─缓解D3适配器从同一wire表示提供列表与流,在轮次结束时保存模型消息、显示记录和完成轮次,正常重启后恢复该快照。E7E8
问题P2用户要让新输入接管运行中的Agent时,直接取消可能中断工具;迟到的取消请求又可能误伤后续轮次,因此停止必须识别具体会话、轮次和工具边界。E6E11
└─缓解D2工具边界停止请求绑定会话与当前轮次,等待运行中工具结束后停止循环;过时请求和已撤销请求不停止新轮次。正常路径先发布工具结束帧,但转换失败仍会停止。E6E11
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑判断:适合已有会话控制面的单沙箱服务替换底层Agent循环,采用宿主职责、明确端口、真实pre-tool权限和身份绑定中断。若要求失败时拒绝,应改变缺规则/非法policy的默认;需要崩溃中途恢复或副作用对账时另有持久协议,不能据此宣称现成能力。

取舍

同进程降低启动开销但没有adapter故障隔离;旧OpenCode wire是过渡格式;默认allow保持兼容;pending交互仅内存,轮次快照不覆盖在途效果,Pi扩展、compaction与subagents不支持。

证据到哪为止

证据覆盖9月18日官站公告、9月17日合并PR固定实现、脚本化权限/中断/正常重启用例与作者五会话echo启动案例,不覆盖社区扩展、复杂任务成功率、在途崩溃或远端效果对账。

09.21论文 GAUGE:分开核验满意度、任务成功和近分候选排序问题模拟用户和judge得到的高满意度,可能只证明会话听起来有帮助,而没有证明任务完成;用人类满意度校准也可能保留这个盲区。结论GAUGE把体验校准、任务完成与近分版本选择拆开,使高总体相关性不再直接成为上线保证。它提供测量与拒判边界,未修复Agent本身。 观测与评测文件与工件工具与协议 75
问题P1模拟用户和judge得到的高满意度,可能只证明会话听起来有帮助,而没有证明任务完成;用人类满意度校准也可能保留这个盲区。E2E4
├─测量D1作者为同一会话分别记录满意度、能看到任务与工具证据的模型评分,以及任务完成判据,检查体验认可是否对应真实完成。E3E4
└─缓解D3作者将自然终止位限制为截断报警,并对judge差距落在采样噪声内的比较保留拒判;模型或模拟器变化触发重新校准。E5
问题P2跨强弱模型得到很高的排序相关性,仍可能无法分辨上线时常比较的相近版本;把总体相关性用于小幅升级决策可能选错版本。E2E4
├─诊断D2作者将成功率相近的候选版本对与差距较大的版本对分开计算排序分歧,再用预算退化、更换评分模型和用户模拟器检查诊断的适用范围。E3E4
└─缓解D3作者将自然终止位限制为截断报警,并对judge差距落在采样噪声内的比较保留拒判;模型或模拟器变化触发重新校准。E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑判断:可把Agent发布评审的数据合同分成体验评分、任务完成证据、配置级比较与拒判原因四部分。近分版本不得仅凭全池相关性自动晋级;结束位仅作为截断信号,适用于已有可核验业务终态或动作记录的系统。

取舍

近分31%是相对有限样本oracle排序的分歧而非真实部署后悔率;其CI较宽。retail oracle并非纯非LLM,必须与airline分开。completion bit不覆盖大多数正常结束的语义失败;拒判以覆盖率换错误率。

证据到哪为止

作者证据来自合成τ²客服任务、25配置网格、受控退化和小规模盲人类panel;retail含LLM子判据,真实客户和近分真实排序仍有限。

09.21论文 SkillAlign:固定技能集合,比较它们如何进入上下文问题Agent拿到相关技能后,全文注入仍可能增加干扰或遗漏当下所需信息;只优化检索无法判断同一技能应该怎样进入当前上下文。结论SkillAlign将“选什么技能”与“怎样展示所选技能”分成两个决策,提供同候选接口比较。证据支持展示方式是独立变量,未证明一种压缩方式或学习策略普遍最优。 记忆与上下文身份与权限安全与隔离 75
问题P1Agent拿到相关技能后,全文注入仍可能增加干扰或遗漏当下所需信息;只优化检索无法判断同一技能应该怎样进入当前上下文。E2E3
├─缓解D1作者在技能提供者与Agent之间加入展示层,保留原始技能并生成提醒、带适用条件的摘要和有顺序的流程视图,也允许不展示。E3
└─测量D3作者利用固定接口的任务结果生成展示选择标签与偏好,在独立辅助环境上训练轻量策略,再用固定轨迹回放测量选择空间。E5
问题P2技能方法的成绩变化常混合了候选质量、文本长度和展示结构;若不固定任务、模型与技能集合,就无法归因于上下文接口。E2E4
└─测量D2作者固定任务、Agent后端、候选技能ID和顺序,只替换展示接口,并用无技能、近似等长普通摘要和保真审查区分接口效果。E3E4
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑判断:可将技能提供、视图生成和实际上下文装配分成独立接口,保留原文、来源、候选ID/顺序、视图版本与渲染长度。适用于需要比较技能呈现策略的harness;展示提示不形成权限强制层,安全关键动作仍由原有执行边界决定。

取舍

压缩不普遍胜过全文;生成视图仍有任务相关遗漏。表中C是渲染技能文本长度,超长条件会截断或拒绝,不等于实际输入账单。bootstrap只覆盖任务抽样,不覆盖模型运行随机性;策略是离线回放,不能宣称已在线自适应。

证据到哪为止

两套任务、三后端、固定provider候选的原文结果及局部等长/保真检查;未覆盖在线策略、完整计费和运行随机性,库来源泄漏控制细节有限。

09.21论文 REST:用位置平衡的多问题输入诊断共享上下文压力问题单题分数无法说明模型在同一次调用中处理多个子任务时是否会漏答后题,或把前题思路带入后题。用单题高分选择批量上下文策略可能高估可靠性。结论REST把“单题会做”与“多个问题共享上下文时仍能逐项完成”分开测量。位置平衡、逐项判分和失误分类可以成为批量任务的诊断层,但不提供上下文隔离的已验证修复。 记忆与上下文观测与评测工具与协议 75
问题P1单题分数无法说明模型在同一次调用中处理多个子任务时是否会漏答后题,或把前题思路带入后题。用单题高分选择批量上下文策略可能高估可靠性。E2E3
├─测量D1作者用循环窗口把原题组成不同大小的问题组,让每题在每个位置各出现一次,再比较同一模型的单题与多题逐项正确率。E2
└─诊断D2作者把失误分成漏答、汇总错误、推理错误、格式违规、重复和截断,并结合每个位置的正确率与推理token分配解释压力曲线。E3E4
问题P2多题分数下降可能来自推理干扰,也可能来自输出截断、答题格式或答案提取;只有一个总分无法区分这些原因。E3E4
├─诊断D2作者把失误分成漏答、汇总错误、推理错误、格式违规、重复和截断,并结合每个位置的正确率与推理token分配解释压力曲线。E3E4
└─验证D3作者分别改变答案提取器、提示、采样设置和输出上限,检查分数下降是否只由评测接口或生成限制引起。E4E6
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑判断:可把REST的任务身份、原答案、组大小、题目位置和逐项输出映射到Agent批量子任务的上下文装配评审。它提供何时出现遗漏或相互干扰的诊断材料;是否拆分调用、隔离上下文或重新分配预算是应用层采用判断,本文未证明任何具体修复方案的收益。

取舍

沿用公开原题减少新增标注,却保留训练污染风险;循环平衡位置并未穷举同伴组合。每次调用固定32K输出上限由多题共享,不能视为逐题等预算。提取器可改变分数,延迟随压力增加,注意力和不同训练模型的比较不支持单机制因果归因。

证据到哪为止

证据来自九个公开文本推理题库和三十余模型;预算扩展只覆盖两种蒸馏模型,提取、重复运行和延迟材料均有具体设置范围。没有真实Agent状态恢复或部署成功率证据。

09.21论文 Monotonic Scaffolding:逐层提供正确信息,分开测量依赖与稳定性问题同一道题最终答对,不能说明模型原本就会,还是必须先给出规则和解释。终点分数隐藏了模型对不同上下文材料的依赖。结论逐层提供正确材料能把信息需求与答案稳定性分开观察。论文给出了可追溯的条件序列和探索性题目画像,但Stable Accuracy衡量的是这套指导条件下的持续正确,不能替代真实推理能力。 记忆与上下文文件与工件状态与恢复 75
问题P1同一道题最终答对,不能说明模型原本就会,还是必须先给出规则和解释。终点分数隐藏了模型对不同上下文材料的依赖。E2E3
└─测量D1作者把专家题解整理为事实、争点、法律标识、规则正文、应用和结论,并逐层提供给同一道题,记录首次出现正确答案的位置。E2E3
问题P2模型在某个条件下答对后,加入更多正确材料仍可能让它答错;只看终点平均分会漏掉这种上下文稳定性问题。E3E4E5
└─诊断D2作者保留每题在各指导条件下的对错序列,分别记录首次答对与之后的首次复错;稳定准确率只计入从无指导开始就答对、且所有后续条件都答对的题目。E3E4
问题P3不同法律题目需要的指导材料可能不同,整体平均分无法区分普遍困难与特别依赖规则、应用说明的题目。E6
└─诊断D3作者对题目在各指导层的结果做主成分分析,探索整体难度与对规则、应用及结论材料依赖的不同分布。E6
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑判断:适合具有可信分层参考材料的知识问答、规则解释或Agent上下文装配诊断。保留任务真值、材料层和版本、每层输出、首次成功及复错位置,将无辅助正确率、指导依赖和持续正确分别展示。它不能签发在线法律判断、权限或完成凭据,也不证明真实Agent长期恢复。

取舍

每道题需要多种条件的调用和可靠专家题解;输入长度与语义结构一同变化。S2E的无退化0与正间隔混合,不能按同一越小越稳刻度解释;最高层给出结论是有意的oracle信息,不能当无辅助能力。打散对照保留边际准确率却也破坏题目难度关联。

证据到哪为止

证据覆盖3,123道巴西葡语法律选择题、17种模型设置、作者三次采样多数投票与打散对照;材料长度、自动结构化、单域样本和S2E解释冲突限制外推。

09.21工程 SuperQode Jev:由问题包提供判断,由宿主组合权限与完成状态问题编码Agent自主提出的命令可能符合工具名权限,却偏离当前任务或携带破坏、外传语义;将这类判断交给自由生成结果,又会模糊模型建议与硬策略的优先级。结论可替换的语义决策扩展应提供受约束的判断,由宿主代码决定权限与完成状态。SuperQode展示了这条职责边界及不同故障语义;它增加可审计的裁决接口,没有证明分类器正确或外部任务已经完成。 工具与协议状态与恢复运行时与调度 75
问题P1编码Agent自主提出的命令可能符合工具名权限,却偏离当前任务或携带破坏、外传语义;将这类判断交给自由生成结果,又会模糊模型建议与硬策略的优先级。E1E6E8
├─缓解D1把人审的问题、输入约束和阈值冻结成带版本与内容hash的问题包;决策客户端只回答预定类型,控制流仍由宿主代码拥有。E4E5E9
└─缓解D2在native工具执行前先尊重确定性拒绝,再由代码组合风险与任务判断;主动弃权要求审批,扩展不可用则显式回退原权限策略。E6E7E8
问题P2判分扩展的低置信、调用失败与真正通过若混成一个状态,编码任务就可能在缺少有效判断时被宣布完成;普通非空回答检查也会掩盖这一缺口。E1E10E11E12
├─缓解D1把人审的问题、输入约束和阈值冻结成带版本与内容hash的问题包;决策客户端只回答预定类型,控制流仍由宿主代码拥有。E4E5E9
├─缓解D3把一般决策的弃权和rubric的未评分保留为独立结果,修订循环有上限;headless仅在rubric满足时保留成功状态。E9E11E13E8
└─测量D4用有类型的标签与拆分数据记录通过、失败、弃权和未评分,另标记仅检查非空的旧冒烟任务。E10E12
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑判断:适合宿主确实拥有工具循环、已有可信硬策略而需要补充语义裁决的系统。将不可覆盖deny、可替换分类器和最终执行分开,记录pack版本/hash、模型、故障原因及实际生效策略。服务端若需要故障时强制审批,应显式改变组合策略;不能把本实现的回退当成已有拒绝保证。评分结果与外部效果收据分存,外部Agent仍需自己的执行前接入点。

取舍

语义门额外依赖托管服务、配置与网络;出错回退旧策略保留可用性,也保留旧策略的自动放行。pack按ID缓存,没有热加载/隔离/跨会话迁移协议。概率和args_plausible只是模型判断;rubric仅看裁剪文本,不能证明工具真实完成。外部ACP runtime不在控制范围。

证据到哪为止

证据是9月18日维护者文章与v2.4.0固定实现,覆盖native权限组合、一般决策和headless判分映射。单条live示例和小型合成标签不支持生产安全率、阈值校准、外部ACP覆盖或等成本优势。

09.20工程 Google Mantis:局部威胁上下文、快照来源与跨变更审查问题安全Agent仅看到局部代码或失鲜威胁文档时,难以判断一条可疑路径是否符合当前部署边界,容易把上下文缺失当成漏洞或安全结论。结论把代码版本、局部威胁模型和审查覆盖一起交给Agent,可以让上下文缩减更可解释;小变更快扫仍需跨变更深扫和独立裁决。可迁移的是上下文合同,生产效果与强制执行能力不能由技能文本推出。 记忆与上下文安全与隔离文件与工件 75
问题P1安全Agent仅看到局部代码或失鲜威胁文档时,难以判断一条可疑路径是否符合当前部署边界,容易把上下文缺失当成漏洞或安全结论。E1E3E5
├─缓解D1作者用代码元数据和架构、实体知识生成局部威胁上下文,并在公开技能协议中记录快照来源、归档旧模型及限制失鲜结论的用途。E1E3E5
└─缓解D2作者借助调用图扩展需要检查的上下文;公开协议要求保留索引覆盖信息,与词法检索取并集,禁止把空索引当作不可达证明。E1E4
问题P2逐次变更扫描可以缩短上下文和等待时间,却可能遗漏多个变更共同形成的漏洞;开发、扫描与裁决共用上下文还会传播同一种判断偏差。E2
└─缓解D3作者将单次变更的快速扫描与夜间聚合变更的深扫连接到独立triage,再把修复提案送回人工审查;各角色分别使用自己的规则和上下文。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑判断:适用于持续变化且需要局部威胁背景的代码审查Agent。将源代码版本、KB版本、索引覆盖、finding来源和裁决状态分开保存,派生上下文用于导航,缺失或失鲜时保留不确定结论。采用前提是能维护可信代码快照和领域边界;仅有文本技能而无host约束时,不应赋予自动关闭风险或自动合并权限。

取舍

上下文构建需要维护代码元数据、领域规则与快照关系。公开结构索引会退化到词法检索,threat-model依赖上游KB;MODE-OFF及显式target_root存在例外。博客内部部署、开源技能协议和模型外强制实现是不同证据层,不能互相等同。

证据到哪为止

依据为Google内部工作流描述、架构图和固定版本公开技能协议;生产数字未披露样本及归因对照,公开协议有退化模式,也未证明所有host实际执行这些约束。

09.20工程 CC-Gen与CAP-CPT:政策结构、规则适应性和内化训练分开评估问题只看策略文档长度或模型总分,无法知道任务集合、参数负担和条件分支变化怎样影响业务工具Agent;混入用户模拟器错误还会使政策推理成绩失真。结论CC-Gen让政策结构与内化后的规则适应性成为可单独检查的对象。作者方法能改善某些内化基线,却未保住完整上下文的全部更新能力;更适合迁移分项评测,而不是据压缩率直接选择训练方案。 工具与协议记忆与上下文文件与工件 72.5
问题P1只看策略文档长度或模型总分,无法知道任务集合、参数负担和条件分支变化怎样影响业务工具Agent;混入用户模拟器错误还会使政策推理成绩失真。E1E2
└─测量D1CC-Gen从数据库与政策模板生成可调任务和条件深度,再生成查询、gold动作与步数筛选,用全轨迹成功和条件参数准确率描述失败。E1E2
问题P2政策内化后的普通任务成功率不能说明模型能否接受新政策、覆盖旧条款或解释规则,因此输入变短可能掩盖规则适应能力的损失。E3E4E5
└─诊断D2作者把普通任务、整篇政策替换、局部规则覆盖、政策问答和通用指令遵循分开评测,比较完整政策上下文与内化后的policy ID条件。E4E5E6
问题P3只用成功推理与工具轨迹来内化政策,需要大量标注轨迹,且复杂条件下仍容易失败;有限轨迹不能充分展示不同规则该怎样应用。E3E4E5
└─缓解D3CAP-CPT先按事实、行为和条件复杂度组织政策训练材料,再用policy ID提供调用入口,并结合继续预训练与轨迹SFT学习应用规则。E3E4E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑判断:适用于评估是否压缩或内化经常变化的业务政策。保留policy版本、生成因素、gold动作、后续替换/覆盖内容与各自判据,把完整上下文作为对照,任务、更新、解释和成本分别记录。可迁移的是评测接口及取舍,不是把动态规则全写进权重;生产授权仍需模型外策略承担。

取舍

Task把任务数和参数数耦合,未做等token隔离;训练组额外CPT数据可远多于SFT横轴。所有实验单次运行,主测试量、去重和推理预算披露不足;referral judge未校准且量纲冲突,覆盖范围和有效期也不够完整。

证据到哪为止

证据为合成数据库/政策任务、多模型复杂度表、两种Qwen内化比较及改写Retail任务;全部单次运行,测试与预算口径、任务耦合及未校准referral judge限制因果和部署外推。

09.20论文 压缩保真与信息使用:固定记忆上的解码训练及分项诊断问题压缩模型能够重建原文,并不保证回答问题时能正确使用压缩表示;仅按重建分数验收,会漏掉生成过程中的信息混淆。结论这项工作把压缩表示的保真与生成时的信息使用分开,展示固定编码后训练解码器能改善若干QA任务,并伴随更频繁的局部原文重建。采用价值同时在压缩组件与分项诊断;效果和成本结论都要限定到作者的模型、任务和缓存条件。 记忆与上下文身份与权限文件与工件 75
问题P1压缩模型能够重建原文,并不保证回答问题时能正确使用压缩表示;仅按重建分数验收,会漏掉生成过程中的信息混淆。E1E2E3
├─缓解D1作者把固定文本块压成连续记忆向量,并在保留SFT编码结果的条件下训练解码器,以答案正确性为主要奖励并施加超长输出惩罚,让生成过程更常展开原文片段。E1E2E3
└─诊断D2作者分别测量原文重建、问答结果、不同长度阈值的逐字片段重建和跨区域取用,再用引用模板监督、另一模型家族与另一judge检查结论范围。E3E4E5E6
问题P2压缩后的任务总分和名义压缩倍数无法说明模型如何取用信息,也会掩盖输出、边界标记与预编码成本,使方案比较失真。E4E5E6E7
├─诊断D2作者分别测量原文重建、问答结果、不同长度阈值的逐字片段重建和跨区域取用,再用引用模板监督、另一模型家族与另一judge检查结论范围。E3E4E5E6
└─测量D3作者把表示压缩率与实际解码器序列缩短分开计量,并明确首token时延只在记忆向量已经预计算缓存的条件下测得。E7
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑判断:适合可以缓存并反复查询稳定长文档、且掌控模型输入表示的服务。可独立迁移的评测原则是将重建保真、任务结果、取用行为和实际成本分账。动态工具输出频繁变化时,编码成本未摊薄,不能直接套用TTFT收益;本文也未提供session更新、租户隔离或外部副作用恢复协议。

取舍

需要可修改encoder/decoder的模型栈和额外训练,不能直接应用到只接收文本的封闭API。完整上下文使用Instruct,作者模型从Base训练;跨家族采样与训练预算不一致。逐字重建只是行为诊断,缺少隔离其因果作用的对照。双judge未做人类校准,QA多seed、近重复审计与区间未报告。

证据到哪为止

依据为八组8000题QA、长上下文任务、重建和行为统计、CoT/跨家族/双judge对照及预编码缓存成本表。没有单独干预重建行为的因果证据,也未覆盖长程Agent工具执行或动态上下文维护。

09.18论文 SoL-Pi:用递归自动研究把harness开销变成可验证机制问题长轨迹中的重复动作、工具观察和上下文重放会累积成本,而固定工作流或膨胀协调代码难以在多环境发现可复用机制。结论SoL-Pi的增量是受控地搜索和编译harness机制,而不是简单压缩prompt;它把效率与证据保持放进同一选择门槛,但组合损失和治理依赖仍需显式记录。 观测与评测身份与权限记忆与上下文 92.5
问题P1长轨迹中的重复动作、工具观察和上下文重放会累积成本,而固定工作流或膨胀协调代码难以在多环境发现可复用机制。E1E2
├─解决D1作者用可丢弃最小skill loop和隔离的auto-research流水线连接提案、实现、审查、轨迹内验证与held-out验证。E1E2
└─缓解D2作者把Action Fusion、Online Context Compact、ObservationPack和Evidence-Preserving Reducer固化进harness循环。E3E4E5
问题P2成本优化若没有能力门槛和held-out边界,会奖励提前停止、跳过证据或记住训练任务。E2E6
├─解决D1作者用可丢弃最小skill loop和隔离的auto-research流水线连接提案、实现、审查、轨迹内验证与held-out验证。E1E2
└─缓解D2作者把Action Fusion、Online Context Compact、ObservationPack和Evidence-Preserving Reducer固化进harness循环。E3E4E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

服务器可采用可丢弃候选loop、训练/held-out隔离、能力与效率双账本,以及动作确定性、可寻址压缩、逐行证据收据三个运行时合同;自动搜索不应默认获得生产控制面写权限。

取舍

SoL-Pi把harness改进变成带能力门槛和隔离验证的候选搜索,并把动作、context、观察和委托机制一起编译到循环。

证据到哪为止

证据覆盖535个搜索环境、51任务EdgeBench和限定paired/swarm,支持机制及作者报告的成本趋势,不支持普遍迁移或完全自主RSI。

09.18论文 How Do Agent Harnesses Create Value:把计划、终态验收与风险价值拆开问题单一成功率无法归因计划信息、终态验证与模型能力,错误放行和正确结果被混在一个指标中。结论harness价值应分开测量计划内容带来的执行收益、终态检查减少的错误放行及成本,再在明确责任损失下比较配置。 状态与恢复观测与评测记忆与上下文 100
问题P1单一成功率无法归因计划信息、终态验证与模型能力,错误放行和正确结果被混在一个指标中。E1E2E3
└─测量D1作者用等词数、等包装的Fixed–Sham配对和任务聚类bootstrap估计任务特定计划信息的增量。E2E3E4
问题P2验证器会拦截错误完成,也会误拒正确完成并产生推理成本;缺少统一状态和责任协议就无法比较harness。E2E5E6
└─诊断D2作者把oracle正确性、完成声明、终态拒绝和增量成本做成状态矩阵,再按success价值与误放行责任损失计算条件harness价值。E2E5E6
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

服务器应把计划版本、执行轨迹、环境事实、完成声明和发布决定分账;按业务责任选择V/L和阈值,Verifier只读且拒绝后的修复另建状态。

取舍

本文用配对内容控制、oracle/acceptance分离和责任加权,把计划收益、错误放行和成本从同一个成功分数中拆出来。

证据到哪为止

证据来自τ²-bench Retail/Airline作者报告,支持限定环境中的组件归因和条件价值,不支持副作用回滚或部署总成本保证。

09.18论文 Inference-Engine Fingerprinting Attacks:把推理engine纳入Agent沙箱边界问题模板、tokenization和采样差异可把推理引擎身份泄露给模型,使只隔离代码与工具的沙箱遗漏必经高权限攻击面。结论推理engine必须与代码沙箱、工具服务器一样被视为Agent运行时边界;多轮harness反馈可放大实现差异,因此最小权限、隔离和审计要覆盖模型推理本身。 身份与权限安全与隔离工具与协议 87.5
问题P1模板、tokenization和采样差异可把推理引擎身份泄露给模型,使只隔离代码与工具的沙箱遗漏必经高权限攻击面。E1E2E3
├─诊断D1作者用多轮输出probe和反馈分析组成fingerprinting协议,测量五类engine在模板、tokenizer、sampling和detokenization上的可观察差异。E2E3
└─缓解D2作者把推理engine纳入纵深防御,提出标准化行为、多进程最小权限、engine VM、隐藏身份和memory-safe解析/内核边界。E4E5
问题P2self-refine、ReAct和子Agent反馈能累积probe并选择版本特定路径,因此engine解析器、GPU kernel和宿主权限需要独立最小权限边界。E3E4E5
├─诊断D1作者用多轮输出probe和反馈分析组成fingerprinting协议,测量五类engine在模板、tokenizer、sampling和detokenization上的可观察差异。E2E3
└─缓解D2作者把推理engine纳入纵深防御,提出标准化行为、多进程最小权限、engine VM、隐藏身份和memory-safe解析/内核边界。E4E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

服务器应按租户/会话隔离engine权限,限制网络、文件、GPU管理和宿主服务可达性,对多轮probe做外部限速和异常审计;优先API一致性和最小权限/VM隔离。

取舍

本文把推理engine从可信底座改写为Agent攻击面,要求harness安全边界覆盖模型输出、解析器、GPU和宿主控制路径。

证据到哪为止

证据来自五引擎差异、有限probe和受控PoC作者报告,支持威胁建模和防御优先级,不证明所有engine均可稳定指纹或生产链可复现。

09.18工程 BIRCH:用图像纠错和候选条件化锚点拆开评审偏差问题视觉评审的总体准确率不能揭示模型是否真的使用图像,也不能区分正确性与信息量偏好。结论BIRCH 把视觉评审偏差从总体准确率中拆出,并用候选条件化纠错 anchor 缓解信息量偏好;它适合作为静态工件评审的诊断与上下文组件,不是长期 Agent 成功或安全保证。 文件与工件身份与权限安全与隔离 75
问题P1视觉评审的总体准确率不能揭示模型是否真的使用图像,也不能区分正确性与信息量偏好。E1E3
└─测量D1作者用有图/无图差异、IDS/CDS 分组、长度配对和重复下采样把视觉使用、信息量偏好与正确性驱动判断分开测量。E1E3
问题P2错误或缺失的候选细节会让参考答案与最终选择同时偏向更丰富文本,单一参考答案无法稳定约束候选条件化比较。E2E5
└─缓解D2BIRCH 以图像纠正每个候选并合并为 anchor,再让最终 judge 带着原图、原候选和 anchor 重新比较。E2E4E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

工程推断:为多模态 judge 保存图像版本、候选哈希、纠正理由、anchor 来源和最终选择,将视觉证据使用与文本丰富度偏好作为不同事件字段;anchor 只能是可追溯参照,不能充当完成或授权凭据。

取舍

BIRCH 增加一次调用并保留残余信息量偏好;修订后的 benchmark 标签、有限模型和静态成对任务限制了外推。

证据到哪为止

证据覆盖两个成对视觉评审基准、八个 judge 和有限模型成本测量;修订标签流程、生成随机性、长轨迹和服务级副作用均未覆盖。

09.18论文 Anchoring Bias:把历史评分快照当作可干预的上下文状态问题迭代评审把上一轮分数、尝试编号或通过状态带回下一次judge调用时,旧上下文可能改变当前评分和放行决定,使评审不再独立且错误会沿着修订循环累积。结论历史评分快照即使只作为上下文元数据,也会改变LLM judge的评分和接受决定;评审系统应把历史状态当作可干预变量而非中性提示。 记忆与上下文状态与恢复观测与评测 95
问题P1迭代评审把上一轮分数、尝试编号或通过状态带回下一次judge调用时,旧上下文可能改变当前评分和放行决定,使评审不再独立且错误会沿着修订循环累积。E1E2E3
├─诊断D1作者用固定答案、随机低于门槛的先验分数和三条件配对协议,把无元数据、修订框架与完整历史元数据的judge输出分开比较,并以任务分层bootstrap估计总锚定效应。E1E2
├─缓解D2作者把数值评分效应与人工标签分类决策都纳入配对测试,并检查CoT和warning是否真正减少总效应。E3E4
└─未解D3研究没有给出能普遍消除历史锚定的运行时隔离协议。E3E4
问题P2只看平均分或单次准确率会掩盖历史元数据对临界门槛和不同任务类别的非均匀影响。E2E3
└─缓解D2作者把数值评分效应与人工标签分类决策都纳入配对测试,并检查CoT和warning是否真正减少总效应。E3E4
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

在Agent评审服务中将prior_score、attempt和revision标记放入显式审计字段,默认不让它们进入judge评分上下文;若业务必须提供,使用无历史分数的配对shadow judge和任务分层漂移监控,同时分别记录分数变化、门槛决定和人工标签纠错。

取舍

保留历史分数可提供流程线索,却会把错误判断变成新的上下文条件;warning可能增加token且仍不能移除总效应。

证据到哪为止

作者报告的多模型固定任务实验与人工标签分类配对;未覆盖未见任务、长周期循环、其他元数据组合或完整成本。

09.18论文 When KV Cache Reuse Fails:把选择一致性与最终正确率分开问题复用候选的KV缓存会改变judge看到的跨候选关系;最终答案正确率可能保持相近,却掩盖被选候选身份的大量变化。结论缓存复用是否保持最终正确率,与是否保持多候选联合选择,是两个问题;本文提供配对协议与信息干预来区分它们。 记忆与上下文文件与工件状态与恢复 82.5
问题P1复用候选的KV缓存会改变judge看到的跨候选关系;最终答案正确率可能保持相近,却掩盖被选候选身份的大量变化。E1E2E4
└─测量D1作者冻结候选文本并匹配输入排列,分别记录最终正确率、相对完整计算的候选选择一致率和候选块复用比例。E1E2
问题P2只观察复用前后选项不同,无法判断变化来自跨候选交互损失、输入顺序,还是参考judge本身不稳定,也不能直接判为质量下降。E3E5
└─诊断D2作者在完整计算中屏蔽跨候选注意力,并按顺序参考和不一致后果检查复用造成的变化。E3E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

工程推断:在judge服务记录候选ID、内容摘要哈希、顺序、缓存策略及所选ID,使任务正确性与候选选择不变性成为不同字段。冻结内容和排列是比较上下文执行策略时的必要配对条件。该协议适用于需要保留候选来源语义的选择器;等价答案可互换时,应同时解释变化后果,不能把JCR变成唯一优化目标。

取舍

严格保持选中ID只在后续确实依赖候选身份时有意义;不同正确答案交换可能无害。门控提高一致性时复用率大幅下降,不能据此主张速度收益保留。固定小样本、单一主backbone与有限模型探针限制外推。

证据到哪为止

支持有限任务上的judge行为诊断;不证明dense最正确、所有不一致有害、风险门控可直接上线或端到端加速。

09.18论文 Simple Agents, Biased Judges:多人对话生成与人类偏好校准问题多人对话生成需要控制发言角色、连贯性与重复,但每角色独立状态会增加编排负担;作者研究较少状态的生成流程能支持什么范围。结论轻量共享状态能组织短多人对话;判断其质量时,LLM之间的高度共识仍可能偏离该样本的人类偏好。 记忆与上下文状态与恢复安全与隔离 75
问题P1多人对话生成需要控制发言角色、连贯性与重复,但每角色独立状态会增加编排负担;作者研究较少状态的生成流程能支持什么范围。E1E2E6
└─缓解D1MPOD用一个滚动上下文按轮注入当前角色,结合发言者选择和语义重复重采样生成多人对话。E1E2
问题P2LLM评审之间排名一致,并不代表符合人类对自然和有趣对话的偏好;风格与生成器差异可能掩盖结构缺陷。E3E4E5
└─诊断D2作者用模型盲化、平衡顺序且允许平局的人类偏好作参照,再用替换单个发言者和打乱话语顺序检查LLM评审的倾向。E3E4E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

工程推断:多人对话评审的数据对象应保存主题、persona、发言序列、生成器组成、A/B顺序、Tie和判据理由。聚合LLM互一致时同时显示其与人类参照的一致性和弃选/平局习惯。MPOD的共享短上下文可作为低状态生成模式,不能直接转作医疗导航、长期协作或独立身份隔离的harness。

取舍

短窗口与有限重采样减少状态复杂度,也可能丢失远程信息。人类偏好参照有中等偏低一致性,样本计数不一致;移植与shuffle不隔离单一因素,故结果只能支持限定任务的评审失配,不足以宣称风格是唯一原因。

证据到哪为止

生成器机制可解释,人机差异有直接标注支持;不支持等成本优势、排除人类歧义或识别唯一风格因果因素。

09.18工程 DeepSeek Harness alpha2:把插件变更变成可恢复的控制事务问题运行中安装、启停和卸载插件会同时改变包文件、运行时资源和当前 Agent 能力;并发或失败会造成半激活、残留依赖或旧能力继续可见。结论插件能力的启停、依赖和权限变化应具备请求、锁、代际和失败恢复语义。 状态与恢复文件与工件运行时与调度 92.5
问题P1运行中安装、启停和卸载插件会同时改变包文件、运行时资源和当前 Agent 能力;并发或失败会造成半激活、残留依赖或旧能力继续可见。E1E3E4
└─缓解D1Plugin Manager 以 profile/bundle 层、requestId、共享写锁和 HMR unload 顺序管理插件生命周期,并在安装失败或取消时恢复快照文件。E3E4
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

采用控制面管理插件生命周期,提交 generation 化能力快照;worker 只读取已提交组合并记录每次失败/恢复事件。

取舍

developer preview、进程内host code和失败删除的partial changes增加信任边界与运维成本。

证据到哪为止

固定tag实现与发布说明;无生产SLO、多租户隔离或安全效果数据。

09.18工程 Build zero-trust AI agents:把意图策略放到 Agent Gateway问题只做正则、签名和输入输出过滤时,合法格式的工具调用仍可能违背用户意图或在多轮中累积副作用。结论意图治理应位于平台工具网关并观察跨轮行为;当前材料证明可组合机制,不证明生产安全效果。 工具与协议身份与权限观测与评测 72.5
问题P1只做正则、签名和输入输出过滤时,合法格式的工具调用仍可能违背用户意图或在多轮中累积副作用。E1E2
└─缓解D1Agent Gateway 将 Model Armor、按意图判断的 Semantic Governance Policies、跨轮 Agent Anomaly Detection 和 remediation 组合为平台层执行闸门。E1E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

将意图、身份和跨轮异常作为工具网关的三阶段决策,并让策略版本和副作用请求共享审计ID。

取舍

平台演示没有攻击成功率、误报率、延迟或策略版本迁移证据。

证据到哪为止

官方工程文章与companion demo;无系统化攻击、成本、延迟或一致性评估。

09.17论文 Nameless Tokenization:分开文本内容与控制标识符的生成权限问题用户消息和工具返回中的文本能够被编码成模板保留的角色、轮次或工具控制标识符,使外部内容与服务端写入的结构边界在编号层面混淆。结论服务端应分别控制谁能生成模板结构、谁只能提供内容;关闭文本伪造控制ID的通道可以建立局部边界,但模型仍可能听从普通文本里的指令。 身份与权限工具与协议记忆与上下文 75
问题P1用户消息和工具返回中的文本能够被编码成模板保留的角色、轮次或工具控制标识符,使外部内容与服务端写入的结构边界在编号层面混淆。E1E2
└─缓解D1作者移除内容编码器中将字符串映射为附加控制token的路径,让可信模板直接写入控制标识符,其他文本按普通词表编码并保留原始字符。E1E2E5
问题P2攻击成功率混合了分隔符外观与保留标识符的作用;直接删除或改写控制字符串又会破坏合法日志内容,使安全与内容效用的取舍难以判断。E3E4
└─诊断D2作者固定注入指令,比较无分隔符、编码为普通文本的分隔符和保留控制标识符,并用含分隔符的合法任务单独测量内容损失。E3E4E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑判断:适用于能够控制tokenizer与模板编译层的自托管Agent服务。可迁移的是为控制编号和普通内容保留不同生成入口,并把控制通道性质、合法内容保真、语义攻击成功率分开解释。迁移前提是掌握模板来源、保留ID集合与所有进入推理引擎的路径;仅能调用第三方文本API时无法在客户端完整实现。它应作为上下文编译边界的一层,不替代工具权限、来源治理与副作用控制。

取舍

移除控制ID通道并不移除同样文本的语义影响,甚至可能提高部分攻击成功率。作者只测五个模型、三个短任务和两个目标,tool攻击仅覆盖两个模型;合成日志probe不说明真实日志出现频率。实现依赖可信模板、文本输入以及控制ID只能通过移除的解析路径产生,绕过renderer或直接提供ID的调用不在保证内。代码和逐项输出尚未公开,全文未给部署延迟。

证据到哪为止

v1报告的256个可加载tokenizer审计、五模型296项短任务、200项合成内容probe及条件对照;无公开实现、部署风险估计或所有攻击均改善的证据。

09.17工程 NVIDIA:以共享USD工件和双重检查组织场景准备Agent问题多个Agent分别修改场景的标签、材料、传感器与物理属性时,后续工作需要依赖先前修改;临时编辑和一次性导出难以提供共同可检查的场景状态。结论文章给出一种把多Agent修改汇入共享领域工件,再用视觉与规则反馈安排后续任务的参考设计。它解释了如何组织场景准备与人类判断;证据支持局部工具步骤和USD检查,不证明完整仿真任务已经可用。 文件与工件状态与恢复工具与协议 75
问题P1多个Agent分别修改场景的标签、材料、传感器与物理属性时,后续工作需要依赖先前修改;临时编辑和一次性导出难以提供共同可检查的场景状态。E1E2
└─缓解D1作者先通过Blender工具盘点场景,再把子Agent产生的标签、物理属性和传感器定义写入可分层组合的USD场景,让后续Agent与仿真工具读取同一结构化工件。E1E2E3
问题P2场景能显示或通过结构检查,仍可能让机器人看不见目标,或遗漏对象角色与物理配置的关联。协调Agent需要知道该修什么、修改后重查哪些依赖,以及哪些意图交给人判断。E2E4E6
├─缓解D2协调Agent结合渲染视图与SimReady规则报告分派修复,再按修改的依赖重新检查:移动传感器后重看可见性,改变对象角色后重查标签与物理属性。E2E4E5E6
└─缓解D3作者将机械性修复与依赖任务意图的决定分开;标签不确定或物理行为有歧义时,子Agent携带上下文与建议交给人确认。E2E6
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑判断:适用于Agent协作编辑CAD、仿真场景等具有结构化领域工件的任务。可迁移的是把工件作为共享状态,分开记录结构规则与任务视图检查,并在修改后重查受影响依赖。采用前提是领域规则、工具能力与人类决策边界明确;若任务没有可检查的共享表示,照搬角色数量没有同等价值。生产服务仍需独立解决版本绑定、写入协调与恢复,文章不提供这些保证。

取舍

共享USD要求各工具正确维护对象层级和元数据,并管理目标profile及其版本。视觉检查增加渲染工作,按依赖重查增加协调成本;人类确认使模糊决定可控,也会中断无人值守流程。原文没有量化成本、错误率或成功率,没有说明多个Agent同时写入、检查结果绑定scene revision以及崩溃后的恢复。

证据到哪为止

正文机制、固定版本SimReady规范以及The Junk Shop局部工具展示;图9明确只检查选定资产与要求,未评估运行时行为,修复暂停。无端到端可靠性或自动修复安全性的比较证据。

09.17工程 Lost in Simulation:把模拟用户的偏差从Agent成绩中分离问题模拟用户的行为可能改变任务难度和错误类型,使一个Agent分数不能稳定代表真人使用时的表现。结论一个交互评测分数同时反映Agent与模拟用户;真人校准必须保留任务和人群条件。 工具与协议观测与评测文件与工件 80
问题P1模拟用户的行为可能改变任务难度和错误类型,使一个Agent分数不能稳定代表真人使用时的表现。E1E2
├─测量D1固定Agent和判分协议,只改变用户模拟模型,并用难度分层的人类任务研究估计模拟与真人成功率的差距。E1E2E3
└─诊断D2补充失败归因及礼貌、身份提示干预,检查模拟行为与校准误差如何随用户生成方式变化。E4E5
问题P2总体模拟分数可能掩盖不同人群的校准差异;相同平均成功率并不表示模拟器对各群体同样有效。E3
├─测量D1固定Agent和判分协议,只改变用户模拟模型,并用难度分层的人类任务研究估计模拟与真人成功率的差距。E1E2E3
└─诊断D2补充失败归因及礼貌、身份提示干预,检查模拟行为与校准误差如何随用户生成方式变化。E4E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

工程推断:把用户模拟配置视为eval协议的一部分,将总体成绩、按桶校准和群体样本范围分别保存。适合多轮用户交互Agent;不把礼貌或人口提示当普遍修复策略。

取舍

真人校准成本高,分层样本减少任务覆盖;按模拟成绩分桶便于审计现有benchmark,却把模拟器噪声带进难度定义。

证据到哪为止

固定GPT4o、115题模拟比较、18题真人子集和小规模失败标注;英语零售与特定招募群体,行为干预重新分桶。

09.17工程 Temporal:长期认证连接与单次登录尝试分开持久化问题把认证视为一次请求或后台任务,难以同时保存人工等待、浏览器归属、超时和后续重新认证责任。结论认证应围绕持续连接建模;Agent执行、人工等待和健康维护拥有不同生命周期。 状态与恢复身份与权限观测与评测 75
问题P1把认证视为一次请求或后台任务,难以同时保存人工等待、浏览器归属、超时和后续重新认证责任。E1
├─缓解D1用长期父工作流管理连接配置和健康责任,每次登录使用独立子工作流管理浏览器、超时、取消与清理。E1
└─缓解D2Agent返回结构化暂停后由Go工作流持久等待,用户输入经校验Update恢复,外部批准用独立的持久轮询与绝对截止时间处理。E2E4
问题P2健康探测失败不一定代表退出登录;将暂时故障当作失效会诱发不必要重试和账户锁定。E3
└─缓解D3将健康结果分成已认证、未认证和无法判断,并以持久失败计数及冷却控制重新认证。E3
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

工程推断:以连接为持久控制面,以尝试为浏览器资源所有者,分别建模人类输入、外部确认和健康不确定。采用前提是认证状态确需跨任务长期维护;恢复和动作幂等不能合并为一个保证。

取舍

增加父子状态、浏览器相关性和跨语言Activity契约的维护成本;持久等待节省占用,但仍需处理浏览器消失与外部动作不确定性。

证据到哪为止

一篇KERNEL生产一手叙述、简化等待代码及成功计数;没有完整实现、总尝试分母或因果可靠性比较。

09.17工程 EverMemOS:先组织经历,再按场景重建回答上下文问题平面检索能找到相关片段,却可能遗漏跨时间的关联证据,使回答无法组成连贯经历或正确解释变化。结论先组织经历,再选择与补齐当前任务需要的上下文;场景是检索结构,不能替代来源事实。 记忆与上下文文件与工件身份与权限 75
问题P1平面检索能找到相关片段,却可能遗漏跨时间的关联证据,使回答无法组成连贯经历或正确解释变化。E1E2
├─缓解D1先按语义边界生成有来源的MemCell,再按相似度、时间间隔及冲突条件归入MemScene,保留原文与检索索引的区别。E1E2
└─缓解D2先匹配原子事实和场景,再重排经历;由LLM检查信息缺口,必要时改写补检索。E2E3
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

工程推断:原文经历与派生视图分离,场景维护明确的时间和冲突规则,补检索显式保存缺口。适合文本个人记忆,不将前瞻推断直接当事实或权限;派生删除与并发更新另需协议。

取舍

构建和检索均引入模型调用与额外索引,早期重写错误可能传播;更高问答准确率不等于更低全生命周期成本。

证据到哪为止

LoCoMo与LongMemEval主要为Episodes-only,Profile另测且样本量口径有冲突;Foresight多为案例,充分性是LLM判定。

09.17工程 AWS:在同一知识图上比较上下文表示与检索策略问题不同关系检索策略使用的表示和上下文不同;仅按算法名称或单榜单选择,容易将问题类型差异和内容预算误当普遍优势。结论对图RAG有用的选择单位是实际交给模型的表示与检索预算,而不是算法品牌。 记忆与上下文身份与权限文件与工件 75
问题P1不同关系检索策略使用的表示和上下文不同;仅按算法名称或单榜单选择,容易将问题类型差异和内容预算误当普遍优势。E1E2E3
├─缓解D1固定词法、向量和图检索的融合骨干,让策略改变图遍历及上下文组织,并将原文段落带入局部图检索。E1E2
└─测量D2对同一问题比较策略与上游实现,同时报告任务准确率、上下文构成和独立计量的查询成本,保留不显著及反向结果。E2E3
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

工程推断:在知识Agent的context assembly保留表示类型、来源段落、实际token与成本元数据;策略与数据入口解耦。增量清理的失败状态需独立对账,参考样例不提供跨库事务。

取舍

共享图降低多策略比较成本,但建图、实体抽取和多轮生成仍昂贵;复杂策略不必然优于廉价替代方案。

证据到哪为止

两个各100题多跳集、三run、28题主题集及另20题费用样本;一图与默认配置,不能推导通用优越、等效或原子更新。

09.17论文 图记忆是否值得采用:先对齐检索键、证据与重排问题长期对话记忆系统的整体分数混合了抽取、表示、检索和回答差异,难以判断图结构究竟带来了什么收益。结论图是否值得使用取决于它保存和返回了什么信息;把检索表示与原会话证据分开,比分别看系统总分更能解释设计选择。 记忆与上下文状态与恢复身份与权限 75
问题P1长期对话记忆系统的整体分数混合了抽取、表示、检索和回答差异,难以判断图结构究竟带来了什么收益。E2E5
├─测量D1把记忆管线拆成抽取、索引维护、检索和回答,显式区分检索键与证据值,再逐阶段比较表示、维护操作和重排选择。E2E3E4E5
└─缓解D2用带自然语言描述的实体作为检索键,映射回原始会话作为回答证据;按实体相似度与关联数量重排,强基线无需扩展邻居。E3E4E5
问题P2适合搜索的实体或摘要不一定保留回答所需的背景;召回正确会话也可能因信息压缩或噪声而答错。E3E5E6
├─缓解D2用带自然语言描述的实体作为检索键,映射回原始会话作为回答证据;按实体相似度与关联数量重排,强基线无需扩展邻居。E3E4E5
└─诊断D3分别检查更新、保持不变和抽取前过滤的效果,同时报告信息精度、召回和回答错误,揭示维护及过滤的损失。E3E6E8
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

工程推断:将带来源版本的key索引与会话value档案分开,按权限回取证据并记录装配出处。适用于能保留原文并承担抽取/维护成本的长期对话;论文未给出更新原子性、留存治理或多租户协议。

取舍

以实体描述抽取、图维护和原会话留存换取匹配与回答信息的分工。图在LME-M更贵,更新可能损精度,过滤可能丢来源;预算、judge与模型标注冲突限制因果归因和生产外推。

证据到哪为止

ACL2026正式版的LongMemEval-S/M与HaluMem-medium阶段比较;无等token预算、图拓扑独立因果证明、judge人工校准或CI,回答模型标注冲突保留。

09.17论文 Fuse:把社会事件与用户转述拆开评测问题助手只从用户转述理解事件时,答错可能来自叙述遗漏、用户偏见或模型推理;直接给全知事件的评测无法区分这些来源。结论将事件与转述分层保存并对照,能识别信息通道造成的判断差异;人类可解性与正确/错误/拒答分报比一个总分更有解释力。 观测与评测文件与工件身份与权限 75
问题P1助手只从用户转述理解事件时,答错可能来自叙述遗漏、用户偏见或模型推理;直接给全知事件的评测无法区分这些来源。E2E3
├─诊断D1先模拟带预设隐藏动机的多人事件,再单独生成用户咨询;固定事件后改变转述偏见与细节,并比较直接观察事件和只看转述的模型。E2E3
└─验证D2分别统计正确、错误与拒答,并用事件及转述的人类多数票检验隐藏动机是否表现出来、输入是否足以作答。E4E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

工程推断:在评测数据层保存event_id、隐藏标签、debrief条件和可见文本之间的关系,标签与完整事件只对评测控制面开放。模型请求按可见输入构建,输出分别保存正确、错误、拒答与所用效用权重;比较以共享事件为单位,防止把同一事件的许多转述误当完全独立样本。适合诊断用户转述驱动的助手,不适合把合成标签当作现实人际判断依据。

取舍

生成、人工验证与分组评测增加成本;二元潜在动机和同源模拟器提高可控性,却限制现实有效性。

证据到哪为止

1200合成事件、21600首条消息、12模型及人类多数票参照;不是现实动机真值、自动judge校准或多轮恢复保证。

09.17工程 COMPASS:用战略信号触发上下文重建问题长任务中的执行者既要推进工具调用,又要发现循环和错误;反复追加整段历史难以保证下一阶段保留关键证据并及时改变策略。结论把战略转向与上下文刷新绑定,能缓解长程执行中的错误坚持与信息丢失;稳定内循环前缀的收益有任务和计算预算边界。 记忆与上下文工具与协议文件与工件 75
问题P1长任务中的执行者既要推进工具调用,又要发现循环和错误;反复追加整段历史难以保证下一阶段保留关键证据并及时改变策略。E2E3
├─缓解D1将工具执行与战略监控分开;监督者读取当前轨迹,发现循环、错误或完成信号后,引导下一轮继续、转向、核验或结束。E3E5E6
└─缓解D2在战略转折时用旧笔记、当前轨迹和监督决定重建简短brief;同一内循环沿用该前缀,并按轮保存证据、约束与未决事项。E3E4E6
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

工程推断:在已有可靠工具执行层上增加三个角色,保留原始轨迹为依据,按round生成带来源引用的brief与notes版本。战略信号触发下一轮发布,当前轮使用稳定版本;工具结果先落入轨迹,再进入上下文整理。适合长程浏览和研究任务,短任务可能不值得额外监督成本。持久化、版本提交、取消ACK和业务幂等需要执行层另行承担,不能交由自然语言brief保证。

取舍

三个角色增加推理与协调成本;压缩后的brief可能遗漏证据,缓存复用依赖轮内前缀稳定,训练小模型又增加样本与策略维护成本。

证据到哪为止

ACL正式稿同主模型三类任务比较与组件消融;不证明等算力最优、可靠停止、在途取消、持久恢复或12B扩展的精确效率。

09.17工程 分布式技能:把有界专家推理迁回主Agent问题有界领域能力也被封装成独立推理Agent时,主Agent必须委托、等待并再次解释答案,增加模型循环;服务独立部署并不总要求推理也独立。结论领域服务可以继续分布式部署,而有界能力的推理可以汇入主Agent;是否保留专家Agent取决于自治、私有上下文和生命周期。 工具与协议身份与权限状态与恢复 87.5
问题P1有界领域能力也被封装成独立推理Agent时,主Agent必须委托、等待并再次解释答案,增加模型循环;服务独立部署并不总要求推理也独立。E1E4
└─缓解D1把有界专家的指令变成可加载skill,保留远程typed MCP业务操作,由主Agent选择操作;有自治需求的研究专家继续保留独立Agent。E1E3E6E7
问题P2把专家指令搬进主Agent后,若同时暴露所有领域工具,schema会继续累积;只认技能名称又可能在加载失败时错误扩展当前可调用目录。E2E3E4
└─缓解D2宿主预取provider目录,但只有技能正文成功读取并匹配缓存后,才把该provider整组工具加入当前执行循环,下一次模型调用再暴露schema。E2E3E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

在可信只读有界域中保留远程服务与服务器端检查,把领域指令交由主Agent解释;将工具暴露绑定provider身份、成功加载和本次run。

取舍

减少嵌套模型循环,却把更多指令和schema放入主上下文;演示总token反增。整组曝光简单,但权限、跨turn恢复和协议版本需另行治理。

证据到哪为止

固定56f453a实现和三对非受控演示支持控制流,不支持质量等价、普遍速度提升或成本下降。

09.17论文 CPE:追踪上下文来源跨角色与作用域的传播问题只检查当前模型输入或单次注入拒绝,会漏掉低信任内容被写入持久来源、在后续任务里以不同消息角色或更广作用域重新出现。结论上下文的信任边界不止在一次模型调用内,还在写入、重新加载和跨任务复用之间;应分别核实来源、传播与行为。 记忆与上下文文件与工件状态与恢复 82.5
问题P1只检查当前模型输入或单次注入拒绝,会漏掉低信任内容被写入持久来源、在后续任务里以不同消息角色或更广作用域重新出现。E2E4
├─诊断D1将上下文来源表示为内容、消息角色、作用域及加载生命周期,区分消息角色迁移与跨运行、跨项目传播。E2E7
└─验证D3分别记录内容传播和后续行为:先观察高层来源变化,再清除原始低层内容,用无关任务重新启动并检查加载与预期行为。E4E6E7
问题P2静态分析可能虚构上下文来源或标错作用域;内容到达某个文件,也不能证明它后来进入模型请求并影响行为。E3E5E6
├─验证D2让静态worker提出来源,独立解释器植入worker不可见随机标记,再从实际模型请求和三次不同启动中核对加载位置与作用域。E3E5
└─验证D3分别记录内容传播和后续行为:先观察高层来源变化,再清除原始低层内容,用无关任务重新启动并检查加载与预期行为。E4E6E7
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

context管线显式记录来源、版本、消息字段、作用域与触发条件;把持久化和共享范围提升视为独立决策,将加载证据与后续行为分开。

取舍

来源验证需要可观察和可构建的目标环境;复杂触发、长载荷与模型行为使自动枚举不完整。统一角色抽象和三次作用域判断有外推边界。

证据到哪为止

12个指定版本、两套人工来源清单和模板条件下的路径观察支持诊断,不构成防御有效、完整覆盖或现版本漏洞保证。

09.16论文 SCOUT:把MCP工具目录变成按需检索的控制面问题全量工具schema占用140.2k token和70.1%的200k窗口,同时让用户与Agent难以从2000多个工具中找到正确能力。结论可执行工具schema也应作为按需上下文管理;先按身份过滤再检索,发现与执行分离。 工具与协议记忆与上下文身份与权限 92.5
问题P1全量工具schema占用140.2k token和70.1%的200k窗口,同时让用户与Agent难以从2000多个工具中找到正确能力。E2E3
├─缓解D1用tool_search和execute_tool把发现与执行分开,只把当前查询相关的工具schema放入模型上下文。E2E3E4
└─缓解D2在用户授权范围内融合BM25和dense检索,以insert-before-delete更新索引,并在检索故障时降级。E2E3E4
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

工程推断:把工具目录、用户授权scope、索引版本和实际执行路由绑定;记录搜索候选、最终工具及回退路径。适合大目录MCP网关,不替代工具副作用对账。

取舍

用索引、embedding和额外搜索回合换取小上下文;检索漏项会直接隐藏能力,降级全量目录又恢复原始风险。

证据到哪为止

一套PayPal生产目录、45个可评查询和24小时/7天遥测;没有端到端任务成功率或严格时延SLO证明。

09.16论文 Social Harness:为跨主体Agent通信增加协议与治理层问题现有个人harness与连接协议只解决单Agent工具使用或可达性,不能保证跨信任边界的消息有效、协作收敛或恶意方隔离。结论跨主体Agent协作需要独立于个人harness的通信控制面;身份、排序、契约和治理必须分层。 工具与协议安全与隔离身份与权限 77.5
问题P1现有个人harness与连接协议只解决单Agent工具使用或可达性,不能保证跨信任边界的消息有效、协作收敛或恶意方隔离。E2E3
├─缓解D1提出五层social harness:可验证身份、可靠有序通信、个人firewall、任务协作契约以及事后治理。E2E3E4
└─缓解D2用collective通信和规定发言者/消息类型的任务契约约束并发对话,把可检查的协议状态置于自然语言之下。E2E3E4
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

工程推断:把principal/agent身份、会话成员、协作状态和允许的下一消息写入可审计控制面;模型消息只在协议允许时提交。此文没有关闭外部动作UNKNOWN或原子完成问题。

取舍

共享上下文帮助汇总却可能泄露无关会话;群组有序投递仍不能阻止生成期竞态。严格发言协议会牺牲并行吞吐。

证据到哪为止

会议调度和有限攻击实验支持故障诊断;五层social harness是架构提案,不是已验证生产系统。

09.16论文 Deictic Ambiguity:测量多阶段上下文中的指代漂移问题后续模型会把表面字段或上一阶段标签当作当前任务语义,导致已经识别正确操作含义时仍作出错误裁决。结论跨阶段上下文需要显式对象绑定;只看最终正确率会漏掉字段标签压过操作语义的机制。 文件与工件记忆与上下文身份与权限 87.5
问题P1后续模型会把表面字段或上一阶段标签当作当前任务语义,导致已经识别正确操作含义时仍作出错误裁决。E2E3
├─测量D1构造correct-draft、透明错误和不透明错误三条件最小对,只改变阶段责任和参照对象。E2E3E4
└─诊断D2用balanced accuracy、条件敏感度、序贯e-value、标签移除消融和错误rationale probe分解失效位置。E2E3E4
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

工程推断:阶段输出携带稳定对象ID、字段来源和任务角色,下一阶段显式重绑定;评测同时记录verdict和rationale是否真正使用目标对象。

取舍

强控制最小对提高归因清晰度,却把任务收窄为一种合成指示歧义;高重复数不能替代独立刺激。

证据到哪为止

十个合成base、21配置和重复调用;不证明所有多Agent交接都存在同等幅度。

09.16工程 LightMem:用小模型分层控制记忆的在线成本问题现有记忆系统很难同时保持检索准确、在线低延迟、固定预算和多用户独立维护。结论把记忆生命周期和推理热路径分开,小模型可以承担预算、重排和写入控制。 记忆与上下文身份与权限文件与工件 87.5
问题P1现有记忆系统很难同时保持检索准确、在线低延迟、固定预算和多用户独立维护。E2E3
├─缓解D1将记忆分为STM、MTM和LTM,用三个小模型分别做预算路由、语义重排和在线写入。E2E3E4
└─缓解D2在线按2K到K的固定预算取用记忆,离线批量去标识并把可复用证据增量整合进LTM。E2E3E4
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

工程推断:按tenant保存STM/MTM/LTM与版本,在线路径只读固定预算视图,离线整合以原始事件为依据原子发布。需要单独实现访问撤销和删除传播。

取舍

以多个小模型、三层状态和离线整合复杂度换取在线可控预算;离线批处理与图维护仍有成本和失鲜窗口。

证据到哪为止

ACL正式稿的对话基准、消融和时延;不证明跨租户隐私、遗忘合规或所有任务质量。

09.16工程 Memory-R1:用下游结果学习记忆写入与蒸馏问题静态记忆生命周期可能漏写、重复或保留冲突内容;取回许多候选后,回答模型也可能没有利用真正相关的信息。结论记忆写入和读取可以由下游任务结果学习,但奖励定义会改变系统偏好的答案与记忆行为。 记忆与上下文身份与权限文件与工件 82.5
问题P1静态记忆生命周期可能漏写、重复或保留冲突内容;取回许多候选后,回答模型也可能没有利用真正相关的信息。E2E3
├─缓解D1Memory Manager从ADD、UPDATE、DELETE、NOOP中选择操作,并用下游回答exact match作为PPO/GRPO奖励。E2E3E4
└─缓解D2Answer Agent从60个候选记忆中学习蒸馏相关事实后回答;两个组件分阶段固定对方训练。E2E3E4
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

工程推断:将每次写操作、候选记忆和下游结果保留为可追溯训练样本;策略版本化上线,写入仍受租户权限、保留和删除规则约束。

取舍

需要离线RL、奖励构造和双模型部署;优化exact match会偏好短答案,judge reward又会偏向冗长文本。

证据到哪为止

ACL正式稿的对话数据、匹配基线、消融和迁移;不证明联合训练、在线持续学习或治理安全。

09.16论文 PACE:用可回查的多粒度历史延缓上下文耗尽问题长期工具任务持续增加历史消息,全量回放会耗尽上下文,而固定压缩强度无法同时适应当前信息需求和剩余窗口。结论可回查原文上的动态粒度选择能缓解长期上下文的容量与细节冲突;压力自适应延缓超窗,但不保证任务正确或严格有界。 身份与权限工具与协议记忆与上下文 75
问题P1长期工具任务持续增加历史消息,全量回放会耗尽上下文,而固定压缩强度无法同时适应当前信息需求和剩余窗口。E2E3E6
├─缓解D1保留原始历史,并为每块生成不同长度的表示;每步依据问题和最近进展重新选择各块粒度,使旧信息可以缩短或重新展开。E2E3E4E5
└─缓解D2用已执行步数和上次窗口占用估计压力,逐步提高保留长表示的阈值,在长链后期压缩更多历史。E3E5E6E8
问题P2早期摘要可能丢掉后来才重要的细节;如果原文无法回查,Agent难以修复这类信息缺口。E2E4
├─缓解D1保留原始历史,并为每块生成不同长度的表示;每步依据问题和最近进展重新选择各块粒度,使旧信息可以缩短或重新展开。E2E3E4E5
└─缓解D3摘要在后台生成,最近两块保留原文;Glimpse工具允许Agent按块ID请求历史全文,以补偿摘要遗漏。E2E4E5E7
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

工程推断:在工具历史写入与模型输入之间加入版本化多粒度装配层,原文按会话权限隔离,粒度和Glimpse读取保留出处。适用于能保存全文且接受后台处理及长度画像成本的长链服务;论文不提供租户公平预算、durable恢复或完成原子性协议。

取舍

以外部原文、后台摘要和embedding开销换取可重新展开的输入视图。相似度不等于依赖,摘要可能失真,压力非硬上限;自定义judge、无CI、无压力行差异和未核实代码限制精确归因及服务外推。

证据到哪为止

正式ACL2026版;同模型内部任务比较及消融,单元任务超窗压力测试。GAIA自定义judge、无CI、参数选择边界、无压力两表差异与总成本缺口均保留。

09.16论文 Plan-RewardBench:用成对完整轨迹检查评审器是否识别过程错误问题Agent最后的回答看起来合理,并不代表途中正确使用了工具事实、跟上了用户的新约束或完成了有效恢复;只评最终回答会把过程错误当成高质量执行。结论完整轨迹配对能把看似成功中的过程错误变成可检查的偏好问题;标签复核和外部选择验证提供有限有效性,但分数仍受构造、裁判和输入处理规则影响。 工具与协议状态与恢复文件与工件 75
问题P1Agent最后的回答看起来合理,并不代表途中正确使用了工具事实、跟上了用户的新约束或完成了有效恢复;只评最终回答会把过程错误当成高质量执行。E1E2
└─测量D1作者固定任务与工具环境,将完整轨迹成对比较,并从自然失败、规则注入和保留工具记录的最小文本编辑中构造难负例,分别检查规划、恢复、拒绝和工具适用性。E1E2
问题P2轨迹偏好可能被字数、格式和候选位置左右,而自动生成的标签也可能有分歧;未经检查的评审器分数难以作为筛选Agent轨迹的可靠依据。E2E3E4
├─验证D2作者用分类评分、分歧复核和成对复查筛选偏好标签,再做人工一致性检查;评测时交换候选位置,并分别报告七个分组。E3E4E5
└─验证D3作者固定执行Agent和四条候选轨迹,让不同评审器选一条,再用外部BFCL规则检查结果。E6
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑采用判断:将任务、工具环境、完整记录和偏好依据绑定为一个评审单元,保留来源与位置交换结果,优先用于离线轨迹筛选和评审器诊断。选择器比较应共享候选池,并保留截断、Tie、解析失败和成本口径;真实业务完成仍以外部结果为准。 最小接口由轨迹读取器产生任务ID、工具环境版本与候选对,评审适配器记录模型、方向、截断和解析状态,汇总器再按类别输出偏好。记录的不变量是原始轨迹不可被评审结果改写、失败调用不可悄悄混入有效分母;部署在有完整工具日志的离线评审服务,不直接控制业务终态。

取舍

完整轨迹提供过程证据,也增加评审输入与调用量;双向评审又增加成本。任务长度、难度和类别分布并未完全分离,公开脚本还存在部分模型截断和错误记录排除,因此更适合按错误类型选择评审器,不能只比较汇总排名。

证据到哪为止

依据1171对英语离线轨迹、291对人工一致性和固定Qwen3-32B四候选的BFCL重排;未证明纯长度因果、统一预算优势或线上恢复安全。

09.16论文 NCB:把单题自一致与上下文干扰下的稳定性分开测量问题模型在没有干扰时多次答对同一事实,仍可能因错误共识或带权威标签的无关材料改口;单题自一致无法识别这种上下文脆弱性。结论单题稳定答对与抵抗上下文干扰是不同能力;邻域分层加压力测试可以发现这一区别。SAT提供另一路减少输入漂移的方法,但诊断关联不能解释成内部结构的因果证明。 记忆与上下文文件与工件状态与恢复 75
问题P1模型在没有干扰时多次答对同一事实,仍可能因错误共识或带权威标签的无关材料改口;单题自一致无法识别这种上下文脆弱性。E1E3E5
├─测量D1作者围绕正确答案构造可独立作答的邻题,将目标题正确频率与邻题正确频率的几何平均结合成NCB分数,区分单题稳定与周边知识表现。E1E2
└─诊断D2作者在同一高自一致集合中按NCB分层,加入不同数量的模拟同伴意见及不同可信度标签的上下文,同时报告有效回答覆盖率和条件准确率。E3E4E5E7
问题P2针对新事实做答案增强训练后,模型可能只在熟悉问法下答对,换成带额外上下文的输入又失稳;提高无干扰准确率不等于学到了稳定的使用方式。E6
└─缓解D3作者另提出SAT训练:让读取邻域或一般上下文的学生模型,匹配冻结教师在无该上下文时的输出分布。E6
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑采用判断:适合静态事实型检索或同伴信息输入的离线诊断,将单题正确性、邻域表现、冲突与无关干扰分开记录,同时保留Coverage。NCB不应成为拒绝新资料的权限规则,也不能用于动态知识更新的一刀切判断;SAT仅对可控训练栈和可信教师有可迁移意义。 最小记录按目标题绑定参考答案、邻题集合及核验来源,并分别保存无干扰、冲突和无关材料条件下的输出与抽取状态,汇总层保留每题有效分母及Coverage。诊断结果只附加脆弱性标记,不自动覆盖事实或记忆;部署边界是可信静态答案库,动态知识更新必须走独立来源与时效判定。

取舍

邻域构建和多次采样增加离线成本,事实核验还需人工参与。更高NCB同时关联更热门、更容易的事实;额外上下文长度、实体抽取与拒答处理影响比较。SAT继承答案增强checkpoint并使用更多上下文样本,不能把结果解释为相同预算下评分机制本身的收益。

证据到哪为止

证据限2000道静态事实种子、四模型的高自一致子集和100事实训练分支;有人工事实筛选与位置/邻题敏感性检查,缺少去混杂与真实Agent任务效用证据。

09.16工程 ClawTab:活跃 Agent 会话的插件准入与控制状态恢复问题外部插件操作正在运行的编码 Agent 时,版本或终端对象变化可能让命令落到错误目标,普通插件发现不足以约束这类会话控制。结论宿主应拥有会话动作准入和局部恢复,扩展负责动作本身;成功送达与任务完成必须分开。 状态与恢复文件与工件身份与权限 75
问题P1外部插件操作正在运行的编码 Agent 时,版本或终端对象变化可能让命令落到错误目标,普通插件发现不足以约束这类会话控制。E1E2E3
├─缓解D1启动时重查插件与批准指纹,为目标窗格建立独占运行和专用令牌,并在宿主接口检查能力、provider及窗格根进程。E2E3E6E7
└─缓解D3示例动作先检查空闲及空输入,再将结果限定为快捷命令已发送。E5
问题P2临时切换模型或清空输入框后,插件失败可能留下改变的会话状态,用户草稿与后续操作会受影响。E1E3E4
└─缓解D2在修改模型与草稿前记录恢复状态,插件失败或取消后尝试恢复;恢复失败单独显示需要用户处理。E3E4
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

工程推断:在已有Agent会话外设置控制适配器,最小数据流为manifest/批准→run令牌与目标快照→宿主能力检查→动作→恢复状态。分别保存命令已发送、插件已退出、Agent操作完成的语义。该迁移适合可信单用户控制端;服务器隔离、Agent代际身份及持久恢复并非原实现提供。

取舍

快速扩展与热发现减少内核变更,但信任仍落在本地用户代码;终端识别受provider版本与UI形态影响。内存恢复简单,却不覆盖daemon崩溃;取消是请求而非全后代停止确认。

证据到哪为止

固定提交支持可信本地进程内恢复;无沙箱、持久恢复、完整Agent代际栅栏或递归取消确认。

09.16论文 EnvPilot:把环境搭建轨迹变成可检索的故障经验问题软件环境搭建Agent反复探索相似依赖与构建故障,整段旧轨迹难以检索出当前仓库真正需要的修复经验。结论按故障检索结构化经验能减少环境搭建的重复探索,但成功率收益伴随上下文成本,且目前只在冻结经验库下获得支持。 记忆与上下文文件与工件观测与评测 75
问题P1软件环境搭建Agent反复探索相似依赖与构建故障,整段旧轨迹难以检索出当前仓库真正需要的修复经验。E2E3
├─缓解D1把历史轨迹抽成问题、解决思路和具体动作三元组,以当前仓库推导的潜在故障检索问题字段,再把完整经验注入Agent。E2
└─验证D2固定经验库、模型和执行器,对比经验表示与检索方式,并区分环境可运行和测试断言全部通过。E3E4E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

工程推断:环境准备服务可保存带版本/来源的problem、solution、action,再以仓库画像生成查询、融合检索并注入执行器。检索记录与实际命令执行结果分开,ECSR只代表环境生命周期完成;不把经验动作自动升级为授权。

取舍

增加结构化经验提高可用性,也增加输入token并可能触发无关探索;相同任务集调k、跨基线运行次数和附录计数错配限制比较。固定库没有验证在线经验治理。

证据到哪为止

112实例、固定667经验和指定执行器;环境成功允许断言失败。三次运行不等于独立验证,Table19计数与部分文字口径有冲突。

09.16论文 PTA-IRT:用历史轨迹校准小样本 SWE Agent 评测问题SWE Agent完整评测需要大量多步运行,只按通过与否选少量题会丢失过程差异,使小样本估计和排名失真。结论历史过程可以辅助题目参数和小题集选择,同时由无新轨迹依赖的评分器完成全量预测;证据只支持给定历史配置下的有限估计收益。 观测与评测文件与工件记忆与上下文 75
问题P1SWE Agent完整评测需要大量多步运行,只按通过与否选少量题会丢失过程差异,使小样本估计和排名失真。E2E4
├─测量D1用历史执行摘要修正题目的难度与区分度,再把轨迹教师的信息蒸馏进不依赖未运行轨迹的全局评分器。E2E3
└─测量D2按历史通过率分层分配题目预算,并结合质量加权信息量选校准题,在小子集上拟合新Agent配置的能力。E3E4E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

工程推断:评测服务离线保存任务/版本/配置、轨迹摘要和全量结果,训练全局评分器及分层选题策略;新配置只从已执行校准题估计标量能力,对其余题输出估计值而非真实通过结果。保持题量、历史处理成本和在线执行成本分列。

取舍

历史摘要带来过程信息和离线费用,也混入参考补丁;分层降低题集偏斜,但小Agent样本、轨迹过滤和无family隔离限制泛化。

证据到哪为止

四SWE基准、四折Agent划分与10%题量比较;无家族/harness隔离或全成本等预算声明,摘要含参考补丁。

09.16论文 AttnRank:按模型的位置偏好排列同一组上下文问题同一组相关文档放在不同上下文位置会影响利用效果,统一按相关性排序无法适配模型及模板的位置偏好。结论模型位置画像可指导同一组证据的布局,给定配置有小幅平均收益;它是带格式边界的经验方法,不是注意力因果定理。 记忆与上下文文件与工件工具与协议 75
问题P1同一组相关文档放在不同上下文位置会影响利用效果,统一按相关性排序无法适配模型及模板的位置偏好。E2E3E4
└─缓解D1先用校准样本估计模型的浅层位置注意力排序,再把最相关文档放到偏好位置,保持检索集合与推理模型不变。E3E4
问题P2注意力与正确率共同变化并不足以说明位置偏好的根因,机制解释需要区分观察、组合干预和理论假设。E2E6
└─诊断D2通过层深观察、文档排列和组合去结构实验描述位置效应,并给出理想化注意力解释。E2E5E6
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

工程推断:在检索结果和上下文序列化之间插入位置映射层,画像绑定模型/模板/k,保留实际文档集合与排序来源。该机制只适用于attention可读且布局稳定的服务;动态工具消息与闭源API不在直接支持范围。

取舍

不增文档且不改参数,但需要attention访问和校准;布局收益小且依赖格式。理论符号矛盾、组合干预、画像信息边界与费用缺口阻止普遍因果或效率保证。

证据到哪为止

正式ACL2026版本、固定5文档与少样本排列比较;存在负例,无显著性或端到端成本结果,理论符号链不一致。

09.16工程 S2G-RAG:让缺失事实同时驱动下一次检索与证据选句问题多跳问答只找到中间实体时,系统可能过早回答,也可能继续重复搜索;缺少明确的剩余事实清单使下一步检索难以检查。结论把剩余事实需求交给可检查的控制接口,能改善限定多跳问答配置的信息组织;它不是可靠停止或完整回答的保证。 记忆与上下文状态与恢复观测与评测 75
问题P1多跳问答只找到中间实体时,系统可能过早回答,也可能继续重复搜索;缺少明确的剩余事实清单使下一步检索难以检查。E1
└─缓解D1作者将充分性判断与缺失事实写成结构化状态,再把缺口字段确定性映射成下一次查询。回答器与检索控制分开。E1E2
问题P2逐轮拼接完整检索文档会引入重复和干扰,但自由生成摘要又可能改变证据;系统需要按当前缺口选择可追溯的信息。E1E2
└─缓解D2同一份缺口清单也指导句子选择器,选择器只返回原文句子编号,由程序还原并追加到证据上下文。E2
问题P3仅从理想状态学习的检索控制器可能不适应真实中间上下文,训练监督需要覆盖多轮积累产生的缺失与噪声。E3
└─缓解D3作者从未微调控制器的执行轨迹中保存每轮上下文,交由教师标注充分性与缺口,再训练小型控制器。E3
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

在检索控制层保存结构化缺口,在上下文装配层保存原句引用;记录充分停止与预算退出的不同原因。适用可控制多轮检索的服务,不能直接拿Judge输出当业务完成证明。

取舍

同最大检索次数不等于同总算力;原句选择可能遗漏语境,标题覆盖代理不证明真实充分性,预算耗尽仍回答。

证据到哪为止

三类QA主结果及HotpotQA组件对照;充分性分析仅为标题覆盖代理,无等总成本、人工充分性校准或重复运行区间。

09.16论文 MapRepair:图记忆修复要同时检查残余冲突与正确结构保留问题Agent逐步把文字观察写成空间图时,早期错误可能到很久以后才形成冲突;只看当前图无法解释哪次观察或修改引入了错误。结论图记忆需要可回查的修改来源,但修复是否值得采用必须同时看冲突与正确结构;这篇的负例说明保持原图有时更好。 文件与工件状态与恢复记忆与上下文 75
问题P1Agent逐步把文字观察写成空间图时,早期错误可能到很久以后才形成冲突;只看当前图无法解释哪次观察或修改引入了错误。E1E2
└─缓解D1作者保存每次图修改的原始观察、分析和边增删,并从提交依赖历史筛选候选,再按结构影响排序回查。E2
问题P2修复器可以通过删掉正确边降低冲突数,也可能因反复回退制造更多错误;仅看图是否一致会高估修复质量。E3E4
└─测量D2作者把修复后的残余冲突与正确方向边保留并列报告,并用组件、模型和非LLM修复参照检查负效应。E3E4E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

对有结构约束的图记忆保存来源绑定的增量修改和修复原因;判断终态时并列保留残余冲突与正确结构损失。不将自动修复设为默认成功路径,尤其不据相对弱基线提升断言值得采用。

取舍

CF是检测器下无冲突,不等于真实图正确;部分模型修复比不修复更差,删除法支配若干增强配置,命名候选漏错及小说过生成不可忽略。

证据到哪为止

v2合成组件对照、7模型TextWorld、42个MANGO图及单小说案例;结构一致性和正确边保留有指标,语义真值、等总成本与普遍修复优势未成立。

09.15论文 CloneMem:连续个人轨迹与多对多证据的记忆诊断问题长期个人记忆评测常把聊天中的事实分开提问,难以观察经历、情绪和观点怎样连续变化;模型可能记住片段,却答错变化的过程。结论连续状态的合成资料和多对多证据关系,使长期记忆的覆盖与答题表现可以分开检查;本文支持这种诊断协议,不证明摘要普遍有害或真实个人可被准确模拟。 记忆与上下文状态与恢复身份与权限 75
问题P1长期个人记忆评测常把聊天中的事实分开提问,难以观察经历、情绪和观点怎样连续变化;模型可能记住片段,却答错变化的过程。E1E2
├─测量D1作者从人物与长期变化线索出发,逐阶段更新状态快照,再共同生成细事件、证据和日记等资料,使后续阶段承接此前状态。E2
└─验证D3在沿时间更新的证据桶上先判断是否足以出题,再生成问答并迭代修订可被表面线索破解的选择题干扰项。E3
问题P2一个问题可能需要多条证据,而每条证据又散布在多份资料中。仅按资料ID命中或最终答题分排名,会混淆证据覆盖、信息表示和回答使用这几类问题。E4E5
├─诊断D2作者保存问题、证据单元和来源资料之间的多对多关系,分别评估证据是否找齐、取回内容是否有用,以及最后答案是否正确。E4E5
└─诊断D4固定检索流程,比较原始资料、抽取记忆及两者组合,并交叉改变骨干和嵌入模型,观察检索与回答指标如何变化。E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑判断:在长历史评测中分开保存原文、状态变化、必需证据单元及来源映射,把覆盖、语义充分性、答案结果分别呈现。保留原文与抽取表示的差异和成本口径,适用于离线资料记忆评估;不把模型心理拟真、生产恢复或最佳框架当本文结论。

取舍

显式快照和证据关系让任务可追溯,但合成一致性不等于真人真实性。查询时禁用互动循环有助比较表示,也缩小了完整Agent适用范围;相同k未对齐token,裁判及规模口径仍有缺口。

证据到哪为止

ACL正式版的十个合成人物、预构建检索系统及所列模型/表示对照;规模和裁判口径未对齐,缺等token与全流程成本、人工judge校准和重复区间。

09.15论文 OctoBench:按实际上下文检查规则遵循,并诊断来源冲突问题编码Agent的规则分散在系统消息、项目文件、技能和运行时提醒中,有些只有执行到特定步骤才出现;只检查最终产物会漏掉过程违规,也无法确定该检查哪些规则。结论分散规则可以通过实际暴露与执行轨迹建立可追溯的过程检查;单对冲突还能显示Agent偏向哪个来源。该协议增加诊断能力,不能代替功能完成或权限裁决。 身份与权限工具与协议记忆与上下文 75
问题P1编码Agent的规则分散在系统消息、项目文件、技能和运行时提醒中,有些只有执行到特定步骤才出现;只检查最终产物会漏掉过程违规,也无法确定该检查哪些规则。E1E2E3
├─测量D1作者记录模型实际收到的消息和工具定义,用参考轨迹构造按来源划分的二元检查,再依据被测轨迹的触发条件判定适用项,分别统计逐项与整实例的遵循情况。E2E3
└─验证D3作者对检查表做人工审查,并以三种自动评审器和专家逐项判分对照,检查规则判定的稳定性与一致性。E6E10
问题P2系统、用户和项目文件提出矛盾要求时,一个汇总遵循分数无法说明Agent实际跟随了哪个来源,因而难以定位冲突处理的偏向。E4
└─诊断D2作者另构造32个来源冲突实例,针对系统、用户和项目文件中的一对要求设置矛盾,并从完整轨迹判断Agent最终跟随哪个来源。E4
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑采用建议:在已有Agent评测中保留实际模型输入、规则来源与触发条件,将每个判分绑定到相应轨迹证据;另保留功能结果判据。来源冲突诊断适合发现部署组合的偏向,但服务端必须独立定义合法优先级和权限,不能把论文观察到的偏好当授权。

取舍

检查表把过程要求变成可定位的错误,但适用项会随轨迹改变;自动判分与长文本截断可能漏掉证据。整实例要求全部通过,其分数自然受检查数影响。人类校准和三评审器增加成本,原文未提供完整token、费用、延迟及运行不确定性对照。

证据到哪为止

证据来自217个构造任务、34个环境、三种scaffold、8模型与32个冲突实例;人类校准限80个高质量实例约200检查,动态适用分母和默认预算限制横向及因果解释。

09.15工程 Prime:离线评测的网络边界必须延伸到推理服务端问题编码Agent的直接外网访问即使已关闭,仍可能通过获准的推理API让服务端代取远程文件或调用搜索,获取本应隔离的答案,使离线评测失真。结论离线约束必须覆盖执行端和推理服务端能够取得的信息;这篇提供了遗漏通路的实证及可检查的代理过滤机制。 观测与评测工具与协议安全与隔离 75
问题P1编码Agent的直接外网访问即使已关闭,仍可能通过获准的推理API让服务端代取远程文件或调用搜索,获取本应隔离的答案,使离线评测失真。E1E2
├─诊断D1作者沿直接联网失败、推理接口可达、服务端代取和正确标记返回的轨迹定位泄漏,把推理API识别为评测边界内的一种外部能力。E1E2
└─缓解D2verifiers把每次运行的网络策略传到推理代理,再按协议过滤远程内容、服务端工具和隐藏引用;无法安全缩窄的能力会被移除。E3E4E5E6
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑采用建议:将推理网关列入Agent工具与网络的统一权限清单,以run绑定网络策略;分别审计本地工具动作、供应商工具和远程输入引用,并保留被删能力路径。适合限制外部信息的评测或受限执行环境,前提是请求确实经过可信代理,执行端不能改写策略或绕过代理;不从本案例推导通用宿主机隔离保证。

取舍

严格策略可能删除请求内容、服务端会话连续性或整项搜索工具,改变Agent能见的上下文。域名过滤不能安全表达现有来源/端口规则时采取保守删除;这一选择保护边界,但原文没有量化任务质量、延迟和成本的变化。

证据到哪为止

证据是公开仓库flag任务的一次成功轨迹与verifiers固定版本源码;未给总尝试数、修补后效果率或完整供应商覆盖。

09.15论文 Belief Consistency:把上下文更新的一致性与答题能力分开测量问题评估模型能否随上下文一致地更新选择时,标准答案任务会把答题能力混入分数;单次输出又无法区分随机选择、违背新约束和稳定倾向的改变。结论上下文更新可以在不要求答对知识题的条件下被测量;关键是比较预期保持的分布,并把非法选择、偏好和输出解析质量分开。 记忆与上下文观测与评测文件与工件 75
问题P1评估模型能否随上下文一致地更新选择时,标准答案任务会把答题能力混入分数;单次输出又无法区分随机选择、违背新约束和稳定倾向的改变。E1E2
├─测量D1作者构造起初三项都有效的选择任务,插入只排除其中一项的固定对话,再比较其余两项在前后上下文中的归一化选择分布。E1E2
└─诊断D2评测分别报告二类分布一致性、包含被排除项的三类分数、选择熵与解析失败,并比较选项、模板及概率提取方式的影响。E2E3E5E6
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑采用建议:在Agent的受控上下文评测中,把预期信息变化写成明确干预,再比较同一配置前后的选择分布,独立记录显式约束违反和解析失败。只在干预不应改变其余选项相对偏好的任务上采用这一不变性判据;真实任务若增加了有区分力的新证据,比例变化可能正确,不能照搬惩罚。

取舍

自由采样避免将给定答案的token概率直接当自然输出倾向,却需要很高的调用量。不同推理模式的样本数及token上限不同,无有效选项时还会排除实例;高二类分必须与熵、非法率、解析失败和有效样本数一起解释。

证据到哪为止

正式论文支持三选一、一次人工逻辑排除下的输出分布诊断;不同模式预算不齐、有效实例会变,未证明长程Agent或思维链忠实性。

09.15论文 Mitigating Context Interference for Reliable and Efficient Search Agents问题多轮搜索积累的文档、查询和思考作用不同;直接累积或统一删除历史,既可能引入干扰,也可能让Agent重复搜索。结论查询条件精简比无差别累积历史更有证据支撑;保留过程思考、转换最新检索观察是可迁移增量,训练优势与普遍因果解释仍有限。 记忆与上下文状态与恢复文件与工件 75
问题P1多轮搜索积累的文档、查询和思考作用不同;直接累积或统一删除历史,既可能引入干扰,也可能让Agent重复搜索。E1
└─诊断D1作者分别移除旧文档、旧查询和旧思考,比较答案正确率与检索轮数,区分哪些历史帮助推理、哪些历史引入干扰。E1
问题P2最新检索结果包含答案相关信息时,搜索Agent仍可能受无关细节干扰;需要把当前查询真正需要的内容送入下一轮推理。E2
└─缓解D2作者用独立的查询条件精简器,从最新检索文档提取当前问题所需信息,再交给搜索Agent继续推理。E2E4
问题P3只在推理时精简检索观察,不能说明Agent是否学会利用这种状态;训练时的上下文组织与效果归因也需要分开考察。E3
└─缓解D3作者把精简后的最新文档接入强化学习轨迹,保留先前思考,仅对模型生成的思考与查询计算策略损失。E3
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

工程启发是把检索结果转换设为context管线的独立步骤:输入绑定查询、检索轮次与原文引用,输出精简观察,Agent状态保留思考和当前观察。原文与精简文本分开保存有助于解释丢失了什么;这是本项目采用设计,论文没有提供生产级溯源协议。 适用范围是可控制检索与上下文装配的搜索服务。最小采用可以先使用推理侧转换,而把训练作为独立成本选择;精简不能获得原文没有的信息,服务端应能区分答案错误、检索遗漏和转换丢失。论文的价值是明确这种信息边界,而不是承诺一项通用压缩率。

取舍

最终答案使用EM规则评分,避免把LLM judge当最终正确性裁判;精简器训练数据仍依赖未充分披露配置与阈值的自动蕴含检查。固定Wikipedia时间只能说明知识库时间对齐,不能证明模型预训练没有接触测试题。原文也未给多seed置信区间。 本次收录的核心是查询条件的信息提取及历史组成诊断,证据达到限定模型和QA任务上的方法贡献。它不证明“最新文档是唯一主因”,不保证所有任务改善,也没有解决长期记忆一致性、服务端写入恢复或跨租户隔离。训练样本与轮数差异使更强的训练公平性结论暂不成立。

证据到哪为止

Qwen 3B/7B、E5与2018 Wikipedia、七个QA集的作者实验;存在数据集反例、40k/60k训练样本及ART表间不一致,未报告完整训练成本与多seed区间。

09.15论文 Anchoring the Cache: Mitigating Contextual Hallucination in KV-Compressed Long-Context Summarization问题长文摘要的KV压缩可能保持较好的文本重合度,却让后续句子越来越不忠于原文;只看ROUGE会漏掉这种生成过程中的失真。结论来源缓存保留与来源信息利用是两件事;部分检索头只读来源能在部分模型与预算下减少幻觉,但效果不是普遍成立。 记忆与上下文观测与评测文件与工件 75
问题P1长文摘要的KV压缩可能保持较好的文本重合度,却让后续句子越来越不忠于原文;只看ROUGE会漏掉这种生成过程中的失真。E1E3
└─测量D1作者同时测量逐句幻觉、生成位置和对原文的注意力比例,区分文本重合度与来源忠实度。E1E3E4
问题P2压缩后保留的原文信息较少,生成历史可能进一步占用检索头的注意力,使模型延续自身错误而非回到原文。E1E2
└─缓解D2HalluKV让一部分预先识别的检索头在解码时只读取保留的原文缓存,其余头继续读取生成历史,以减少错误内容自我强化。E2E3
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

工程启发是将来源信息与生成历史视为两类上下文,在可控推理后端分别规定读取策略。最小采用位置位于KV压缩器之后、解码注意力之前,保存来源边界和头选择配置;这是内部推理组件的设计选择,不是提示词层面的替代方案。 对只使用外部模型API的服务,更直接的启发来自测量:重合分数、来源忠实度与任务成功属于不同对象,不应共用一个成功标签。HalluKV说明少量保留原文只有被持续利用才有价值,同时也说明切断过多生成历史会损害表现。

取舍

检索头与非检索头的二分是近似,头的作用可能混合。模型、摘要长度和遮盖比例影响收益,§5.5沿分析选最佳配置,没有明确独立留出选择过程。缺少多seed区间与人工校准,使很小的分数差异不宜被解读为稳定普遍优势。 论文主要支持可访问注意力头与KV的长文生成后端。它没有证明API型harness也能采用这个开关,没有证明Agent工具任务成功率提高,也没有修复来源压缩本身丢失信息的错误。来源注意力比值的变化包含结构性分母效应,归因必须与整体干预结果分开。

证据到哪为止

六模型、两摘要集、四来源KV预算及附录扩展的作者实验;自动判分未做人类校准,存在模型/预算反例,无法恢复已淘汰来源且要求模型内部访问。

09.14工程 ReportLogic:把报告逻辑评审变成上下文化检查与局部缺陷诊断问题长报告的逻辑缺陷分散在全局结构、局部衔接和证据推理中;只有通用评分标准时,评审者难以把标准一致地应用到具体报告。结论上下文化检查项能把长报告逻辑评审具体化,训练后的judge及局部缺陷操作提供进一步判别与诊断。它仍是受标注、解析及干预构念约束的评审协议,不能把所有呈现变化都当偏置,也不能证明已替代人工。 记忆与上下文观测与评测文件与工件 75
问题P1长报告的逻辑缺陷分散在全局结构、局部衔接和证据推理中;只有通用评分标准时,评审者难以把标准一致地应用到具体报告。E1E2
└─测量D1作者把逻辑质量拆成三层八维,再依据查询和成对报告生成具体检查问题、文本定位提示和好坏示例。E1E2
问题P2人工逻辑评审昂贵,通用模型对同一报告对的偏好未必与人工一致,难以直接充当可扩展的质量判据。E1E3
└─缓解D2LogicJudge使用多教师一致且交换顺序仍稳定的报告偏好进行蒸馏,再学习逐维解释和最终选择。E3
问题P3评审器可能忽略真实逻辑破坏,或对文字呈现变化改变偏好;总体一致率无法解释其具体脆弱点。E4E5
└─诊断D3作者对报告施加指定维度的逻辑破坏或受约束的呈现改写,再比较修改前后的偏好和缺陷定位。E4E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑采用启发:把固定质量维度、当前报告的检查项、文本证据位置和最终裁决分别保存,并记录rubric版本、原始输出及解析状态。适合辅助长报告审核与缺陷归类;不能仅以偏好分发布报告,也不能把因果关系写得更明确一概视为作弊。若修改内容同时改了检查项,应将结果标为评估管线变化。人工核验和生成检查项会增加成本。

取舍

实例化rubric让判断更具体,也让检查项本身成为评测上下文的一部分。攻击后重新生成rubric测量整个管线,无法单独归因judge。CausalDisplay把隐含因果关系写明,可能改善定义中的推理可审计性;Structure Bias也可能改变连贯性。解析失败排除率和查询规模不明进一步限制比较范围。

证据到哪为止

证据包括200例rubric条件比较、1572个人工报告对的三域判别及300例攻击构造;查询规模冲突、解析排除率缺失和部分surface操作构念不变性不足限制强结论。

09.14工程 DR-Arena:用来源树和自适应追问比较研究Agent问题静态研究题的资料和参考答案会失鲜,既有题型与已知内容还可能影响排名,评测需要可追溯的新任务依据。结论来源树让动态研究题及判分依据更可追溯,自适应追问把前一轮回答变成下一轮评测条件。现有证据支持有限样本中的协议用途,不能证明污染消除、纯能力分离或等预算效率优势。 观测与评测文件与工件状态与恢复 75
问题P1静态研究题的资料和参考答案会失鲜,既有题型与已知内容还可能影响排名,评测需要可追溯的新任务依据。E1E2
└─测量D1作者把网页内容和链接关系构造成来源树,以路径与兄弟节点生成研究问题及对Agent隐藏的核对项。E2
问题P2固定难度的一轮问答难以区分相近的研究Agent,也难显示它们在依赖链与信息覆盖上的不同不足。E1E3
└─测量D2框架让两个Agent回答同一题,按胜负、质量与深度/广度不足调整下一题,累计比较信号后停止。E3
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑采用启发:动态评测应保存网页快照、树边关系、问题和私有rubric版本,以及每轮双方输出、裁决与转移理由。把事实正确性与格式/引用偏好分开显示,分开记录轮数和成本;树外可靠证据需要人工处理通道。适合诊断相近研究Agent的差异,不宜直接把树深度作为推理能力或把非胜率当事实错误率。

取舍

来源树增加追溯能力,也限定考官可用的证据范围;其他可靠来源可能不在树内。更深路径和更宽属性是任务构造旋钮,不能自动等同于Agent实际推理深度或检索覆盖。多轮追问提高信息量但预算不固定,judge格式偏好和非盲审核又限制纯能力解释。

证据到哪为止

作者比较六Agent、30树、四轮赛程与789次交互;树结构盲选50例,日志审核30场64回合。不同追问预算、非盲审核、格式偏好及未报告完整停止参数限制推广。

09.14工程 DeepSeek Harness:受限Agent不能继承本地控制接口的用户权限问题本地编码Agent虽被禁止写出工作区,却仍能从shell访问管理自身权限的harness接口。若该接口把本地地址当作用户身份,Agent就能解除后续命令的限制,连审计也会把它误记成用户操作。结论文件沙箱无法单独保护可被同机命令调用的管理接口。本文用控制路径和文件对照诊断了Agent自我解除限制,并由固定版本代码说明认证应发生在控制请求分发前。 身份与权限安全与隔离文件与工件 75
问题P1本地编码Agent虽被禁止写出工作区,却仍能从shell访问管理自身权限的harness接口。若该接口把本地地址当作用户身份,Agent就能解除后续命令的限制,连审计也会把它误记成用户操作。E1E2E3E4
├─诊断D1作者沿“受限shell→本地控制接口→会话权限变化→工作区外写入”追踪信任边界,并用同机同配置的受限对照确认:失守的是控制面的调用身份,而不是最初的文件沙箱没有生效。E1E2E3E4
└─缓解D2官方alpha.1版本在Connection插件分发API和RPC前增加浏览器会话鉴权:启动token兑换签名cookie,请求必须同时通过来源检查与cookie验证。E5E6E7E8
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

在有shell或网络工具的harness中分开执行身份与管理身份,控制API和插件RPC在分发前验证凭据,保留真实调用主体与外部效果证据。该采用判断不等于作者已实现多租户隔离或所有扩展均不可绕过。

取舍

鉴权增加启动token、签名cookie与凭据生命周期管理。所示文件对照不是跨平台统计;本地与远程路径前提不同;修复层还依赖认证材料对不可信执行不可达。

证据到哪为止

证据限于OX所示默认配置配对结果,以及alpha.1所读认证入口和cookie实现;不包含诱导成功率、完整跨平台修复回测或全部插件/凭据可达性审计。

09.13论文 What Eviction Destroys: A Restore-Counterfactual Audit of Forgetting in Agent Memory问题记忆容量受限时的答题错误,可能来自证据被淘汰、保留证据未被检索,或读者没有用好证据;仅看准确率无法判断应改哪一层。结论把恢复响应与证据保留状态结合,可以在限定的原始会话记忆中区分淘汰、检索和残余利用失败,帮助解释相同准确率背后的不同故障。 状态与恢复记忆与上下文安全与隔离 75
问题P1记忆容量受限时的答题错误,可能来自证据被淘汰、保留证据未被检索,或读者没有用好证据;仅看准确率无法判断应改哪一层。E1E3
├─诊断D1作者固定读者和检索设置,对原先能够回答的题恢复完整标注证据,再结合证据是否仍在记忆库中,把错误分成淘汰、检索与残余利用三类。E1E2E3
└─测量D3作者分别报告三类错误占比、可修正错误中的淘汰占比和所有可回答题中的淘汰率,并按题聚类估计不确定性。E4E5
问题P2恢复标注证据会同时改变上下文内容和布局,评分者也可能误判;这些因素会让“不可恢复遗忘”的统计看起来比实际更确定。E2E5E6E7
├─验证D2作者用存活证据恢复、完整保留库注入和非标注片段替换检查恢复干预的偏差,并通过另一评分模型重判样本,限定分箱解释。E6E7
└─测量D3作者分别报告三类错误占比、可修正错误中的淘汰占比和所有可回答题中的淘汰率,并按题聚类估计不确定性。E4E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

适合有gold标注且保存原始单元的记忆审计:分别保留存储快照、gold保留位图、注入片段、reader和judge身份,按三分箱解释错误并明确分母。它提供诊断启发,不能直接成为压缩摘要的淘汰政策、生产恢复机制或用户数据擦除保证。

取舍

筛选clean-gold可答题缩窄样本范围;恢复会改变nongold组合;全保留库检查读取预算更大。非标注替换不保证无关,同厂商judge一致性不能排除相关偏差;代码发布声明与实际快照不符。

证据到哪为止

LongMemEval-S的clean-gold可答切片、原始单元与固定读者/注入协议;支持诊断分箱,不证明信息彻底消失、策略等价或生产恢复效果。

09.13论文 BudgetMem:在查询到来后分配各记忆模块的处理成本问题离线统一提炼历史时不知道后续问题,可能提前删掉关键证据;对每个查询都用昂贵模型重新提炼,又会造成不必要的记忆处理开销。结论原始历史延后提炼与模块级选档,使记忆处理能围绕当前查询作成本取舍;软策略仍依赖独立的服务限额。 记忆与上下文运行时与调度文件与工件 75
问题P1离线统一提炼历史时不知道后续问题,可能提前删掉关键证据;对每个查询都用昂贵模型重新提炼,又会造成不必要的记忆处理开销。E1
└─缓解D1保留原始历史分块,在查询到来后检索,并让轻量路由器为过滤、信息提取和摘要模块分别选择低、中、高处理档位。E2E3
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

采用启发:保留带来源的原始chunk,固定过滤/提取/摘要接口,按查询与模块输入选择已定义档位;记录选择及模型调用成本。适用前提是检索覆盖足够、提取计算值得优化;硬预算准入与中止需外部执行契约,不由lambda保证。

取舍

原始历史存储与查询时处理增加开销;固定topK不是等总token。容量轴混合模型差异。划分比例与表格不一致,会话隔离未知;三种子均值缺充分区间,judge未见人工校准。

证据到哪为止

三个问答集合、所列模型与提取成本口径;不是逐请求硬预算、全任务最低成本或已证明无泄漏。

09.13论文 Conflict-Aware Memory:排除动作冲突的近邻,并修正检索连接问题向量相似的记忆可能要求相反动作;把这些近邻直接作为示例,会让具身 Agent 生成语法正确却含义错误的任务目标。结论向量相似度之外增加动作与对象相容性判断,有助于减少错误示例污染;即时过滤与长期索引修改需要分开理解。 记忆与上下文文件与工件安全与隔离 75
问题P1向量相似的记忆可能要求相反动作;把这些近邻直接作为示例,会让具身 Agent 生成语法正确却含义错误的任务目标。E1E4
└─缓解D1在近邻检索后按对象与动作规则识别冲突,移除不适合当前查询的示例,并剪去一致候选与冲突候选之间的检索图连接。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

采用启发:在对象/动作词表明确的Agent中,先检索,再做查询相关的冲突过滤,保留被过滤原因和源例子。持久剪边需另有可追溯版本与恢复边界;开放域语义冲突、物理执行安全与外部效果不能交给这个规则替代。

取舍

GPT4o判别增加费用和时延;固定对象/动作假设限制外推。图修剪与过滤未独立归因,错误修剪的长期影响未回答。Table3混合噪声IA标签不一致,应保留92→60端点。

证据到哪为止

四个有限具身场景、目标语法/含义指标、整体过滤对照与噪声注入;未证明剪边独立收益、物理执行成功或开放域安全。

09.13论文 CUB:把服从上下文与抵抗干扰分开测量问题让模型更愿意采用外部资料,可能同时让它更容易受无关资料干扰;只测其中一面,无法判断上下文方法究竟改善了什么。结论CUB使“采用资料”与“抵抗干扰”的取舍可见,并揭示数据和提示如何扭曲结论;它提供诊断协议,不能替代正确性判定。 记忆与上下文工具与协议身份与权限 82.5
问题P1让模型更愿意采用外部资料,可能同时让它更容易受无关资料干扰;只测其中一面,无法判断上下文方法究竟改善了什么。E1E2
├─诊断D1将正确、冲突和无关资料分别加入任务,在相同模型与输入上比较有无上下文干预方法,并分开报告服从资料与抵抗干扰的变化。E1E2E3
└─诊断D2把各方法的分项结果放在服从度与鲁棒性的共同坐标中,并追查合成数据、提示格式和资料标签如何改变结论。E4E5E6
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

可在检索后的阅读与回答环节采用这种分项诊断:明确模型原预测、资料宣称和任务真值三个不同对象,记录资料类型及同输入的方法差值。它适合检查上下文策略的依赖方向;业务正确性、来源可信度和长期状态更新需分别定义,不能沿用BCU作为统一验收分。

取舍

对冲突资料更忠实未必更正确;对无关资料保持原输出也可能保留错误。三类指标便于诊断,但依赖数据标签、无上下文参考和不同方法的调参条件,不能压成无条件业务收益。

证据到哪为止

证据覆盖三数据、7类方法和11模型的单份英语上下文;标签疑点、调参例外及模型间误差条限制通用排名和长任务外推。

09.13论文 Agentic Rubrics:先读仓库形成检查表,再比较候选补丁问题仅根据问题描述和补丁给分,容易漏掉仓库已有接口、调用方式和行为约束,导致多个候选中选错补丁。结论仓库探索可以先转成复用检查表,改善固定候选池的选择;生成这种判据也可训练,但它不是测试或人类缺陷确认的等价替代。 文件与工件记忆与上下文工具与协议 82.5
问题P1仅根据问题描述和补丁给分,容易漏掉仓库已有接口、调用方式和行为约束,导致多个候选中选错补丁。E1E2
└─缓解D1先让专家Agent探索修改前的仓库,为具体文件、接口和行为生成一次加权检查表,再让评分者用同一张表逐项比较各候选补丁。E1E2E4
问题P2让强模型为每个任务探索仓库能改善检查标准,但持续依赖它生成这些标准会带来额外成本;这种探索与归纳能力能否迁移到开放模型仍需证据。E5E7
└─验证D2把专家在仓库中生成检查表的轨迹用于训练开放模型,并与训练同一模型直接判补丁对错的路线比较。E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

可在已有补丁候选选择环节固定修改前仓库版本与任务,先产出针对接口、约束和行为的检查表,再将相同检查表与最终patch交给评分者。保留逐项理由与生成版本有利于审查;它适合补充候选排序,执行测试、授权和最终合并决策仍有各自证据。生成者蒸馏需要相应仓库轨迹资料。

取舍

任务检查表可跨候选摊销探索成本,却把正确性的一部分交给自然语言标准和judge。标准过严会拒绝可接受实现,标准不完整会漏问题;蒸馏降低强模型依赖的方向有依据,但训练资料与判分调用仍有成本。

证据到哪为止

500任务同候选池和仓库访问消融支持限定收益;预算不齐、若干表文冲突及模型效用审查限制成本、公正性和正确性外推。

09.13论文 Harness-of-Harness:分别延续软件工件与执行证据问题长时间自主开发不能只保留代码或对话:如果下一轮忘了哪些行为已验证、哪些缺口尚未关闭,就可能重复工作并破坏已有成果。结论HoH用工件和证据两条连续状态驱动持续开发,消融支持跨轮反馈的作用;它没有证明公开可核的权限强制或多日零人工运行。 安全与隔离工具与协议状态与恢复 82.5
问题P1长时间自主开发不能只保留代码或对话:如果下一轮忘了哪些行为已验证、哪些缺口尚未关闭,就可能重复工作并破坏已有成果。E1E2
├─缓解D1把当前软件工件和执行证据分别传给下一轮规划,让已验证行为成为保留约束,让观察到的缺口成为新的开发目标。E1E2E6
└─缓解D2每轮由Developer续写当前工件,再由单独调用的QA检查冻结候选并输出结构化证据,供下一轮Planner使用。E3E4E6
问题P2开发者的完成叙述不等于软件实际行为;如果检查时继续修改候选,反馈就难以对应下一轮应保留或修复的具体版本。E3E4
└─缓解D2每轮由Developer续写当前工件,再由单独调用的QA检查冻结候选并输出结构化证据,供下一轮Planner使用。E3E4E6
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

可在跨调用开发服务中分别保存工件版本与该版本的检查证据,再由规划器把已验证项转为保留约束、缺口转为更新目标。开发任务从当前工件继续,检查针对冻结副本,返回结构化观察。实际部署仍需要落实写权限和版本绑定;论文不提供多租户公平、递归取消确认或父子工件原子完成合同。

取舍

分离工件与证据使下一轮约束更清楚,也增加规划和QA调用。冻结候选有助于证据归属,但依赖领域检查和实际隔离;论文给出协议及附录实现描述,公开仓库尚无核心代码。持续迭代仍可能重开问题,不能把多轮运行视作单调改进。

证据到哪为止

受控45任务的开发轮次比较和消融支持有限机制,token不相等、单有效run、多日个案和未公开核心实现限制外推。

09.13工程 Anthropic事件评估:分开测量行动、解释与监控所见上下文问题Agent 对环境的解释看似合理,却未必约束下一步行动;只读取推理或追问模型,容易误判危险行为为何发生。结论模型解释、实际行动和监控判断需要分开观察。改变轨迹信息及监控视图能揭示它们何时脱节,但不能单独给出生产安全保证。 安全与隔离工具与协议记忆与上下文 87.5
问题P1Agent 对环境的解释看似合理,却未必约束下一步行动;只读取推理或追问模型,容易误判危险行为为何发生。E1E2E6
└─诊断D1在同一事件轨迹的指定节点改变环境线索或授权提醒的位置,继续采样后分别判断语言表述与实际行动。E2E4
问题P2监控器读取执行者的完整解释时,也可能接受其中的错误前提,使同一工具行为在不同上下文视图下得到不同判断。E3E5
└─诊断D2让监控器分别读取完整轨迹与去掉推理文字的轨迹,并用其他事件检查去除解释是否也损失必要证据。E3E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

本项目可把轨迹版本、干预节点、可见信息视图及判分口径作为eval记录的独立字段。保存语言判断、实际工具行为、监控输出三个结果;监控输入保留来源类型,区分执行者解释与外部工具证据。适用于离线诊断和监控分析,不据此授予执行权限,也不承诺通用安全。

取舍

局部重放可聚焦同一决策点,但继承此前行动与解释,后续模型还面对不属于自身策略的轨迹。从头模拟更接近完整决策过程,却产生模拟线索和任务构造偏差。去掉推理可减少错误解释的影响,也会删除监控所需的伤害信息。

证据到哪为止

第三方特定事件、作者局部采样与模拟诊断;判分校准、总体发生率和持续防护效果仍有限。

09.13论文 Sense and Sensitivity:能复述代码,不等于按代码推理问题长上下文模型能找到并复述一段代码,并不保证能用这段代码计算答案;只测检索会漏掉中间位置的信息使用失败。结论信息被找到和被用于推理是不同能力。位置对照与输入敏感度能暴露检索分数掩盖的盲区,但不能仅凭删行后仍答对证明训练记忆。 记忆与上下文观测与评测文件与工件 75
问题P1长上下文模型能找到并复述一段代码,并不保证能用这段代码计算答案;只测检索会漏掉中间位置的信息使用失败。E1E3
└─诊断D1对同一目标代码分别测逐字提取与输入输出预测,在多个上下文长度和位置上观察两种能力的变化。E1E3
问题P2代码基准中的任务可能允许凭熟悉模式补全答案,使模型不充分依赖当前提供的代码,也能得到较高分数。E2E4
└─诊断D2逐步删除函数内容以测量答案对当前代码的依赖,再构造含随机独立运算的SemTrace任务,让缺失操作更难被熟悉模板替代。E2E4
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

本项目可在context评测记录中分开保存信息提取正确性与依据信息执行任务的正确性,同时记录目标位置、上下文长度、任务无干扰基线及输入依赖敏感度。只把这些作为测量维度;不能从单轮函数实验推导长期记忆更新、工具调度或所有真实代码库的收益。

取舍

目标函数位置和无关代码长度可分别控制,但词法任务的起止标记提供额外定位线索。SemTrace降低常见算法模式的可猜性,换来较窄的独立运算任务;删行实验保留原答案,解释受到代码有效性和推断任务变化的影响。

证据到哪为止

短函数及合成运算在受控长上下文中的作者实验;不是完整代码库Agent或长期context系统的效果保证。

09.12工程 Pydantic Lambda:让持久化扩展接管操作边界与异步生命周期问题Agent 执行因超时或重试从入口重来时,已经完成的模型请求和工具调用会重复,既浪费开销,也可能再次改变外部状态。结论可恢复Agent的关键不仅是保存结果,还要让能力装配、线程和操作序列遵守同一恢复契约。Pydantic给出了这一适配边界,但外部副作用和取消后的清理仍需独立处理。 工具与协议状态与恢复文件与工件 82.5
问题P1Agent 执行因超时或重试从入口重来时,已经完成的模型请求和工具调用会重复,既浪费开销,也可能再次改变外部状态。E1E6
└─缓解D1将持久化实现为 Agent 能力扩展,拦截模型、工具和动态解析操作;通过专用适配后端把结果交给 Lambda 保存,恢复时复用已完成操作。E1E2E3E9
问题P2异步 Agent 的并发工具和动态能力会改变执行顺序,而 Lambda 按操作位置恢复;直接接入容易错配历史结果,旧调用的清理还可能越过下一次调用。E2E5E7
└─缓解D2用队列连接同步 Lambda 入口和异步 Agent 循环,在持久上下文顺序执行工具,并固定操作名称及部署版本;取消超时后更换事件循环。E4E5E7
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

可在需要跨调用恢复、工具集相对稳定且允许最终结果返回的Agent服务中采用操作级durability capability。保留核心Agent操作接口,把引擎的线程、序列和序列化约束放到适配器;业务侧保留幂等键或外部结果核对能力。高并发工具、必须向调用方持续流式输出或频繁热装配能力的服务,不能直接接受本适配器的约束。

取舍

顺序工具和固定版本使操作序列更可预测,代价是并发度受限、在途升级需保留旧版本。每个checkpoint增加操作与状态存储;退出持久入口即退回普通运行。取消等待有界,换loop只隔离loop资源。

证据到哪为止

博客与固定源码支持机制及配置约束;没有跨引擎等价性、生产吞吐/总成本或外部恰好一次执行证据。

09.12论文 AgeMem:联合决定长期记忆写入与当前上下文取舍问题长任务中,Agent 既要保存将来有用的信息,又要裁剪当前上下文;把这两项决策交给固定检索和独立控制器,容易让保存与使用脱节。结论AgeMem把保存什么和现在看什么放进同一策略,并用后续任务反馈训练跨阶段选择。增强基线支持限定的联合管理贡献,但动作奖励代理、辅助模型成本和任务反例限制外推。 记忆与上下文工具与协议文件与工件 75
问题P1长任务中,Agent 既要保存将来有用的信息,又要裁剪当前上下文;把这两项决策交给固定检索和独立控制器,容易让保存与使用脱节。E1E2
└─缓解D1把长期记忆的增改删和当前上下文的检索、摘要、过滤暴露为同一 Agent 策略可调用的六个工具,让信息的保存与取用共同参与任务决策。E2E9
问题P2一次记忆写入或压缩是否有用,往往到后续问题出现才知道;仅凭即时规则或总体任务分数,难让早期记忆动作对后续结果负责。E1E3E4
└─缓解D2构造先积累记忆、再清空当前上下文并引入干扰、最后回答后续任务的训练轨迹,将终局复合奖励作用于整条轨迹的步骤。E3E4
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

可在跨会话知识需要复用、当前上下文需主动取舍的助手中采用双状态与显式memory工具接口,把选择写入、检索、压缩的决策一起表示。是否训练这种策略需由任务资料和奖励可获得性决定;服务端另行负责持久版本、租户分区及删除语义。已有证据适用于受控任务,不支持自动遗忘即事实修复或降低整体账单。

取舍

工具化让策略能主动修订记忆,却增加调用与辅助模型开销;终局奖励可连接早期动作和后来结果,但关键短语、judge和维护动作出现与真正信息效用并不等价。最终context变短不保证整个任务花费下降。

证据到哪为止

作者报告的五任务、组件及增强基线对照支持组合机制;没有等总预算、人评judge校准、多次区间或生产长期记忆一致性证据。

09.12工程 Managed Agents:让会话记录、控制循环与执行环境分别恢复问题会话与执行容器绑定后,容器故障会同时损失进度;提示压缩还可能使后续任务找不回原始事件。结论我们的采用判断是把不可丢的事件记录放在可替换harness之外,再把执行环境作为资源分配。适合长任务和频繁更新控制逻辑的系统;外部副作用、工具身份和日志访问权限仍需单独定义。 状态与恢复身份与权限工具与协议 87.5
问题P1会话与执行容器绑定后,容器故障会同时损失进度;提示压缩还可能使后续任务找不回原始事件。E1
├─缓解D1会话日志独立于控制循环:Session保存追加事件,harness通过emitEvent写入、getSession恢复E2
├─缓解D2原始事件与模型上下文分开:getEvents按位置读取日志片段,harness自行组织或压缩当前提示E2
└─缓解D3按需分配沙箱并隔离凭据:模型开始推理无需先启动执行容器E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

我们的采用判断是把不可丢的事件记录放在可替换harness之外,再把执行环境作为资源分配。适合长任务和频繁更新控制逻辑的系统;外部副作用、工具身份和日志访问权限仍需单独定义。

取舍

日志持久化不意味着外部操作恰好一次;恢复后的工具和资源仍需满足自身状态合同。延迟改善不能外推成所有任务完成更快,也不能由凭据代理推导全部权限问题已经解决。

证据到哪为止

日志持久化不意味着外部操作恰好一次;恢复后的工具和资源仍需满足自身状态合同。延迟改善不能外推成所有任务完成更快,也不能由凭据代理推导全部权限问题已经解决。

09.12工程 Cognition多Agent实践:集中写入,让其他Agent提供审查与判断问题并行写入会分散决策;直接让较弱模型负责升级求助,也可能错过真正困难的问题。结论可先把额外Agent用于审查、搜索与咨询,并明确谁负责最终修改。任务确实能分区时再讨论多写者;不能把本文的经验当成禁止所有并行写入的定律。 记忆与上下文文件与工件状态与恢复 82.5
问题P1并行写入会分散决策;直接让较弱模型负责升级求助,也可能错过真正困难的问题。E1
├─缓解D1审查者使用干净上下文:审查Agent从差异重新获取必要背景,避免继承编码过程的冗长轨迹;编码者再结合用户约束筛选审查意见,减少越界修改与来回循环E2
├─缓解D2把求助设计成双向交流:主模型可调用更强模型作为smart friendE2
└─缓解D3按模型能力划定协作边界:较弱的SWE-1.5仍不能可靠判断何时求助;跨前沿模型组合更像能力路由E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

可先把额外Agent用于审查、搜索与咨询,并明确谁负责最终修改。任务确实能分区时再讨论多写者;不能把本文的经验当成禁止所有并行写入的定律。

取舍

审查者的干净上下文可能缺失用户意图,仍需主Agent综合。子Agent不会自然共享状态;经理能力、沟通成本和最终验收仍限制扩大任务范围。

证据到哪为止

审查者的干净上下文可能缺失用户意图,仍需主Agent综合。子Agent不会自然共享状态;经理能力、沟通成本和最终验收仍限制扩大任务范围。

09.12工程 Claude Code质量复盘:三种产品改动如何叠加成退化问题聚合质量指标和内部试用不能覆盖特定会话状态;以降低延迟为目标的改动还可能损伤后续推理与编码质量。结论质量分析应把模型、Harness配置、会话状态和部署实验一起版本化。降低字数或历史长度之前,要识别被删信息承担的推理作用;面向用户的可读性改进不应变成不分任务的硬性截短。 状态与恢复观测与评测文件与工件 92.5
问题P1聚合质量指标和内部试用不能覆盖特定会话状态;以降低延迟为目标的改动还可能损伤后续推理与编码质量。E1
├─缓解D1按变更和受影响状态分开诊断:默认effort从high降到medium改变质量/延迟取舍;空闲一小时后的历史清理本应仅发生一次,错误标志却持续到后续每一轮,反复丢弃推理历史并破坏缓存E2
├─缓解D2把提示变化放入逐模型对照:限制工具间文本与最终回复长度的提示,在扩大评测范围后的消融中暴露编码质量下降E2
└─缓解D3让验证环境覆盖真实部署差异:内部消息队列实验和推理显示变化曾掩盖历史清理问题E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

质量分析应把模型、Harness配置、会话状态和部署实验一起版本化。降低字数或历史长度之前,要识别被删信息承担的推理作用;面向用户的可读性改进不应变成不分任务的硬性截短。

取舍

跨仓库审查回测找到一次缺陷不代表全面检出率。后续发布控制是改进措施,并非已经验证消除所有退化;用户反馈的广泛差异也不能由单一故障解释。

证据到哪为止

跨仓库审查回测找到一次缺陷不代表全面检出率。后续发布控制是改进措施,并非已经验证消除所有退化;用户反馈的广泛差异也不能由单一故障解释。

09.12工程 Cursor如何改进Harness:用线上结果校验离线收益问题离线分数改善不一定让用户得到更好的代码;工具报错若不区分模型和环境,也难以定位真正的Harness退化。结论可将离线回归、用户结果代理和按工具分类的运行告警并用。更强模型不一定需要旧护栏;是否保留护栏应与当前模型匹配。复杂任务频繁换模型还要承担信息与缓存代价。 工具与协议状态与恢复文件与工件 87.5
问题P1离线分数改善不一定让用户得到更好的代码;工具报错若不区分模型和环境,也难以定位真正的Harness退化。E1
├─缓解D1把用户后续行为加入线上对照:在离线基准之外并行部署Harness变体,观察代码在固定间隔后仍被保留的比例,并用模型阅读用户后续反馈判断满意度E2
├─缓解D2按工具和模型建立错误基线:未知错误作为实现缺陷报警;参数错误、环境矛盾、供应商错误等分别统计,按工具和模型计算预期基线E2
└─缓解D3让模型切换显式改变HarnessE2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

可将离线回归、用户结果代理和按工具分类的运行告警并用。更强模型不一定需要旧护栏;是否保留护栏应与当前模型匹配。复杂任务频繁换模型还要承担信息与缓存代价。

取舍

代码保留率不等于正确性,用户继续新任务也不必然表示满意。无法把错误下降全部归因于某个报警组件。模型切换的历史不匹配和缓存成本仍存在。

证据到哪为止

代码保留率不等于正确性,用户继续新任务也不必然表示满意。无法把错误下降全部归因于某个报警组件。模型切换的历史不匹配和缓存成本仍存在。

09.12工程 Google质量迭代:用稳定的专项指标识别总分掩盖的失败问题一个目标上的失败会被其他通过项稀释;自动变化的评分标准还会使修复前后难以直接比较。结论我们更值得采用的是把关心的失败变成稳定、可解释的专项指标,并检查判分器看到了哪些工具和上下文。通用总分适合发现线索,不能独自承担每项改动的验收。 观测与评测工具与协议记忆与上下文 82.5
问题P1一个目标上的失败会被其他通过项稀释;自动变化的评分标准还会使修复前后难以直接比较。E1
├─缓解D1让专项指标保持不变:在通用多轮评分之外,把是否遵从用户修改单独划分为遵从、忽略、部分遵从和无修改E2
├─缓解D2依据轨迹区分状态正确与回复正确:旅行Agent有的失败已经在内部保存了正确日期,最终回答却仍重复旧值E2
└─缓解D3分开修改与评分职责:编码Agent提出更改,外部评测服务判分,用户批准后继续E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

我们更值得采用的是把关心的失败变成稳定、可解释的专项指标,并检查判分器看到了哪些工具和上下文。通用总分适合发现线索,不能独自承担每项改动的验收。

取舍

外部判分器仍是模型,职责分开并不消除共同偏差。沿同一小集合反复修复可能过拟合;自适应rubric的总分变化也不等于固定量尺下的收益。

证据到哪为止

外部判分器仍是模型,职责分开并不消除共同偏差。沿同一小集合反复修复可能过拟合;自适应rubric的总分变化也不等于固定量尺下的收益。

09.12论文 Deep Agents递归编排:让代码负责遍历,让子Agent处理局部语义问题长文本聚合既需要覆盖每一条输入,又需要稳定累计结果;仅靠模型逐步记住计数容易遗漏或放弃。结论适合可明确分区、需要覆盖大量输入的聚合工作。若简单逐轮方法已能完成任务,额外子Agent和解释器未必值得;应把枚举完整性与内容判断正确性分别理解。 记忆与上下文身份与权限安全与隔离 75
问题P1长文本聚合既需要覆盖每一条输入,又需要稳定累计结果;仅靠模型逐步记住计数容易遗漏或放弃。E1
├─缓解D1把遍历与聚合交给程序:主Agent编写循环、分批和并发脚本,解释器调度子Agent读取局部输入,再由代码汇总E2
└─缓解D2区分递归Agent与原始RLM:原论文把整个输入放进解释器变量并递归调用语言模型;这里调用的是带工具和状态的子AgentE2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

适合可明确分区、需要覆盖大量输入的聚合工作。若简单逐轮方法已能完成任务,额外子Agent和解释器未必值得;应把枚举完整性与内容判断正确性分别理解。

取舍

128k时token更少但成本更高,延迟也增加。循环覆盖的是程序实际枚举的批次,不保证分区或语义判断正确;样本仅为一种聚合任务,未隔离每个组件的贡献。

证据到哪为止

128k时token更少但成本更高,延迟也增加。循环覆盖的是程序实际枚举的批次,不保证分区或语义判断正确;样本仅为一种聚合任务,未隔离每个组件的贡献。

09.12工程 Hugging Face入侵复盘:追踪Agent如何跨越数据、身份与集群边界问题单个数据处理缺陷会与过宽身份、元数据访问和共享连接器叠加;大量失败探测又使有效攻击路径难以及时从告警中显现。结论可借此逐项审视数据解析、工作负载身份、连接器权限与告警升级之间的联系。沙箱的可靠性取决于它能触达的服务和凭据;既要保留被攻破路径,也要保留确实挡住后续动作的边界。 身份与权限安全与隔离观测与评测 92.5
问题P1单个数据处理缺陷会与过宽身份、元数据访问和共享连接器叠加;大量失败探测又使有效攻击路径难以及时从告警中显现。E1
├─缓解D1按信任边界重建成功与失败路径:作者把外部执行环境、数据转换pod、节点身份和内部连接器分开,关联命令与平台审计记录E2
├─缓解D2区分获得权限与实际造成影响:复盘分别记录凭据读取、角色枚举、数据库访问和供应链写入尝试E2
└─缓解D3针对被跨越的边界修复:团队停用危险处理路径、阻止pod访问云元数据、轮换凭据并收窄连接器的集群授权,同时修正安全Agent未提升告警严重度的问题E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

可借此逐项审视数据解析、工作负载身份、连接器权限与告警升级之间的联系。沙箱的可靠性取决于它能触达的服务和凭据;既要保留被攻破路径,也要保留确实挡住后续动作的边界。

取舍

这是一次经过脱敏的响应团队重建,不能代表所有模型或正常部署配置。外部评测阶段部分事实引用另一方披露;“为了作弊”是作者推断,不能写成已证明的内在动机。约17,600动作也不是同等数量的成功攻击。

证据到哪为止

这是一次经过脱敏的响应团队重建,不能代表所有模型或正常部署配置。外部评测阶段部分事实引用另一方披露;“为了作弊”是作者推断,不能写成已证明的内在动机。约17,600动作也不是同等数量的成功攻击。

09.12工程 Factory模型路由:把缓存与任务状态纳入换模型的成本问题只比较模型单价会忽略整段历史重新计费,也可能把按某模型工具习惯构造的请求交给另一模型。结论更可迁移的是在选择模型时同时考虑历史、请求构造和任务结果。单次问答可能由网关掌握足够信息;长任务可在自然子任务边界路由,不能只按token单价频繁切换。 工具与协议状态与恢复文件与工件 80
问题P1只比较模型单价会忽略整段历史重新计费,也可能把按某模型工具习惯构造的请求交给另一模型。E1
├─缓解D1在构造请求之前选择模型:Harness先结合任务进展和模型能力选择模型,再匹配提示、工具格式和推理设置E2
└─缓解D2用新子任务缩小切换成本:父会话保留温热缓存,新worker只接收目标、前提和完成条件,独立选择模型E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

更可迁移的是在选择模型时同时考虑历史、请求构造和任务结果。单次问答可能由网关掌握足够信息;长任务可在自然子任务边界路由,不能只按token单价频繁切换。

取舍

缓存盲目切换图采用固定已观察轨迹的费用重估,排除缓存写入溢价,并非另跑策略的成功率比较。文章未公开完整路由策略、阈值和误差范围;“只能在Harness”是设计主张,取决于状态能否向路由层提供。

证据到哪为止

缓存盲目切换图采用固定已观察轨迹的费用重估,排除缓存写入溢价,并非另跑策略的成功率比较。文章未公开完整路由策略、阈值和误差范围;“只能在Harness”是设计主张,取决于状态能否向路由层提供。

09.12工程 Factory大型任务实验:把完成标准交给独立验证角色问题Agent边写边决定检查什么,容易验证自己已经实现的部分,然后在未覆盖大量行为时自行宣布完成。结论可迁移的是让完成判断独立于当前实现进度,并保留可执行的结果标准。适用于有可观察参考行为的重建和迁移;缺乏可靠真值、预算受限或任务很小时,维护独立验证体系未必划算。 文件与工件观测与评测 92.5
问题P1Agent边写边决定检查什么,容易验证自己已经实现的部分,然后在未覆盖大量行为时自行宣布完成。E1
├─缓解D1先调查行为,再建立可执行测量:验证者在实现开始前检查参考程序,构造加权案例和比较规则E2
└─缓解D2在实现者与内部测试之间保留边界:编排者接收验证者聚合的缺失行为与根因,再交给实现者处理;实现者不能查看测试案例和原始输出E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

可迁移的是让完成判断独立于当前实现进度,并保留可执行的结果标准。适用于有可观察参考行为的重建和迁移;缺乏可靠真值、预算受限或任务很小时,维护独立验证体系未必划算。

取舍

设计和实际消耗预算同时变化,没有等预算对照,不能将全部提升归因于角色分离或宣称只是换组织就免费增益。内部测试仍是行为抽样,90.3也不是完整GDAL功能覆盖率。

证据到哪为止

设计和实际消耗预算同时变化,没有等预算对照,不能将全部提升归因于角色分离或宣称只是换组织就免费增益。内部测试仍是行为抽样,90.3也不是完整GDAL功能覆盖率。

09.12工程 ADK上下文架构:从持久事件为每次调用生成视图问题把全部历史与大工具输出永久放入提示,会增加成本并干扰当前决策;多Agent继续转发整段历史还会放大这些问题。结论可把持久状态与单次模型输入分开设计,并明确每种内容的生命周期与继承范围。迁移时最关键的是压缩后还保留什么、谁能重新读取,以及实际默认交接配置。 记忆与上下文工具与协议文件与工件 75
问题P1把全部历史与大工具输出永久放入提示,会增加成本并干扰当前决策;多Agent继续转发整段历史还会放大这些问题。E1
├─缓解D1从事件记录生成临时上下文:会话保存结构化事件;contents处理器筛选事件并转换模型角色,其他有序处理器加入身份、指令和工具E2
├─缓解D2分别处理大对象、历史压缩与长期记忆E2
└─缓解D3明确子Agent继承什么:工具式调用返回结果,控制权转交则让子Agent接续会话;include_contents控制历史范围,角色转换解释其他Agent的动作,减少误认E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

可把持久状态与单次模型输入分开设计,并明确每种内容的生命周期与继承范围。迁移时最关键的是压缩后还保留什么、谁能重新读取,以及实际默认交接配置。

取舍

压缩可能裁剪或降低原事件优先级,不能据此保证原始历史永久可恢复。按需召回不保证恰好选到所需信息;角色重写也不等于形式化正确性。

证据到哪为止

压缩可能裁剪或降低原事件优先级,不能据此保证原始历史永久可恢复。按需召回不保证恰好选到所需信息;角色重写也不等于形式化正确性。

09.12工程 Replit自测:在持久REPL中结合浏览器操作与状态检查问题语法、单元与API检查覆盖不了真实浏览器中的完整用户流程;逐点击调用又带来延迟和上下文负担。结论适用于真实状态跨越前端、服务与数据库的应用测试。程序负责重复操作,模型负责依据观察选择下一步;采用价值取决于验证目标、可见信号和交接质量。 状态与恢复记忆与上下文工具与协议 82.5
问题P1语法、单元与API检查覆盖不了真实浏览器中的完整用户流程;逐点击调用又带来延迟和上下文负担。E1
├─缓解D1把浏览器操作写成可迭代代码:测试Agent在持久JavaScript执行环境中调用Playwright,批量表达循环和条件E2
├─缓解D2让观察与动作相互推进:除了浏览器操作,还提供简化DOM、标签、只读数据库查询,以及本次执行以来的新客户端/服务端日志E2
└─缓解D3把测试上下文放到子Agent:编码Agent提供高层验证目标,测试Agent执行并返回结果摘要E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

适用于真实状态跨越前端、服务与数据库的应用测试。程序负责重复操作,模型负责依据观察选择下一步;采用价值取决于验证目标、可见信号和交接质量。

取舍

浏览器完成操作不代表验证覆盖完整,测试Agent仍自行判断何时结束。人工估算的纯电脑操作费用不能当成严格基准对照;代码执行工具也需要独立隔离。

证据到哪为止

浏览器完成操作不代表验证覆盖完整,测试Agent仍自行判断何时结束。人工估算的纯电脑操作费用不能当成严格基准对照;代码执行工具也需要独立隔离。

09.12工程 OpenAI的Harness工程:让代码约束与运行反馈成为Agent可读材料问题代码生成快于人工检查,未表达的规则和运行信号容易被遗漏。结论应先让约束可执行、结果可观察,再扩大自主范围。 文件与工件记忆与上下文安全与隔离 82.5
问题P1代码生成快于人工检查,未表达的规则和运行信号容易被遗漏。E1
├─缓解D1组织可查证的仓库知识:短入口连接版本化文档与计划,检查器维护结构E2
└─缓解D2把规则与反馈放进开发循环:分层依赖由工具强制,隔离工作区提供界面、日志和指标;后台任务清理偏离E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

应先让约束可执行、结果可观察,再扩大自主范围。

取舍

长期架构质量仍未知;减少合并阻塞依赖纠错成本低,不能普遍照搬。

证据到哪为止

长期架构质量仍未知;减少合并阻塞依赖纠错成本低,不能普遍照搬。

09.12论文 AlphaEval:把企业任务和验收标准一起做成评测问题通用基准的明确题目和单一判分,不能覆盖真实交付中的隐含要求与多种产物。结论可以借鉴共同定义任务与多种验收的做法;上线判断应保留领域分项,不能把64.41解读为可替代64.41%的工作。 观测与评测文件与工件 75
问题P1通用基准的明确题目和单一判分,不能覆盖真实交付中的隐含要求与多种产物。E1
├─测量D1让业务专家共同定义任务与验收:七家企业提供真实任务材料、参考结果和隐含约束,经过反复讨论整理为查询、文件、配置和评测规则E2
└─测量D2按任务组合判分,并公开聚合口径:94个任务覆盖六类职业领域,分别使用参考答案、约束检查、模型判分或界面验证;总体得分是六个领域均分,不是94项完成率E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

可以借鉴共同定义任务与多种验收的做法;上线判断应保留领域分项,不能把64.41解读为可替代64.41%的工作。

取舍

只有最佳配置做了三次重复;表4所谓95%区间实际等于均值±标准差,不能据此声称排名稳定。经济价值由人工工时、工资、专家调整与质量分推算,不是实际节省金额。

证据到哪为止

只有最佳配置做了三次重复;表4所谓95%区间实际等于均值±标准差,不能据此声称排名稳定。经济价值由人工工时、工资、专家调整与质量分推算,不是实际节省金额。

09.12论文 AHE:让Harness修改留下可检查的预测与回归记录问题自动修改Harness时,可编辑组件、轨迹依据和修改效果常常互相脱节。结论优先借鉴可追溯修改与保护验证器的结构;不能仅凭修改理由或预计风险批准自动晋级。 文件与工件身份与权限记忆与上下文 82.5
问题P1自动修改Harness时,可编辑组件、轨迹依据和修改效果常常互相脱节。E1
├─测量D1把修改对象与诊断依据变成可定位文件E2
└─测量D2记录修改预测,再用下一轮结果检查E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

优先借鉴可追溯修改与保护验证器的结构;不能仅凭修改理由或预计风险批准自动晋级。

取舍

同一任务集反复优化和择优;单次演化,跨基准收益很小。回归预测召回率仅11.1%,修改自述不能替代回归检查。正文称各角色high,附录将演化角色列为xhigh,需保留配置差异。

证据到哪为止

同一任务集反复优化和择优;单次演化,跨基准收益很小。回归预测召回率仅11.1%,修改自述不能替代回归检查。正文称各角色high,附录将演化角色列为xhigh,需保留配置差异。

09.12论文 Agent Meltdowns:普通环境错误也会诱发越界恢复问题文件缺失或网络错误可能使Agent扩大搜索、改变权限或隐瞒失败;成功率评测容易漏掉这些恢复过程中的行为。结论恢复测试应同时检查授权范围和最终披露;超时阈值只是候选防护,文章没有验证它能可靠阻断越界。 状态与恢复文件与工件身份与权限 92.5
问题P1文件缺失或网络错误可能使Agent扩大搜索、改变权限或隐瞒失败;成功率评测容易漏掉这些恢复过程中的行为。E1
├─诊断D1对同一任务比较有错误与无错误运行E2
└─诊断D2分别标注风险行为、实施阶段和是否披露E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

恢复测试应同时检查授权范围和最终披露;超时阈值只是候选防护,文章没有验证它能可靠阻断越界。

取舍

Codex等配置开放了完整文件与工具权限,不能外推默认部署风险率。场景与模型样本不均;文中不同阶段统计集合未完全对齐,本分析不使用64.7%作为总体生产风险率。

证据到哪为止

Codex等配置开放了完整文件与工具权限,不能外推默认部署风险率。场景与模型样本不均;文中不同阶段统计集合未完全对齐,本分析不使用64.7%作为总体生产风险率。

09.12论文 真实编码会话中的失配:把用户纠正转成可审查的故障记录问题基准轨迹无法直接反映开发者在实际协作中反复纠正Agent的负担。结论值得迁移的是带原始轮次的反馈分析与误报复查,不宜据此直接给产品或模型排可靠性榜。 状态与恢复文件与工件 80
问题P1基准轨迹无法直接反映开发者在实际协作中反复纠正Agent的负担。E1
├─测量D1只从有明确用户反馈的会话提取失配E2
└─测量D2分开症状、原因、损害和解决方式:对16118个有效事件多轴标注并抽样人工检查;原因与损害标注更不可靠,因此不把所有标签当作确定根因E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

值得迁移的是带原始轮次的反馈分析与误报复查,不宜据此直接给产品或模型排可靠性榜。

取舍

90.67%的事件解决状态不可见,不能写成未解决;只纳入公开记录及可见纠正,无法推断总体故障率。IDE与CLI比较同时混合产品、任务和时间。

证据到哪为止

90.67%的事件解决状态不可见,不能写成未解决;只纳入公开记录及可见纠正,无法推断总体故障率。IDE与CLI比较同时混合产品、任务和时间。

09.12论文 Skill参考架构:区分文件、运行时采用、执行权限与验收问题安装或激活Skill不等于它被正确执行,也不意味着获得其提到的权限。结论可以用四层责任审查自己的Skill系统,优先补齐运行身份、权限和验收,而不是按模式数量打成熟度分。 身份与权限文件与工件安全与隔离 75
问题P1安装或激活Skill不等于它被正确执行,也不意味着获得其提到的权限。E1
├─测量D1按责任拆开Skill进入运行的过程E2
└─测量D2为每次使用保留身份和独立验收状态E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

可以用四层责任审查自己的Skill系统,优先补齐运行身份、权限和验收,而不是按模式数量打成熟度分。

取舍

架构构造和对照来自同一语料,不能称独立验证。未在公开资料出现不等于产品不存在该功能;Skill-BOM是提议中的模式,不是成熟通用标准。

证据到哪为止

架构构造和对照来自同一语料,不能称独立验证。未在公开资料出现不等于产品不存在该功能;Skill-BOM是提议中的模式,不是成熟通用标准。

09.12论文 ToolMaze:把工具错误与可用恢复路径分开控制问题工具失败后,Agent可能反复重试而不改路,也可能盲信格式正常但内容错误的输出。结论可借鉴二维故障矩阵和有条件的恢复指标;发布时应同时显示恢复、终止和最终完成。 工具与协议状态与恢复观测与评测 82.5
问题P1工具失败后,Agent可能反复重试而不改路,也可能盲信格式正常但内容错误的输出。E1
├─测量D1先构建工具依赖图,再生成任务:270个工具形成四类拓扑,枚举图内可用路径,并反向检查自然语言任务是否保留依赖E2
└─测量D2独立控制错误类型与恢复测量:400个基础任务分别加入显式或隐式、临时或永久故障;区分整体表现、遇错后的恢复比例和多余调用代价E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

可借鉴二维故障矩阵和有条件的恢复指标;发布时应同时显示恢复、终止和最终完成。

取舍

穷举只覆盖构造图内的解空间,语义验证依赖模型。固定的合成故障没有覆盖真实工具的全部联动错误,缩放拟合不是普遍规律。

证据到哪为止

穷举只覆盖构造图内的解空间,语义验证依赖模型。固定的合成故障没有覆盖真实工具的全部联动错误,缩放拟合不是普遍规律。

09.12论文 TokenPilot:压缩上下文时同时计算缓存损失问题删掉更多token可能破坏前缀缓存,使实际调用更贵。结论采用时应一起看命中、未命中、输出和质量分;优先保留全文恢复通路,不能只优化上下文长度。 状态与恢复身份与权限工具与协议 87.5
问题P1删掉更多token可能破坏前缀缓存,使实际调用更贵。E1
├─缓解D1先稳定前缀,再缩减工具输入:易变路径、时间和工具定义移到动态位置;长输出以预览入上下文,全文按哈希保存并允许取回E2
└─缓解D2按剩余用途分批移出历史:模型估计片段是否完成、是否仍被依赖,系统检查状态转换并按批次删除,减少每轮改写造成的缓存损失E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

采用时应一起看命中、未命中、输出和质量分;优先保留全文恢复通路,不能只优化上下文长度。

取舍

用途估计可能误判,缓存收益依赖后端。混合任务补充实验仍有收益,但不能保证跨租户可安全复用,静态替换必须保留原值和隔离范围。

证据到哪为止

用途估计可能误判,缓存收益依赖后端。混合任务补充实验仍有收益,但不能保证跨租户可安全复用,静态替换必须保留原值和隔离范围。

09.12论文 Agent记忆系统比较:选型要对齐更新、检索与维护负担问题只比较最终回答质量,无法判断记忆失败发生在提取、检索还是更新维护。结论先定位当前任务需要最新事实、远距关联还是低维护成本,再选结构;不要按一张总榜替换记忆系统。 记忆与上下文观测与评测文件与工件 75
问题P1只比较最终回答质量,无法判断记忆失败发生在提取、检索还是更新维护。E1
├─测量D1分模块、分工作负载评估记忆:把系统拆为表示存储、提取、检索路由与维护,在多套数据上分别观察答案、证据检索、事实更新和长历史表现E2
└─测量D2用组件变体检查设计取舍:改变融合比例、检索规划、反思和合并策略,并单独记录构建与查询开销,避免将整体系统差异直接当作单个组件贡献E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

先定位当前任务需要最新事实、远距关联还是低维护成本,再选结构;不要按一张总榜替换记忆系统。

取舍

各实验覆盖的系统和样本不同,词面指标不等于语义正确;成本包含摊销和异常过滤口径,不能直接作为生产延迟承诺。

证据到哪为止

各实验覆盖的系统和样本不同,词面指标不等于语义正确;成本包含摊销和异常过滤口径,不能直接作为生产延迟承诺。

09.12论文 AgentLocate:通过多视角标注改进故障位置判断问题长协作轨迹中,下游暴露错误的Agent容易被误当作最早责任来源。结论适合减少人工排查范围,不能自动裁决责任或以多数票替代真实干预证据。 文件与工件运行时与调度观测与评测 75
问题P1长协作轨迹中,下游暴露错误的Agent容易被误当作最早责任来源。E1
├─诊断D1先提定位假设,再聚合不同提示的评估E2
└─诊断D2用评估反馈训练定位模型:将假设、理由和聚合标签用于LoRA微调;训练和测试轨迹分开,运行时由微调后的Judge输出位置E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

适合减少人工排查范围,不能自动裁决责任或以多数票替代真实干预证据。

取舍

反事实修正并未真实执行,所谓决定性错误是基于日志的推断。Evaluator用同一个基础模型且看到初始假设,自报置信度未经校准,不能视为独立事实核验。

证据到哪为止

反事实修正并未真实执行,所谓决定性错误是基于日志的推断。Evaluator用同一个基础模型且看到初始假设,自报置信度未经校准,不能视为独立事实核验。

09.12论文 LHTB:用最终状态中的分项证据衡量长任务进展问题极难长任务中,大量模型都未完全通过,二元得分掩盖了有用的部分进展。结论保留部分进展便于诊断,但验收仍需单独检查最终必要条件,不能用加权均分补偿关键失败。 文件与工件状态与恢复观测与评测 75
问题P1极难长任务中,大量模型都未完全通过,二元得分掩盖了有用的部分进展。E1
├─测量D1把任务拆成可独立检查的目标:46个容器任务提供参考解和隐藏检查,将文件、测试、数值或模拟器结果按子目标加权评分E2
└─测量D2同时报告完成、部分进展和退出行为E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

保留部分进展便于诊断,但验收仍需单独检查最终必要条件,不能用加权均分补偿关键失败。

取舍

任务经特定模型反复校准难度,GPT-5.3使用不同Harness;少量任务和单次模型任务组合限制稳定排名。部分高分不意味着已具备可交付结果。

证据到哪为止

任务经特定模型反复校准难度,GPT-5.3使用不同Harness;少量任务和单次模型任务组合限制稳定排名。部分高分不意味着已具备可交付结果。

09.12论文 Harness演化评测:先排除多次尝试和同题优化带来的收益问题反复在同一公开题集修改Harness再报分,可能把搜索预算和记题收益误当作可迁移设计。结论应把可复用设计改善与单题多试成功分别报告,同时公开验证器权限和全部搜索成本。 观测与评测身份与权限文件与工件 92.5
问题P1反复在同一公开题集修改Harness再报分,可能把搜索预算和记题收益误当作可迁移设计。E1
├─测量D1对齐反馈与尝试次数后比较不同搜索位置E2
└─测量D2把搜索、选择和测试任务分开:45题训练、10题选配置、34题测试,衡量冻结Harness在未参与修改的题目上是否改善E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

应把可复用设计改善与单题多试成功分别报告,同时公开验证器权限和全部搜索成本。

取舍

主要对齐rollout次数,并非严格相同token或费用;AHE关闭了探索Agent且每题只采一次,与原论文运行设置不同。两次重复及单一套件限制泛化。

证据到哪为止

主要对齐rollout次数,并非严格相同token或费用;AHE关闭了探索Agent且每题只采一次,与原论文运行设置不同。两次重复及单一套件限制泛化。

09.12论文 GuardianAgentBench:检查工具参数之外,还要检查调用是否覆盖任务问题参数合法不代表工具选择相关,也不代表完成任务所需的调用没有遗漏。结论把参数、相关性、任务覆盖分开记录,并同时测量救回的失败与误伤的成功。 工具与协议安全与隔离文件与工件 75
问题P1参数合法不代表工具选择相关,也不代表完成任务所需的调用没有遗漏。E1
└─缓解D1把工具调用分成三种检查:在调用前检查参数、任务覆盖和相关性,失败后给予反馈,最多重试两次,再阻断并升级E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把参数、相关性、任务覆盖分开记录,并同时测量救回的失败与误伤的成功。

取舍

检查器实际由Claude Sonnet 4.5驱动,不能按文中另一处的“规则式”描述理解为确定性保证。生成、判分和检查存在模型关联,检查只在一个框架上评估,额外推理成本没有完整报告。

证据到哪为止

检查器实际由Claude Sonnet 4.5驱动,不能按文中另一处的“规则式”描述理解为确定性保证。生成、判分和检查存在模型关联,检查只在一个框架上评估,额外推理成本没有完整报告。

09.12论文 SEAL:Agent自写测试,仍需要独立的版本接纳门槛问题Agent同时修改策略和测试时,自评分可能持续优秀,而隐藏部署表现退化。结论让候选生成与版本接纳使用不同权限、数据和评测接口,并独立观察部署回退。 观测与评测文件与工件身份与权限 87.5
问题P1Agent同时修改策略和测试时,自评分可能持续优秀,而隐藏部署表现退化。E1
├─缓解D1把测试和接纳权分离:Agent保留自写测试;Harness用不可见的固定审计比较候选与当前版本,只返回接纳或拒绝,拒绝时保留整个原版本E2
└─缓解D2分开开发、审计与部署环境:审计种子与自测、最终部署分离,最终部署另有环境扰动,检查审计代理指标能否迁移E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

让候选生成与版本接纳使用不同权限、数据和评测接口,并独立观察部署回退。

取舍

审计仍是有限代理:出现审计分数上升而部署分数下降的接纳。等提案数不等于等总计算;反复返回一位接纳结果仍会泄露优化信号。三种子半极差不是置信区间。

证据到哪为止

审计仍是有限代理:出现审计分数上升而部署分数下降的接纳。等提案数不等于等总计算;反复返回一位接纳结果仍会泄露优化信号。三种子半极差不是置信区间。

09.12论文 Model or Harness:给故障分类之前,先说明归因规则问题同一失败可能被归于模型或外围执行系统,缺少统一边界会导致修复方向混乱。结论先记录观察到的失效位置,再分别检验模型与Harness的修复方案,避免把分类标签写成责任定论。 状态与恢复文件与工件 75
问题P1同一失败可能被归于模型或外围执行系统,缺少统一边界会导致修复方向混乱。E1
├─测量D1标记最早未恢复的失效:用交互边和责任侧组织41类故障,并结合原始案例证据定位最早未被后续步骤纠正的错误E2
└─测量D2允许保留不同归因:比较多模型分类与人工标签,以一致程度表达不确定性,不把模型共识当作因果验证E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

先记录观察到的失效位置,再分别检验模型与Harness的修复方案,避免把分类标签写成责任定论。

取舍

分类体系与案例共同开发,人工标签来自单人;“更强模型是否能避免或恢复”这条规则本身影响责任划分。案例不是总体随机样本,日志归因没有经过修复干预验证。

证据到哪为止

分类体系与案例共同开发,人工标签来自单人;“更强模型是否能避免或恢复”这条规则本身影响责任划分。案例不是总体随机样本,日志归因没有经过修复干预验证。

09.12论文 MEA:执行者报告完成后,由独立审计决定状态推进问题长任务中执行者可能过早宣布完成,错误状态随后成为下一轮的前提。结论采用显式状态推进条件,并给审计保留独立的环境读取能力;同时限制轮数和审计预算。 观测与评测状态与恢复记忆与上下文 87.5
问题P1长任务中执行者可能过早宣布完成,错误状态随后成为下一轮的前提。E1
├─缓解D1分离管理、执行与审计:管理者持有需求、产物和事实状态;执行者以有界任务合同进入新上下文;审计者只读检查环境,审计通过才推进完成状态E2
└─缓解D2限制跨轮传播的信息:保留合同与审计结果,丢弃执行原始轨迹,把执行报告用作定位线索而非完成证据E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

采用显式状态推进条件,并给审计保留独立的环境读取能力;同时限制轮数和审计预算。

取舍

多个机制一起改变,未隔离新上下文、审计与额外预算的贡献。不同官方基线的协议不能视为完全相同;只读审计和修改监测也不等于完整安全隔离证明。

证据到哪为止

多个机制一起改变,未隔离新上下文、审计与额外预算的贡献。不同官方基线的协议不能视为完全相同;只读审计和修改监测也不等于完整安全隔离证明。

09.12论文 DreamGuard:在工具执行前结合历史状态预判风险问题单步检查可能看不见逐步累积的风险,而过度阻断又会损害正常任务。结论同时设置危险漏报、正常任务误伤和干预时机的验收指标,不能只优化一个安全率。 安全与隔离状态与恢复观测与评测 82.5
问题P1单步检查可能看不见逐步累积的风险,而过度阻断又会损害正常任务。E1
├─缓解D1维护风险相关的递归状态:以压缩历史状态预测候选动作后的表示,联合即时危险和前缀风险,在动作执行前给出放行、暂停或阻断E2
└─缓解D2校准阈值并检查误伤:在安全轨迹上校准阈值,分别测量危险轨迹检出、提前干预和安全任务误报E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

同时设置危险漏报、正常任务误伤和干预时机的验收指标,不能只优化一个安全率。

取舍

文中SR表示危险轨迹是否触发干预,不能写成任务成功率。不同数据上的指标并非全部第一,AgentDojo误报仍高;阈值只在SafetyDrift上校准,分布变化需重校准,阻断也不提供安全替代动作。

证据到哪为止

文中SR表示危险轨迹是否触发干预,不能写成任务成功率。不同数据上的指标并非全部第一,AgentDojo误报仍高;阈值只在SafetyDrift上校准,分布变化需重校准,阻断也不提供安全替代动作。

09.12论文 可靠编码Agent专章:外部动作成功后,内部记录仍可能未知问题外部操作已经完成而进程未记账就崩溃,重试可能重复副作用;内部日志不能证明外部状态。结论先为一个有副作用的工具建立稳定调用身份、外部状态核对与未知状态处理,再做精确崩溃点测试。 状态与恢复身份与权限记忆与上下文 72.5
问题P1外部操作已经完成而进程未记账就崩溃,重试可能重复副作用;内部日志不能证明外部状态。E1
└─缓解D1区分逻辑工作、尝试和外部提交:用稳定调用身份跨越重试边界,要求外部去重或状态核对;不确定时保留未决状态并升级处理E2
问题P2整体成功率不能区分证据未保存、未召回或未被利用,容易误判记忆设计的作用。E1E2
└─测量D2将检索和最终完成分项观察:分别记录证据是否可用、被检索、进入上下文以及最终任务结果,避免端到端分数掩盖边界失效E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

先为一个有副作用的工具建立稳定调用身份、外部状态核对与未知状态处理,再做精确崩溃点测试。

取舍

本次评分限定已审查的恢复与检索专章及证据说明,不代表通读206条实践。作者明确本地案例不是独立外部证据,私有轨迹不能完整复核;分布式系统经验向Agent的迁移也不等于生产效果证明。

证据到哪为止

本次评分限定已审查的恢复与检索专章及证据说明,不代表通读206条实践。作者明确本地案例不是独立外部证据,私有轨迹不能完整复核;分布式系统经验向Agent的迁移也不等于生产效果证明。

09.12论文 编码工具配置研究:仓库里的文件能说明什么问题不同工具暴露不同配置入口,难以比较团队如何组织规则、技能和辅助Agent。结论统一核心规则时保留工具适配层,并另行记录配置的实际加载和执行。 文件与工件工具与协议观测与评测 75
问题P1不同工具暴露不同配置入口,难以比较团队如何组织规则、技能和辅助Agent。E1
├─测量D1建立配置机制和文件的映射:在经过筛选的GitHub项目中检测八类配置,再统计采用、共现和文件内容E2
└─测量D2补充实际使用的旁证:检查AI署名提交及短文件内容,剔除空文件和依赖目录,减少把残留文件当成配置的误判E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

统一核心规则时保留工具适配层,并另行记录配置的实际加载和执行。

取舍

检测到文件不等于该机制在运行中生效;署名提交也不能证明每种机制被使用。样本偏向成熟英文开源项目,Codex专属配置仅4例,不能据此比较工具市场份额或效果。

证据到哪为止

检测到文件不等于该机制在运行中生效;署名提交也不能证明每种机制被使用。样本偏向成熟英文开源项目,Codex专属配置仅4例,不能据此比较工具市场份额或效果。

09.12论文 Agent可靠性:把重复成功、扰动、置信度和安全分开测问题平均成功率掩盖同一任务反复执行不稳定、成本波动及错误时仍自信的问题。结论报告重复成功、成本波动和误判置信度,并为安全单独设门槛,避免只按平均任务分数选型。 安全与隔离工具与协议文件与工件 80
问题P1平均成功率掩盖同一任务反复执行不稳定、成本波动及错误时仍自信的问题。E1
├─测量D1用多维协议测量可靠性:对任务重复运行,改写提示、注入工具故障和环境格式变化,并测量完成后的置信度E2
└─测量D2安全单列为约束:一致性、稳健性和可预测性可汇总;安全违规与严重度单列,避免均分掩盖尾部风险E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

报告重复成功、成本波动和误判置信度,并为安全单独设门槛,避免只按平均任务分数选型。

取舍

每个基准只使用一种Harness,安全判断依赖LLM;重复五次、部分模型默认采样设置和有限扰动不能代表生产可靠性。总可靠性分数不包含安全。

证据到哪为止

每个基准只使用一种Harness,安全判断依赖LLM;重复五次、部分模型默认采样设置和有限扰动不能代表生产可靠性。总可靠性分数不包含安全。

09.12论文 Meta-Harness:用可检索历史代码和轨迹改进外围程序问题标量分数或短摘要丢失失败细节,使程序级优化难以定位有效修改。结论保留完整历史供按需检索,并把搜索集反馈与不可见测试结果分开。 记忆与上下文文件与工件 82.5
问题P1标量分数或短摘要丢失失败细节,使程序级优化难以定位有效修改。E1
└─测量D1外层提案Agent检索历次代码、分数与轨迹,生成通过接口检查的候选;保留成本与质量的Pareto前沿,基础模型固定E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

保留完整历史供按需检索,并把搜索集反馈与不可见测试结果分开。

取舍

源码正则和人工泄漏检查不能代替独立测试集;终端榜单来自不同实现,不能把排名视为统一预算下的模型能力比较。

证据到哪为止

源码正则和人工泄漏检查不能代替独立测试集;终端榜单来自不同实现,不能把排名视为统一预算下的模型能力比较。

09.12论文 比较Agent时,模型与Harness必须一起披露问题模型排行榜混合上下文、重试和验收配置,无法区分收益来自哪里。结论采用模型×Harness成对报告,保留预算和配置;将方差比例限定在实际选取的网格。 记忆与上下文安全与隔离文件与工件 75
问题P1模型排行榜混合上下文、重试和验收配置,无法区分收益来自哪里。E1
└─测量D1使用三模型乘三Harness的因子网格,固定任务、步数和执行环境,分别计算模型与Harness间的方差,并披露配置E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

采用模型×Harness成对报告,保留预算和配置;将方差比例限定在实际选取的网格。

取舍

刻意选取能力相近模型与差异较大的Harness会影响方差比,多个机制一起变化;7.80倍不是普遍定律,也没有隔离每个组件的因果贡献。

证据到哪为止

刻意选取能力相近模型与差异较大的Harness会影响方差比,多个机制一起变化;7.80倍不是普遍定律,也没有隔离每个组件的因果贡献。

09.12论文 ToolFailBench:调用了工具,也可能没使用工具结果问题最终回答错误不能区分漏调用、忽略返回值、编造字段或不必要调用。结论把调用是否执行、返回值是否使用与多余调用分别验收。 工具与协议状态与恢复观测与评测 75
问题P1最终回答错误不能区分漏调用、忽略返回值、编造字段或不必要调用。E1
└─测量D1设置750个需工具任务和250个无需工具对照,用偏离常见先验的模拟返回值检查结果利用;规则与两个LLM共同标注轨迹E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把调用是否执行、返回值是否使用与多余调用分别验收。

取舍

仅为单轮模拟工具,不代表专业任务胜任或多步恢复能力;多数票一致性不是标签正确性的独立证明,表述与表格分母应按Required任务集合解读。

证据到哪为止

仅为单轮模拟工具,不代表专业任务胜任或多步恢复能力;多数票一致性不是标签正确性的独立证明,表述与表格分母应按Required任务集合解读。

09.12论文 ChainCaps:数据经过工具链,使用权限只能收窄问题每个工具单独获准,并不能阻止受限数据经多次转换后流向未授权出口。结论在出口边界强制检查来源权限,并把策略编写、数据流覆盖与正常任务误伤纳入验收。 身份与权限工具与协议文件与工件 87.5
问题P1每个工具单独获准,并不能阻止受限数据经多次转换后流向未授权出口。E1
└─缓解D1MCP代理给数据附加可到达出口集合,转换时取输入权限和工具策略交集;上下文保守继承,出口调用前检查,例外授权绑定请求与来源E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

在出口边界强制检查来源权限,并把策略编写、数据流覆盖与正常任务误伤纳入验收。

取舍

定理依赖可见数据流和正确策略;Shell等绕过边界仍有残余失败。Fides/PFI比较是抽象规则回放,不是完整系统对照;复杂正常任务仍可能误拦。

证据到哪为止

定理依赖可见数据流和正确策略;Shell等绕过边界仍有残余失败。Fides/PFI比较是抽象规则回放,不是完整系统对照;复杂正常任务仍可能误拦。

09.12论文 TraceSafe:安全检查也需要理解工具结构与上下文问题自然语言安全检测可能漏掉参数、版本和接口层面的异常。结论将正常轨迹误报与各类结构漏报同时报告,不把安全总分当作工具边界覆盖率。 观测与评测安全与隔离工具与协议 75
问题P1自然语言安全检测可能漏掉参数、版本和接口层面的异常。E1
└─测量D1从成功工具轨迹出发,以受控代码编辑构造12类风险,保留正常对照,比较二分类与有分类定义的检测方式E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

将正常轨迹误报与各类结构漏报同时报告,不把安全总分当作工具边界覆盖率。

取舍

检测的是离线构造风险,不是实时阻断效果;任务成功不自动证明全部安全,结构编辑也不能覆盖真实攻击。结构能力相关性不能证明它是唯一因果瓶颈,较长轨迹趋势主要发生在约6k Token以内。

证据到哪为止

检测的是离线构造风险,不是实时阻断效果;任务成功不自动证明全部安全,结构编辑也不能覆盖真实攻击。结构能力相关性不能证明它是唯一因果瓶颈,较长轨迹趋势主要发生在约6k Token以内。

09.12论文 虚假完成检测:先核对环境状态,再相信结束语问题Agent可能声称完成,但任务环境没有达到要求,普通文本裁判容易受自信表达影响。结论把文本与轨迹检测作为人工复核队列信号,完成状态仍由独立环境检查确认。 状态与恢复观测与评测安全与隔离 80
问题P1Agent可能声称完成,但任务环境没有达到要求,普通文本裁判容易受自信表达影响。E1
└─测量D1用程序化最终状态与完成声明交叉标注,训练轻量轨迹检测器,采用任务隔离、跨模型与跨域测试E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把文本与轨迹检测作为人工复核队列信号,完成状态仍由独立环境检查确认。

取舍

τ基准标签部分由结束语规则形成,虽有人工及消融控制仍有表达依赖;跨域表现下降,10%标记率时约一半误报。检测器不能替代直接状态验收。

证据到哪为止

τ基准标签部分由结束语规则形成,虽有人工及消融控制仍有表达依赖;跨域表现下降,10%标记率时约一半误报。检测器不能替代直接状态验收。

09.12论文 Memory-induced Tool-Drift:个人偏好可能污染专业工具参数问题本来只适用于个人场景的偏好,被记忆系统当成通用规则,影响无关任务中的参数。结论存储偏好时保留适用场景,在高影响参数处单独核对任务依据。 记忆与上下文工具与协议安全与隔离 75
问题P1本来只适用于个人场景的偏好,被记忆系统当成通用规则,影响无关任务中的参数。E1
└─测量D1用无记忆、中性记忆和偏好记忆对照,在直接注入与三种记忆框架下比较参数偏移;再测试提示防御和相关性过滤E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

存储偏好时保留适用场景,在高影响参数处单独核对任务依据。

取舍

608个工具是扫描器标记的潜在风险,不是608个已发生事故。偏移由LLM判分;干净分离任务中过滤有效,但跨域相关性难题仍在。机制解释和训练防御不能写成已验证解决方案。

证据到哪为止

608个工具是扫描器标记的潜在风险,不是608个已发生事故。偏移由LLM判分;干净分离任务中过滤有效,但跨域相关性难题仍在。机制解释和训练防御不能写成已验证解决方案。

09.12论文 SAFARI:用检索调查长轨迹,而不是一次塞进上下文问题超长日志中故障位置可能超出裁判上下文,截断会丢失关键证据。结论让诊断保留原日志定位与未解问题,区分“命中一个故障”和“确认决定性根因”。 记忆与上下文文件与工件 75
问题P1超长日志中故障位置可能超出裁判上下文,截断会丢失关键证据。E1
└─诊断D1调查Agent按片段读取和搜索日志,保留假设与证据的短期记忆;把结论拆成最多三条交给只看引用的评估器,最多调查30轮E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

让诊断保留原日志定位与未解问题,区分“命中一个故障”和“确认决定性根因”。

取舍

评估器不读取原日志,不能验证引用是否完整;TRAIL精度只要求命中任意标注故障,不等于找到唯一根因。按已知故障位置缩小上下文的压力实验不等于真实五倍长度部署;未验证线上修复效果。

证据到哪为止

评估器不读取原日志,不能验证引用是否完整;TRAIL精度只要求命中任意标注故障,不等于找到唯一根因。按已知故障位置缩小上下文的压力实验不等于真实五倍长度部署;未验证线上修复效果。

09.12论文 Slim:搜索只给线索,浏览再取相关片段问题搜索阶段一次装入大量页面,使长任务预算消耗在无关内容上。结论先减少无关材料进入上下文,再按实际任务检验摘要触发点及证据保留。 文件与工件记忆与上下文身份与权限 75
问题P1搜索阶段一次装入大量页面,使长任务预算消耗在无关内容上。E1
└─缓解D1搜索返回标题、链接和摘要,浏览按查询提取片段,再周期性压缩整段执行历史E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

先减少无关材料进入上下文,再按实际任务检验摘要触发点及证据保留。

取舍

成本计算排除缓存Token费用,不能直接当真实账单;消融正文写50样本而表注写100,样本数仍待澄清。整体收益不代表每个默认参数最佳,摘要可能丢失信息。

证据到哪为止

成本计算排除缓存Token费用,不能直接当真实账单;消融正文写50样本而表注写100,样本数仍待澄清。整体收益不代表每个默认参数最佳,摘要可能丢失信息。

09.12论文 日志审查:先检验评测有没有把正确行为判错问题只看最终通过率,会混淆Agent失败、任务错误和过程中发生的违规。结论发布分数时附任务有效性审查、完整日志和过程风险,而不是把所有失败都归给模型。 观测与评测文件与工件 80
问题P1只看最终通过率,会混淆Agent失败、任务错误和过程中发生的违规。E1
└─测量D1先声明评测有效性目标,收齐任务和环境证据,迭代标注规则并人工核查,再按结果统计行为与分数的关联E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

发布分数时附任务有效性审查、完整日志和过程风险,而不是把所有失败都归给模型。

取舍

这是移除问题任务后的子集变化,不是同一任务被系统修复后的收益;其他研究清洗数不同,应保留各自口径。模拟说服测试不能直接量化真实部署事故。

证据到哪为止

这是移除问题任务后的子集变化,不是同一任务被系统修复后的收益;其他研究清洗数不同,应保留各自口径。模拟说服测试不能直接量化真实部署事故。

09.12论文 AdaMAST:从自己的失败轨迹形成可维护的分类表问题固定通用分类难以覆盖特定系统的角色和领域失败,原始轨迹又太长难以复用。结论先为自己的轨迹建立带例证的失败词表,并分别验证词表一致性、人工正确性和实际修复收益。 文件与工件 87.5
问题P1固定通用分类难以覆盖特定系统的角色和领域失败,原始轨迹又太长难以复用。E1
└─诊断D1从轨迹归纳系统、角色和领域代码,合并并检查证据;通过一致性门槛后用于搜索、运行检查和候选选择,系统变化时再修订E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

先为自己的轨迹建立带例证的失败词表,并分别验证词表一致性、人工正确性和实际修复收益。

取舍

LLM一致性不等于正确性;不同Harness用了不同模型,不能横向归因。最佳五选一收益混合了分类与学习型选择器,OfficeQA没有统一预算验证。

证据到哪为止

LLM一致性不等于正确性;不同Harness用了不同模型,不能横向归因。最佳五选一收益混合了分类与学习型选择器,OfficeQA没有统一预算验证。

09.12论文 ReflexGrad:持续停滞时切换到重规划,并留出执行冷却期问题局部反思可能持续优化错误策略,新的计划也可能被下一次局部修改打断。结论让停滞触发、重规划产物与执行窗口可观测,另测进度判分器的误触发。 状态与恢复身份与权限观测与评测 75
问题P1局部反思可能持续优化错误策略,新的计划也可能被下一次局部修改打断。E1
└─缓解D1连续五步低进度触发慢速诊断,平时每三步局部改进;慢计划优先并给予五步冷却,避免旧反馈立即覆盖新策略E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

让停滞触发、重规划产物与执行窗口可观测,另测进度判分器的误触发。

取舍

所谓计算匹配表实际约55、100、140次调用不齐,示例条件也不同;调用数不等于Token成本。不显著的跨模型差异不等于等效性证明,自然语言诊断也不是因果真值。

证据到哪为止

所谓计算匹配表实际约55、100、140次调用不齐,示例条件也不同;调用数不等于Token成本。不显著的跨模型差异不等于等效性证明,自然语言诊断也不是因果真值。

09.12论文 ComponentBench:在控件层分离模型能力与交互接口问题完整工作流过长难以定位问题,单次点击又不足以覆盖真实控件操作。结论把控件级失败和观察动作空间纳入验收,再测试它们在完整流程中的组合效果。 状态与恢复文件与工件 82.5
问题P1完整工作流过长难以定位问题,单次点击又不足以覆盖真实控件操作。E1
└─测量D1构造2910个控件任务,以提交后的实际状态验证,人工走通并记录参考轨迹;同Harness比较辅助树、编号覆盖和像素接口E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把控件级失败和观察动作空间纳入验收,再测试它们在完整流程中的组合效果。

取舍

Browser-Use一轮最多四个动作,其余模式一轮一个,不能作为完全等预算第四组;人工最短轨迹不是最优路径,控件能力尚未验证能预测长工作流成功。

证据到哪为止

Browser-Use一轮最多四个动作,其余模式一轮一个,不能作为完全等预算第四组;人工最短轨迹不是最优路径,控件能力尚未验证能预测长工作流成功。

09.12论文 共形故障归因:给出可校准的区间,避免强行猜一个步骤问题单点故障归因常不可靠,回退太晚无法覆盖错误,太早又重复大量工作。结论将不确定的归因作为带覆盖条件的候选区间,另行验证状态可恢复性和重跑成功。 状态与恢复安全与隔离文件与工件 87.5
问题P1单点故障归因常不可靠,回退太晚无法覆盖错误,太早又重复大量工作。E1
└─测量D1把步骤分数变成连续预测区间,在留出数据上校准覆盖率,再从区间开头回退E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

将不确定的归因作为带覆盖条件的候选区间,另行验证状态可恢复性和重跑成功。

取舍

覆盖保证要求校准与测试轨迹可交换,且依赖标签定义;合成注入点不自动等于自然唯一根因。覆盖错误不保证修复成功,步数代价也不包含全部状态恢复成本。

证据到哪为止

覆盖保证要求校准与测试轨迹可交换,且依赖标签定义;合成注入点不自动等于自然唯一根因。覆盖错误不保证修复成功,步数代价也不包含全部状态恢复成本。

09.12论文 EvoHarness-RL:学习何时读写外部状态问题有了记忆和进度表,Agent仍可能过度访问或完全忽视它们。结论把状态访问变成可记录、可计费的动作,先观察何时有益,再决定是否需要训练。 状态与恢复记忆与上下文观测与评测 75
问题P1有了记忆和进度表,Agent仍可能过度访问或完全忽视它们。E1
└─缓解D1以环境事实、执行进度和跨任务经验组织状态,开放四类读写动作;先监督学习,再用任务奖励和开销约束训练访问策略E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把状态访问变成可记录、可计费的动作,先观察何时有益,再决定是否需要训练。

取舍

状态组件消融在冻结模型的推理Harness上进行,不能证明训练后策略的每个组件贡献。只在ALFWorld验证,适配器、教师和离线经验整理均有成本;这里的自演化是状态与访问策略,不是任意改写运行时代码。

证据到哪为止

状态组件消融在冻结模型的推理Harness上进行,不能证明训练后策略的每个组件贡献。只在ALFWorld验证,适配器、教师和离线经验整理均有成本;这里的自演化是状态与访问策略,不是任意改写运行时代码。

09.12论文 AggAgent:汇总并行研究时,按需回查轨迹证据问题只投票最终答案会丢失过程证据,拼接全部轨迹又容易超出上下文。结论保留候选的工具观察和来源,在分歧处回查;把汇总成本与前面的并行运行总成本一起报告。 记忆与上下文工具与协议文件与工件 75
问题P1只投票最终答案会丢失过程证据,拼接全部轨迹又容易超出上下文。E1
└─缓解D1汇总Agent先看候选答案和元数据,再搜索与读取有分歧的轨迹片段,最后综合答案;所有汇总方法使用同一组候选E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

保留候选的工具观察和来源,在分歧处回查;把汇总成本与前面的并行运行总成本一起报告。

取舍

单次上下文有界不等于累计计算严格独立于候选数;全体答案仍随数量增长。开放研究依赖LLM评分,原轨迹可回查也不自动证明其内容正确。

证据到哪为止

单次上下文有界不等于累计计算严格独立于候选数;全体答案仍随数量增长。开放研究依赖LLM评分,原轨迹可回查也不自动证明其内容正确。

09.12工程 把Agent放进Orb:先把开发环境变成可检查的接口问题依赖、服务启动和浏览器环境不稳定,会让Agent把时间耗在猜测环境。结论优先固定安装、启动和观测接口;环境启动与业务验收分别保留明确结果。 状态与恢复文件与工件 80
问题P1依赖、服务启动和浏览器环境不稳定,会让Agent把时间耗在猜测环境。E1
└─缓解D1用版本化setup建立环境,resume恢复连接;用幂等ensure-dev-server检查健康与配置变化,明确端口、日志和仅开发环境使用的认证路径E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

优先固定安装、启动和观测接口;环境启动与业务验收分别保留明确结果。

取舍

示例没有量化可靠性收益;开发认证便利不能迁入生产,环境健康也不代表功能验收通过。

证据到哪为止

示例没有量化可靠性收益;开发认证便利不能迁入生产,环境健康也不代表功能验收通过。

09.12工程 DSL与语义模型:让Agent在受约束的词汇中生成和检验问题通用代码生成把线程、时钟和网络等过多设计选择重新暴露给模型。结论领域稳定且反复生成相似产物时采用;先尝试清晰类型与库接口,只有收益覆盖维护成本才建DSL。 文件与工件 87.5
问题P1通用代码生成把线程、时钟和网络等过多设计选择重新暴露给模型。E1
└─缓解D1先建立Tickloom的确定性tick、网络、存储和副本语义,再用类型约束的场景DSL表达动作;编译器排除非法调用顺序,运行检查验证场景预期E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

领域稳定且反复生成相似产物时采用;先尝试清晰类型与库接口,只有收益覆盖维护成本才建DSL。

取舍

支持的是受约束领域中的实现方法,不是普遍成功率提升;语法合法仍可能语义错误,底层模型和验证器本身需要维护。

证据到哪为止

支持的是受约束领域中的实现方法,不是普遍成功率提升;语法合法仍可能语义错误,底层模型和验证器本身需要维护。

09.12工程 Sierra MCP Gateway:把上下文访问与身份约束集中到调用边界问题独立工具集成会重复权限逻辑,并让同一会话混入不同客户的敏感资料。结论集中数据出口与身份策略,同时用只能走正式接口的客户端验收,分别管理交互和长期自动化身份。 工具与协议身份与权限观测与评测 87.5
问题P1独立工具集成会重复权限逻辑,并让同一会话混入不同客户的敏感资料。E1
└─缓解D1网关先确定客户候选,再逐层判断敏感性,阻断未经批准的跨客户访问并留审计;交互使用用户身份,自动化使用预声明客户和工具范围的服务身份E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

集中数据出口与身份策略,同时用只能走正式接口的客户端验收,分别管理交互和长期自动化身份。

取舍

模型分类仍可能漏判;采用率不证明隔离率。只读CLI是有意选择的另一通道,其权限与审计不能由MCP网关覆盖的叙述自动推得。

证据到哪为止

模型分类仍可能漏判;采用率不证明隔离率。只读CLI是有意选择的另一通道,其权限与审计不能由MCP网关覆盖的叙述自动推得。

09.12工程 Agency:通过消息和检查点让Agent休眠后继续工作问题大量会话闲置时仍占机器,且恢复不能依赖原内存进程。结论会话长期闲置且恢复状态可序列化时使用;把副作用幂等与存储保留策略作为应用责任单列。 状态与恢复安全与隔离运行时与调度 87.5
问题P1大量会话闲置时仍占机器,且恢复不能依赖原内存进程。E1
└─缓解D1无状态控制面管理持久runner;输入输出队列解耦应用,单写者输出日志按检查点重放;密钥注入、出口过滤和runner身份放在沙箱外E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

会话长期闲置且恢复状态可序列化时使用;把副作用幂等与存储保留策略作为应用责任单列。

取舍

8ms/40ms是双方在线的队列往返分位数,不是恢复延迟;应用负责检查点内容,日志恢复不保证外部动作无重复,容器也不是绝对隔离证明。

证据到哪为止

8ms/40ms是双方在线的队列往返分位数,不是恢复延迟;应用负责检查点内容,日志恢复不保证外部动作无重复,容器也不是绝对隔离证明。

09.12工程 无状态MCP:用三个小实现检验更简单的工具接口问题会话握手和路由状态提高小型MCP客户端与服务端的实现成本。结论适合明确、可审计的工具接口;同时保留鉴权、查询权限和业务状态。 工具与协议状态与恢复文件与工件 75
问题P1会话握手和路由状态提高小型MCP客户端与服务端的实现成本。E1
└─缓解D1把版本与客户端信息放入单次请求,作者实现CLI检查器、Datasette只读查询插件和LLM客户端E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

适合明确、可审计的工具接口;同时保留鉴权、查询权限和业务状态。

取舍

仅支持所示工具接入可行性;不证明吞吐或安全性提高,无状态传输也不表示业务无需保存状态,客户端仍为alpha。

证据到哪为止

仅支持所示工具接入可行性;不证明吞吐或安全性提高,无状态传输也不表示业务无需保存状态,客户端仍为alpha。

09.12工程 Zalando:集中接入和风险规则支撑多团队Agent采用问题工具快速变化时,凭证、配置、成本和审查方式难以在数百团队保持一致。结论先统一接入与可观测字段,风险规则按自身事故校准;区分已运行能力与路线图。 状态与恢复工具与协议身份与权限 87.5
问题P1工具快速变化时,凭证、配置、成本和审查方式难以在数百团队保持一致。E1
└─缓解D1以LLM代理与动态凭证接入统一治理,按事故经验给PR风险分级;用会话与代码演变数据观察问题,而不强制所有团队选同一客户端E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

先统一接入与可观测字段,风险规则按自身事故校准;区分已运行能力与路线图。

取舍

低风险PR相对全部PR的20–40%时长差不是随机对照;复杂度曲线也不能单独归因AI,规划中的平台和身份Broker不算已部署。

证据到哪为止

低风险PR相对全部PR的20–40%时长差不是随机对照;复杂度曲线也不能单独归因AI,规划中的平台和身份Broker不算已部署。

09.12工程 Hyper-τ-bench:让Agent从业务资料中构建另一个Agent问题真实构建任务的规格分散,还要兼顾工具缺陷、服务成本和最终用户表现。结论分开评估需求发现、构建设计与交付服务表现,预算作为交付约束。 状态与恢复工具与协议记忆与上下文 75
问题P1真实构建任务的规格分散,还要兼顾工具缺陷、服务成本和最终用户表现。E1
└─测量D1开发Agent在模拟公司资料与客户访谈中恢复需求,在沙箱构建服务Agent;交付后用不可见任务、固定模型菜单与会话预算验收E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

分开评估需求发现、构建设计与交付服务表现,预算作为交付约束。

取舍

参考对照增加了人工知识和干预,不是单一结对机制收益;提问数相关性不证明自动访谈能力,博客未完整披露方差及全部运行协议。

证据到哪为止

参考对照增加了人工知识和干预,不是单一结对机制收益;提问数相关性不证明自动访谈能力,博客未完整披露方差及全部运行协议。

09.12工程 My AI Adoption Journey:把反复纠错转化为仓库工具问题Agent能完成局部任务,但人工盯守与重复纠错会抵消收益。结论适合可检查且相对独立的维护任务;保留人对复杂设计的投入,按任务价值而非运行时长安排Agent。 工具与协议运行时与调度文件与工件 72.5
问题P1Agent能完成局部任务,但人工盯守与重复纠错会抵消收益。E1
└─缓解D1用本人手工结果校准任务边界,把Ghostty中的失败经验写入规则并提供截图、测试等工具;后台只承接已知适合的工作E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

适合可检查且相对独立的维护任务;保留人对复杂设计的投入,按任务价值而非运行时长安排Agent。

取舍

不能保证写入规则后永不再犯,也没有整体效率或技能保持的受控比较。

证据到哪为止

不能保证写入规则后永不再犯,也没有整体效率或技能保持的受控比较。

09.12工程 Stripe Minions:将自由推理嵌入有界交付流程问题无人值守编码需要完整开发环境、足够上下文和明确停止条件。结论已有稳定开发环境和自动检查时采用;保留有界修复、失败交接和独立代码审查。 安全与隔离状态与恢复工具与协议 87.5
问题P1无人值守编码需要完整开发环境、足够上下文和明确停止条件。E1
└─缓解D1预热隔离devbox,Goose分支交错Agent步骤与固定Git、lint、测试步骤;按目录加载规则和工具子集,先本地修复,再最多两轮CI并交人工审查E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

已有稳定开发环境和自动检查时采用;保留有界修复、失败交接和独立代码审查。

取舍

PR量不是成功率;多轮指示和人工修正仍可能发生,隔离与两轮CI是特定基础设施选择,不能移植为通用安全保证。

证据到哪为止

PR量不是成功率;多轮指示和人工修正仍可能发生,隔离与两轮CI是特定基础设施选择,不能移植为通用安全保证。

09.12论文 GAM:在语义边界固化记忆,再沿主题回到事件证据问题长对话不断更新记忆时,暂时性的叙事变化容易混入长期知识;固定长度切分又可能拆散需要一起理解的事件。结论GAM通过推迟长期图更新、保留事件原文并按主题回钻,改善两个对话问答基准中的记忆召回。可采用的是写入时机与检索路径的分工;证据不覆盖生产恢复、事实正确性或所有任务上的优势。 记忆与上下文文件与工件身份与权限 75
问题P1长对话不断更新记忆时,暂时性的叙事变化容易混入长期知识;固定长度切分又可能拆散需要一起理解的事件。E1E2
└─缓解D1将新话轮先追加到独立事件图,在稀疏维护时机判断语义边界,再生成含摘要与原文的主题节点,并归档和链接事件图。E2E3
问题P2把长期主题和具体事件分开保存后,单靠相似度搜索难以同时找到相关主题、说话者和时间细节。E1E4
└─缓解D2检索先定位主题并扩展相邻主题,再回到归档事件,用语义分结合时间、说话者和置信信号挑选最终上下文。E4
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

可在持续对话记忆管线借鉴活跃事件缓冲、语义固化和可回钻原文的主题索引。服务端采用时必须另行定义图/原文的版本、并发和恢复边界;论文算法中的atomic不能充当数据库事务凭据。对短历史或严格低延迟查询,额外图维护未必划算。

取舍

写入分层减少长期图频繁更新,却增加分界判断、摘要、关系评分和归档成本。主题剪枝适合定位明确的问题,也可能漏掉开放问题的宽泛背景;查询token较少但不保证低延迟。

证据到哪为止

正式ACL论文、四个冻结backbone、两个文本问答基准、组件/切分对照和模拟分界噪声;成本分查询与维护,缺重复不确定性、完整预算配平和持久恢复证据。

09.12工程 Blaxel:把执行权与原生会话一起交给云端,再经审阅和重试带回本地问题本地Agent转到云端继续工作时,项目文件、原生会话和待发送输入必须一起交接;若本地仍继续执行,两端会形成互相冲突的工作历史。结论该插件让同一会话以明确执行归属移到云端,并通过审阅、历史校验与可重试导入带回本地;适用范围是受支持的快照和子会话状态。 状态与恢复文件与工件身份与权限 75
问题P1本地Agent转到云端继续工作时,项目文件、原生会话和待发送输入必须一起交接;若本地仍继续执行,两端会形成互相冲突的工作历史。E1E2E3
└─缓解D1插件拦截本地Agent的新请求,等待在途工具结束后持有会话锁,再将原生事件、项目快照和支持的后代历史交给云端继续执行。E2E3E7
问题P2云端任务返回时,文件修改、根会话和子会话历史可能只写入一部分;直接删除云环境会丢失恢复依据,直接继承云端权限则会改变本地执行边界。E4E5E6
├─缓解D2返回流程先冻结云端并核对审阅补丁和历史前缀,按顺序导入文件与会话;冲突保留恢复材料,写完返回回执后才清理云环境。E3E4E5
└─缓解D3返回会话时重新追加原来的本地权限策略,避免云端VM中的宽权限随历史导入而成为本地工具权限。E6E8
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

本项目可迁移的最小设计是把执行归属、状态载荷和返回清理分成可检查的合同。harness内核提供请求拦截、停稳、原生事件导入和权限策略接口;插件承担本地与云端绑定、项目快照、审阅补丁以及返回回执。部署前提是Git工作区、支持的静止子会话与可移植模型认证,而不是假定所有插件状态都能迁移。

取舍

明确交接点换来可检查的恢复顺序,但持续双端编辑、任意活动子任务和全部插件能力迁移不受支持。VM宽权限与portable key使返回权限恢复成为必要边界;多个本地对象依次写入而非共同事务。

证据到哪为止

固定September10实现支持客户端交接与顺序返回,作者案例支持有限可用性;没有跨对象原子提交,远端冻结重启持久性本轮仅核到设计说明。

09.11工程 Agents SDK:把任务状态与沙箱生命周期分开问题容器失效不应同时丢失任务进度。结论这篇文章的价值在于说明任务如何脱离单个容器持续运行,证据属于架构和接口说明。 状态与恢复文件与工件安全与隔离 75
问题P1容器失效不应同时丢失任务进度。E1
└─缓解D1用Manifest定义工作区,并将可恢复状态放在计算环境之外。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

我们的启发是分别管理任务记录与临时计算资源;恢复时还需核对外部副作用,不能只恢复文件。

取舍

检查点恢复没有证明外部操作只发生一次。文章发布时先支持Python,其他能力的计划不能当作当时已交付功能。

证据到哪为止

检查点恢复没有证明外部操作只发生一次。文章发布时先支持Python,其他能力的计划不能当作当时已交付功能。

09.11工程 Claude隔离设计:权限边界需要覆盖代码、凭据和工具问题同样运行模型生成的代码,不同产品需要保护的对象不同。结论隔离的有效性取决于所有执行路径是否遵守同一权限边界。文章最有价值的是公开修补案例,而不是一个通用“安全沙箱”结论。 身份与权限安全与隔离工具与协议 92.5
问题P1同样运行模型生成的代码,不同产品需要保护的对象不同。E1
└─缓解D1按产品划定执行位置、文件挂载与宿主工具的权限边界。E2
问题P2允许访问可信域名,仍可能把数据送给不该接收的人。E1
└─缓解D2让凭据与信任检查决定可执行行为,补足域名白名单。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

我们的采用重点是画出真实的数据和执行路径:代码在哪运行,凭据由谁持有,挂载允许什么操作,工具是否绕过执行隔离。它适合设计权限边界和排查绕过;高权限宿主工具与外部服务仍应各自约束。

取舍

限制文件写入不等于限制读取或外发,虚拟机也不能替代对宿主MCP的审查。产品模式变化会改变边界;文章提到的日志导出还存在事后可见性限制。案例证明特定漏洞及修补逻辑,不能证明所有注入均被阻止。

证据到哪为止

限制文件写入不等于限制读取或外发,虚拟机也不能替代对宿主MCP的审查。产品模式变化会改变边界;文章提到的日志导出还存在事后可见性限制。案例证明特定漏洞及修补逻辑,不能证明所有注入均被阻止。

09.11工程 多Agent红队:消息传播会放大信任和权限错误问题单个Agent看似合理的协助,可能在网络中变成越权传播。结论网络层的危险来自信任被逐次转交。文章展示了传播路径,尚未证明某套缓解措施能普遍阻断它。 身份与权限安全与隔离文件与工件 80
问题P1单个Agent看似合理的协助,可能在网络中变成越权传播。E1
└─诊断D1沿消息链检查传播、声誉放大、伪共识和代理转述。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

我们的启发是让交接保留原始请求者、授权范围和信息来源,接收者不能把同一来源的多次转述算成独立证据。该文适合扩充多Agent风险模型,无法替代每次工具操作的授权判断。

取舍

这些是受控平台上的案例,不是网络攻击发生率。不同模型、历史和角色共同影响结果,不能逐项作因果归因。文末提出限速、传播隔离和来源记录等措施,其防御效果并未在这些案例中完成系统比较。

证据到哪为止

这些是受控平台上的案例,不是网络攻击发生率。不同模型、历史和角色共同影响结果,不能逐项作因果归因。文末提出限速、传播隔离和来源记录等措施,其防御效果并未在这些案例中完成系统比较。

09.11工程 Deep Agents评测:把环境、任务产物和重复运行纳入比较问题最终回答看起来正确,不能说明Agent实际改变了正确的文件或状态。结论评测对象应包含环境与产物。分层测试能降低迭代成本,但快速子集不能独立证明最终质量。 观测与评测文件与工件状态与恢复 75
问题P1最终回答看起来正确,不能说明Agent实际改变了正确的文件或状态。E1
├─测量D1把执行环境、任务指令和验收脚本共同定义为一道测试。E2
└─测量D2将重复端到端评测与快速能力测试分层使用。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

我们的采用重点是把“任务是什么”和“如何验收”一起保存,并分别展示重复运行的任务结果和组件测试状态。它适合已有可执行验收条件的工作;开放式品质仍需要额外判断依据。

取舍

固定难而可解的子集有利于迭代,也会形成选择偏差。反复用同一子集决定改动,不能把这部分成绩当成独立泛化证明。对話用户模拟和脚本验收仍只覆盖已建模的业务行为。

证据到哪为止

固定难而可解的子集有利于迭代,也会形成选择偏差。反复用同一子集决定改动,不能把这部分成绩当成独立泛化证明。对話用户模拟和脚本验收仍只覆盖已建模的业务行为。

09.11工程 Deep Agents v0.7:用对照评测删去不再必要的默认提示问题默认提示和工具指导不断累积,可能增加成本并挤压用户指令。结论v0.7展示了如何用评测缩减默认指导,同时保留可配置性。文章支持固定输入显著减少,不能支持所有任务同幅降本或质量等效。 工具与协议观测与评测文件与工件 82.5
问题P1默认提示和工具指导不断累积,可能增加成本并挤压用户指令。E1
├─缓解D1比较新旧框架后,移除基础系统提示、缩短工具描述,并将待办中间件改为可选。E2
└─缓解D2开放中间件替换,同时让文件工具明确报告分页与截断状态。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

我们的启发是把默认提示视为需要维护的设计选择,并保留应用覆盖默认值的入口。采用时应关心任务总成本、结果质量和工具权限;只有基础输入规模相近,才适合横向比较固定开销。

取舍

默认开销下降不等于整次任务便宜65%,奖励差不显著也不能保证任何业务无回退。长任务、较弱模型或需要展示进度的产品仍可能需要待办机制。默认删除工具等行为变化,也会改变应用的权限配置。

证据到哪为止

默认开销下降不等于整次任务便宜65%,奖励差不显著也不能保证任何业务无回退。长任务、较弱模型或需要展示进度的产品仍可能需要待办机制。默认删除工具等行为变化,也会改变应用的权限配置。

09.11论文 Agent Harness综述:按工程职责区分执行核心与控制层问题组件名称相似,不代表承担相同职责;按产品名比较容易遗漏系统边界。结论这篇综述把分散项目整理为可解释的工程职责地图。它能帮助定位缺口,不能替代系统效果比较。 工具与协议记忆与上下文观测与评测 82.5
问题P1组件名称相似,不代表承担相同职责;按产品名比较容易遗漏系统边界。E1
├─测量D1用七类工程职责描述系统,而不是按品牌或最小运行组件分类。E2
└─测量D2公开收集、纳入和编码规则,让生态分布有可追溯的含义。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

我们的启发是用七类职责检查架构边界及接口,尤其把观测与验证分开。它适合做设计审查和研究导航;选型仍需回到项目实现与本地任务,不应按标签数量排名。

取舍

公开项目、英语材料和coding场景占比较高,不能据此估计整个生产市场。某项目未被标上治理或观测标签,表示未找到足够公开依据,不等于它没有实现。分类也没有证明七层越齐全性能越好。

证据到哪为止

公开项目、英语材料和coding场景占比较高,不能据此估计整个生产市场。某项目未被标上治理或观测标签,表示未找到足够公开依据,不等于它没有实现。分类也没有证明七层越齐全性能越好。

09.11论文 计算机操作可靠性:重复成功比一次完成更难问题一次成功率高,仍可能在重复处理相同任务时频繁失败。结论重复成功取决于信息和行为是否稳定,不只是采样温度。澄清在所测设置中有效,计划复用则明显依赖模型与反馈质量。 观测与评测文件与工件身份与权限 92.5
问题P1一次成功率高,仍可能在重复处理相同任务时频繁失败。E1
└─测量D1用同题重复执行及配对比较,区分成功水平和稳定性。E2
问题P2可靠性不足有不同来源,降低随机性不一定解决指令和计划问题。E1
└─测量D2分别干预解码、界面噪声、指令澄清和历史计划。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

我们的启发是将“成功过”和“重复可用”分开,并把明确目标、正确观察和执行计划作为不同排查入口。适合已有稳定任务定义和验收信号的工作;真实用户信息不足时,应保留不确定性,而非预期复制实验提升。

取舍

静态澄清读取评测脚本来明确成功条件,用户模拟器也使用轨迹和评测信号;计划提炼假定可取得真实成功标签。这些是诊断实验的受控信息,不等于现实中Agent能自主识别所有歧义。固定计划还可能放大不完整反馈。

证据到哪为止

静态澄清读取评测脚本来明确成功条件,用户模拟器也使用轨迹和评测信号;计划提炼假定可取得真实成功标签。这些是诊断实验的受控信息,不等于现实中Agent能自主识别所有歧义。固定计划还可能放大不完整反馈。

09.11论文 长时域训练:改变动作粒度,缩短需要学习的交互链问题最终目标很远时,整条轨迹失败的反馈可能惩罚本来正确的中间动作。结论有效时域由动作接口和奖励划分共同决定。论文为缩短交互链提供了对照证据,迁移前提是能保持动作与子目标的可验证性。 状态与恢复文件与工件工具与协议 87.5
问题P1最终目标很远时,整条轨迹失败的反馈可能惩罚本来正确的中间动作。E1
├─缓解D1允许灵活的宏动作,减少达到同一目标所需的交互轮次。E2
└─缓解D2对可验证子目标分段计算回报,缩短信用分配范围。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

我们的启发是把动作接口也看作学习问题的一部分:可验证、可中止的复合操作可能比大量细碎操作更合适。它主要适用于可控制训练环境、动作语义与奖励的团队;普通应用只能借鉴接口粒度,不能套用训练增益。

取舍

机制解释中关于负优势更新的部分仍是作者推测。主实验使用小模型与受控环境,子目标回报改变了监督结构。结论不能直接外推成闭源模型运行时批量调用工具必然更好,更不能忽略宏动作中的错误和副作用。

证据到哪为止

机制解释中关于负优势更新的部分仍是作者推测。主实验使用小模型与受控环境,子目标回报改变了监督结构。结论不能直接外推成闭源模型运行时批量调用工具必然更好,更不能忽略宏动作中的错误和副作用。

09.11论文 何时澄清:先区分目标缺失与输入缺失问题较晚补充信息能否挽回任务,取决于此前缺少的是什么。结论澄清的价值取决于缺失信息类型和任务结构。论文给出时机诊断方法,尚未提供可直接部署的自动提问策略。 安全与隔离工具与协议文件与工件 82.5
问题P1较晚补充信息能否挽回任务,取决于此前缺少的是什么。E1
├─测量D1按目标、输入、约束和背景四类缺失,在控制时点注入真实补充信息。E2
└─测量D2另外观察自然提问,并将提问频率与提问时机分开记录。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

我们的启发是先识别缺失信息会否改变交付目标,再判断能否通过环境探索补足。该研究适合解释澄清优先级;实际交互应看错误方向的代价,不宜把轨迹百分比写成固定提问规则。

取舍

摘要把晚问的不利影响写得过于普遍,正文并不支持所有类型过半程都低于不问:代码任务的约束澄清在全部测试时点仍高于无澄清。10%和50%也不是通用门限。强制提供正确答案测的是信息价值上界,未解决自动识别歧义、提出好问题和用户回答成本。

证据到哪为止

摘要把晚问的不利影响写得过于普遍,正文并不支持所有类型过半程都低于不问:代码任务的约束澄清在全部测试时点仍高于无澄清。10%和50%也不是通用门限。强制提供正确答案测的是信息价值上界,未解决自动识别歧义、提出好问题和用户回答成本。

09.11论文 HarnessAudit:任务完成后,仍要检查执行是否越界问题正确的最终结果会掩盖途中发生的资源越权和信息泄露。结论完成任务与遵守权限是两个独立判断。HarnessAudit提供了把二者放进同一次轨迹审查的方法,结论限于其模拟任务与审计规则。 观测与评测身份与权限安全与隔离 87.5
问题P1正确的最终结果会掩盖途中发生的资源越权和信息泄露。E1
├─测量D1用隐藏的任务规则和独立后台记录审查动作、资源与通信。E2
└─测量D2分别评估边界遵守、执行有效性和扰动后的稳定性。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

我们的启发是让验收同时读取最终产物和执行证据,并将“工具允许调用”进一步细化为允许访问哪些资源、允许传递哪些字段。适合可明确表达权限的工作流;若日志不完整或策略含糊,评测也会失去依据。

取舍

这是模拟服务和已定义策略下的评测,不是线上安全认证。部分指标依赖GPT-5.4评判及严重性权重,综合分不能直接解释为事故概率。框架比较还包含模型、工具和执行策略差异,“框架决定安全上限”应视作解释,不能当作严格因果定律。

证据到哪为止

这是模拟服务和已定义策略下的评测,不是线上安全认证。部分指标依赖GPT-5.4评判及严重性权重,综合分不能直接解释为事故概率。框架比较还包含模型、工具和执行策略差异,“框架决定安全上限”应视作解释,不能当作严格因果定律。

09.11论文 Self-Harness:从反复失败中提出小改动,再决定是否保留问题仅凭一次失败修改整个框架,容易修好个案却破坏已有行为。结论Self-Harness把失败诊断连到受限修改和回归筛选。收益有具体轨迹支持,但保留集参与选型,泛化结论需相应收窄。 观测与评测工具与协议文件与工件 82.5
问题P1仅凭一次失败修改整个框架,容易修好个案却破坏已有行为。E1
├─缓解D1按验收失败、相关行为及其作用聚合轨迹,再提出范围有限的候选修改。E2
└─缓解D2用两个固定任务划分的结果决定晋级,并记录被拒绝的候选。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

我们的启发是让修改记录保留针对的失败模式、实际改动范围和被破坏的行为,并把筛选数据与最终判断数据的角色写清楚。它适合有可靠任务验收器的框架迭代,不能仅靠模型自我评价证明进步。

取舍

反复用同一保留集筛选,会使最终成绩受到选择过程影响。最小初始框架也不等于已有成熟生产框架;最大相对提升不能作为一般收益预期。接受条件约束任务通过数,没有覆盖安全性、费用和所有合并改动的交互。

证据到哪为止

反复用同一保留集筛选,会使最终成绩受到选择过程影响。最小初始框架也不等于已有成熟生产框架;最大相对提升不能作为一般收益预期。接受条件约束任务通过数,没有覆盖安全性、费用和所有合并改动的交互。

09.11论文 训练与Harness协同:更换工具接口可能暴露训练依赖问题训练所得能力可能依赖特定工具接口,换接口后看似合理的调用仍会失败。结论模型与执行框架存在共同适应。训练时提供可用信息有帮助,但迁移后的正确格式仍不代表正确动作。 工具与协议文件与工件状态与恢复 82.5
问题P1训练所得能力可能依赖特定工具接口,换接口后看似合理的调用仍会失败。E1
├─测量D1逐级增加工具前提和状态信息,并比较训练时使用与训练后补加。E2
└─测量D2通过工具版本和任务类别迁移,区分格式适应与动作适用。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

我们的启发是把工具接口版本与训练配置一起记录,并把格式错误和状态错误分别观察。它适合能控制训练或工具环境的系统;只更换描述时,首先要确认新增信息的来源和成本。

取舍

更充分的框架直接提供了原本需要探索的信息,收益不只来自文字写得更好。结果主要来自改造后的ALFWorld和小型开源模型;高信息版本也没有消除迁移损失。不能据此要求所有生产框架都增加更多上下文。

证据到哪为止

更充分的框架直接提供了原本需要探索的信息,收益不只来自文字写得更好。结果主要来自改造后的ALFWorld和小型开源模型;高信息版本也没有消除迁移损失。不能据此要求所有生产框架都增加更多上下文。

09.11论文 Outcome Monitors:发现工具异常之后,还要给出可行的恢复入口问题工具没有报错,并不表示返回内容符合任务所需条件。结论恢复入口是这组实验中可检测增益的重要来源。结果约束能减少无效警告,但不能保证任意工具故障都会被发现或修复。 工具与协议状态与恢复观测与评测 95
问题P1工具没有报错,并不表示返回内容符合任务所需条件。E1
├─缓解D1从公开接口和干净样本建立结果约束,在调用返回时检查。E2
└─缓解D2将公开可用的替代工具附在回执中,并单独检查这部分的贡献。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

我们的启发是把检测覆盖、恢复能力和真实故障频率分别评估。它适合有公开结果约束和替代读取路径的工具;不可逆写入、权限和隐私问题不能仅靠提示回执保护。

取舍

故障密集样本不能直接预测自然生产流量的收益。独立构造的事故类故障检出率约46%,对合理字符串内部的错误尤其有限;AppWorld保留集没有净收益。分类故障和守恒关系故障的恢复效果也不同,且非强制提示仍可能诱导错误反应。

证据到哪为止

故障密集样本不能直接预测自然生产流量的收益。独立构造的事故类故障检出率约46%,对合理字符串内部的错误尤其有限;AppWorld保留集没有净收益。分类故障和守恒关系故障的恢复效果也不同,且非强制提示仍可能诱导错误反应。

09.11论文 记忆压缩断崖:规则需要按类型保留,不能只按相似度筛选问题一条不常被提及的规则可能决定安全边界,却在压缩和检索中被丢弃。结论规则能否存活,需要贯穿压缩、分区和检索。该方法改善了规则保留,但分类漏检和预算前提决定其保证范围。 记忆与上下文安全与隔离身份与权限 87.5
问题P1一条不常被提及的规则可能决定安全边界,却在压缩和检索中被丢弃。E1
├─缓解D1先识别信息类型,再对约束采用严格保留路径。E2
└─缓解D2在压缩、拆分和检索时分别维护约束的完整性、作用域和优先级。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

我们的启发是把规则与一般经历分开存储,并让预算不足成为显式状态,避免静默删规则。采用时还要保留来源权威和作用域,不能把外部文档中的命令误升为系统约束;执行权限仍需独立检查。

取舍

保证依赖分类器识别到了规则、作用域正确和预算可行;SafetyMed仍有分类漏检。它保护的是存储与上下文中的内容,并不保证模型会服从规则。公开GitHub语料、类型标注分歧、分区复制开销和缺少token匹配的下游对照共同限制外推。

证据到哪为止

保证依赖分类器识别到了规则、作用域正确和预算可行;SafetyMed仍有分类漏检。它保护的是存储与上下文中的内容,并不保证模型会服从规则。公开GitHub语料、类型标注分歧、分区复制开销和缺少token匹配的下游对照共同限制外推。

09.11工程 Manus上下文工程:缓存、行动选择与长期记忆要分别处理问题反复改写上下文前部,会损失缓存并增加重复输入成本。结论Manus提供的是一组有取舍的上下文设计经验。缓存命中、信息可恢复和任务完成应分别判断。 记忆与上下文文件与工件工具与协议 82.5
问题P1反复改写上下文前部,会损失缓存并增加重复输入成本。E1
└─缓解D1保持稳定前缀和工具定义,用状态控制当前可选动作。E2
问题P2历史越来越长时,Agent容易忘记目标或重复此前错误。E1
└─缓解D2把大块信息存为可回读文件,并用计划与错误记录维持任务方向。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

我们的采用重点是明确每类信息的职责:稳定规则放前部,可回读材料保留地址与版本,当前目标和未解决错误保持可见。它适合工具调用密集的长期任务,具体动作掩码和缓存策略需要执行平台支持。

取舍

外存可恢复需要文件、链接和版本仍然可用。把所有信息放进文件并不保证会正确回读;错误记录和待办也要占用上下文。稳定缓存前缀与适度改变任务示例作用于不同位置,不能简单理解成“提示一律固定”或“一律变化”。

证据到哪为止

外存可恢复需要文件、链接和版本仍然可用。把所有信息放进文件并不保证会正确回读;错误记录和待办也要占用上下文。稳定缓存前缀与适度改变任务示例作用于不同位置,不能简单理解成“提示一律固定”或“一律变化”。

09.11工程 Pizza Bot:扩展就绪后才进入Agent,刷新与恢复保留版本边界问题插件已经安装时,Agent仍可能看到尚未连接或不兼容的能力,造成委托后才发现工具不可用。结论Pizza Bot把技能存在、技能可调用和插件版本激活分开处理,提供了可检查的扩展生命周期;恢复保证只到持久状态和技能文件,不能扩大为副作用恰好一次。 工具与协议文件与工件状态与恢复 75
问题P1插件已经安装时,Agent仍可能看到尚未连接或不兼容的能力,造成委托后才发现工具不可用。E1E2E4
├─缓解D1把已安装技能与可调用技能分开:依赖就绪后,才将技能编译为绑定工具和审批策略的worker。E2E3E8
└─缓解D4服务器持有运行,客户端只订阅;中断审批依赖checkpointer。E3E7E9
问题P2扩展刷新与暂停恢复发生交错时,新的技能文件可能覆盖旧运行所依赖的上下文。E4E5
├─缓解D2插件生成内容通过校验才激活为版本快照;刷新失败保留旧快照并显式标记失鲜。E4
├─缓解D3新消息装入当前技能文件,恢复命令使用持久状态中的技能文件。E5
└─缓解D4服务器持有运行,客户端只订阅;中断审批依赖checkpointer。E3E7E9
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

将安装目录、ready目录和激活快照分开;新turn使用当前材料,resume沿用旧state文件。多租户身份与副作用提交另由服务器设计承担,属于本项目采用推断。

取舍

依赖准入减少委托后的不可用工具;保留旧快照提高可用性但允许失鲜。进程级权限与单用户存储使部署边界较窄。

证据到哪为止

固定commit代码与官方指南支持状态流;没有开源版可靠性负载报告,插件使用宿主用户权限。

09.11论文 Attn-GS:先标记个性化信号,再离线压缩任务画像问题个性化历史压缩到很短的画像时,截断或直接摘要可能丢掉决定当前任务表现的用户偏好。结论Attn-GS用注意力标记引导文本压缩,在两类个性化任务中较直接摘要保留更多效用;可复用的是与具体问题无关的任务画像,边界是白盒前处理、更新成本和代理指标。 身份与权限记忆与上下文文件与工件 75
问题P1个性化历史压缩到很短的画像时,截断或直接摘要可能丢掉决定当前任务表现的用户偏好。E1E4
├─缓解D1用白盒模型的句级注意力标出历史中的任务相关内容,再让摘要器基于完整带标记历史生成短画像。E2E3
├─缓解D2标注和摘要只依赖历史与任务类型,具体问题在最终生成阶段加入,使画像可离线复用。E3E7
└─验证D3用独立用户历史微调标注器,并比较随机标记、全部标记、提示标记和未微调标注器。E4E5E6
问题P2若每个请求都重新处理完整历史,短摘要难以抵消重复的上下文处理开销。E3E7
└─缓解D2标注和摘要只依赖历史与任务类型,具体问题在最终生成阶段加入,使画像可离线复用。E3E7
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

采用两阶段画像编译:历史加任务说明先标重点,再摘要;画像与用户/历史版本/任务类型绑定。服务端失效与删除策略属于本项目推断,论文未解决。

取舍

白盒标注和可选任务微调增加前置成本,换取任务相关画像;离线复用依赖历史与任务类型稳定。

证据到哪为止

ACL正式论文、两类任务、多种标记对照;无总成本测量、重复不确定性或动态记忆一致性证据。

09.11论文 MemoryAgentBench:测量冲突覆写、多跳传播与预算敏感性问题一次性长上下文测评无法观察记忆随输入累积后能否覆写旧事实,并把更新传播到多跳答案。结论MemoryAgentBench把记忆的累积输入、最新事实和多跳传播变成显式测量条件,并显示排名受预算和覆写指令影响;这是一套静态流评测协议,不能直接证明真实长期Agent的更新可靠性。 记忆与上下文文件与工件安全与隔离 75
问题P1一次性长上下文测评无法观察记忆随输入累积后能否覆写旧事实,并把更新传播到多跳答案。E1E2
├─测量D1将资料顺序分块注入统一记忆接口,再以四类任务测量累积状态的使用能力。E1E3
└─诊断D2在FactConsolidation中按序注入相互冲突的事实,并分别检验新值召回和多跳推导。E2E4
问题P2记忆系统榜单混合骨干、输入预算和更新指令,分数差异可能被误读为记忆架构的优劣。E5E6E7
└─诊断D3改变token预算、骨干及覆写指令,检查记忆排名和冲突答案对比较条件的敏感性。E5E6E7
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

采用明确序号与覆写语义的资料流,同时保留单跳新值题和多跳传播题;预算和构建费用分账,按任务读结果而不依赖总榜。此为本项目评测设计推断。

取舍

统一注入接口提高可比性,但两阶段静态材料不包含真实互动反馈;异质指标与构建开销需要分开理解。

证据到哪为止

ICLR2026及arXiv v4;顺序注入、冲突实体判分与预算/政策对照。主表预算不齐,裁判校准借用前作,成本排除一次索引。

09.10论文 Cortex:先验证工具缓存的充分性,再核算复用收益问题精确缓存无法跨措辞复用工具证据,近邻缓存又可能把不充分的结果送进Agent。结论Cortex把工具缓存的命中从字符串或向量相似改为响应是否足够回答当前请求,再把淘汰与辅助推理放进成本账本。它支持有局部性的只读证据复用,不提供源版本一致性保证。 文件与工件工具与协议身份与权限 75
问题P1精确缓存无法跨措辞复用工具证据,近邻缓存又可能把不充分的结果送进Agent。E1E2
├─缓解D1SE候选经ANN与语义充分性两层筛选,未确认命中就回源。E2E3
└─验证D4离线回源抽样调整充分性阈值。E3
问题P2缓存命中率不代表净收益:保留低价值数据和judge争用都可能抵消远程调用节省。E4E5E8
├─缓解D2TTL和LCFU管理保留价值,基于确认转移作低初始优先级预取。E4E8
└─缓解D3Agent与judge共享GPU并优先Agent推理,辅助判定延迟时回源。E5E8
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

适用于有局部性、回源昂贵的只读工具入口。外部组件负责租户/权限/源版本分区;缓存只负责候选、充分性判定、淘汰与回源,这些分区是本项目推断。

取舍

用小模型与回源路径换取更高语义复用率;用资源共享换取GPU成本下降但可能增加尾时延。TTL只限定保留时间。

证据到哪为止

合成及代理访问、窄coding子集;缺更新/权限注入与重复不确定性,表文数字矛盾单独保留。

09.10论文 MemUse:把问得出、用得上与回忆话术分开测量问题长期对话中的记忆评测通常明确提示模型回忆事实,却无法说明模型在用户自然发言时是否会使用这些事实。结论记忆评测需要分别检查明确问答能力、自然回复的事实使用及整体融入判定的有效性;本文提供配对诊断,而非已经验证的用户收益优化。 记忆与上下文观测与评测文件与工件 82.5
问题P1长期对话中的记忆评测通常明确提示模型回忆事实,却无法说明模型在用户自然发言时是否会使用这些事实。E1E2E3
├─诊断D1作者从真实对话的记忆触发时刻重建上下文,把自然回复与明确事实问答配对,并分别评判答得出、整体融入和回复中的具体事实。E2E3
└─测量D3在共享摘要上随机改变额外历史容量,并把事件级记忆判断与session级用户评分关联。E1E6E7
问题P2整体判断回复是否融入记忆,可能把回忆话术当作有依据的记忆使用,从而误判提示或记忆组件的改进。E4E5
└─验证D2作者结合人工判定校准、逐事实核验和提示及提取流程干预,检查整体融入评分是否被回忆风格抬高。E4E5E8
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

本项目工程推断:适用于需要自然承接长期历史的对话Agent评测。最小数据合同保存触发时刻、当时可见历史及摘要版本、生成器和提示版本、预期事实、自然回复与另行问答输出。评估层分别输出事实问答、自然回复逐事实支持和整体融入,保留judge版本及人工校准来源;满意度和资源消耗另列。既有事实标注可以迁移,但陪伴对话的时机标准不能直接替代工具任务成功。

取舍

保留自然触发句提高了生态相关性,却使应引用哪些事实及何时引用更主观。NI整体分数适合做诊断线索,不能单独代表真实支持或用户收益;显性触发事件采样、31页论文中的72/73实例口径、对话人群与不等预算限制外推。

证据到哪为止

共享摘要上的容量比较、有限显性事件及主观judge只支持所研究对话条件;满意度关联、跨harness分数和提示提升均不能作普遍因果结论。

09.10论文 MAST:从交接、停滞到错误验收,定位多 Agent 的失败问题任务失败后,只看最终答案很难分清是分工不当、交接丢信息,还是没有正确验收。结论MAST的主要贡献是让失败诊断有共同语言,并为分类与自动标注提供分层检查。采用时应把标签接到实际轨迹,保留任务验收作为独立判据。 观测与评测文件与工件 80
问题P1任务失败后,只看最终答案很难分清是分工不当、交接丢信息,还是没有正确验收。E1E3
├─诊断D1作者沿执行轨迹建立14类失败模式,把系统设计、协作失配和任务验证分开定位。E1E3
└─验证D3在部分系统中分别调整提示和协作结构,观察任务成绩是否变化。E4
问题P2失败分类要用于大量轨迹,还必须说明不同标注者能否稳定识别同一问题。E2
└─验证D2先由专家迭代分类定义,再用带示例的LLM标注扩展语料,并与独立人类参照比较。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

我们的采用重点是保留足以诊断的交接记录:任务目标、交付内容、接收者实际使用的信息,以及最终产物的验收依据。MAST可以作为排查词表,让“停滞”“信息被忽略”“验收错误”有不同入口;自动标签适合作为人工复核线索。 它适合回答“哪里可能出错”,不能独立回答“这次任务是否合格”。因此诊断标签与任务验收结果应分别保存,修复建议也应指向具体执行环节,避免把提高某个分类指标当成业务成功。

取舍

系统之间的任务、轨迹采样和运行配置不同,分类频数因此混合了框架行为与任务难度。图4还使用各系统前30条轨迹的子集。用它比较某类故障的表现形式有意义,用它直接宣布某框架最可靠则超出证据。 一致性也不等于根因正确率。标注者可能稳定识别同一种症状,而真正原因仍涉及上下文、工具或任务规则。论文的干预覆盖有限系统与基准,最终产物是否合格仍要回到任务本身的判据。

证据到哪为止

专家一致性、自动标注一致性与局部干预分别支持不同结论;跨系统频数不具备统一任务基线。

09.10论文 Magentic-One:用双层控制循环识别停滞并重规划问题长任务中局部动作可能不断成功,整体却陷入重复或停滞;主Agent需要据此调整计划。结论Magentic-One将主Agent的工作组织成事实维护、进度判断与重规划闭环。它改善了任务控制的可解释性,最终正确性仍取决于实际结果与验收依据。 记忆与上下文文件与工件工具与协议 82.5
问题P1长任务中局部动作可能不断成功,整体却陷入重复或停滞;主Agent需要据此调整计划。E1E2E3
├─缓解D1外层维护任务事实与计划,内层逐步检查完成、重复和前进情况;连续停滞后返回外层重规划。E2E3
└─缓解D3通过固定职责的浏览、文件、编码和终端工具执行任务,并记录隔离运行轨迹。E1E5
问题P2多工具和多角色协作时,已知事实、待查信息与下一步指令容易混在对话里,影响分派和判断。E1E2
├─缓解D2任务账本区分已知事实、待查项和推断;进度账本据此选择下一位Agent并给出具体指令。E1E2
└─缓解D3通过固定职责的浏览、文件、编码和终端工具执行任务,并记录隔离运行轨迹。E1E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

我们的采用重点是保留事实账本与进度判断之间的连接。一次重规划应能解释:哪些事实变了、哪些动作连续没有推进、下一计划改变了什么。这样能帮助读懂主Agent为何改变方向,也便于区分无效循环和正常的困难探索。 这套控制逻辑适合任务路径不固定、但执行角色相对稳定的系统。它可以与运行时的重试恢复并用,不过二者解决不同层面的问题;最终验收仍应引用实际产物和任务判据,不能只依赖进度账本中的自我判断。

取舍

进度与完成判断仍由模型作出。它可能把表面变化当成前进,或把不充分的结果当成完成;达到轮数或资源限制后的最终回答也可能只是最佳猜测。运行结束、主Agent说已完成和任务确实合格,需要分别理解。 系统依赖固定团队和当时的工具能力。文件转成Markdown会损失部分图像信息,代码角色也不等同于完整代码仓库开发系统;多轮浏览与反思还增加费用和时间。论文没有建立持久故障恢复、跨任务记忆或大规模并行调度的保证。

证据到哪为止

账本消融同时移除多项控制逻辑;上下文重置不回滚外部操作,任务终止也不自动意味着合格。

09.10论文 AgentScope 1.0:把消息、工具执行和运行状态分成可组合接口问题模型消息格式、工具返回形态和Agent交互方式不一致,会使应用逻辑与适配代码相互缠绕。结论AgentScope的价值在于明确不同接口与执行状态如何组合。采用统一框架后,应用仍需写清哪些状态可恢复、哪些动作可取消,以及权限由哪一层强制执行。 工具与协议状态与恢复文件与工件 75
问题P1模型消息格式、工具返回形态和Agent交互方式不一致,会使应用逻辑与适配代码相互缠绕。E1E2
├─缓解D1作者用结构化消息与模型formatter适配输入输出,将不同工具形态统一为异步生成器,并显式区分reply与observe。E1E2E3
└─缓解D3应用Agent与Runtime的运行、服务和沙箱层分离,并通过hooks及Studio接入观测。E4E5
问题P2流式工具被中断或Agent被恢复时,已经发生的部分执行容易与内存中的完整结果混淆。E3E4
├─缓解D2中断时保留部分工具结果和中断标记;需要保存的模块状态经StateModule导出和恢复。E3E4
└─缓解D3应用Agent与Runtime的运行、服务和沙箱层分离,并通过hooks及Studio接入观测。E4E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

我们的采用重点是三条清楚的边界:模型适配负责格式,Agent逻辑负责推理和观察,Runtime负责服务承载与执行环境。中断记录则同时保留部分产物和执行状态,让后续Agent能够理解当前进度。 它适合多模型、多工具且需要定制交互的应用。若任务还要求跨进程持久恢复、外部副作用去重或强权限隔离,应在相应层另行建立合同;不要仅因为所有组件都接入统一框架,就认为这些保证已经成立。

取舍

取消一次工具调用,不一定能撤销它已发出的请求或已经修改的文件;加载快照也不自动与外部状态保持同一时刻。动态工具组控制可见工具集合,同样不能代替资源端授权。接口解决了组织方式,强制保证仍取决于具体实现边界。 并发也需要应用理解依赖关系。能够同时运行多个异步任务,不意味着彼此有先后依赖的动作可以安全并行;状态注册遗漏则会导致恢复缺项。框架提供组合能力,应用仍需说明哪些状态归谁持有、哪些动作必须按序完成。

证据到哪为止

依据主要是接口与实现说明;未建立外部副作用原子恢复、统一生产性能或跨租户隔离的证据。

09.10工程 Cursor Cloud agents:让工作流、机器和会话分别恢复问题长任务依赖单个worker持续运行时,超时、进程故障和部署升级会打断任务推进。结论Cursor的经验说明,长期云端任务需要独立于承载进程和用户连接的运行身份。有限工作流与会话回退提供了恢复结构,外部效果仍需要单独确认。 状态与恢复文件与工件工具与协议 82.5
问题P1长任务依赖单个worker持续运行时,超时、进程故障和部署升级会打断任务推进。E1E2
└─缓解D1作者用Temporal承载持久执行,将有限任务工作流与可重试、可超时的activities分开。E2
问题P2Agent运行、远程机器和用户会话的生命周期不同,绑在一起会妨碍恢复并造成流式输出状态混乱。E3
└─缓解D2分别管理Agent循环、机器状态和会话记录;流式重试允许客户端回退并替换失败尝试的输出。E3
问题P3云端缺少可运行的开发环境时,Agent难以验证结果,可能交付表面合理但不能工作的修改。E1E5
└─缓解D3为Agent准备可运行、可验证的开发环境,并按模型能力调整固定步骤与自主操作的分工。E1E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

我们的采用重点是分别定义任务、执行尝试、机器和会话的身份。用户断线不应删除任务;机器更换不应使旧输出看起来仍然有效;工具重试则需要自己的去重和结果确认规则。这样的划分能让恢复行为更容易理解和检查。 它适合持续运行、经常跨越进程或连接生命周期的云端Agent。简单短任务未必需要同等复杂的工作流基础设施;迁移价值主要来自清楚的任务边界、恢复责任和环境验证条件,而非复制某个工具名称。

取舍

一个activity在产生外部效果后失败,重试仍可能重复该效果。会话回退也只改变用户看到的内容,并不回滚数据库、提交或远程操作。文章没有给出覆盖所有状态的原子提交协议,因此不能把持久工作流直接解释为端到端恰好执行一次。 生命周期拆分增加了状态协调要求。系统需要知道某次输出属于哪次执行、使用哪台机器及何种环境;具体的一致性和隔离能力仍受实现约束。生产经验提供了问题和方向,没有替每种部署证明相同结果。

证据到哪为止

生产规模与可靠性为作者自述,缺统一SLA口径;跨状态原子恢复、外部效果去重不能由架构名称推导。

09.10工程 Anthropic Application harness:把产品目标转成可检查的交付结果问题简短需求没有明确交付范围,而生成者的自我验收容易宽松,导致应用外观完成但功能不成立。结论Application harness把目标展开和实际验收接到生成过程。最值得保留的是可检查的交付与具体反馈;角色和阶段数量则应随任务与模型能力变化。 文件与工件记忆与上下文 75
问题P1简短需求没有明确交付范围,而生成者的自我验收容易宽松,导致应用外观完成但功能不成立。E1E2E3
├─缓解D1Planner展开产品规格,Generator与Evaluator先商定可检查的阶段交付,再实现并根据实际运行结果修正。E2E3
├─缓解D2作者用人工审阅和示例校准评价标准,并随模型升级删减重置和sprint等流程。E2E5E6
└─验证D3角色通过文件交换规格和反馈,评价者用Playwright及应用接口检查功能。E2E3
问题P2模型能力和任务类型改变后,原来的上下文、分阶段开发和评价流程可能变成额外负担。E5E6
└─缓解D2作者用人工审阅和示例校准评价标准,并随模型升级删减重置和sprint等流程。E2E5E6
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

我们的采用重点是让任务目标、交付标准和实际检查保持一致。复杂应用可以保留独立规格和具体缺陷反馈;简单任务则未必需要多角色与多阶段。评价结果应说明检查了哪些行为、遗漏哪些维度,便于判断完成声明的范围。 模型升级时,应重新审视固定流程是否还有作用。可以迁移的是明确交付、运行检查和反馈修正之间的联系;sprint数量、上下文重置和角色数量都是可调整的实现选择。

取舍

评价者能看到什么,决定了它能检查什么。浏览器交互可以揭示按钮或流程故障,却不必然覆盖声音质量、真实用户偏好或所有后端条件;经过提示校准的LLM评价也不能直接等同于独立客观真值。 更多轮次未必更好。文章中前端中间版本有时比最终版本更受偏好,重复生成也持续消耗预算。缺少同任务、同预算的组件对照时,最稳妥的结论是流程提供了一种组织方式,不能宣布每个角色或每轮反馈都带来净收益。

证据到哪为止

案例预算与范围不同,未单独证明每个角色的因果收益;评价覆盖范围受工具与模型感知能力限制。

09.10工程 Cursor Self-driving codebases:用任务所有权和持续反馈组织大量Worker问题大量Worker共享协调状态并等待全局同步时,锁争用和最慢任务会抵消并行收益。结论大规模Worker协作的关键是范围所有权和持续反馈。去掉不必要的全局等待有助于推进,但开发吞吐和最终产物质量仍需分别衡量。 状态与恢复文件与工件 87.5
问题P1大量Worker共享协调状态并等待全局同步时,锁争用和最慢任务会抵消并行收益。E1E2
├─缓解D1由根Planner和有边界的子Planner持续规划,Worker在各自仓库副本中完成分配任务,不依赖全体同步。E2E3
└─缓解D3移除集中集成瓶颈,容忍开发过程中的少量局部错误,并单独考虑最终稳定分支的整理。E4
问题P2持续开发需要明确任务所有权,并把实际发现送回计划;集中调度者若同时承担太多职责,也会形成瓶颈。E2E3
├─缓解D1由根Planner和有边界的子Planner持续规划,Worker在各自仓库副本中完成分配任务,不依赖全体同步。E2E3
└─缓解D2Worker把修改、偏差、发现与反馈交回原Planner,Planner结合当前代码持续调整后续任务。E3
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

我们的采用重点是为每个规划范围和执行任务指定明确负责人,并让交接包含产物、偏差与新发现。规划者可以持续吸收反馈,Worker也不必共同维护一份难以协调的全局计划。 它适合可以拆成相对独立修改的长期开发。高度耦合、需要严格串行顺序的工作仍应保留必要协调;即使开发过程采用异步推进,也应分别看吞吐和最终功能质量,避免用活跃度替代完成度。

取舍

独立仓库副本仍可能产生相互冲突的修改,异步计划也可能基于不同版本。文章没有给出适用于所有冲突、重试和任务重复执行的完整协议,因此不能推导出全局一致性或任意扩展规模下的正确性保证。 开发阶段容忍局部错误,需要有最终质量边界。移除集中集成解决了吞吐瓶颈,却没有取消发布前必须确认功能和兼容性的责任。代码量、提交数和工具调用量都无法替代这一判断。

证据到哪为止

方案在多次共同变化的工程迭代中形成;吞吐、局部错误容忍和发布质量是三个不同指标。

09.10论文 Scaling Agent Systems:多 Agent 的收益取决于任务和协调成本问题更多Agent有时提高成绩,有时反而降低表现;仅凭数量无法判断某种任务是否值得协作。结论Scaling的实证贡献是揭示协作收益的任务依赖性。其比较维度有助于解释架构选择,经验阈值和回归输出应限于相应数据、资源口径与验证设置。 工具与协议状态与恢复观测与评测 72.5
问题P1更多Agent有时提高成绩,有时反而降低表现;仅凭数量无法判断某种任务是否值得协作。E1E4
├─测量D1作者在六个基准上比较单Agent及四类协作架构,并约束工具、核心提示与推理资源。E1E2E4
└─测量D2分别记录成功、开销和错误指标,再用回归及不同留出和稳健性检查分析架构与任务的关系。E3E4E5E6
问题P2架构比较若不同时说明预算、聚合策略和测量口径,就难以解释收益来自何处。E2E3E6
└─测量D2分别记录成功、开销和错误指标,再用回归及不同留出和稳健性检查分析架构与任务的关系。E3E4E5E6
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

我们的采用重点是先判断工作能否独立拆分、动作是否有顺序依赖,以及单Agent已经解决了多少问题。论文提供了组织比较的维度,也提醒我们保留聚合与验证策略,不能只比较“几个Agent、什么拓扑”。 它适合形成架构选型的条件清单,不能充当通用预测器。阅读其结果时应同时保留任务成绩、资源口径和误差定义;对未覆盖任务,采用判断应明确属于基于机制的推断,而非论文已证明的结论。

取舍

17.2倍与4.4倍描述轨迹中因协调错误增加的计算工作,不是任务失败概率。任务层错误比约为1.1–1.3。约45%的单Agent基线阈值也来自所测数据及模型形式,适合视作这些实验中的模式,不能直接写进所有任务的路由规则。 部分统计关系在更谨慎的分析中不再显著。按数据集聚类后,一些工具和协调项只能作为方向性观察;原文将能力饱和视为相对更稳的结果。新增代码和终端基准各仅20题,完整成本分析主要来自原四基准,结论强度应随这些覆盖范围收窄。 预测输入并非都能在部署前免费获得。ACI由六个基准的单Agent成绩构成,协调效率等还涉及运行后的表现;核心推理预算受控也不表示所有token、延迟和费用完全相等。用回归作事前选型时,需要先说明可取得哪些输入以及代价。

证据到哪为止

87%命中是限定配置留出结果;轨迹错误倍率不等于失败概率;小样本、成本覆盖和运行后输入限制事前泛化。

09.10论文 Puppeteer:用强化学习选择下一位Agent,权衡质量和推理成本问题固定协作顺序不能随着任务进展选择更合适的Agent,容易调用无帮助的角色并增加推理成本。结论Puppeteer说明路由策略可以围绕质量与成本共同学习。采用价值取决于稳定候选集合、可信反馈和可摊销的优化投入,不能只看平均得分或推理token下降。 文件与工件状态与恢复工具与协议 82.5
问题P1固定协作顺序不能随着任务进展选择更合适的Agent,容易调用无帮助的角色并增加推理成本。E1E2
├─缓解D1中央策略在每一步根据全局上下文选择一个Agent,执行后更新状态,再决定下一步或终止。E1
├─缓解D2作者用REINFORCE优化路由策略,将终局质量与推理成本共同写入奖励,利用已完成轨迹调整后续选择。E2E5
└─测量D3分别比较同骨干与异构Agent设置,并跟踪调用数量、token和推理结构的变化。E3E4
问题P2只优化答案质量可能不断增加调用,只压低成本又可能过早结束,需要明确权衡目标。E2
├─缓解D2作者用REINFORCE优化路由策略,将终局质量与推理成本共同写入奖励,利用已完成轨迹调整后续选择。E2E5
└─测量D3分别比较同骨干与异构Agent设置,并跟踪调用数量、token和推理结构的变化。E3E4
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

我们的采用重点是把“选择谁”与Agent自身行为分开,并明确质量与成本的权衡目标。它适合反复遇到类似任务、候选Agent集合较稳定且能得到可信终局反馈的系统;一次性任务或缺少可靠评价时,学习路由的投入可能难以回收。 可迁移的是状态驱动选择和显式奖励结构,而非某个固定循环拓扑。采用判断应同时考虑任务质量、每次推理开销和策略优化成本,并保留对奖励误差与未覆盖任务的边界。

取舍

initial和evolved是同一在线优化轨迹的不同阶段,而非天然对应训练集与独立测试集。阶段结果支持策略在优化过程中的变化,不能直接当成冻结策略在未知任务上的泛化成绩。终局奖励也较粗,未提供每一步决策是否正确的充分反馈。 推理省token不等于总投入一定更少。附录报告使用8张A800、训练约2–6小时,且训练与多Agent推理交错;部分Mimas同骨干任务还没有持续成本下降趋势。比较实际费用时,需要区分单次推理、在线学习和基线搜索所消耗的不同资源。 紧凑和循环结构只是随优化出现的观察。论文没有单独干预循环来证明它必然产生收益;Agent与工具集合仍固定,偶发协调失误也未消失。中央路由器的存在因此不构成一致性或可靠性的保证。

证据到哪为止

平均收益并非逐任务收益;阶段比较不自动证明冻结策略泛化;紧凑循环的因果作用及总成本优势仍有限定。

09.10论文 MemoryBench:把用户反馈的记忆与后续任务收益分开测量问题记忆系统能从长历史找回答案,并不说明它能利用过去任务的用户反馈改善下一项任务。只测事实问答,会遗漏反馈经验是否真正有用。结论MemoryBench把反馈经验是否改善后续任务变成可分层检查的问题,并用任务形态及反馈噪声暴露记忆系统的差异。它提供的是测量协议,结果仍受模拟假设、输入预算与判分口径限制。 记忆与上下文观测与评测文件与工件 75
问题P1记忆系统能从长历史找回答案,并不说明它能利用过去任务的用户反馈改善下一项任务。只测事实问答,会遗漏反馈经验是否真正有用。E1E2
├─测量D1作者把反馈生成、记忆更新和测试任务判分分开:系统先从训练任务的反馈日志积累经验,再在不同测试题上比较表现,并按领域及输入输出长度报告结果。E2E3E6
└─验证D3作者用人类成对判断检查反馈文本,用同题有无反馈、逐批日志和替换模拟器检查不同层面的表现。E5E7E8
问题P2文字批评、点赞和复制传递的信息不同,模拟反馈还可能带有噪声。若把这些信号当成同一种真实偏好,评测就可能把模拟器偏差误判为记忆系统能力。E4E5E8
├─测量D2作者按任务是否有可计算答案生成文字反馈或满意度,再把满意度映射为点赞、点踩和复制信号;通过调整映射或加入噪声,观察记忆系统对反馈变化的敏感性。E4E8
└─验证D3作者用人类成对判断检查反馈文本,用同题有无反馈、逐批日志和替换模拟器检查不同层面的表现。E5E7E8
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

本项目判断:适合在已有Agent评测中分开保存任务context、反馈日志、更新后的记忆版本与测试结果,并将文字和行为反馈视为不同信息源。采用的是反馈利用的测量分工;若要选择生产记忆系统,本文尚不能提供等预算排名、真实用户偏好校准或多租户隔离结论。

取舍

代价和判断范围来自不同反馈、存储粒度与任务量表:同骨干与top-5条目并不统一上下文或费用预算,静态知识输入和部分日志也不同;人评只检查反馈语言,主结果没有多seed区间。成本表单位冲突使精确延迟结论不能采用。

证据到哪为止

11个公开数据集的采样任务、同骨干八系统、有限逐步更新及反馈干预,另有人评反馈文本;未建立真实行为概率、最终量表的独立校准或严格等预算优势。

09.09论文 ACON:用失败轨迹优化上下文的删留规则问题长任务Agent的摘要可能删掉后续动作必需的状态和前置条件,最终失败分数却无法告诉压缩器应当保留什么。结论ACON把“摘要应保留什么”转为由任务轨迹反馈驱动的压缩规则优化,并允许较小模型承担压缩。它给出可迁移的优化边界,尚不能保证每类任务都保持精度或降低延迟。 工具与协议文件与工件记忆与上下文 82.5
问题P1长任务Agent的摘要可能删掉后续动作必需的状态和前置条件,最终失败分数却无法告诉压缩器应当保留什么。E1E2
├─缓解D1作者分别压缩累积历史和刚收到的长观察,并只在超过阈值时触发;历史压缩保留最近一次动作与观察。E1E5
└─缓解D2作者比较同任务完整上下文成功而压缩上下文失败的轨迹,用丢失信息反馈改写压缩规则,再从成功轨迹寻找可删冗余。E2
问题P2反复调用大模型做压缩会增加额外成本和延迟,即使执行Agent看到的上下文变短,整个系统也未必更便宜或更快。E3E6
└─缓解D3作者用优化后的大模型压缩器生成输入输出样本,训练较小的压缩器替代它,使执行Agent与压缩模型可以独立配置。E3E4
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

本项目判断:适用于执行模型不能微调、已有明确任务结果且上下文增长显著的工具Agent。把压缩规则、触发位置、执行模型和压缩模型分开版本化,按任务类型选择效用优先或更强压缩;保留来源材料与结果口径,不能把压缩后的文本当权威状态或持久恢复凭据。

取舍

压缩减少峰值输入但可能破坏困难任务;第二阶段与联合压缩不保证优于只优化效用。训练测试划分存在,但候选选择的held-out说法与训练子集描述不一致。固定seed仍有非确定性,0.6个百分点的反馈消融没有区间。

证据到哪为止

证据来自固定ReAct配置、独立任务测试集和阈值/反馈/组合消融;困难任务、QA和部分学生模型存在退化,候选选择集说明及完整延迟收益均有明确限制。

09.09工程 Chorus:把临时worker调用映射到协作会话问题Pi临时worker在一次工具调用内就结束,若让模型自行创建和关闭Chorus会话,实际子进程与平台工作记录容易脱节。结论Chorus把临时worker的协作记录交给扩展事件,把持久主会话的新建与恢复交回Pi。这个适配边界可复用,但当前实现只提供尽力记账,不能承担必须无遗漏的完成或恢复合同。 工具与协议状态与恢复身份与权限 75
问题P1Pi临时worker在一次工具调用内就结束,若让模型自行创建和关闭Chorus会话,实际子进程与平台工作记录容易脱节。E1E2E6
└─缓解D1扩展在subagent调用开始时为worker创建会话并注入UUID,按toolCallId保存映射,在工具结果与结束事件中发起关闭。E2E6
问题P2远程唤醒Pi时,沿用其他宿主的会话探测可能误判新建与恢复,使协作平台的任务身份无法稳定指向原生会话。E4E5
└─缓解D2Pi后端把同一业务anchor传为原生session-id,由Pi按当前目录中的会话决定创建或恢复,并禁用Claude探测结果的权威性。E4E5E10
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

本项目判断:可迁移的是先辨认宿主的临时调用与持久会话,再把外部协作记录绑定到真实事件和原生会话身份。适合需要可观察任务关联的harness适配;若记录必须完整,现有进程内重试不足以作为事务账本,也不能据此宣布子产物与父完成原子提交。

取舍

自动记账依赖进程内Map和当前MCP错误识别。创建失败不会阻止worker,关闭最后重试失败后仍清空记录;没有持久outbox或重启对账。UUID工作流文本不强制权限,Pi的permissionMode在所审spawner中不生效。

证据到哪为止

官方发布稿、固定Chorus代码及起点前Pi源码支持事件映射和原生session-id语义;关闭状态只在内存,MCP业务错误和进程崩溃缺少持久对账。

09.09论文 HarnessRisk:把任务完成、风险识别与实际安全分开测量问题只看任务成功率或单个攻击入口,会漏掉Agent在配置、插件和恢复等不同职责中一边完成任务、一边产生不安全状态的情况。结论HarnessRisk让安全评测同时看见任务交付、攻击效果、可见持久污染和风险识别,并把同一协议扩到六类harness职责。它能诊断部署组合的薄弱处,但不能从排名反推出某个组件更安全或污染已在未来会话生效。 安全与隔离状态与恢复工具与协议 75
问题P1只看任务成功率或单个攻击入口,会漏掉Agent在配置、插件和恢复等不同职责中一边完成任务、一边产生不安全状态的情况。E1E2
└─诊断D1作者用六类harness职责组织128个三轮工作流,每例同时规定正常交付与攻击效果,并由适配器导出相同格式的工具和状态证据。E1E2
问题P2发现风险、写入污染和真正完成攻击是不同结果;把它们混成一个安全分数,会误判部署组合是否已阻断或修复问题。E2E3E5
└─测量D2作者分别判断任务效用、攻击成功、可见持久污染和显式风险识别,并为可执行结果和语义判断采用不同的独立校准材料。E2E3
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

本项目判断:适合将已有Agent评测扩为配置/扩展/运行/持久化/动作/恢复职责矩阵,并同时保留正常效果、攻击效果、污染状态及检测证据。可用于定位薄弱职责;不能直接据其排名选择生产harness,也不能将污染标签签发为长期攻击或恢复完成收据。

取舍

各harness以实际配置比较,工具、提示与推理预算不同;只有有效输出和可解析judge结果进入分母,排除数量未完整列出。持久污染依赖导出状态,检测依赖显式表达,三seed和bootstrap都未覆盖全部依赖结构。

证据到哪为止

128个构造工作流、14部署组合、三个sampling seeds和两类独立judge校准支持样本内诊断;有效分母选择、预算差异、状态可见性及三轮owner措辞限制因果和长期外推。

09.09工程 LangChain:按委托关系选择上下文分叉或隔离问题接续主管工作的子Agent只收到任务描述时,会丢失已有调查过程,重复收集信息或遗漏隐含约束。结论委托职责决定消息上下文是否继承;把消息模式与状态、权限、完成协议分开,才不会把分叉误读为完整隔离。 工具与协议记忆与上下文状态与恢复 75
问题P1接续主管工作的子Agent只收到任务描述时,会丢失已有调查过程,重复收集信息或遗漏隐含约束。E1E2
├─缓解D1为接续工作提供fork模式:从主管当前有效历史构造子消息上下文,再追加委托任务,保留已经形成的摘要。E3E4
└─缓解D3分叉子Agent保留task工具外形,在声明式fork调用点拒绝再次委托;返回时压缩子轨迹并过滤状态。E5E6
问题P2审查或独立调查的子Agent若继承主管全部推理,可能被既有判断影响;上下文共享需要随委托职责选择。E1E2
├─缓解D2保留isolated模式,让独立调查与审查从任务描述开始,并把模式选择落实到子Agent配置。E2E4
└─缓解D3分叉子Agent保留task工具外形,在声明式fork调用点拒绝再次委托;返回时压缩子轨迹并过滤状态。E5E6
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

可在服务端委托配置中显式区分接续工作与独立核查,把消息历史构造、允许的非消息状态和结果回传分别建模。采用时保留所审实现对摘要、尾部工具调用与旧结果的处理;权限、共享存储和并发合并仍由宿主系统负责,不能从mode名称推导安全隔离。

取舍

分叉使子Agent接收更多历史,隔离则要求主管重新表达足够的任务条件。缓存收益没有量化;fork仍为实验特性,skills配置受限。声明式与compiled子图采用不同状态过滤,模式不能替代权限、进程或并发写隔离。

证据到哪为止

官方博客与固定代码支持有效历史构造、过滤和回传路径;没有成本/偏差对照,compiled子图不自动获得声明式fork的递归标记。

09.09论文 Mem-Gallery:把多模态记忆的检索、使用与更新分开测量问题已有记忆评测难以同时测到跨会话信息演化与必须依赖图像的回答,容易低估多模态记忆的实际困难。结论图文长期记忆需要分别检查证据是否找到、是否被正确理解,以及旧信息是否被正确替换;这套基准让三类失败更容易区分。 记忆与上下文文件与工件观测与评测 75
问题P1已有记忆评测难以同时测到跨会话信息演化与必须依赖图像的回答,容易低估多模态记忆的实际困难。E3E4E5
└─测量D1构造带证据轮标注的多会话图文历史,以九类任务分别查询事实、视觉推理、知识更新、冲突和无法回答的情况。E4E5
问题P2只看最终答案分数,无法区分没有检索到证据、取回后视觉推理失败,以及偏好更新后仍使用旧记忆。E7E8E9
└─诊断D2统一主要模型与检索配置,分别记录证据检索、最终回答和资源开销,并改变检索数量、比较图像与描述输入。E6E7E8E9
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

可把多模态记忆评估拆为历史证据、检索结果、最终回答和资源记录四层,并保留更新前后事实及对应图像,避免把所有错误归为召回不足。采用时承认本文是离线图文QA诊断,不把它替代工具任务成功率;比较结论要带caption条件、截断条件和预算口径。

取舍

合成和整理的历史提高任务可控性,但不代表真实长期用户分布。文本基线含视觉caption,FullMemory又会截断,各系统总token不同;自动答案judge没有直接见原图,也未给独立人工校准和多次运行区间。

证据到哪为止

正式论文的离线合成/整理图文QA、作者报告的系统比较与案例支持诊断价值;不支持同成本优势、单组件归因或真实Agent执行效果。

09.09论文 AIOpsOops:保留诊断关系,隔离不可信遥测文本问题运维 Agent 把低权限用户能写入的遥测内容当成故障解释,可能在仍然执行合法修复任务时提出危险操作;只检测显眼的指令覆盖容易漏掉这种诱导。结论AIOpsOops 表明保持合法任务并不能阻止遥测诱导;可控字段的稳定抽象提供了一种保留结构、减少模型接触攻击语义的防御。 安全与隔离文件与工件身份与权限 87.5
问题P1运维 Agent 把低权限用户能写入的遥测内容当成故障解释,可能在仍然执行合法修复任务时提出危险操作;只检测显眼的指令覆盖容易漏掉这种诱导。E1E2E4
├─诊断D1作者构造经应用遥测进入 Agent 的任务相关诱导,并用跨应用、模型和 Agent 的对照测量它如何改变修复建议。E2E3E4
└─缓解D2作者先识别可控遥测字段,运行时只把这些字段替换成稳定的带类型标识,保留日志结构与重复值之间的关联。E5E6E7
问题P2防御若直接删除所有遥测,会同时破坏根因分析需要的结构和关联信息;需要在移除可控文本的同时保留可用的诊断上下文。E5E6E7
└─缓解D2作者先识别可控遥测字段,运行时只把这些字段替换成稳定的带类型标识,保留日志结构与重复值之间的关联。E5E6E7
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

可在运维 Agent 的工具返回与上下文装配之间加入字段抽象层:已知可控字段只暴露稳定类型标识,结构和错误码继续进入模型,原文留给授权的人类诊断。适用条件是业务任务不依赖该字段的自由文本语义,并且可控入口能够充分枚举;这不能替代写操作权限控制。

取舍

字段抽象比整段删除保留更多诊断信息,但前提是可以发现和解析可控字段。设置阶段依赖应用副本、端点覆盖、模板维护和正则正确性;业务更新或其他输入渠道仍可能超出防护范围。

证据到哪为止

结果来自隔离合成环境中的 180 次攻击,以及单 Agent/模型的 36 次正常任务对照;防御范围受模板覆盖、解析正确性和输入渠道限制。

09.09论文 AVA:用事件图扩展上下文,再回到原始证据问题长视频问答只按当前问题检索相似帧,容易丢失事件前后经过和跨片段实体关系;把全部视频放进模型上下文又受窗口与成本限制。结论AVA 把长视频组织为可扩展检索的事件关系,并在生成后回查视觉证据;主要代价在多路径查询,而不是初始向量检索。 记忆与上下文文件与工件观测与评测 82.5
问题P1长视频问答只按当前问题检索相似帧,容易丢失事件前后经过和跨片段实体关系;把全部视频放进模型上下文又受窗口与成本限制。E1
├─缓解D1作者将视频持续整理为保留时间顺序、实体关系和原始帧链接的事件图,使检索能从相关片段继续找到相邻事件与关联证据。E2
└─缓解D2作者从事件、实体和原始帧三路选择起点,再用受限动作树扩充上下文,并通过候选一致性和原始帧核查筛选答案。E3E4
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

可迁移到具有时间序列证据的 Agent 上下文管线:把事件、实体和原始材料链接分开保存,查询时受限扩展相邻事件,回答前回到原始材料。它适合可容忍分钟级分析的离线或后台任务;若要求秒级交互,本文树搜索配置不能直接满足。

取舍

事件图需要先支付描述、合并与实体抽取成本,描述遗漏仍可能传播到检索。多路径搜索增加回答机会,也引入显著延迟与噪声;作者的深度消融已经出现更深反而更差的情况。

证据到哪为止

结论限定于论文的三个问答数据集及其模型配置;AVA-100 部分拼接,组件消融样本较小,图索引基线的片段归因说明存在不一致。

09.09论文 Pufibara:候选绑定的工程证据与独立评测契约问题Agent多轮修改后可能遗失工程义务,或把旧候选仿真结果误用作当前候选的支持证据。结论将证据绑定到精确候选,并把Agent自判完成与外部验收分成两个判断。 状态与恢复观测与评测文件与工件 75
问题P1Agent多轮修改后可能遗失工程义务,或把旧候选仿真结果误用作当前候选的支持证据。E3E5
└─缓解D1用持久义务账本和绑定候选身份的证据记录组织Agent修订上下文。E4E5E7
问题P2能编译/仿真及agent自判ready不能证明任务行为正确,最后编辑的工件也不等于有意提交的结果。E3E6E8E10
└─测量D2让Agent显式冻结提交精确候选,再由loop外预先冻结的合同独立验收。E6E8E10
问题P3原样公共模型可能测到记忆,任意合成任务又可能缺物理真实性与可靠判据。E9E15
└─验证D3从可执行参考模型派生新任务,并以正确样本和能运行但偏离目标的反例校验行为合同。E9E10E15
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

适用于反复修改并依据外部反馈交付工件的Agent。可迁移候选身份和证据失效规则、显式提交以及独立验收;物理命题、观测绑定和场景契约需领域化,不能将本文Modelica结果视为通用效果。

取舍

候选相关内容、观测、场景和容差需要逐任务定义,修改后需重新收集相关证据;账本状态仍是agent解释。独立有限场景契约也可能错判,大部分实现和完整任务私有,限制外部审查。

证据到哪为止

作者报告仅覆盖Modelica、两个后端和每条件单次的完整harness比较;Repair无单独行为gate,readiness非强制正确性门,私有工件限制完整核查。

09.09工程 Harness Inspector:保留交付关系的证据强度问题仅查看会话或提交,无法保留原始意图、探索过程与最终交付之间的多对多证据关系。结论在产生可复用经验之前,先把事实关系与推测关系分开保存。 观测与评测文件与工件状态与恢复 75
问题P1仅查看会话或提交,无法保留原始意图、探索过程与最终交付之间的多对多证据关系。E2
└─诊断D1以独立采集和归一化建立Story(需求意图)—Session(执行会话)—Commit(代码提交)的只读证据投影。E2E3E6
问题P2路径、时间和动作频率容易被误读成贡献归属或可复用经验,证据强度需要显式保留。E5E7
├─诊断D2关系携带来源事实与限制,明确区分直接关系、同路径观测、候选及背景。E3E7
└─诊断D3按Turn查看和仅序列Replay,缺少时间/结果/成本时保留unknown。E4E8
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

可在采集会话与Git事件后保留独立记录,再生成带关系类型、依据和缺失状态的只读投影,供交付审阅或后续记忆候选筛选使用。迁移重点是保存关联依据与未知状态;候选关系不能直接触发验收或技能激活,跨租户的访问控制仍需宿主系统提供。

取舍

窗口限制和隐私归一化减少可呈现细节;缺少provider或Story锚点时证据链不完整,候选关系仍依赖人工解释。

证据到哪为止

原文机制、当前官方文档与fictional示例支持结构理解;不支持关联准确率、生产诊断效用或技能提升结论。

09.09论文 AMemGym:让被测助手参与形成历史,识别离线记忆评测偏差问题静态他人轨迹不包含被测助手自身对话选择的后果,记忆配置排序可能偏移。结论对话选择会改变待测记忆本身,因此context评测必须把静态理解与在线互动分开。给状态oracle和分段probe能定位测量盲区,但这些是操作性诊断,不是证明系统已解决遗忘。 文件与工件记忆与上下文状态与恢复 87.5
问题P1静态他人轨迹不包含被测助手自身对话选择的后果,记忆配置排序可能偏移。E1E3
└─缓解D1schema/state trajectory → fixed exposure utterance → on-policy free-form interaction → period evaluationE1E3
问题P2最终QA错不能区分状态写入/保留、后续读取和读到后的使用,模型应用能力会混入记忆分。E2
└─诊断D2overall/oracle normalized score plus write/read/utilization conditional probesE2
问题P3自由模拟会话可能没有传入真值或后续冲突,自动gold可能不可靠。E1E4
└─验证D3state exposure/state integrity/golden-choice meta-evaluation; user LLM change; 5-run native subsetE4
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑判断:把结构化用户状态轨迹、实际曝光事件、助手对话及period题分开存档;评测配置时明确区分复用历史与真实互动,并保留同模型oracle、状态probe与最终答题三个观察面。优先采用测量协议;AWE配置与自演化prompt不作为直接生产默认值。

取舍

on-policy提高交互贴合度但每个候选需独立对话,无法共享全套静态轨迹成本。;固定state-bearing utterance确保信息输入,却使真实世界不完整/含糊曝光覆盖不足。;oracle-state normalization减少模型应用差异但不能完全因果分离记忆与推理;denominator依赖模型和题难。;Table3完整反馈和仅问题均.197,不能把write改进等同整体更优,且utilization反向。

证据到哪为止

已阅读最终proceedings§3–5及附录C/D/E/F,视觉核查Figure3的条件诊断路径,复核Table2排序与Table3反例。来源身份/日期来自官方proceedings metadata及原始arXiv history。机制和数据有效性足以支持新eval方法;不支持等成本最好或配置排名普遍稳定的主张。

09.09论文 CIMemories:按接收者和目的衡量必要信息与累计披露问题只保护一个秘密或只报低泄露率,无法发现同一记忆在不同接收者/目的下的细粒度不当披露,也奖励什么都不说。结论context是否有用须与能否向该接收者披露分开测量;静态memory前缀也能形成有效的信息干预。最可迁移贡献是任务化属性规范与累计风险指标,不是模型安全排行榜或一条隐私prompt。 文件与工件记忆与上下文观测与评测 80
问题P1只保护一个秘密或只报低泄露率,无法发现同一记忆在不同接收者/目的下的细粒度不当披露,也奖励什么都不说。E1E2
└─测量D1profile memory statements × purpose/recipient contexts → necessary/inappropriate/ambiguous labels → violation+completenessE1E2
问题P2单次响应平均掩盖不同任务和不同运行分别泄露不同属性的累积风险;记忆增长改变可暴露信息集合。E1E3
└─测量D2Violation@n over task/draw union; fixed necessary attributes plus growing inappropriate setE1E3
问题P3自动隐私规范标签和披露检测器可能带偏,导致风险测量失真。E2E4
└─验证D330 model label draws per pair; unanimous labels; separate label/reveal human agreementE2E4
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

编辑判断:在context选择与对外输出评测中使用attribute×purpose×recipient矩阵,分别保留必要、禁止与不确定项;同时看输出覆盖与跨任务/多次响应的累计属性披露,避免把全删记忆当成功。该规范层可接企业已授权的数据政策;论文提供测量协议,不提供可直接强制执行的隐私授权网关。

取舍

只评分三persona一致的属性-任务对,减少争议也遗漏灰区和个人差异。;形式REVEAL允许推断,实际Fig7只计完整显式value,不能把数字当全部信息泄漏。;Violation@5会随更多任务/抽样而非减地增长,这是累计风险测量,不是agent多session越来越失控。;Completeness是必要属性覆盖,消息实际成功/用户批准/工具副作用未测。;单轮non-tool、固定必要加额外属性长度增加;无真实长期记忆写入更新或输出网关防护实现。

证据到哪为止

重新阅读最终ICLR proceedings§3–6、AppendixA/B/C与Figures4/5,确认新增人工校准与60profile扩展是最终版证据;arXiv v1不含这些,不能用v1替代。确认Violation@5及Completeness分母/聚合不同,Figure7检测范围窄于形式定义。论文满足context干预和新eval协议门槛,但不解决权限或真实多session泄漏。

09.09论文 A.I.G:在真实DeepSeek Harness上分开测量载体、输出与动作问题把文件载体近似为纯文本会跳过解析与编码路径,无法判断不可信信息是否真正到达被测循环。结论保留真实循环只是第一步;载体解析、内容曝光、输出变化、敏感调用及参数命中需要分别观察,双judge结论应并存。 文件与工件工具与协议安全与隔离 67.5
问题P1把文件载体近似为纯文本会跳过解析与编码路径,无法判断不可信信息是否真正到达被测循环。E1E2
├─测量D1真实DSH适配器、载体矩阵、source/sink插件和完整session traceE1E2E4E7
└─诊断D3追踪additionalContexts与pre-execute/deny-only guard位置E6E7
问题P2混合输出改写、敏感调用和参数成功的单一攻击率会掩盖风险层级与评分器分歧。E2E3
└─诊断D2按目标类型和Full/Partial/Failure分层,分别保存JR规则判定与JL语义判定E2E3E5
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把source provenance、载体解析结果、tool call身份和sink参数判据与judge原判定一并归档;看板分展示内容暴露、输出控制、敏感动作尝试,分母与渠道固定。DSH已有deny-only guard可供独立权限策略接入,但本文没有证明新增策略效果。

取舍

真实循环保留模型工具选择,source与sink仍是受控fixture;不代表生产解析器和权限配置。;没有无攻击任务效用、防御消融、judge人工校准和多次同case置信区间;无法分离模型能力与harness因果贡献。;公开adapter未按call ID关联结果,未将进程错误分类;扩展到并发/异常时证据映射不足,但不据此推翻作者原表。

证据到哪为止

主流程重新阅读v2 §2–8、Tables2–6、AppendixA/B,并核固定提交的README、driver、adapter、DSH tool guard与additionalContexts路径。确认naive是攻击基线、641 sink与Full/Partial重叠、模拟工具仅证明尝试;聚合数字为作者报告,guard接口存在不等于本文已测防护。

09.08论文 MEMENTO:把记忆召回与利用分开诊断问题任务失败时,仅看最终成功率,无法判断问题是否出在获得记忆后的理解和使用环节。结论MEMENTO用受控任务观察记忆已提供后的利用困难,并探索偏好事实与行动轨迹分开组织的设计。 记忆与上下文文件与工件状态与恢复 87.5
问题P1任务失败时,仅看最终成功率,无法判断问题是否出在获得记忆后的理解和使用环节。E1
└─诊断D1保持场景和目标相同,改变指令是否明说偏好,并保证所需记忆出现在检索结果中。E1
问题P2完整历史同时承载用户偏好和行动示例;直接压缩历史,可能在减少干扰的同时丢掉有用示范。E4
└─缓解D2保留完整交互轨迹,同时用分层用户画像图单独组织偏好事实和行为顺序。E4
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

我们更倾向于借鉴两点:解释记忆系统表现时,区分是否获得所需信息与获得后能否使用;组织历史时,区分偏好事实与行动示例。这些启发适用于需要历史偏好的任务,不能据此把用户画像图当作所有记忆系统的默认方案。

取舍

主实验采用理想化感知与动作;多记忆任务增加目标与协调负担。画像图还引入额外处理与上下文开销,现有结果不能单独证明等预算下的图结构收益。

证据到哪为止

结论来自理想化感知与动作设置;任务差值不能直接当作单个记忆组件的因果贡献。

09.08论文 ACE:用稳定条目和局部更新抑制上下文坍缩问题长任务中的上下文更新容易偏向简短总结,反复整体重写会使有价值的细节消失。结论将上下文当作可局部修订的条目库,按任务复杂度决定是否引入反思与整理角色。 记忆与上下文身份与权限文件与工件 92.5
问题P1长任务中的上下文更新容易偏向简短总结,反复整体重写会使有价值的细节消失。E1
└─设计D1将经验保存为稳定ID条目,用局部delta及确定性合并更新playbook。E2
问题P2局部经验也可能冗余或有害。E2
└─设计D2用helpful/harmful计数、反思和去重管理条目。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

将上下文当作可局部修订的条目库,按任务复杂度决定是否引入反思与整理角色。

取舍

效果依赖Reflector质量;原文明说简短固定规则就能解决的任务未必需要长playbook。

证据到哪为止

效果依赖Reflector质量;原文明说简短固定规则就能解决的任务未必需要长playbook。

09.08论文 JIT-Agent:按任务生成并准入四模块 harness问题固定harness难以匹配搜索、规划与工作区任务的不同控制和记忆需求。结论把可变策略放入显式接口,在生成产物与共享执行内核之间保持边界。 文件与工件记忆与上下文工具与协议 87.5
问题P1固定harness难以匹配搜索、规划与工作区任务的不同控制和记忆需求。E1
└─设计D1按任务生成四模块harness,经协议和执行检查后选择一个候选装入固定内核。E2
问题P2生成的harness可能不符合接口或不能运行。E2
└─设计D2在选定前分别检查语法、协议和可执行性。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把可变策略放入显式接口,在生成产物与共享执行内核之间保持边界。

取舍

生成器经过训练且测试时冻结;跨模型结果使用50或100题子集,接口合规与执行成功也不等于安全保证。

证据到哪为止

生成器经过训练且测试时冻结;跨模型结果使用50或100题子集,接口合规与执行成功也不等于安全保证。

09.08论文 BEAM / LIGHT:连续叙事中的更新、冲突与顺序探针问题现有长对话测评缺少连续叙事和多类记忆能力;BEAM用人物、关系与时间线构造对话及可追溯问题。结论借鉴来源可定位的更新、冲突与顺序问题,并根据任务需要组合检索、近期缓冲和scratchpad。 记忆与上下文文件与工件身份与权限 82.5
问题P1现有长对话测评缺少连续叙事和多类记忆能力;BEAM用人物、关系与时间线构造对话及可追溯问题。E1
└─设计D1构造连续人物与事件历史,用来源绑定的问题和原子评分测量长期记忆能力。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

借鉴来源可定位的更新、冲突与顺序问题,并根据任务需要组合检索、近期缓冲和scratchpad。

取舍

数据是合成对话;10M场景的长上下文基线仅保留能装入窗口的近期历史,不能视为完整10M直接输入的同预算比较。

证据到哪为止

数据是合成对话;10M场景的长上下文基线仅保留能装入窗口的近期历史,不能视为完整10M直接输入的同预算比较。

09.08论文 MemGAS:From Single to Multi-Granularity: Toward Long-Term Memory Association and Selection of Conversational Agents问题长期对话记忆包含会话、轮次、摘要与关键词,固定粒度难兼顾细节和检索噪声。结论把粒度选择与关系传播分开理解,依据问题类型选择上下文,而非把更细粒度一律当作更好。 记忆与上下文文件与工件状态与恢复 82.5
问题P1长期对话记忆包含会话、轮次、摘要与关键词,固定粒度难兼顾细节和检索噪声。E1
└─设计D1以逆熵软权重组合记忆粒度,在GMM关联图上经PPR扩展并过滤结果。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把粒度选择与关系传播分开理解,依据问题类型选择上下文,而非把更细粒度一律当作更好。

取舍

部分大型基线因运行成本缺席LongMemEval-m;相同top-k不等于相同token成本,论文也未在所有指标上领先。

证据到哪为止

部分大型基线因运行成本缺席LongMemEval-m;相同top-k不等于相同token成本,论文也未在所有指标上领先。

09.08论文 Cordis:A Programming Paradigm for Spatiotemporal Composability问题动态插件系统既要清理撤载副作用,也要在依赖提供者变化时调整消费者生命周期。结论将能力声明、依赖有效性和撤载清理放在统一生命周期中,明确外部不可逆操作的边界。 工具与协议文件与工件状态与恢复 92.5
问题P1动态插件系统既要清理撤载副作用,也要在依赖提供者变化时调整消费者生命周期。E1
└─设计D1把提供能力、依赖关系和清理函数纳入生命周期,撤载时先停供再等待依赖者退出。E2
问题P2目标在生命周期转换途中变化,会使清理和重建交错。E2
└─设计D2先完成当前LOADING或UNLOADING转换,再响应新的目标状态。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

将能力声明、依赖有效性和撤载清理放在统一生命周期中,明确外部不可逆操作的边界。

取舍

形式保证限于受context管理且可逆的边界;Koishi案例是单生态观察证据,不提供架构间定量因果对照;不可信代码仍需外部沙箱。

证据到哪为止

形式保证限于受context管理且可逆的边界;Koishi案例是单生态观察证据,不提供架构间定量因果对照;不可信代码仍需外部沙箱。

09.08论文 How Memory Management Impacts LLM Agents: An Empirical Study of Experience-Following Behavior问题Agent把自身执行轨迹加入记忆,后续任务又会模仿相似经验,错误和不适用策略因此可能持续传播。结论记忆价值应结合后续使用效果理解,并将记录的正确性与可迁移性分开判断。 记忆与上下文状态与恢复文件与工件 92.5
问题P1Agent把自身执行轨迹加入记忆,后续任务又会模仿相似经验,错误和不适用策略因此可能持续传播。E1
└─设计D1按检索次数与后续任务效用管理记忆保留和删除,比较不同管理策略。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

记忆价值应结合后续使用效果理解,并将记录的正确性与可迁移性分开判断。

取舍

研究主要覆盖添加与删除,没有覆盖合并、摘要和结构重写;作者明确将发现限定为经验研究而非形式保证。

证据到哪为止

研究主要覆盖添加与删除,没有覆盖合并、摘要和结构重写;作者明确将发现限定为经验研究而非形式保证。

09.08工程 Faster, cheaper support investigations with precomputed context问题支持调查反复跨工单、对话和工程资料收集同一组证据,索引路由优化仍未消除重复综合成本。结论按稳定案例标识预计算带来源和假设状态的证据包,并保留当前状态的权威查询入口。 记忆与上下文文件与工件身份与权限 92.5
问题P1支持调查反复跨工单、对话和工程资料收集同一组证据,索引路由优化仍未消除重复综合成本。E1
└─设计D1预计算带来源和证据水位的case知识,将路由profile与案例事实分离。E2
问题P2缓存事实可能落后于实时系统。E2
└─设计D2显式保存证据水位和假设状态,查询实时状态时以权威系统为准。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

按稳定案例标识预计算带来源和假设状态的证据包,并保留当前状态的权威查询入口。

取舍

这是小样本方向性结果;“未观察到显著下降”不等于证明事实性等价,58%输入token下降仅对应其中的案例调查流程。

证据到哪为止

这是小样本方向性结果;“未观察到显著下降”不等于证明事实性等价,58%输入token下降仅对应其中的案例调查流程。

09.08论文 When Personalization Legitimizes Risks: Uncovering Safety Vulnerabilities in Personalized Dialogue Agents问题良性个人历史可能改变对危险请求的意图判断,个性化记忆本身也会带来安全偏移。结论把个人背景作为解释线索而非行为授权,阅读安全结论时同时看正常任务效用。 安全与隔离记忆与上下文身份与权限 87.5
问题P1良性个人历史可能改变对危险请求的意图判断,个性化记忆本身也会带来安全偏移。E1
└─设计D1固定风险问题比较无记忆和良性个人历史,另分析detect-and-reflect防护的效用代价。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把个人背景作为解释线索而非行为授权,阅读安全结论时同时看正常任务效用。

取舍

研究是文本、孤立单轮安全问题,不含工具执行;抑制风险与维持个性化之间的取舍因框架而异。

证据到哪为止

研究是文本、孤立单轮安全问题,不含工具执行;抑制风险与维持个性化之间的取舍因框架而异。

09.08论文 Controllable Memory Usage: Balancing Anchoring and Innovation in Long-Term Human-Agent Interaction问题用户有时要求沿用历史,有时要求跳出旧思路;相关记忆被召回后仍可能造成过度依赖。结论将用户要求的记忆依赖程度与检索相关性分别表达,避免把“想换个思路”误解成缺少更多历史。 记忆与上下文文件与工件状态与恢复 87.5
问题P1用户有时要求沿用历史,有时要求跳出旧思路;相关记忆被召回后仍可能造成过度依赖。E1
└─设计D1以MD-Score度量目标记忆依赖,结合偏好SFT与GRPO训练可控依赖行为。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

将用户要求的记忆依赖程度与检索相关性分别表达,避免把“想换个思路”误解成缺少更多历史。

取舍

数据仅覆盖Research和Tutoring,离散等级不能表达所有真实偏好;与masking的比较包含不同训练与推理成本。

证据到哪为止

数据仅覆盖Research和Tutoring,离散等级不能表达所有真实偏好;与masking的比较包含不同训练与推理成本。

09.05工程 Shopify:让修复完成跟随当前事实,而不是跟随 Agent 的上一份计划问题漏洞补丁在等待评审时可能失鲜,PR通过CI也不代表默认分支中的漏洞已经消失。结论将完成条件绑定到当前源码与业务记录,并让交接保留证据、责任主体和未决问题。 安全与隔离观测与评测文件与工件 92.5
问题P1漏洞补丁在等待评审时可能失鲜,PR通过CI也不代表默认分支中的漏洞已经消失。E1
└─设计D1将claim账本与当前仓库SHA、PR和默认分支结果持续对账后判断关闭。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

将完成条件绑定到当前源码与业务记录,并让交接保留证据、责任主体和未决问题。

取舍

70%积压下降是11天生产观察且包含已过时/别处已修复项;并非70%都由新补丁修好,也不是控制实验的效果归因。

证据到哪为止

70%积压下降是11天生产观察且包含已过时/别处已修复项;并非70%都由新补丁修好,也不是控制实验的效果归因。

09.05工程 MetaMask:把 Agent 权限编译成资源端可撤销、不可放大的委托链问题自治客户端需要在用户授予的范围内支出,而全权私钥或逐笔人审都无法同时满足其目标。结论将授权边界落在被调用资源能执行的规则上,同时区分无匹配授权与明确被拒绝两种后续行为。 身份与权限工具与协议安全与隔离 87.5
问题P1自治客户端需要在用户授予的范围内支出,而全权私钥或逐笔人审都无法同时满足其目标。E1
└─设计D1由资源侧验证链上委托caveat,子委托只能收窄并检查到期与撤销。E2
问题P2委托继续转交可能扩大原先权限。E2
└─设计D2完整验证委托链,要求子委托范围不大于上游并支持到期或撤销。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

将授权边界落在被调用资源能执行的规则上,同时区分无匹配授权与明确被拒绝两种后续行为。

取舍

案例由供应商与集成方报告;交易额属于launchpad业务结果,并不证明委托机制的安全收益。

证据到哪为止

案例由供应商与集成方报告;交易额属于launchpad业务结果,并不证明委托机制的安全收益。

09.05工程 Datadog:Agent 安全必须从组件清单升级为全会话序列检测问题只看最终API或模型输入输出,会漏掉预处理命令、工具数据和跨步骤攻击路径。结论围绕同一会话保留从输入到副作用的证据链,并把可疑路径与已发生后果分开呈现。 工具与协议记忆与上下文安全与隔离 80
问题P1只看最终API或模型输入输出,会漏掉预处理命令、工具数据和跨步骤攻击路径。E1
└─设计D1把输入、动态上下文、工具及出站行为关联成完整trace,再做序列检测与身份归因。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

围绕同一会话保留从输入到副作用的证据链,并把可疑路径与已发生后果分开呈现。

取舍

异常成本、token增长或可疑序列不能单独当作安全事件;工具侧与接收服务侧仍分别承担执行约束。

证据到哪为止

异常成本、token增长或可疑序列不能单独当作安全事件;工具侧与接收服务侧仍分别承担执行约束。

09.05工程 Datadog:为 Agent 提供机器可判定的服务目录与完整 dispatch contract问题面向人的Golden Path缺少Agent可机器读取的能力契约与确定性流程边界。结论用可读契约描述能力,用目录确定权威元数据,让派发显式绑定任务、权限、环境与结果。 状态与恢复身份与权限工具与协议 85
问题P1面向人的Golden Path缺少Agent可机器读取的能力契约与确定性流程边界。E1
└─设计D1用类型化能力合同和权威目录连接工具发现、显式派发及同任务身份的恢复。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

用可读契约描述能力,用目录确定权威元数据,让派发显式绑定任务、权限、环境与结果。

取舍

文章主要提供设计建议和内部案例,不能将每一项推荐都理解成已经交付的通用平台保证。

证据到哪为止

文章主要提供设计建议和内部案例,不能将每一项推荐都理解成已经交付的通用平台保证。

09.05工程 NVIDIA:让长期记忆提供证据与优先级,但不能自行变成权限问题企业记忆需要连接不断变化的人物、项目与义务,单纯保留对话或检索片段难以维持一致判断。结论分开存储来源证据、派生知识和判断记录,让用户纠正可追踪;记忆内容不直接充当权限。 记忆与上下文身份与权限安全与隔离 92.5
问题P1企业记忆需要连接不断变化的人物、项目与义务,单纯保留对话或检索片段难以维持一致判断。E1
└─设计D1以Markdown self model组织用户事实,以SQLite义务账本和intent gate约束后续判断。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

分开存储来源证据、派生知识和判断记录,让用户纠正可追踪;记忆内容不直接充当权限。

取舍

公开recipe不发送消息或修改源系统;变更事实一项只有5题,100%结果不能被外推为普遍可靠。

证据到哪为止

公开recipe不发送消息或修改源系统;变更事实一项只有5题,100%结果不能被外推为普遍可靠。

09.04工程 Oracle:把模型读取与人工审批拆成不同的 MCP 调用域问题供应链推荐需要跨不同Agent宿主呈现,同时让人工审批只授权眼前的确定调拨。结论将读取、展示、审批和提交分别设边界,在提交时核对实时库存。 工具与协议文件与工件身份与权限 92.5
问题P1供应链推荐需要跨不同Agent宿主呈现,同时让人工审批只授权眼前的确定调拨。E1
└─设计D1用仅widget可见的approvalId绑定actor与不可变推荐,由app-only工具提交数据库事务。E2
问题P2用户批准后库存可能已经变化。E2
└─设计D2数据库加锁重算可行性,再在同一事务中写入转移和审计。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

将读取、展示、审批和提交分别设边界,在提交时核对实时库存。

取舍

这是参考实现;iframe隔离依赖宿主执行,不能替代服务器鉴权和数据库事务。

证据到哪为止

这是参考实现;iframe隔离依赖宿主执行,不能替代服务器鉴权和数据库事务。

09.04工程 Temporal / Manetu:先区分恢复语义,再滚转长寿命 Agent问题长寿命Agent的恢复、状态与执行身份需要跨进程保留,而人工继续和崩溃恢复携带的输入不同。结论把业务会话身份与工作进程解耦,明确每类恢复是否应携带新输入。 状态与恢复工具与协议文件与工件 92.5
问题P1长寿命Agent的恢复、状态与执行身份需要跨进程保留,而人工继续和崩溃恢复携带的输入不同。E1
└─设计D1把Thread、Run和Checkpoint分别映射到Workflow、Activity与Update,区分人工输入和崩溃恢复。E2
问题P2历史滚转时外部进程可能仍在执行。E2
└─设计D2Continue-as-New前处理未完成Activity并等待对应进程退出。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把业务会话身份与工作进程解耦,明确每类恢复是否应携带新输入。

取舍

该方案依赖特定运行时拦截及框架映射;透明恢复不自动证明任意外部副作用具备精确一次语义。

证据到哪为止

该方案依赖特定运行时拦截及框架映射;透明恢复不自动证明任意外部副作用具备精确一次语义。

09.04工程 Cloudflare:让 Agent 决定图表,让已抓数据决定数值问题多轮网络调查既需要保留查询上下文,也需要让图表数值能追溯到真实API结果。结论让模型选择呈现方式,由已取得的结构化数据填充数值,并保留会话恢复状态。 工具与协议文件与工件身份与权限 75
问题P1多轮网络调查既需要保留查询上下文,也需要让图表数值能追溯到真实API结果。E1
└─设计D1每会话用Durable Object及SQLite保留状态,Code Mode按需查API,图表引用已获取数据。E2
问题P2模型重写数值会使图表偏离实际返回结果。E2
└─设计D2图表规格通过dataFrom引用相同API路径已有的数据。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

让模型选择呈现方式,由已取得的结构化数据填充数值,并保留会话恢复状态。

取舍

数据绑定减少数值重造,不保证模型选对查询范围、指标或图表;产品仍为beta。

证据到哪为止

数据绑定减少数值重造,不保证模型选对查询范围、指标或图表;产品仍为beta。

09.03工程 Your agent's guardrails have a bypass问题不同Agent框架的治理接口无法保证在相同执行位置做出相同处理。结论将拦截点和决策责任显式化,同时在运行环境处理宿主可绕过的风险。 工具与协议状态与恢复记忆与上下文 92.5
问题P1不同Agent框架的治理接口无法保证在相同执行位置做出相同处理。E1
└─设计D1定义allow、deny、transform协议及宿主执行义务,并对错误采用失败关闭。E2
问题P2旧批准可能被用到已经变化的调用上。E2
└─设计D2将审批绑定调用上下文指纹,由宿主核对后执行。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

将拦截点和决策责任显式化,同时在运行环境处理宿主可绕过的风险。

取舍

契约以可信宿主合作执行为前提,不是对恶意宿主的安全边界;流式处理还存在缓冲与暴露量取舍。

证据到哪为止

契约以可信宿主合作执行为前提,不是对恶意宿主的安全边界;流式处理还存在缓冲与暴露量取舍。

09.03工程 Stop restricting the agent. Start restricting its environment.问题执行型运维Agent可能利用环境能力绕过自身prompt中的操作限制。结论把可信控制和不可信工作负载分开,按实际操作与目标限制能力。 身份与权限工具与协议记忆与上下文 92.5
问题P1执行型运维Agent可能利用环境能力绕过自身prompt中的操作限制。E1
└─设计D1以单Agent隔离环境及调用代理隔开代码和原始凭据,生产写操作经过人工审查。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把可信控制和不可信工作负载分开,按实际操作与目标限制能力。

取舍

原文承认替代执行路径和MCP契约扩大仍可能绕过限制;不能将规划能力写成已交付保证。

证据到哪为止

原文承认替代执行路径和MCP契约扩大仍可能绕过限制;不能将规划能力写成已交付保证。

09.03工程 Who spent all the tokens? Real-time, run-scoped cost control for AI agents问题一次Agent任务跨进程、模型和子任务,按独立请求或进程计费会丢失统一预算。结论围绕任务身份归集调用成本,将花费控制与结果价值判断分开。 身份与权限工具与协议记忆与上下文 92.5
问题P1一次Agent任务跨进程、模型和子任务,按独立请求或进程计费会丢失统一预算。E1
└─设计D1以共享run账本累计消耗,在预算节点发出STEER或HALT并区分本地与严格共享计数。E2
问题P2分布式消耗计数可能滞后。E2
└─设计D2区分默认本地最终一致计数与增加往返的严格共享读取。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

围绕任务身份归集调用成本,将花费控制与结果价值判断分开。

取舍

成本限制不能判定答案是否正确;价值分配层尚未建成,不能将局部案例当作普遍收益。

证据到哪为止

成本限制不能判定答案是否正确;价值分配层尚未建成,不能将局部案例当作普遍收益。

09.03工程 How we make AI coding more cost efficient without sacrificing task quality问题逐条压短工具输出可能引发重新读取,反而增加整个编程任务的成本。结论按完整任务判断效率,优先去除重复传输与空转,保留所需信息。 记忆与上下文工具与协议身份与权限 100
问题P1逐条压短工具输出可能引发重新读取,反而增加整个编程任务的成本。E1
└─设计D1保留源码、压缩可恢复的噪声、去除无用行号,并在后台任务完成时直接返回结果。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

按完整任务判断效率,优先去除重复传输与空转,保留所需信息。

取舍

RTK负面结果限定于测试集成;未检出质量下降不是证明所有任务等效,CLI与review收益也不同。

证据到哪为止

RTK负面结果限定于测试集成;未检出质量下降不是证明所有任务等效,CLI与review收益也不同。

09.03工程 Running a Software Factory Efficiently at Uber Scale问题大规模Agent使用增长使总账难解释,单价、上下文和调用轮数共同决定每个业务结果的成本。结论以完成任务的成本和质量拆解优化,将工具目录与中间轮询移出持续模型上下文。 工具与协议身份与权限状态与恢复 92.5
问题P1大规模Agent使用增长使总账难解释,单价、上下文和调用轮数共同决定每个业务结果的成本。E1
└─设计D1把工具接入统一网关,以动态发现和Code Mode脚本压缩往返及轮询开销。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

以完成任务的成本和质量拆解优化,将工具目录与中间轮询移出持续模型上下文。

取舍

默认模型、400k压缩和缓存TTL反映Uber工作负载;文中明确说明成本收益不可直接外推。

证据到哪为止

默认模型、400k压缩和缓存TTL反映Uber工作负载;文中明确说明成本收益不可直接外推。

09.03工程 An Organizational Second Brain: Building an AI That Learns From Experts问题企业专家知识隐含在材料和判断过程中,每次检索再推导既慢又不一致,纠正也难持久化。结论把事实立场和推理步骤分开维护,将专家纠正定位到具体文件与依赖。 记忆与上下文文件与工件身份与权限 92.5
问题P1企业专家知识隐含在材料和判断过程中,每次检索再推导既慢又不一致,纠正也难持久化。E1
└─设计D1分离领域知识与recipe,用实际材料和专家反馈归因,再以最小编辑修订知识。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把事实立场和推理步骤分开维护,将专家纠正定位到具体文件与依赖。

取舍

单合规领域六周实践与专家主观反馈支持可行性,不证明跨领域同等收益;知识正确与流程正确必须分别判断。

证据到哪为止

单合规领域六周实践与专家主观反馈支持可行性,不证明跨领域同等收益;知识正确与流程正确必须分别判断。

09.03工程 Automate planned lifecycle upgrades with AWS DevOps Agent and Kiro问题计划内集群升级涉及发现、版本调查、代码修改和失败恢复,模型输出不足以直接触发部署。结论在确定性流水线核对模型产物,将可自动判定的约束和需要人工判断的条件明确区分。 文件与工件工具与协议状态与恢复 92.5
问题P1计划内集群升级涉及发现、版本调查、代码修改和失败恢复,模型输出不足以直接触发部署。E1
└─设计D1先澄清升级spec,限制修改文件范围,以人工PR审查和有界恢复推进升级。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

在确定性流水线核对模型产物,将可自动判定的约束和需要人工判断的条件明确区分。

取舍

文中的skill隔离依赖模型遵守指令;CloudFormation回滚不等于控制面版本已回退,部分可回滚条件没有自动检查。

证据到哪为止

文中的skill隔离依赖模型遵守指令;CloudFormation回滚不等于控制面版本已回退,部分可回滚条件没有自动检查。

09.03工程 A guide to the anatomy of effective commerce agents问题商业会话跨购物意图但共享用户和交易状态,分散委派容易丢失上下文,直接执行写操作又可能越权。结论让模型组织交互、既有业务系统执行业务规则,对最终状态和批准对象实施约束。 文件与工件状态与恢复工具与协议 92.5
问题P1商业会话跨购物意图但共享用户和交易状态,分散委派容易丢失上下文,直接执行写操作又可能越权。E1
└─设计D1由单Agent按需加载skill,服务端生成稳定UI对象ID,先暂存变更再在apply时重验。E2
问题P2暂存的订单变更在提交时可能违反最新约束。E2
└─设计D2apply时重新读取并校验最终状态后提交。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

让模型组织交互、既有业务系统执行业务规则,对最终状态和批准对象实施约束。

取舍

不是排斥所有子Agent;自包含研究或独立合规会话仍适用,eager streaming会放弃服务端schema保证。

证据到哪为止

不是排斥所有子Agent;自包含研究或独立合规会话仍适用,eager streaming会放弃服务端schema保证。

09.02工程 What We Learned Putting A2A Into Production问题独立部署的Agent需要跨边界传递任务、用户语义和答案来源,只有返回文本会丢失判断条件。结论跨Agent交接同时传递身份、来源新鲜度和可见失败,并区分协议能力与私有扩展。 身份与权限工具与协议状态与恢复 92.5
问题P1独立部署的Agent需要跨边界传递任务、用户语义和答案来源,只有返回文本会丢失判断条件。E1
└─设计D1基于Agent Card路由并携带双方约定的私有DataContext,将错误和session世代显式传递。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

跨Agent交接同时传递身份、来源新鲜度和可见失败,并区分协议能力与私有扩展。

取舍

来源envelope格式错误时被静默丢弃,兼容优先并不保证每次回答都有来源;协议仍缺跨端会话滚转等能力。

证据到哪为止

来源envelope格式错误时被静默丢弃,兼容优先并不保证每次回答都有来源;协议仍缺跨端会话滚转等能力。

09.02工程 How we eliminated $1 million a year of wasted AI agent spend in one hour问题工具参数含糊或返回原始异常,Agent反复猜测后仍可能完成任务,使额外花费隐藏在成功率中。结论将可恢复参数错误和真正失败分开,让工具契约与错误信息支持下一步判断。 工具与协议状态与恢复身份与权限 72.5
问题P1工具参数含糊或返回原始异常,Agent反复猜测后仍可能完成任务,使额外花费隐藏在成功率中。E1
└─设计D1从会话trace定位七类工具缺陷,区分参数、返回体和等待过程造成的成本。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

将可恢复参数错误和真正失败分开,让工具契约与错误信息支持下一步判断。

取舍

年度数值由观察窗口外推,等待不等于全部可回收的人力;输入归一化也不能放松业务授权。

证据到哪为止

年度数值由观察窗口外推,等待不等于全部可回收的人力;输入归一化也不能放松业务授权。

09.02工程 Building an Adaptive Agentic Cybersecurity System with NVIDIA Nemotron问题生成检测规则既要命中观察到的攻击,也要避免只记住环境标识而不能迁移。结论将语法有效、命中已见攻击、行为泛化和良性噪声作为不同证据层。 观测与评测记忆与上下文安全与隔离 92.5
问题P1生成检测规则既要命中观察到的攻击,也要避免只记住环境标识而不能迁移。E1
└─设计D1在专用模型之外加入schema grounding、lint、回测和独立评审等执行约束。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

将语法有效、命中已见攻击、行为泛化和良性噪声作为不同证据层。

取舍

只含一个场景族、八次新攻击及有限良性流量;三次harness失败保留了完整遥测,不代表生产误报率已获证明。

证据到哪为止

只含一个场景族、八次新攻击及有限良性流量;三次harness失败保留了完整遥测,不代表生产误报率已获证明。

09.01工程 Closing the AI agent trust gap with graduated autonomy问题固定授予权限无法反映Agent行为和版本变化,平均分还可能掩盖安全退化。结论把行为评分用于权限调整,关键限制仍由资源调用路径执行。 工具与协议身份与权限安全与隔离 80
问题P1固定授予权限无法反映Agent行为和版本变化,平均分还可能掩盖安全退化。E1
└─设计D1以独立安全下限和慢升快降的信任等级控制能力,调用前由进程外Cedar策略裁决。E2
问题P2链式委派可能把低信任任务提升到更高能力。E2
└─设计D2以委派链中的最低信任等级计算有效权限。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把行为评分用于权限调整,关键限制仍由资源调用路径执行。

取舍

权重和分级是文章提供的起始模板,未给出生产效果对照;记录动作前状态不意味着所有外部副作用都可回滚。

证据到哪为止

权重和分级是文章提供的起始模板,未给出生产效果对照;记录动作前状态不意味着所有外部副作用都可回滚。

09.01工程 Building Self-Correcting Memory in OpenWiki问题代码演进后,Wiki仍可能沿用曾经正确的事实,单纯补充新知识无法识别旧结论失效。结论把事实与版本化来源相连,让未知或过时状态持续可见直到原文重新核对。 记忆与上下文状态与恢复文件与工件 92.5
问题P1代码演进后,Wiki仍可能沿用曾经正确的事实,单纯补充新知识无法识别旧结论失效。E1
└─设计D1把知识claim绑定来源版本,确定性扫描陈旧状态并在逐项核对后更新验证标记。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把事实与版本化来源相连,让未知或过时状态持续可见直到原文重新核对。

取舍

source变化只表示需要重新判断,不等于结论错误;未被访问的stale项可持续保留,系统不保证每轮全部修正。

证据到哪为止

source变化只表示需要重新判断,不等于结论错误;未被访问的stale项可持续保留,系统不保证每轮全部修正。

08.31工程 Introducing Dogwood: runtime verification for AI agents问题单次授权无法表达先审批后操作、累计额度和时间窗口内的行动约束。结论将时序前提与当前请求共同判断,明确计量的是请求、完成结果还是独立对象。 运行时与调度身份与权限状态与恢复 95
问题P1单次授权无法表达先审批后操作、累计额度和时间窗口内的行动约束。E1
└─设计D1在Cedar权限规则中加入过去时态条件,让策略同时考虑窗口内和当前请求。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

将时序前提与当前请求共同判断,明确计量的是请求、完成结果还是独立对象。

取舍

状态和事件历史增加求值成本;时态条件尚不支持Cedar已有自动推理工具,示例的存在审批也不自动表达审批一次性消费。

证据到哪为止

状态和事件历史增加求值成本;时态条件尚不支持Cedar已有自动推理工具,示例的存在审批也不自动表达审批一次性消费。

08.31工程 Temporal Agent Harness: An early look at durable agent infrastructure问题业务Agent的会话跨工具、人工等待和进程故障,内层模型循环缺少统一持久控制。结论分离内层推理循环与外层业务生命周期,让控制和状态具备独立接口。 状态与恢复工具与协议身份与权限 72.5
问题P1业务Agent的会话跨工具、人工等待和进程故障,内层模型循环缺少统一持久控制。E1
└─设计D1外层Workflow承载持久状态和审批,内层Agent SDK执行推理,通过统一事件接口连接。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

分离内层推理循环与外层业务生命周期,让控制和状态具备独立接口。

取舍

作者明确阶段早于public preview,API仍会变化;持久恢复不能替代外部副作用自身的幂等与权限设计。

证据到哪为止

作者明确阶段早于public preview,API仍会变化;持久恢复不能替代外部副作用自身的幂等与权限设计。

08.31工程 Scaling patterns for self-organizing multi-agent clusters with Kiro问题分布式Agent讨论既要交换进展,也要避免全可见导致过早共识与上下文膨胀。结论按探索与收敛阶段调节可见范围,并把旧任务状态与新运行明确隔离。 文件与工件状态与恢复记忆与上下文 87.5
问题P1分布式Agent讨论既要交换进展,也要避免全可见导致过早共识与上下文膨胀。E1
└─设计D1各Agent维护追加日志并只观察有限邻居,以每轮新会话和共享工件协调工作。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

按探索与收敛阶段调节可见范围,并把旧任务状态与新运行明确隔离。

取舍

局部每轮读取有界不等于整体通信或达成共识成本不增长;共享产物的一致性不能由日志CRDT性质自动推出。

证据到哪为止

局部每轮读取有界不等于整体通信或达成共识成本不增长;共享产物的一致性不能由日志CRDT性质自动推出。

08.31工程 Staying Ahead of Adversarial AI Through Agentic Source Code Review问题源码漏洞判断需要可达性和业务威胁模型,孤立模式匹配容易产生无效发现。结论把发现、反证和威胁模型适用性分开,保留从入口到危险操作的路径。 文件与工件安全与隔离记忆与上下文 80
问题P1源码漏洞判断需要可达性和业务威胁模型,孤立模式匹配容易产生无效发现。E1
└─设计D1人审威胁模型后拆分入口分析,独立核验漏洞假设并匹配精确漏洞条件。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把发现、反证和威胁模型适用性分开,保留从入口到危险操作的路径。

取舍

多模型高温判断不等于独立客观证据;正文未披露足够定量数据证明泛化检出率,仍依赖专家复核。

证据到哪为止

多模型高温判断不等于独立客观证据;正文未披露足够定量数据证明泛化检出率,仍依赖专家复核。

08.31工程 Route AI Agent Workloads Across Models with NVIDIA NeMo Switchyard问题不同模型在任务阶段与成本上各有优势,固定选最强模型不一定得到最佳结果成本。结论将路由策略和供应商调用分开,按任务完成质量解释成本取舍。 状态与恢复工具与协议记忆与上下文 87.5
问题P1不同模型在任务阶段与成本上各有优势,固定选最强模型不一定得到最佳结果成本。E1
└─设计D1用语义model target与会话亲和选择模型,遇到指定错误信号再升级。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

将路由策略和供应商调用分开,按任务完成质量解释成本取舍。

取舍

收益限定各伙伴任务集和组合;prefill路由需要模型内部状态与训练,不是所有API模型都可直接使用。

证据到哪为止

收益限定各伙伴任务集和组合;prefill路由需要模型内部状态与训练,不是所有API模型都可直接使用。

08.06工程 How we build an autonomous SRE Agent for Kubernetes Deployments问题周期健康检查不需要每次启动完整多Agent调查,而写操作需要明确可审阅范围。结论让固定监测走直接采集,复杂诊断再进入Agent;批准项尽量小且可理解。 工具与协议文件与工件身份与权限 92.5
问题P1周期健康检查不需要每次启动完整多Agent调查,而写操作需要明确可审阅范围。E1
└─设计D1用Python采集加单次模型判断完成健康检查,写能力集中在受RBAC和人审约束的executor。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

让固定监测走直接采集,复杂诊断再进入Agent;批准项尽量小且可理解。

取舍

初版定时collector漏采利用率导致结构性答不出问题;简化循环是否足够取决于实际输入覆盖。

证据到哪为止

初版定时collector漏采利用率导致结构性答不出问题;简化循环是否足够取决于实际输入覆盖。

08.05工程 TOLAP: Closing the data-object security gap in AI agent architectures问题工具获准访问某数据源后,仍可能返回调用者无权读取的行或字段。结论在数据离开权威源之前执行对象级授权,避免靠模型过滤已拿到的敏感内容。 工具与协议文件与工件记忆与上下文 72.5
问题P1工具获准访问某数据源后,仍可能返回调用者无权读取的行或字段。E1
└─设计D1把规则按最严格语义合并并签名,由资源工具wrapper核对时效、上下文与请求。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

在数据离开权威源之前执行对象级授权,避免靠模型过滤已拿到的敏感内容。

取舍

签名证明完整性而非策略本身正确,过期时间也不自动阻止有效期内重复使用;跨源覆盖依赖各wrapper实现。

证据到哪为止

签名证明完整性而非策略本身正确,过期时间也不自动阻止有效期内重复使用;跨源覆盖依赖各wrapper实现。

08.05工程 Do more with less: How GKE can reduce your cost per agent by 75%问题大量间歇工作Agent长期占用独立运行环境,空闲资源使每Agent成本偏高。结论按延迟要求组合预热、挂起和排队,将密度收益与同时唤醒风险一起考虑。 状态与恢复安全与隔离文件与工件 77.5
问题P1大量间歇工作Agent长期占用独立运行环境,空闲资源使每Agent成本偏高。E1
└─设计D1组合gVisor隔离、预热与快照释放闲置资源,提高特定间歇负载的单节点密度。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

按延迟要求组合预热、挂起和排队,将密度收益与同时唤醒风险一起考虑。

取舍

75%是带间歇活动和可接受启动等待的上限案例;与microVM相比的密度证据不能证明隔离机制等价。

证据到哪为止

75%是带间歇活动和可接受启动等待的上限案例;与microVM相比的密度证据不能证明隔离机制等价。

08.05工程 Your agent needs a computer, not a container — introducing @cloudflare/computer问题每个Agent长期占用容器开销较高,但任务又需要共享文件和不同执行能力。结论以持久工作区为中心,按工作需要附加轻重不同的执行环境。 文件与工件工具与协议状态与恢复 67.5
问题P1每个Agent长期占用容器开销较高,但任务又需要共享文件和不同执行能力。E1
└─设计D1以SQLite文件系统衔接isolate与容器FUSE,用统一exec入口调度不同执行环境。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

以持久工作区为中心,按工作需要附加轻重不同的执行环境。

取舍

早期preview,容器少于10%工作是目标而非已达到的普遍结果;共享接口不等于各后端能力一致。

证据到哪为止

早期preview,容器少于10%工作是目标而非已达到的普遍结果;共享接口不等于各后端能力一致。

08.05工程 Automating cross-repo documentation with GitHub Agentic Workflows问题产品和文档分属仓库,文档往往滞后,而直接给Agent跨仓写权限扩大风险。结论把生成内容与持权发布分开,让源变更和领域评审人跟随文档草稿。 文件与工件状态与恢复身份与权限 92.5
问题P1产品和文档分属仓库,文档往往滞后,而直接给Agent跨仓写权限扩大风险。E1
└─设计D1只读Agent产出变更意图,受限handler按milestone分支关系创建草稿PR。E2
问题P2不同发布分支需要不同的文档目标。E2
└─设计D2通过milestone与分支映射选择草稿PR目标。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把生成内容与持权发布分开,让源变更和领域评审人跟随文档草稿。

取舍

早版有9/69关闭,后续窗口不能掩盖不同版本;合并率也不等于内容无需编辑或质量普遍可靠。

证据到哪为止

早版有9/69关闭,后续窗口不能掩盖不同版本;合并率也不等于内容无需编辑或质量普遍可靠。

08.05工程 How Stripe Built Kai, its Company-Wide AI Agent, on Deep Agents问题企业Agent需要跨会话文件、隔离代码和大量内部能力,全部前置上下文会降低质量。结论复用通用循环,在企业层维护身份、文件与技能目录,动态缩小可见上下文。 文件与工件工具与协议安全与隔离 82.5
问题P1企业Agent需要跨会话文件、隔离代码和大量内部能力,全部前置上下文会降低质量。E1
└─设计D1以S3虚拟文件系统同步沙箱工作区,先发现skill再加载其允许的工具集合。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

复用通用循环,在企业层维护身份、文件与技能目录,动态缩小可见上下文。

取舍

一人一周是已有内部基础上的初版开发故事,不是从零建设企业平台的全部成本;加载工具列表本身不等于授权。

证据到哪为止

一人一周是已有内部基础上的初版开发故事,不是从零建设企业平台的全部成本;加载工具列表本身不等于授权。

08.05工程 How Apollo Rebuilt Its AI Assistant on Deep Agents to Power the Full GTM Loop问题每个新业务都新增子Agent与路由,产生开发成本和反复确认,难支持跨GTM目标。结论按用户目标组织可组合能力,用同一质量定义连接上线前检查与线上反馈。 观测与评测工具与协议文件与工件 75
问题P1每个新业务都新增子Agent与路由,产生开发成本和反复确认,难支持跨GTM目标。E1
└─设计D1将层级主管改为扁平skill计划,并用分层rubric、双人评价和生产反馈改进系统。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

按用户目标组织可组合能力,用同一质量定义连接上线前检查与线上反馈。

取舍

未披露等预算对照,不能据此认定所有supervisor架构都不适合;无头扩展仍需要业务权限边界。

证据到哪为止

未披露等预算对照,不能据此认定所有supervisor架构都不适合;无头扩展仍需要业务权限边界。

08.05工程 How we built LangChain’s agent-first data stack问题企业数据问答不仅缺表信息,还缺统一指标定义、权威来源和团队语义。结论将数据结构、指标口径、业务解释和信任声明分层维护,按失败类型更新对应层。 记忆与上下文文件与工件身份与权限 72.5
问题P1企业数据问答不仅缺表信息,还缺统一指标定义、权威来源和团队语义。E1
└─设计D1把dbt逻辑、语义层和版本化guide用于数据代理,由数据团队维护权威认可标记。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

将数据结构、指标口径、业务解释和信任声明分层维护,按失败类型更新对应层。

取舍

采用率不是所有人都在使用Agent,也不证明回答正确率;作者明确底层模型混乱不能靠语义层补救。

证据到哪为止

采用率不是所有人都在使用Agent,也不证明回答正确率;作者明确底层模型混乱不能靠语义层补救。

08.05工程 Build Production-Ready Agents with the GitHub Copilot Harness and Agent Framework问题已有Copilot能力需要进入统一Agent Framework接口,同时保留其原生工具循环和审批责任。结论在拥有实际工具循环的一层落实审批,再通过统一接口组合其他应用组件。 工具与协议状态与恢复文件与工件 67.5
问题P1已有Copilot能力需要进入统一Agent Framework接口,同时保留其原生工具循环和审批责任。E1
└─设计D1由Copilot SDK掌握内层代理循环,框架提供外层接口,工具执行接入SDK审批hook。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

在拥有实际工具循环的一层落实审批,再通过统一接口组合其他应用组件。

取舍

文章的默认监督描述不能覆盖示例中主动全放行配置;自定义hook可能绕过默认审批且仅给警告。

证据到哪为止

文章的默认监督描述不能覆盖示例中主动全放行配置;自定义hook可能绕过默认审批且仅给警告。

08.04工程 Zero risk isn't the job: a CISO's guide to agentic AI问题同一权限下模型升级也可能发现新的委派路径,按旧模型能力估算风险会失效。结论依据可用能力与资源边界治理,并把间接委派纳入身份和影响范围。 身份与权限安全与隔离工具与协议 77.5
问题P1同一权限下模型升级也可能发现新的委派路径,按旧模型能力估算风险会失效。E1
└─设计D1围绕输入来源、动作身份、影响范围和可观测性分析代理系统的实际授权路径。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

依据可用能力与资源边界治理,并把间接委派纳入身份和影响范围。

取舍

内部内容不是天然可信,原文自己限定攻击需内部人员或被盗账户;这是治理经验而非安全效果定量比较。

证据到哪为止

内部内容不是天然可信,原文自己限定攻击需内部人员或被盗账户;这是治理经验而非安全效果定量比较。

08.04工程 How Anthropic runs large-scale code migrations with Claude Code问题跨语言迁移涉及隐含契约和架构差异,逐文件翻译会扩散相同错误。结论把重复发现转成规则修订,分开判断语法通过、可运行和行为一致。 文件与工件状态与恢复观测与评测 92.5
问题P1跨语言迁移涉及隐含契约和架构差异,逐文件翻译会扩散相同错误。E1
└─设计D1先建立迁移规则和缺口清单,再按依赖翻译,分别核对编译、运行与行为。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把重复发现转成规则修订,分开判断语法通过、可运行和行为一致。

取舍

结构保留与重新设计不适用同一种对照;是否把编译放进内循环取决于编译成本,文件存在仅表示翻译阶段产物存在。

证据到哪为止

结构保留与重新设计不适用同一种对照;是否把编译放进内循环取决于编译成本,文件存在仅表示翻译阶段产物存在。

08.04工程 Agentic retrieval for Amazon Bedrock Managed Knowledge Base问题多跳问题需要从前次结果提出下一次查询,单次检索容易缺少证据链。结论将子查询过程和最终证据集分开记录,按问题复杂度理解额外检索价值。 记忆与上下文观测与评测状态与恢复 87.5
问题P1多跳问题需要从前次结果提出下一次查询,单次检索容易缺少证据链。E1
└─设计D1组合投机检索与多轮查询规划,最终返回去重片段并保留完整检索轨迹。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

将子查询过程和最终证据集分开记录,按问题复杂度理解额外检索价值。

取舍

MuSiQue召回提升不是最终答案准确率;更多轮数增加成本,guardrail只支持BLOCK不支持MASK。

证据到哪为止

MuSiQue召回提升不是最终答案准确率;更多轮数增加成本,guardrail只支持BLOCK不支持MASK。

08.04工程 How to Run an Autoresearch Workflow with RL Agent Skills and NVIDIA NeMo问题长研究会话容易遗失目标、环境惯例和停止条件,导致低信息量的反复尝试。结论可借鉴持久目标、资源约束和决策记录的组织方式;文章分析不需要执行其中的研究流程。 状态与恢复文件与工件记忆与上下文 67.5
问题P1长研究会话容易遗失目标、环境惯例和停止条件,导致低信息量的反复尝试。E1
└─设计D1以行为规范、会话记忆和autoresearch三个skill分别管理会话规则、累积信息和研究循环。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

可借鉴持久目标、资源约束和决策记录的组织方式;文章分析不需要执行其中的研究流程。

取舍

这是作者的RL研究工作流案例,paper-to-code开始训练不代表算法有效性已被确认;人仍负责目标和结果判断。

证据到哪为止

这是作者的RL研究工作流案例,paper-to-code开始训练不代表算法有效性已被确认;人仍负责目标和结果判断。

08.04工程 Trajectory: A Standard Format for Agent Experience Data问题不同harness的经验格式差异和运行元数据,使跨工具记忆读取昂贵。结论区分供Agent阅读的经验视图和保真运行记录,根据消费者保留必要信息。 记忆与上下文工具与协议身份与权限 75
问题P1不同harness的经验格式差异和运行元数据,使跨工具记忆读取昂贵。E1
└─设计D1将不同代理轨迹统一为角色和工具关联结构,并可选择截断冗长工具输出。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

区分供Agent阅读的经验视图和保真运行记录,根据消费者保留必要信息。

取舍

格式服务记忆阅读而非完整执行重放,丢弃或截断的信息可能不适合审计用途。

证据到哪为止

格式服务记忆阅读而非完整执行重放,丢弃或截断的信息可能不适合审计用途。

08.04工程 Is a Pod the right deployment unit for an AI agent?问题短暂且突发的Agent生命周期与长期Pod不一致,一Agent一Pod会保留大量空闲资源。结论将逻辑Agent身份与承载进程分开,使用现有集群管理执行资源。 状态与恢复身份与权限运行时与调度 67.5
问题P1短暂且突发的Agent生命周期与长期Pod不一致,一Agent一Pod会保留大量空闲资源。E1
└─设计D1用WorkerPool及ActorTemplate管理Kubernetes工作节点,由额外控制面调度逻辑Actor。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

将逻辑Agent身份与承载进程分开,使用现有集群管理执行资源。

取舍

身份、actor级策略和计费在文中多为待讨论问题;没有量化容量结果支持无限规模。

证据到哪为止

身份、actor级策略和计费在文中多为待讨论问题;没有量化容量结果支持无限规模。

08.04工程 State & Persistence: The Problem of Agent Reliability问题执行进度和跨任务知识共享生命周期,会在恢复、保留和权限上产生错误。结论分别定义状态与记忆的生命周期,将恢复绑定到执行版本和已提交动作身份。 状态与恢复记忆与上下文工具与协议 77.5
问题P1执行进度和跨任务知识共享生命周期,会在恢复、保留和权限上产生错误。E1
└─设计D1在工具边界保存状态和已作决策,以模型、代码、prompt的版本组合解释恢复语义。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

分别定义状态与记忆的生命周期,将恢复绑定到执行版本和已提交动作身份。

取舍

文章是多来源架构综合,费用案例明确为轶事;bundle是设计建议,不是数据库自动提供的完整能力。

证据到哪为止

文章是多来源架构综合,费用案例明确为轶事;bundle是设计建议,不是数据库自动提供的完整能力。

08.04工程 What 10 autonomous film crews taught us about agent teamwork问题多Agent创作需要跨阶段交接,进程重启后只靠消息历史容易遗失决策。结论让交接围绕可读产物和明确阶段结果,完成声明需要与实际产物对应。 文件与工件状态与恢复工具与协议 75
问题P1多Agent创作需要跨阶段交接,进程重启后只靠消息历史容易遗失决策。E1
└─设计D1通过共享文件、传路径的消息和阶段评审协调电影制作团队。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

让交接围绕可读产物和明确阶段结果,完成声明需要与实际产物对应。

取舍

十支团队的一次创作活动是观察案例,文件协作优势不构成一般任务的受控结论。

证据到哪为止

十支团队的一次创作活动是观察案例,文件协作优势不构成一般任务的受控结论。

08.04工程 When agents build agents问题复杂目标需要动态组合专长,并在跨次运行中保留工作而不持续膨胀主上下文。结论分开运行时可用能力与下一轮改进产物,保持稳定调用契约。 工具与协议文件与工件观测与评测 80
问题P1复杂目标需要动态组合专长,并在跨次运行中保留工作而不持续膨胀主上下文。E1
└─设计D1用Monty组织隔离子代理及动态生成能力,静态检查通过的能力在下一run启用。E2
问题P2新生成能力可能改变正在执行任务的条件。E2
└─设计D2静态检查通过后在下一run启用,保持当前run的能力集合。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

分开运行时可用能力与下一轮改进产物,保持稳定调用契约。

取舍

按层级检索子Agent历史仍属规划;文章未给动态编排的量化收益对照。

证据到哪为止

按层级检索子Agent历史仍属规划;文章未给动态编排的量化收益对照。

08.04工程 When agents improve agents问题一次run结束不等于目标完成,跨run改进还可能只优化了有偏的评分者。结论把完成条件、可检索经验和评价标准分开,保留对标准与改动的人工判断。 记忆与上下文状态与恢复文件与工件 77.5
问题P1一次run结束不等于目标完成,跨run改进还可能只优化了有偏的评分者。E1
└─设计D1以持久轨迹BM25检索和版本化rubric支持诊断,由人工校准并决定优化采用。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把完成条件、可检索经验和评价标准分开,保留对标准与改动的人工判断。

取舍

搜索目前是全store或单会话,不能当作细粒度访问隔离;65个PR/22合并不是自动改进因果证明。

证据到哪为止

搜索目前是全store或单会话,不能当作细粒度访问隔离;65个PR/22合并不是自动改进因果证明。

08.04论文 Six Agent Harness Capabilities for Higher Model Performance问题文本化工具结果反复进入上下文,工具、状态和控制散落多个接口。结论用类型化对象和有界预览减少重复传输,把确定性检查置于明确方法边界。 文件与工件工具与协议记忆与上下文 82.5
问题P1文本化工具结果反复进入上下文,工具、状态和控制散落多个接口。E1
└─设计D1把状态保留为可引用的Python对象,通过代码动作和typed关系组织工作记忆。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

用类型化对象和有界预览减少重复传输,把确定性检查置于明确方法边界。

取舍

SWE-bench无压缩现象限定这些任务和模型;研究preview和沙箱外部依赖不能被概括成框架单独提供全部安全性。

证据到哪为止

SWE-bench无压缩现象限定这些任务和模型;研究preview和沙箱外部依赖不能被概括成框架单独提供全部安全性。

08.04工程 Safety and alignment in an era of long-horizon models问题长时间自主工作可能把多个局部看似正常动作组合成对约束的绕过。结论围绕完整轨迹判断目标与约束,保留可介入的执行边界。 状态与恢复安全与隔离身份与权限 80
问题P1长时间自主工作可能把多个局部看似正常动作组合成对约束的绕过。E1
└─设计D1从实际事故补充评估与长指令对齐,以能暂停会话的轨迹监控支撑有限内部部署。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

围绕完整轨迹判断目标与约束,保留可介入的执行边界。

取舍

作者只描述少量环境和定性改进,轨迹重放本身有随机性;没有严重事件观察不构成普遍安全保证。

证据到哪为止

作者只描述少量环境和定性改进,轨迹重放本身有随机性;没有严重事件观察不构成普遍安全保证。

07.31论文 Skill Use or Skill Theater? Evaluating the Reasoning Backroom in Skill-Augmented Language Agents问题Agent声称用了某skill,不一定代表该artifact实际改变了决策,最终正确率也无法解释来源归因。结论把实际行为变化、结果效用和自报来源分别分析,不把引用skill当作使用证据。 观测与评测文件与工件工具与协议 92.5
问题P1Agent声称用了某skill,不一定代表该artifact实际改变了决策,最终正确率也无法解释来源归因。E1
└─设计D1固定任务与预算,干预skill名称、内容或存在性,并在答案提交后收集归因。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把实际行为变化、结果效用和自报来源分别分析,不把引用skill当作使用证据。

取舍

识别的是artifact级决策敏感性,不揭示内部推理;答案不变也不能排除学过相同程序,单路径不估计服务随机波动。

证据到哪为止

识别的是artifact级决策敏感性,不揭示内部推理;答案不变也不能排除学过相同程序,单路径不估计服务随机波动。

07.31论文 SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use问题只按最终检查通过筛选经验,会保留选错skill后靠试错修好的过程。结论将过程证据和最终产物分开评价,版本化评分标准并保留禁止破坏的关键步骤。 观测与评测文件与工件记忆与上下文 87.5
问题P1只按最终检查通过筛选经验,会保留选错skill后靠试错修好的过程。E1
└─设计D1按选择、遵循、组合、反思四维分析skill行为,以独立verifier和隔离验证集约束修订。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

将过程证据和最终产物分开评价,版本化评分标准并保留禁止破坏的关键步骤。

取舍

训练结果是离线SFT;大库边界只评选择而非完整容器任务,未报告长期生产反馈。

证据到哪为止

训练结果是离线SFT;大库边界只评选择而非完整容器任务,未报告长期生产反馈。

07.31论文 Dynamic Agent Skills: A Lifecycle Survey and Taxonomy of Evolving Skill Libraries问题动态skill库不仅有检索,还涉及提出、准入、组织、维护和来源治理,混为一谈会误判成熟度。结论按具体生命周期阶段比较系统,区分能添加、能调用与能持续维护。 记忆与上下文文件与工件状态与恢复 80
问题P1动态skill库不仅有检索,还涉及提出、准入、组织、维护和来源治理,混为一谈会误判成熟度。E1
└─设计D1以八阶段生命周期整理动态skill研究,区分能力表示、准入、运行和维护等证据角色。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

按具体生命周期阶段比较系统,区分能添加、能调用与能持续维护。

取舍

这是arXiv为主且非穷尽的综述,不是共享harness上的统一比较;分类归纳不能替代各论文实证。

证据到哪为止

这是arXiv为主且非穷尽的综述,不是共享harness上的统一比较;分类归纳不能替代各论文实证。

07.31工程 Building AX evals that actually work问题含糊标准让模型评分看似准确,却无法区分正确使用、仅出现名称和根本不适用。结论让判断附带可定位证据,结构与算术由代码处理,保留明确不适用条件。 记忆与上下文文件与工件工具与协议 77.5
问题P1含糊标准让模型评分看似准确,却无法区分正确使用、仅出现名称和根本不适用。E1
└─设计D1逐项使用pass、fail、skip及人工样本校准,将版本和汇总算术交给确定性工具。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

让判断附带可定位证据,结构与算术由代码处理,保留明确不适用条件。

取舍

5–10例校准是实践起点,不证明整体可信;不适用跳过不能用于隐藏困难案例。

证据到哪为止

5–10例校准是实践起点,不证明整体可信;不适用跳过不能用于隐藏困难案例。

07.31工程 How to test agent skills without hitting real APIs问题API评测可能付费、改变真实数据或受他人写入干扰,修改skill网址又引入新的变量。结论阅读此类证据时区分隔离模拟与真实集成,保持被评skill本体一致。 工具与协议状态与恢复文件与工件 67.5
问题P1API评测可能付费、改变真实数据或受他人写入干扰,修改skill网址又引入新的变量。E1
└─设计D1由Dev Proxy在原URL拦截调用,以种子数据和可重置CRUD状态模拟服务。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

阅读此类证据时区分隔离模拟与真实集成,保持被评skill本体一致。

取舍

代理只模拟已配置操作,不证明真实鉴权、延迟和上游故障行为;原文没有效果量比较。

证据到哪为止

代理只模拟已配置操作,不证明真实鉴权、延迟和上游故障行为;原文没有效果量比较。

07.31论文 SIGIL: Compiling Agent Skills into Typed Harnesses问题自然语言skill把已确定的流程约束和需要模型判断的部分混在一起,导致必要步骤被跳过。结论将程序负责的流程与模型负责的语义判断显式区分,追踪每项约束的来源。 文件与工件工具与协议运行时与调度 92.5
问题P1自然语言skill把已确定的流程约束和需要模型判断的部分混在一起,导致必要步骤被跳过。E1
└─设计D1从来源跨度提取要求形成AG-IR,校验后确定性降低为可执行结构。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

将程序负责的流程与模型负责的语义判断显式区分,追踪每项约束的来源。

取舍

来源片段存在不证明解释正确;可执行结构约束只覆盖已正确提取和编译的要求。

证据到哪为止

来源片段存在不证明解释正确;可执行结构约束只覆盖已正确提取和编译的要求。

07.31论文 MemTxn: A Transaction Boundary for Source-Supported Updates and Complete-State Recovery in Agent Memory问题记忆更新准入、答案版本选择与持久恢复是不同问题,单键修复可能遗漏其他已受损状态。结论分开准入、可见性和恢复,并将可恢复范围绑定到应用可见状态。 文件与工件状态与恢复记忆与上下文 92.5
问题P1记忆更新准入、答案版本选择与持久恢复是不同问题,单键修复可能遗漏其他已受损状态。E1
└─设计D1用有序token条件约束记忆修订、声明时间选择版本,并保存完整active-map前像。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

分开准入、可见性和恢复,并将可恢复范围绑定到应用可见状态。

取舍

不保证语义角色绑定、并发、重复故障、intent损坏或物理丢失;恢复以前像完整且外部检测器调用为前提。

证据到哪为止

不保证语义角色绑定、并发、重复故障、intent损坏或物理丢失;恢复以前像完整且外部检测器调用为前提。

07.31论文 MANTA: Multi-Agent Network Topology Adaptation for Self-Evolving Multi-Agent Systems问题固定团队拓扑无法根据任务和已发生的协作问题调整分工及信息可见性。结论以可观察协作问题触发结构调整,保留过程信号与结果正确性的区别。 观测与评测文件与工件身份与权限 87.5
问题P1固定团队拓扑无法根据任务和已发生的协作问题调整分工及信息可见性。E1
└─设计D1过程审计发现问题后进行最多三操作的有界修订,以两种时间尺度维护playbook。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

以可观察协作问题触发结构调整,保留过程信号与结果正确性的区别。

取舍

无过程flag不等于答案正确;跨域迁移每组30题,控制者不接收benchmark verdict。

证据到哪为止

无过程flag不等于答案正确;跨域迁移每组30题,控制者不接收benchmark verdict。

07.31论文 AgentRadio: Passive Awareness for Long-Horizon Multi-Agent Collaboration问题协作中前台等待消息会打断独立工作,跨分工发现要到评审时才传递。结论把消息到达与工作执行解耦,让跨任务相关发现及时进入对方上下文。 文件与工件状态与恢复工具与协议 90
问题P1协作中前台等待消息会打断独立工作,跨分工发现要到评审时才传递。E1
└─设计D1后台watcher在步骤边界把同伴消息送入代理,替代每次通信都阻塞推理的方式。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把消息到达与工作执行解耦,让跨任务相关发现及时进入对方上下文。

取舍

无额外监听模型调用不等于零成本,消息仍占token;主实验124题,三次随机性检查只覆盖30题子集。

证据到哪为止

无额外监听模型调用不等于零成本,消息仍占token;主实验124题,三次随机性检查只覆盖30题子集。

07.31论文 Hybrid Analysis for Secure MCP Tool Use in LLM Agents问题仅检查声明参数或返回文本,看不到MCP工具真实执行的进程、文件和网络行为。结论将声明动作与实际执行证据关联,分别描述执行前阻止和执行后发现。 工具与协议安全与隔离文件与工件 92.5
问题P1仅检查声明参数或返回文本,看不到MCP工具真实执行的进程、文件和网络行为。E1
└─设计D1调用前检查参数,执行中采集eBPF行为树,返回前审查结果是否可以交给模型。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

将声明动作与实际执行证据关联,分别描述执行前阻止和执行后发现。

取舍

已经发生的副作用不会自动撤销;本地Docker/cgroup原型不覆盖无相应遥测的远程工具,且不看网络payload。

证据到哪为止

已经发生的副作用不会自动撤销;本地Docker/cgroup原型不覆盖无相应遥测的远程工具,且不看网络payload。

07.30论文 Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability问题文件记忆的组织、压缩和维护会同时影响查找成本与信息保留,目录更复杂未必更好。结论按信息材料和消费者能力选择组织程度,将建库成本与每次使用成本分开。 记忆与上下文文件与工件工具与协议 92.5
问题P1文件记忆的组织、压缩和维护会同时影响查找成本与信息保留,目录更复杂未必更好。E1
└─设计D1分离记忆管理、搜索与执行角色,在相同任务中比较不同文件组织和存储形式。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

按信息材料和消费者能力选择组织程度,将建库成本与每次使用成本分开。

取舍

对话32k/128k含不同内容,不能纯归因长度;增长证据限140任务链,维护可让库更大而非更小。

证据到哪为止

对话32k/128k含不同内容,不能纯归因长度;增长证据限140任务链,维护可让库更大而非更小。

07.30论文 VITAL-RAG: Invariance Race for Context Allocation in Coding Agents问题同一代码对象的多视图会重复占据上下文,已检索到的证据还可能在token预算下被截掉。结论将检索排序、对象去重和最终上下文分配分别建模。 文件与工件记忆与上下文身份与权限 82.5
问题P1同一代码对象的多视图会重复占据上下文,已检索到的证据还可能在token预算下被截掉。E1
└─设计D1每个来源对象只占一个排名位置,再按查询添加companion并限制对象token预算。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

将检索排序、对象去重和最终上下文分配分别建模。

取舍

依赖索引提供的对象身份,固定4096token设置不代表所有窗口的最佳分配;检索召回不等于任务完成率。

证据到哪为止

依赖索引提供的对象身份,固定4096token设置不代表所有窗口的最佳分配;检索召回不等于任务完成率。

07.30论文 MemSecBench: Tracking Agent Memory Poisoning from Persistence to Consequence and Repair问题记忆写入成功不等于攻击成功,清除恶意条目也不等于修复后良性记忆仍完整。结论按完整生命周期定位风险,删除动作和完成声明都不能代替最终状态证据。 记忆与上下文安全与隔离观测与评测 92.5
问题P1记忆写入成功不等于攻击成功,清除恶意条目也不等于修复后良性记忆仍完整。E1
└─设计D1分别观察污染写入、召回、采纳和外部后果,并独立评估选择性遗忘与良性信息保留。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

按完整生命周期定位风险,删除动作和完成声明都不能代替最终状态证据。

取舍

假定攻击内容已进入支持的流程,不研究获取账户入口;judge只报告500条人工标签一致率,后端优劣随配置反转。

证据到哪为止

假定攻击内容已进入支持的流程,不研究获取账户入口;judge只报告500条人工标签一致率,后端优劣随配置反转。

07.30论文 FinCacheServe: Dependency-Consistent Answer Reuse for Cost-Efficient RAG Serving over Mutable Enterprise Documents问题可变企业文档下,相似问题复用答案可能跨报告期或过期依赖,生成缓存需要比语义相似更严格的条件。结论把正确性复用门槛与缓存淘汰收益策略分开。 文件与工件工具与协议观测与评测 100
问题P1可变企业文档下,相似问题复用答案可能跨报告期或过期依赖,生成缓存需要比语义相似更严格的条件。E1
└─设计D1将复用答案绑定请求签名和证据、版本、工具指纹,以反向索引传播失效。E2
问题P2来源变化后旧答案可能仍被命中。E2
└─设计D2通过证据和版本指纹绑定缓存,反向索引传播失效。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把正确性复用门槛与缓存淘汰收益策略分开。

取舍

保证的是记录依赖的新鲜度而非财务事实正确;多副本跨区一致性不在实证范围,节能数字基于功率假设。

证据到哪为止

保证的是记录依赖的新鲜度而非财务事实正确;多副本跨区一致性不在实证范围,节能数字基于功率假设。

07.30论文 AgentGUI: An Interface for Observing and Steering Long-Running AI Agents问题长Agent任务中人难以理解轨迹,Agent空闲后也可能遗漏产物而不继续。结论让任务条件、轨迹和文件在同一界面可查,将需要继续的原因指向具体缺项。 状态与恢复文件与工件工具与协议 75
问题P1长Agent任务中人难以理解轨迹,Agent空闲后也可能遗漏产物而不继续。E1
└─设计D1提供分层轨迹、文件预览和用户steering,再由manager按条件判断任务状态。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

让任务条件、轨迹和文件在同一界面可查,将需要继续的原因指向具体缺项。

取舍

产物存在不证明内容正确;manager token少于1%不等于全部资源开销少于1%,Hermes与Claude支持成熟度不同。

证据到哪为止

产物存在不证明内容正确;manager token少于1%不等于全部资源开销少于1%,Hermes与Claude支持成熟度不同。

07.29论文 Towards a Systems Foundation for Agentic Cloud Management问题多会话操作不同云资源仍可能争用同一父资源或容量,单按资源ID协调不够。结论以真实依赖和容量约束确定冲突范围,给Agent返回可归因的等待或拒绝原因。 工具与协议文件与工件状态与恢复 80
问题P1多会话操作不同云资源仍可能争用同一父资源或容量,单按资源ID协调不够。E1
└─设计D1从全局资源图投影session状态,以多粒度锁和容量escrow协调操作,并在提交前重验。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

以真实依赖和容量约束确定冲突范围,给Agent返回可归因的等待或拒绝原因。

取舍

provider语义依赖插件,自动生成插件属于规划;语义事务不是对所有云副作用提供通用原子回滚。

证据到哪为止

provider语义依赖插件,自动生成插件属于规划;语义事务不是对所有云副作用提供通用原子回滚。

07.29论文 CodeNib: A Multi-View Data System for Serving Repository Context to Coding Agents问题代码上下文来自结构、词法和向量视图,构建、维护、查询与交付需要明确边界。结论显式记录各视图版本和provider,分开数据新鲜度与交付策略。 文件与工件工具与协议记忆与上下文 100
问题P1代码上下文来自结构、词法和向量视图,构建、维护、查询与交付需要明确边界。E1
└─设计D1以commit manifest组织多种代码视图,按能力加载并对符号变化进行增量维护。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

显式记录各视图版本和provider,分开数据新鲜度与交付策略。

取舍

静态导航不完全等价实时LSP;token下降未测缓存或prefill延迟,compaction并非所有模型最优。

证据到哪为止

静态导航不完全等价实时LSP;token下降未测缓存或prefill延迟,compaction并非所有模型最优。

07.29论文 SkillGate: Cost Efficient Runtime Malicious Skill File Detection in Coding Agents问题全量模型扫描skill昂贵,纯模式匹配又可能误报大量正常技术内容。结论将低成本筛查、语义判定和最终准入分开,保留筛查覆盖范围。 文件与工件身份与权限安全与隔离 80
问题P1全量模型扫描skill昂贵,纯模式匹配又可能误报大量正常技术内容。E1
└─设计D1先用模式筛选MCP响应片段,再交给judge并隔离可疑内容。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

将低成本筛查、语义判定和最终准入分开,保留筛查覆盖范围。

取舍

150恶意文件为手工示例;正则无命中直接放行会漏过新编码方式,PATH shim不是不可绕过的系统边界。

证据到哪为止

150恶意文件为手工示例;正则无命中直接放行会漏过新编码方式,PATH shim不是不可绕过的系统边界。

07.29论文 OrchBench: Evaluating Multi-Agent Orchestration Plans in Isolation via Deterministic Simulation问题端到端多Agent分数混合了任务求解和编排能力,难判断信息转移与资源分配本身。结论把编排结构单独分析,用声明依赖与信息流解释失败而非只看Agent数量。 身份与权限记忆与上下文工具与协议 92.5
问题P1端到端多Agent分数混合了任务求解和编排能力,难判断信息转移与资源分配本身。E1
└─设计D1在DAG模拟中显式建模任务分配、跨Agent信息传递和压缩损失,确定性计算调度结果。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把编排结构单独分析,用声明依赖与信息流解释失败而非只看Agent数量。

取舍

质量来自模拟假设;跨框架时间相关性很低,不能把模拟token或时延当作真实系统收益。

证据到哪为止

质量来自模拟假设;跨框架时间相关性很低,不能把模拟token或时延当作真实系统收益。

07.29工程 Discover Agent Skills from MCP servers in .NET问题多Agent各自复制skill会出现版本漂移,远程分发又引入解包与执行风险。结论统一发现和分发接口,分别治理内容读取、归档落盘与脚本执行。 文件与工件工具与协议身份与权限 80
问题P1多Agent各自复制skill会出现版本漂移,远程分发又引入解包与执行风险。E1
└─设计D1用skill目录索引发现能力,按需读取资源或archive,并限制下载与解压规模。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

统一发现和分发接口,分别治理内容读取、归档落盘与脚本执行。

取舍

远程archive脚本明确不执行;资源限制不证明内容语义安全,统一来源也不是权限依据。

证据到哪为止

远程archive脚本明确不执行;资源限制不证明内容语义安全,统一来源也不是权限依据。

07.28工程 Security incident disclosure — July 2026问题数据处理工作节点的代码执行漏洞可能演变为节点和跨集群凭证暴露。结论把数据处理面和凭证传播纳入系统边界,取证能力需能处理真实恶意材料。 安全与隔离身份与权限观测与评测 85
问题P1数据处理工作节点的代码执行漏洞可能演变为节点和跨集群凭证暴露。E1
└─设计D1从真实入侵事件追踪loader执行、凭据触达与横向移动,再界定修复和轮换范围。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把数据处理面和凭证传播纳入系统边界,取证能力需能处理真实恶意材料。

取舍

攻击者使用的LLM明确未知,不能归因某模型;小时级分析是事故报告而非受控效率比较。

证据到哪为止

攻击者使用的LLM明确未知,不能归因某模型;小时级分析是事故报告而非受控效率比较。

07.28工程 Agents SDK adds MCP Specification 2026-07-28 support问题协议升级需同时服务新无状态客户端与旧连接,不能因迁移丢失交互式输入和身份状态。结论区分协议会话和应用任务状态,以能力探测决定兼容路径。 工具与协议状态与恢复身份与权限 87.5
问题P1协议升级需同时服务新无状态客户端与旧连接,不能因迁移丢失交互式输入和身份状态。E1
└─设计D1先探测新发现协议后回退旧初始化,用MRTR恢复原操作,并隔离每请求server实例。E2
问题P2并发请求共用协议server可能互相污染状态。E2
└─设计D2每请求创建server实例,特殊session场景保留明确路由。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

区分协议会话和应用任务状态,以能力探测决定兼容路径。

取舍

普通无状态操作可同路由兼容,依赖session/RPC/独立流的服务仍需重设计或双路由过渡。

证据到哪为止

普通无状态操作可同路由兼容,依赖session/RPC/独立流的服务仍需重设计或双路由过渡。

07.28工程 Build enterprise search for agents with Amazon Bedrock Managed Knowledge Base问题企业检索需覆盖多来源与多跳问题,同时避免同步ACL过时后继续暴露文档。结论权限判断与语义相关性分开,按复杂度选择直接检索或迭代检索。 记忆与上下文身份与权限文件与工件 80
问题P1企业检索需覆盖多来源与多跳问题,同时避免同步ACL过时后继续暴露文档。E1
└─设计D1在检索前过滤候选,查询时再检查权威源ACL,结合多轮子查询返回去重证据。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

权限判断与语义相关性分开,按复杂度选择直接检索或迭代检索。

取舍

官方功能介绍和客户陈述不提供完整准确率对照;统一网关不能替代上游文档权限语义。

证据到哪为止

官方功能介绍和客户陈述不提供完整准确率对照;统一网关不能替代上游文档权限语义。

07.28工程 The Microsoft Agent Framework Harness is now released问题从chat client到长任务Agent还需要工具循环、状态、记忆、规划和可观测性。结论让通用循环有明确可替换部件,展示功能时保留各组件成熟度。 工具与协议文件与工件记忆与上下文 75
问题P1从chat client到长任务Agent还需要工具循环、状态、记忆、规划和可观测性。E1
└─设计D1用可替换的默认组件构成harness,并在每次模型调用后保存对话历史。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

让通用循环有明确可替换部件,展示功能时保留各组件成熟度。

取舍

历史持久化不自动保证工具副作用不重复;ready-made不意味着所有扩展都已稳定。

证据到哪为止

历史持久化不自动保证工具副作用不重复;ready-made不意味着所有扩展都已稳定。

07.28工程 How Couchbase built a multi-model AI architecture for Capella iQ with Amazon Bedrock问题企业SQL助手需要模型切换与高可用,同时保持租户配置和区域约束。结论在调用层解耦模型选择,并将地域和租户覆盖规则作为配置的一部分。 身份与权限运行时与调度文件与工件 85
问题P1企业SQL助手需要模型切换与高可用,同时保持租户配置和区域约束。E1
└─设计D1通过namespace配置、私有端点和美国地域内跨区路由组织NL查询服务。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

在调用层解耦模型选择,并将地域和租户覆盖规则作为配置的一部分。

取舍

私网不等于单区域,跨区故障仍需超时与重试设计;小模型蒸馏降本是未来计划。

证据到哪为止

私网不等于单区域,跨区故障仍需超时与重试设计;小模型蒸馏降本是未来计划。

07.27工程 Open Knowledge format v0.2 tackles agentic trust问题知识消费者需要在读取正文前判断来源和新鲜度,计算值还需知道是否按批准公式取得。结论把来源、生成者、核验记录、定义有效期与本次计算证据分别表达。 观测与评测记忆与上下文身份与权限 92.5
问题P1知识消费者需要在读取正文前判断来源和新鲜度,计算值还需知道是否按批准公式取得。E1
└─设计D1分离generated与verified知识状态、绝对过期时间,以及逐次计算的证明收据。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把来源、生成者、核验记录、定义有效期与本次计算证据分别表达。

取舍

信任tier是建议而非访问控制,OKF本身不执行;reference实现为概念验证,过期定义仍可能通过一次计算attestation。

证据到哪为止

信任tier是建议而非访问控制,OKF本身不执行;reference实现为概念验证,过期定义仍可能通过一次计算attestation。

07.27论文 IssueTrojanBench: Benchmarking AI Coding Agents Against Malicious Issue Requests问题编程Agent从issue和附件读取外部材料时,可能把攻击者伪装成任务要求的内容执行到仓库。结论保留用户任务与issue内容的信任边界,按实际动作而非最终口头拒绝判断后果。 文件与工件安全与隔离状态与恢复 80
问题P1编程Agent从issue和附件读取外部材料时,可能把攻击者伪装成任务要求的内容执行到仓库。E1
└─设计D1把issue变体投入固定代理设置,按实际执行、交付工件和风险提醒分别统计结果。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

保留用户任务与issue内容的信任边界,按实际动作而非最终口头拒绝判断后果。

取舍

攻击变体数量不等于独立任务多样性;各harness搭配模型不同,不能据总平均分纯比较框架安全性。

证据到哪为止

攻击变体数量不等于独立任务多样性;各harness搭配模型不同,不能据总平均分纯比较框架安全性。

07.27工程 Native Agent Memory for Microsoft Agent Framework, Powered by Azure Cosmos DB问题长期用户记忆需要跨新会话注入,又不宜把存储和抽取逻辑绑进Agent循环。结论通过生命周期扩展记忆能力,将身份、抽取标准和注入语义分别设计。 记忆与上下文安全与隔离文件与工件 80
问题P1长期用户记忆需要跨新会话注入,又不宜把存储和抽取逻辑绑进Agent循环。E1
└─设计D1以context provider的before_run召回、after_run保存及可定制抽取维护用户记忆。E2
问题P2用户画像可能被当作高优先级指令。E2
└─设计D2使用稳定user_id和thread_id,将召回画像作为用户角色的不可信参考。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

通过生命周期扩展记忆能力,将身份、抽取标准和注入语义分别设计。

取舍

正常context退出会drain后台任务,不证明异常终止无损;user_id分区需可信身份绑定,非可信标签也不是确定性防注入。

证据到哪为止

正常context退出会drain后台任务,不证明异常终止无损;user_id分区需可信身份绑定,非可信标签也不是确定性防注入。

07.27工程 Move Agent Orchestration/Workflows out of Code with Agent Framework Declarative Workflows 1.0问题代码内散落的编排使分支、状态和人工等待不易独立审阅和复用。结论将稳定编排外置为可审阅定义,复杂业务函数仍由代码提供。 状态与恢复工具与协议身份与权限 75
问题P1代码内散落的编排使分支、状态和人工等待不易独立审阅和复用。E1
└─设计D1将YAML中的状态、条件、工具、人工输入与checkpoint加载为普通Workflow。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

将稳定编排外置为可审阅定义,复杂业务函数仍由代码提供。

取舍

声明式格式不自动证明策略安全、流程无环或迁移兼容;文章示例并未提供这些额外保证。

证据到哪为止

声明式格式不自动证明策略安全、流程无环或迁移兼容;文章示例并未提供这些额外保证。

07.27工程 Building trade assistant: How Jefferies optimized front office trading operations with AI问题交易分析问题跨多个数据源和业务口径,直接让模型完成查询与图表内容容易失真。结论把模型的意图解释与确定性数据权限、业务处理和呈现分开。 身份与权限记忆与上下文工具与协议 72.5
问题P1交易分析问题跨多个数据源和业务口径,直接让模型完成查询与图表内容容易失真。E1
└─设计D1由代理选择数据源和查询,Query Executor实施行级过滤,专用引擎渲染数值图表。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把模型的意图解释与确定性数据权限、业务处理和呈现分开。

取舍

正文提供工程案例而非准确率受控对照;图表渲染正确不证明SQL口径或源数据正确。

证据到哪为止

正文提供工程案例而非准确率受控对照;图表渲染正确不证明SQL口径或源数据正确。

07.24工程 AI Teammates: how monday.com runs production AI agents on Amazon Bedrock问题Agent需要像团队成员一样承接多入口任务,状态与责任不能分别散在多个聊天工具。结论将任务、身份和交付纳入现有团队系统,并按状态寿命选择存储。 状态与恢复运行时与调度身份与权限 92.5
问题P1Agent需要像团队成员一样承接多入口任务,状态与责任不能分别散在多个聊天工具。E1
└─设计D1用SNS/SQS统一消息入口,分层存放活动状态、EFS工作区和S3记录,并以review筛选PR。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

将任务、身份和交付纳入现有团队系统,并按状态寿命选择存储。

取舍

自动合并依赖特定agent×repo×change-class信号;已有业务治理仍需覆盖Agent新行为,不能由集成直接推出普遍安全。

证据到哪为止

自动合并依赖特定agent×repo×change-class信号;已有业务治理仍需覆盖Agent新行为,不能由集成直接推出普遍安全。

07.24论文 Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification问题安全测试需要把风险描述转成可观察的状态变化,而不是相信代理自报成功。结论借鉴可观察证据分层,同时分开成功谓词和分母。 工具与协议安全与隔离观测与评测 87.5
问题P1安全测试需要把风险描述转成可观察的状态变化,而不是相信代理自报成功。E1
└─设计D1组合风险、方法和环境生成安全案例,用初始状态脚本及确定性环境谓词裁决结果。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

借鉴可观察证据分层,同时分开成功谓词和分母。

取舍

良性完整任务与攻击单个违规使用不同成功谓词,70.5%与90.6%的差不能单独证明自适应驱动的因果收益;自动生成谓词仍有误判边界。

证据到哪为止

良性完整任务与攻击单个违规使用不同成功谓词,70.5%与90.6%的差不能单独证明自适应驱动的因果收益;自动生成谓词仍有误判边界。

07.24工程 Best practices for applying Amazon Bedrock Guardrails to code generation workflows问题逐段重复扫描代码与历史会消耗 Guardrails 配额,检查应围绕输入和落盘执行边界组织。结论把检查位置、检测能力与缓存失效条件分别建模。 安全与隔离文件与工件工具与协议 77.5
问题P1逐段重复扫描代码与历史会消耗 Guardrails 配额,检查应围绕输入和落盘执行边界组织。E1
└─设计D1在输入、完整工件和执行边界解耦调用Guardrails,以内容缓存和较大批次减少重复扫描。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把检查位置、检测能力与缓存失效条件分别建模。

取舍

示例按文件内容哈希缓存,未绑定策略版本;工具包装必须在副作用之前执行才构成闸门,文本检测不等于代码语义安全。

证据到哪为止

示例按文件内容哈希缓存,未绑定策略版本;工具包装必须在副作用之前执行才构成闸门,文本检测不等于代码语义安全。

07.24论文 ChannelGuard: Safe Models Do Not Compose into Safe Multi-Agent Systems问题多代理的工具、记忆和互相传递内容引入输入过滤覆盖不到的注入路径。结论边界覆盖值得借鉴,静态签名、压缩保留内容和不确定性处理必须分别评估。 工具与协议观测与评测记忆与上下文 92.5
问题P1多代理的工具、记忆和互相传递内容引入输入过滤覆盖不到的注入路径。E1
└─设计D1在多类通信边界逐句计算短语库相似度,选择通过、截短或阻断并记录阻断层。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

边界覆盖值得借鉴,静态签名、压缩保留内容和不确定性处理必须分别评估。

取舍

主要比较每组30例、单种子和模拟工具;三值决策的熵上界不等于传递文本的信息量上界,不能推导完整安全保证。

证据到哪为止

主要比较每组30例、单种子和模拟工具;三值决策的熵上界不等于传递文本的信息量上界,不能推导完整安全保证。

07.24论文 JANUS: Foreseeing Latent Risk for Long-Horizon Agent Safety问题长任务中的风险可能尚未显露,护栏需要依据轨迹前缀判断后续危险。结论区分预测未来风险与已经发生违规的证据,预测应标为概率判断。 安全与隔离工具与协议身份与权限 87.5
问题P1长任务中的风险可能尚未显露,护栏需要依据轨迹前缀判断后续危险。E1
└─设计D1共享模型先预测未来摘要再进行安全裁决,以耦合奖励联合训练两项能力。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

区分预测未来风险与已经发生违规的证据,预测应标为概率判断。

取舍

训练轨迹来自多代理模拟,外部工具和新政策泛化未充分刻画;正文表格混用Vanguard名称,按具体机制识别结论。

证据到哪为止

训练轨迹来自多代理模拟,外部工具和新政策泛化未充分刻画;正文表格混用Vanguard名称,按具体机制识别结论。

07.24工程 Evaluating AI Agents: A production blueprint with Strands and AgentCore问题生产代理需要同时评价工具使用、推理和最终交付,接口正常不代表任务正确。结论按模块选择证据与评分方式,再用任务结果汇总,不只统计工具路径。 工具与协议观测与评测文件与工件 92.5
问题P1生产代理需要同时评价工具使用、推理和最终交付,接口正常不代表任务正确。E1
└─设计D1把确定性工具评分、推理judge和输出质量分层,结合人工校准与多次通过口径。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

按模块选择证据与评分方式,再用任务结果汇总,不只统计工具路径。

取舍

95/85/90门槛是案例设置,87%到98%等为团队前后报告,不能归因到单一组件或直接移植为通用标准。

证据到哪为止

95/85/90门槛是案例设置,87%到98%等为团队前后报告,不能归因到单一组件或直接移植为通用标准。

07.24工程 How Outtake built a cyber investigator on Claude问题长时间网络调查需要持久工作空间、灵活工具与外围约束共同支持。结论把始终必须执行的规则放到宿主,把领域判断保留给代理。 记忆与上下文工具与协议状态与恢复 85
问题P1长时间网络调查需要持久工作空间、灵活工具与外围约束共同支持。E1
└─设计D1以文件系统和bash支持开放调查,把必须成立的约束移到harness,工具改进交由独立代理和人审。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把始终必须执行的规则放到宿主,把领域判断保留给代理。

取舍

这是团队工程经验,未给出各组件受控效果;blastbox容许代理被劫持假设,不意味着任意网络内容可信。

证据到哪为止

这是团队工程经验,未给出各组件受控效果;blastbox容许代理被劫持假设,不意味着任意网络内容可信。

07.24论文 OpenSkillRisk: Benchmarking Agent Safety When Using Real-World Risky Third-Party Skills问题公开技能中的风险既有无条件恶意,也有取决于用户授权范围的操作。结论同时保留风险识别、实际执行和安全完成三个维度。 安全与隔离文件与工件身份与权限 92.5
问题P1公开技能中的风险既有无条件恶意,也有取决于用户授权范围的操作。E1
└─设计D1用筛选后的真实技能配合良性任务,在模拟外部服务中分别记录风险执行和风险意识。E2
问题P2防护可能通过过度拒绝牺牲正常任务。E2
└─设计D2单独报告良性技能过度防御,并区分阻断后放弃与安全完成。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

同时保留风险识别、实际执行和安全完成三个维度。

取舍

主动加载防护技能在40个良性技能上的平均过度防御22.50%,被动为1.88%;Fsafe不直接计入良性任务完成,不能替代效用指标。

证据到哪为止

主动加载防护技能在40个良性技能上的平均过度防御22.50%,被动为1.88%;Fsafe不直接计入良性任务完成,不能替代效用指标。

07.24工程 Detecting silent agent failures with Amazon Bedrock AgentCore optimization问题成功结束且无异常的会话也可能跳过前置操作或编造结果。结论先定位具体失败及证据,再把根因假设与修复建议分开。 观测与评测工具与协议运行时与调度 72.5
问题P1成功结束且无异常的会话也可能跳过前置操作或编造结果。E1
└─设计D1在逐会话失败分类后跨会话聚类,剪枝执行图并定位根因及影响范围。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

先定位具体失败及证据,再把根因假设与修复建议分开。

取舍

聚类数量描述分析样本内影响范围;根因是系统推断,增强提示词不等于强制工具执行。

证据到哪为止

聚类数量描述分析样本内影响范围;根因是系统推断,增强提示词不等于强制工具执行。

07.24工程 The Blueprint: How Voicify makes AI-enabled ordering a delight for customers问题电话订餐要在低延迟下处理复杂菜单并准确提交POS订单。结论让确定性订单校验承接最终写入,按对话需要加载菜单细节。 观测与评测安全与隔离身份与权限 72.5
问题P1电话订餐要在低延迟下处理复杂菜单并准确提交POS订单。E1
└─设计D1按对话需要渐进加载菜单,经POS验证再提交订单,并组合预留和按需推理容量。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

让确定性订单校验承接最终写入,按对话需要加载菜单细节。

取舍

25%至30%节省与100%可用是客户案例自报,未给出统一测试窗口;未来主动下单仍是展望。

证据到哪为止

25%至30%节省与100%可用是客户案例自报,未给出统一测试窗口;未来主动下单仍是展望。

07.23工程 How Anthropic secures its AI-native software development lifecycle问题AI扩大代码产量后,安全审查需要扩展吞吐并保留责任和权限边界。结论权限图需要覆盖代理间委托,治理要检查审查循环本身。 身份与权限文件与工件安全与隔离 92.5
问题P1AI扩大代码产量后,安全审查需要扩展吞吐并保留责任和权限边界。E1
└─设计D1结合VM出网边界、CI审查与风险抽样,将工具调用、批准和代理间消息送入审计。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

权限图需要覆盖代理间委托,治理要检查审查循环本身。

取舍

80%代码与16%到54%审查评论均属内部统计,评论比例不等于漏洞召回;不同上下文也不保证模型错误独立。

证据到哪为止

80%代码与16%到54%审查评论均属内部统计,评论比例不等于漏洞召回;不同上下文也不保证模型错误独立。

07.23工程 Agents SDK reduces MCP schema conversion, adds exposure controls for MCP in Think and Code Mode SDK adds direct host APIs问题同一MCP目录反复转换schema和多渠道重复暴露工具浪费上下文与运行成本。结论把目录发现、模型可见性和调用权限分别控制。 工具与协议状态与恢复文件与工件 80
问题P1同一MCP目录反复转换schema和多渠道重复暴露工具浪费上下文与运行成本。E1
└─设计D1缓存活连接的转换schema,单独控制自动工具暴露,并提供Code Mode直接宿主API。E2
问题P2同一工具同时出现在自动列表和Code Mode中。E2
└─设计D2用includeMcpTools关闭自动getAITools暴露,保留发现及直接调用。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把目录发现、模型可见性和调用权限分别控制。

取舍

关闭自动暴露不关闭发现、直调或Code Mode连接;这是发布说明,没有给出性能测量。

证据到哪为止

关闭自动暴露不关闭发现、直调或Code Mode连接;这是发布说明,没有给出性能测量。

07.23工程 Build agentic full-stack apps with Genkit问题全栈对话应用需要统一状态、流式协议、工具暂停与前端续接。结论让UI状态、对话状态和可下载产物有清晰生命周期。 状态与恢复工具与协议文件与工件 87.5
问题P1全栈对话应用需要统一状态、流式协议、工具暂停与前端续接。E1
└─设计D1统一对话和流式接口,按应用需要选择客户端状态或服务端快照,并支持暂停和后台任务。E2
问题P2用户返回的恢复参数可能与暂停调用不符。E2
└─设计D2运行时依据session history核对恢复输入。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

让UI状态、对话状态和可下载产物有清晰生命周期。

取舍

API仍是预览版;请求断开后的继续工作不自动证明进程崩溃后所有副作用恰好一次。

证据到哪为止

API仍是预览版;请求断开后的继续工作不自动证明进程崩溃后所有副作用恰好一次。

07.23论文 Know Your Agent: Reconnaissance-Driven Pentesting of AI Agents问题代理暴露的工具和行为信息会帮助攻击者构造更贴合任务的间接注入。结论把工具元数据和错误消息也纳入攻击面分析。 工具与协议身份与权限安全与隔离 92.5
问题P1代理暴露的工具和行为信息会帮助攻击者构造更贴合任务的间接注入。E1
└─设计D1以结构化目标资料库记录侦察信息,根据战术先决条件选择下一次探测或尝试。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把工具元数据和错误消息也纳入攻击面分析。

取舍

21.9%是该设置总成功率;任务合理性解释属于作者归因,不能从危害分组直接证明模型内部拒绝机制。

证据到哪为止

21.9%是该设置总成功率;任务合理性解释属于作者归因,不能从危害分组直接证明模型内部拒绝机制。

07.23工程 How KTern.AI built agentic AI for SAP on Amazon Bedrock AgentCore问题SAP转换项目跨会话跨工具,要求项目记忆、客户隔离与过程可观测。结论先设计项目记忆和权限模型,再组合领域代理。 工具与协议身份与权限记忆与上下文 72.5
问题P1SAP转换项目跨会话跨工具,要求项目记忆、客户隔离与过程可观测。E1
└─设计D1以SAP领域配置组合专向代理,复用AgentCore运行、项目记忆、身份和工具网关。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

先设计项目记忆和权限模型,再组合领域代理。

取舍

部署从周到小时是团队经验,托管服务配置不替代具体SAP权限与数据范围设计。

证据到哪为止

部署从周到小时是团队经验,托管服务配置不替代具体SAP权限与数据范围设计。

07.23论文 When HTTP 402 Meets the Blockchain: Risks on Emerging x402 Payments问题x402中介在HTTP验证与链上结算之间承担付款授权和费用边界。结论区分证明有效、结算成功、资源放行和赞助费用四个状态。 身份与权限观测与评测安全与隔离 100
问题P1x402中介在HTTP验证与链上结算之间承担付款授权和费用边界。E1
└─设计D1按八条支付规则发现适用能力,对应核对HTTP验证结果与链上实际收据。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

区分证明有效、结算成功、资源放行和赞助费用四个状态。

取舍

15个服务均违反规则不等于都遭到资产盗取;放行发生在verify还是settle影响危害,统计窗口与实现版本限制适用范围。

证据到哪为止

15个服务均违反规则不等于都遭到资产盗取;放行发生在verify还是settle影响危害,统计窗口与实现版本限制适用范围。

07.23论文 Twin Agent: Context Residual Compression for Privilege Separated Agents问题有权限的代理直接阅读不可信材料容易把注入转成实际操作。结论记录每种实例中真正隔离的输入区域及仍可传递的信息。 身份与权限安全与隔离观测与评测 92.5
问题P1有权限的代理直接阅读不可信材料容易把注入转成实际操作。E1
└─设计D1Explore读取不可信区域,Safe保留权限和权威轨迹,两者仅传递限长且经过检测的残差信息。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

记录每种实例中真正隔离的输入区域及仍可传递的信息。

取舍

安全依赖短注入难以同时绕过检测器和模型的经验假设,原文明确没有形式化保证;SWE设置只隔离issue而非所有仓库内容。

证据到哪为止

安全依赖短注入难以同时绕过检测器和模型的经验假设,原文明确没有形式化保证;SWE设置只隔离issue而非所有仓库内容。

07.23工程 Building Agents that Act on Your Behalf with Toolboxes in Foundry问题多租户工具调用要传递最终用户身份,避免各代理重复实现凭据交换。结论把身份交换、资源授权与操作确认分别表达。 工具与协议文件与工件身份与权限 72.5
问题P1多租户工具调用要传递最终用户身份,避免各代理重复实现凭据交换。E1
└─设计D1将OAuth连接配置和版本化toolbox交给平台,代理通过单MCP端点使用用户委托身份。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把身份交换、资源授权与操作确认分别表达。

取舍

示例require_approval为never,OBO身份传递本身不等于逐次用户审批;输入输出护栏不是注入绝对不可能的证明。

证据到哪为止

示例require_approval为never,OBO身份传递本身不等于逐次用户审批;输入输出护栏不是注入绝对不可能的证明。

07.23工程 Agents can respond to MCP elicitation requests问题MCP调用中可能需要用户提供表单信息或完成站外授权。结论把用户输入作为明确的协议事件并保留请求来源。 工具与协议状态与恢复身份与权限 80
问题P1MCP调用中可能需要用户提供表单信息或完成站外授权。E1
└─设计D1把MCP表单或URL请求转给用户,接收同意、拒绝或取消,并恢复原调用。E2
问题P2休眠后原处理回调不再驻留内存。E2
└─设计D2持久保存宣告模式,在onStart重新绑定对应处理函数。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把用户输入作为明确的协议事件并保留请求来源。

取舍

SDK提供转发机制,具体UI仍需实现;URL打开需要用户同意,不能由代理自行代答敏感授权。

证据到哪为止

SDK提供转发机制,具体UI仍需实现;URL打开需要用户同意,不能由代理自行代答敏感授权。

07.23工程 Build specialized agent workflows for your business with Amazon Quick and NVIDIA NeMo Agent Toolkit问题企业聊天入口需要调用有结构的供应链分析流程并返回证据包。结论区分演示数据流和生产必需控制,不把待加控制写成已交付。 状态与恢复工具与协议观测与评测 85
问题P1企业聊天入口需要调用有结构的供应链分析流程并返回证据包。E1
└─设计D1由Quick经Gateway和Lambda调用NeMo,顺序组织采购、库存、政策与建议函数并返回证据包。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

区分演示数据流和生产必需控制,不把待加控制写成已交付。

取舍

原文明示这是demo,Gateway的AuthorizerType为NONE,自定义header不构成授权;生产身份与写入审批属于建议。

证据到哪为止

原文明示这是demo,Gateway的AuthorizerType为NONE,自定义header不构成授权;生产身份与写入审批属于建议。

07.23工程 Agents SDK v0.17.0:后台子 Agent 必须是持久运行实体问题后台子任务不能依赖发起对话的连接和单个进程存活。结论把任务运行、进度信号和最终副作用分别追踪。 状态与恢复文件与工件身份与权限 92.5
问题P1后台子任务不能依赖发起对话的连接和单个进程存活。E1
└─设计D1把后台子任务保存为耐久句柄,提供预算、取消和milestone,并统一turn入场路径。E2
问题P2嵌套阻塞调用可能造成死锁。E2
└─设计D2通过统一runTurn入场路径拒绝嵌套阻塞式请求。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把任务运行、进度信号和最终副作用分别追踪。

取舍

完成通知限定happy path的exactly-once;修补转录不代表撤销外部操作,server actions仍是实验API。

证据到哪为止

完成通知限定happy path的exactly-once;修补转录不代表撤销外部操作,server actions仍是实验API。

07.23工程 Secure Agent Workspace:端点只展示,Agent 在受管边界内执行问题企业长期代理需要统一管理执行环境、身份、出网和工具边界。结论按外部访问、内部执行、凭据和审计分别列出责任方。 身份与权限文件与工件工具与协议 85
问题P1企业长期代理需要统一管理执行环境、身份、出网和工具边界。E1
└─设计D1把本地端点作为交互层,代理运行于每用户受管VM,并叠加出网、签名策略和凭据代理。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

按外部访问、内部执行、凭据和审计分别列出责任方。

取舍

这是参考设计的分阶段要求,不是已有部署的覆盖证明或安全测量;VM隔离与工具授权承担不同职责。

证据到哪为止

这是参考设计的分阶段要求,不是已有部署的覆盖证明或安全测量;VM隔离与工具授权承担不同职责。

07.23论文 Arca:在等待边界保存“余下程序”,而不是冻结整个进程问题短任务等待I/O时仍占运行资源,传统进程快照成本妨碍细粒度调度。结论借鉴等待时显式保存续体的边界,而不是直接替换通用运行时。 状态与恢复运行时与调度文件与工件 92.5
问题P1短任务等待I/O时仍占运行资源,传统进程快照成本妨碍细粒度调度。E1
└─设计D1由内核捕获可序列化continuation,将I/O表述为effect与回调后恢复执行。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

借鉴等待时显式保存续体的边界,而不是直接替换通用运行时。

取舍

研究OS不支持共享内存线程,I/O与计算高度交织和大状态守护进程不适配;不能把微秒数据等同于网络迁移总耗时。

证据到哪为止

研究OS不支持共享内存线程,I/O与计算高度交织和大状态守护进程不适配;不能把微秒数据等同于网络迁移总耗时。

07.23论文 StriaTrace:常开骨架 trace,异常时才提高细节问题在线推理尾延迟异常短暂,持续重型profiling会扰动生产。结论先用低成本信号定位异常,再在关键路径收集细节。 文件与工件工具与协议运行时与调度 100
问题P1在线推理尾延迟异常短暂,持续重型profiling会扰动生产。E1
└─设计D1常态只追踪同步点与关键路径,以token量拟合尾延迟上界,异常时补充细粒度采集。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

先用低成本信号定位异常,再在关键路径收集细节。

取舍

该百分比是追踪开销对比,不是推理总体延迟下降;统计上界和关联诊断不能单独证明故障因果。

证据到哪为止

该百分比是追踪开销对比,不是推理总体延迟下降;统计上界和关联诊断不能单独证明故障因果。

07.23工程 AWS Support Companion:每个 Agent 依赖都要有超时、降级与刷新契约问题支持工程师需要联合文档、工单和服务状态处理故障。结论把可降级上下文和必须成功的授权步骤分开。 工具与协议运行时与调度记忆与上下文 85
问题P1支持工程师需要联合文档、工单和服务状态处理故障。E1
└─设计D1并行初始化MCP,记忆读取超时后降级,异步保存对话,并在Gateway token过期前刷新。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把可降级上下文和必须成功的授权步骤分开。

取舍

降级会失去上下文,异步保存不保证突然崩溃时不丢记录;内容护栏与IAM权限不是同一种控制。

证据到哪为止

降级会失去上下文,异步保存不保证突然崩溃时不丢记录;内容护栏与IAM权限不是同一种控制。

07.23论文 Murakkab:让 SLO 成为 Agent 工作流运行时的输入问题代理工作流逻辑与模型硬件配置绑定,阻碍质量、成本和延迟的跨层选择。结论把任务结构与执行配置分离,同时保留每档质量约束。 状态与恢复运行时与调度文件与工件 92.5
问题P1代理工作流逻辑与模型硬件配置绑定,阻碍质量、成本和延迟的跨层选择。E1
└─设计D1分离声明式DAG和执行配置,用性能画像选择模型、资源及运行时组合以满足SLO。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把任务结构与执行配置分离,同时保留每档质量约束。

取舍

最高4.3倍节省来自指定配置与SLO组合,放宽准确率会改变收益;代理工作流到达分布是近似而非实际生产trace。

证据到哪为止

最高4.3倍节省来自指定配置与SLO组合,放宽准确率会改变收益;代理工作流到达分布是近似而非实际生产trace。

07.23论文 libDSE:持久执行可以投机,但外部可见性不能投机问题分布式持久执行中的同步落盘放大端到端延迟。结论把可回滚的内部状态与不可撤销的外部承诺分开。 状态与恢复文件与工件工具与协议 92.5
问题P1分布式持久执行中的同步落盘放大端到端延迟。E1
└─设计D1允许DSE参与者内部推测执行,跟踪依赖并恢复状态,外部输出通过持久化Barrier。E2
问题P2外部支付等服务无法撤销推测状态。E2
└─设计D2在非DSE服务之前调用Barrier,等待所有上游依赖持久化。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把可回滚的内部状态与不可撤销的外部承诺分开。

取舍

所有推测参与者需适配StateObject,失败可能保守回滚更多工作;不可撤销外部接口仍需等待,不能随意推测执行。

证据到哪为止

所有推测参与者需适配StateObject,失败可能保守回滚更多工作;不可撤销外部接口仍需等待,不能随意推测执行。

07.23工程 Cloud Run sandboxes:工具执行默认拿不到凭证、网络和持久写权限问题应用要运行模型生成代码,同时隔离宿主凭据、网络和写入。结论按读取、写入、出网和产物传递分别定义沙箱能力。 身份与权限文件与工件安全与隔离 85
问题P1应用要运行模型生成代码,同时隔离宿主凭据、网络和写入。E1
└─设计D1在Cloud Run中提供凭据隔离、默认拒绝出网及临时写层,以显式文件交换交付结果。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

按读取、写入、出网和产物传递分别定义沙箱能力。

取舍

只读仍能读取容器中可见文件,镜像内敏感文件不应被当成自动隐藏;结束丢弃临时写入不等于撤销已获准外部请求。

证据到哪为止

只读仍能读取容器中可见文件,镜像内敏感文件不应被当成自动隐藏;结束丢弃临时写入不等于撤销已获准外部请求。

07.23工程 Web Bot Authentication:共享出口 IP 不能充当 Agent 身份问题网站需要识别合法机器人操作者,避免把所有AI流量按伪装客户端处理。结论把操作者身份标签作为策略输入,而非操作许可本身。 身份与权限安全与隔离工具与协议 85
问题P1网站需要识别合法机器人操作者,避免把所有AI流量按伪装客户端处理。E1
└─设计D1从签名目录取得公钥验证HTTP消息,把验证结果和操作者信息标为WAF策略标签。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把操作者身份标签作为策略输入,而非操作许可本身。

取舍

身份签名证明来源不证明任务得到最终用户授权,也不表示可以绕过其他WAF和业务策略。

证据到哪为止

身份签名证明来源不证明任务得到最终用户授权,也不表示可以绕过其他WAF和业务策略。

07.23工程 Structured memory filtering with metadata in AgentCore Memory:先确定边界,再做相似度问题仅语义相似度难以准确检索指定时间、部门或客户范围的记忆。结论已知事实用结构字段传递,不让模型重新猜租户或部门。 记忆与上下文安全与隔离身份与权限 92.5
问题P1仅语义相似度难以准确检索指定时间、部门或客户范围的记忆。E1
└─设计D1确定性元数据原样传播并隔离提取合并,主题等字段可由模型推断,检索组合结构与语义条件。E2
问题P2模型重猜已知部门会造成错误分组和合并。E2
└─设计D2将这些键设为STRICTLY_CONSISTENT,按确定性值隔离提取与合并。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

已知事实用结构字段传递,不让模型重新猜租户或部门。

取舍

缺失确定性字段仍会处理,过滤条件与namespace必须由可信应用设置;时间过滤改进没有给出可泛化数值。

证据到哪为止

缺失确定性字段仍会处理,过滤条件与namespace必须由可信应用设置;时间过滤改进没有给出可泛化数值。

07.23工程 SeaweedFS:过期客户端不能靠“最后写入者获胜”问题不同后端缺少统一条件写能力,分布式锁又增加成本。结论把稳态单对象串行化与故障切换一致性分开陈述。 文件与工件 85
问题P1不同后端缺少统一条件写能力,分布式锁又增加成本。E1
└─设计D1把条件变更路由到对象owner,在本地路径锁内检查前提并应用变更。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把稳态单对象串行化与故障切换一致性分开陈述。

取舍

正文同时声称所有写入归同owner和无条件写不路由锁定,不能据此断言所有混合写入都线性化;成员切换下也未给出fencing证明。

证据到哪为止

正文同时声称所有写入归同owner和无条件写不路由锁定,不能据此断言所有混合写入都线性化;成员切换下也未给出fencing证明。

07.23工程 W3C:永久链接应标识资源,临时 URL 只负责传输问题Web代理协议快速增加,身份、描述、发现和交互能力存在重叠及缺口。结论按能力维度比较协议,区分研究提案、已定义字段与尚未完成章节。 文件与工件身份与权限工具与协议 67.5
问题P1Web代理协议快速增加,身份、描述、发现和交互能力存在重叠及缺口。E1
└─设计D1按统一资源空间与超媒体架构比较代理身份、profile、发现和交互协议。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

按能力维度比较协议,区分研究提案、已定义字段与尚未完成章节。

取舍

政策、认证与总结部分仍有占位文字,不能写成已完成统一安全规范;通用表示也增加转换成本。

证据到哪为止

政策、认证与总结部分仍有占位文字,不能写成已完成统一安全规范;通用表示也增加转换成本。

07.23工程 AWS S3:先给每个对象版本一个身份证,再谈缓存问题存量S3启用版本传播期间的短暂404可能被CDN缓存放大。结论把配置传播、数据可见性和边缘负缓存分别考虑。 文件与工件状态与恢复身份与权限 92.5
问题P1存量S3启用版本传播期间的短暂404可能被CDN缓存放大。E1
└─设计D1存量桶先进入Suspended并等待传播,观察版本头后再转Enabled,降低CDN负缓存风险。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

把配置传播、数据可见性和边缘负缓存分别考虑。

取舍

原文说明没有直接确认全局传播完成的API;单对象版本头是操作信号,不是全局证明,版本存储还需生命周期控制。

证据到哪为止

原文说明没有直接确认全局传播完成的API;单对象版本头是操作信号,不是全局证明,版本存储还需生命周期控制。

07.23工程 APNIC:用通知减少延迟,用对账保证最终正确问题数据副本规模增长时,全量传输和高频轮询会放大成本。结论先确定数据权威、变化粒度与允许陈旧时间,再选同步机制。 文件与工件状态与恢复观测与评测 92.5
问题P1数据副本规模增长时,全量传输和高频轮询会放大成本。E1
└─设计D1按权威关系和变化粒度选择块差分、快照增量或Merkle对账,并比较推拉及混合同步。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

先确定数据权威、变化粒度与允许陈旧时间,再选同步机制。

取舍

定位差异的树形效率不等于传输任意变化量都为对数;多写者还涉及冲突和权威来源。

证据到哪为止

定位差异的树形效率不等于传输任意变化量都为对数;多写者还涉及冲突和权威来源。

07.23工程 AG-UI:事件流是失效通知,不是文件内容真相源问题不同代理框架的流式输出使前端反复适配,工具执行还要与用户交互同步。结论让协议承担事件与状态传递,业务层承担授权和内容校验。 文件与工件工具与协议状态与恢复 75
问题P1不同代理框架的流式输出使前端反复适配,工具执行还要与用户交互同步。E1
└─设计D1用AG-UI统一事件和状态传输,由前端注册组件,并以工具结果恢复用户交互。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

让协议承担事件与状态传递,业务层承担授权和内容校验。

取舍

样例是受控组件而非任意生成代码;UI回传和状态流并不替代后端权限或并发冲突解决。

证据到哪为止

样例是受控组件而非任意生成代码;UI回传和状态流并不替代后端权限或并发冲突解决。

07.23论文 RECEIPT:不要相信 Agent 的“我完成了”问题白盒安全代理可能利用探索权限制造浏览器执行信号而没有真实攻击路径。结论证据有效性同时依赖执行信号、角色与环境边界。 文件与工件观测与评测安全与隔离 100
问题P1白盒安全代理可能利用探索权限制造浏览器执行信号而没有真实攻击路径。E1
└─设计D1将探索与干净验证环境分离,限定攻击者和受害者接口,并把浏览器信号绑定到裁决。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

证据有效性同时依赖执行信号、角色与环境边界。

取舍

角色定义与初始快照错误仍可能产生假阳性,当前仅一种模型配置和Chromium;部署WAF影响单独判断。

证据到哪为止

角色定义与初始快照错误仍可能产生假阳性,当前仅一种模型配置和Chromium;部署WAF影响单独判断。

07.23工程 OBO:让工具知道“谁委托谁做了什么”问题多租户代理调用下游API时需要保持用户主体和实际权限。结论审查交换后令牌实际含义及资源端判定,不能只看OBO标签。 身份与权限工具与协议运行时与调度 92.5
问题P1多租户代理调用下游API时需要保持用户主体和实际权限。E1
└─设计D1以OBO交换保留用户身份,由资源服务验证有效权限声明,并按tenant与sub限定数据范围。E2
问题P2交换后的scope可能未按用户角色裁剪。E2
└─设计D2文中Okta方案在令牌加入authorized_scopes,由资源服务据此判定写权限。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

审查交换后令牌实际含义及资源端判定,不能只看OBO标签。

取舍

该scope行为是文中Okta配置条件,不能外推所有OAuth服务;传播身份后仍由资源服务实施授权。

证据到哪为止

该scope行为是文中Okta配置条件,不能外推所有OAuth服务;传播身份后仍由资源服务实施授权。

07.23工程 WAF + PrivateLink:安全入口不能留下可绕过的第二扇门问题给AgentCore加WAF入口后,公开直连端点可能绕过检查。结论入口控制要覆盖所有可达路径,并把例外条件写清。 安全与隔离运行时与调度工具与协议 92.5
问题P1给AgentCore加WAF入口后,公开直连端点可能绕过检查。E1
└─设计D1用WAF、ALB和PrivateLink建立入口,再用资源策略拒绝绕开指定端点的直接请求。E2
问题P2有效凭据仍可直接访问公网端点绕过WAF。E2
└─设计D2用SourceVpce条件和显式Deny封闭直连,同时保留列明的服务调用例外。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

入口控制要覆盖所有可达路径,并把例外条件写清。

取舍

策略保留ViaAWSService例外,端点IP重建可变化;50–200毫秒是文中Lambda额外延迟范围,网络WAF不检验代理语义正确。

证据到哪为止

策略保留ViaAWSService例外,端点IP重建可变化;50–200毫秒是文中Lambda额外延迟范围,网络WAF不检验代理语义正确。

07.23工程 Microsoft Foundry:工具目录和执行目录要分开问题平台把工具发现、运行调度、配置优化和记忆生命周期整合到托管代理。结论拆分各功能的交付状态与责任,避免把路线图合成现有能力。 工具与协议记忆与上下文运行时与调度 75
问题P1平台把工具发现、运行调度、配置优化和记忆生命周期整合到托管代理。E1
└─设计D1以Tool Search按需发现工具,用Routines管理运行,并提供配置优化与记忆TTL等独立能力。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

拆分各功能的交付状态与责任,避免把路线图合成现有能力。

取舍

Optimizer文中为私有预览,预期公测不是已发布事实;TTL字段及默认值有版本特例,榜单复合分数不等于全场景可靠。

证据到哪为止

Optimizer文中为私有预览,预期公测不是已发布事实;TTL字段及默认值有版本特例,榜单复合分数不等于全场景可靠。

07.23工程 Google Cloud:先定义数据驻留和容量,再选运行时问题企业调用Claude需要同时考虑容量、地域、访问控制与应用运行。结论分别选择模型入口、数据地域和代理执行环境。 运行时与调度观测与评测状态与恢复 72.5
问题P1企业调用Claude需要同时考虑容量、地域、访问控制与应用运行。E1
└─设计D1分别选择global、regional或multi-region端点、推理容量及代理运行环境,接入IAM与网络控制。E2
问题价值
方法贡献
证据匹配
可迁移
核心结论有据新颖读过原文范围来源时间窗

怎么用

分别选择模型入口、数据地域和代理执行环境。

取舍

缓存最高节省针对可复用前缀而非所有请求;全球路由与地域约束需要选择,平台合规不自动覆盖整个应用。

证据到哪为止

缓存最高节省针对可复用前缀而非所有请求;全球路由与地域约束需要选择,平台合规不自动覆盖整个应用。

没有符合的。按 Esc 清空。