来源:arXiv cs.AI / cs.LG / cs.CL · 精选 5 篇(论文日期 2026-07-23,滞后执行日期 2 天)
今日精选
1. Agentic Context Management:将 Agent 记忆与成本视为生命周期和架构问题
- 原标题: Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems
- 作者/机构: Gaurav Dadhich(Maximem AI, San Francisco Bay Area)| arXiv
- 核心贡献: ① 指出生产环境中 AI Agent 的失败主因不是推理能力不足,而是上下文管理失当——Agent 在累积的对话历史、巨型 Prompt、工具定义和返回结果中「溺水」,Token 成本每轮递增。② 提出 Agentic Context Management(ACM)学科框架,将上下文管理拆解为五个原语:架构设计(architecting)、摄入(ingesting)、范围界定(scoping)、预判(anticipating)、压缩与整合(compacting & consolidation)。③ 从经济学角度证明:朴素上下文累积使 Token 成本平方增长;粗粒度摘要能购买线性成本但付出准确性悬崖的代价;只有经验证的压缩策略能实现线性成本同时保持信息保真度。④ 基于 Maximem Synap 参考实现,在 LongMemEval 上达 92%、LoCoMo 上达 93.2%。代码与评估框架已开源(github.com/maximem-ai)。
- 工程关联: 对所有部署长对话/多轮 Agent 的团队是必读级参考。五个原语的拆解可以直接指导 Agent 架构设计和中间件选型——特别是「预判」和「压缩与整合」两个原语,在工程实践中鲜有系统化处理。Token 成本从平方到线性的经济论证,对面向用户产品的成本控制有直接决策价值。
- 价值点: 业界首次将 Agent 上下文管理提升为独立学科,从业界落地视角(而非学术实验)出发。五个原语的工程化框架 + 成本数学论证 + 开源参考实现,三位一体,可直接指导生产系统设计。23 页长文 + 6 图 4 表,细节扎实。
2. TTEL:通过错误定位实现测试时推理扩展
- 原标题: Test-Time Scaling via Error Localization
- 作者/机构: Rajiv Shailesh Chitale, Rahul Madhavan, Taneesh Gupta, Deepanway Ghosal, Aravindan Raghuveer(Google DeepMind)| arXiv
- 核心贡献: ① 指出当前测试时扩展方法(独立采样、多轮顺序修正)缺乏 Token 级信用分配,导致有效推理前缀被反复丢弃、计算效率低下。② 提出 TTEL(Test-Time Scaling via Error Localization)算法:通过比较有信息反馈和无上下文基线下的条件概率,在 Token 级别精确定位错误发生位置,截断错误之后的轨迹并从截断点分支新生成路径,最大化复用有效前缀。③ 在 LiveCodeBench 上使用 Qwen3-8B 达到 pass@64 = 71.0%,生成 Token 约为独立采样的一半(360.4k vs 735.0k);在 AIME-2025 和 HMMT-2025 数学基准上也全面超越竞争基线。④ 核心洞察:TTEL 在所有测试的推理领域建立了严格占优的帕累托前沿(pass@k vs 生成 Token 成本)。
- 工程关联: 对推理密集型 LLM 应用(代码生成、数学求解、逻辑推理)的部署优化有直接价值。TTEL 的核心思路——用条件概率差异定位错误、只从错误点重新生成——可以集成到现有的推理框架中,在不牺牲准确率的前提下大幅降低 Token 消耗。对按 Token 计费的 API 调用场景,50% 的 Token 节省意味着直接的成本减半。
- 价值点: Google DeepMind 出品。测试时扩展领域的思路突破——从「多次采样取最佳」或「全量修正」进化为「精确定位错误→只修正错误部分」。帕累托占优(同时提升准确率和降低成本)的论证方式非常严谨,27 页附录细节充分。
3. OpenForgeRL:在任意环境中端到端训练 Harness 原生 Agent
- 原标题: OpenForgeRL: Train Harness-native Agents in Any Environment
- 作者/机构: Xiao Yu, Baolin Peng, Ruize Xu, Hao Zou, Qianhui Wu, Hao Cheng, Wenlin Yao, Nikhil Singh, Zhou Yu, Jianfeng Gao(Microsoft Research)| arXiv
- 核心贡献: ① 指出现代 Agent 依赖复杂推理 Harness(Claude Code、Codex、OpenClaw 等)驱动多轮推理和工具使用,但现有的开源 SFT/RL 训练栈无法原生表达有状态、多进程的 Harness 推理,导致 Agent 无法端到端训练。② 提出 OpenForgeRL 开源框架,通过轻量级代理(拦截 Harness 的模型调用并记录为 RL 训练数据)和 Kubernetes 编排器(每个 rollout 运行在独立远端容器中),解耦训练与推理,实现「在真实 Harness 和环境中训练 Agent」。③ OpenForgeClaw 在 ClawEval 上达到 31.7 pass³ / 55.9 pass@3,OpenForgeGUI 在 OSWorld-Verified 上达到 37.7,接近或超越数倍规模的开源基线。④ 分析发现:不同 Harness 的学习难度差异显著;RL 训练能改善 Agent 的可靠性行为(自验证、工具覆盖、多步计划执行),但错误恢复能力仍有待提升。
- 工程关联: 对自研 Agent 产品的团队提供了从「手工调 Prompt」到「端到端 RL 训练」的工程范式升级路径。框架设计精巧——代理 + K8s 编排的解耦方式可以直接复用现有 RL 训练基础设施,不需要为每种 Harness 重写训练代码。仅用数百到数千条任务数据即可完成训练,数据效率高。
- 价值点: Microsoft Research 出品,Jianfeng Gao(微软技术院士)领衔。填补了「真实 Harness 中的 Agent RL 训练」的关键工程空白——目前业界大量 Agent 产品依赖精心设计的 Prompt,而 OpenForgeRL 证明了通过 RL 训练可以系统地改善 Agent 的可靠性和工具使用能力。跨 Claude Code/Codex/GUI Agent 多种 Harness 的验证增强了通用性。
4. Euclid-MCP:通过 Prolog 为 LLM 提供确定性逻辑推理的 MCP 服务器
- 原标题: Euclid-MCP: A Model Context Protocol Server for Deterministic Logical Reasoning via Prolog
- 作者/机构: Bartolomeo Bogliolo(独立研究者)| arXiv
- 核心贡献: ① 指出 LLM 在多步逻辑推理中不可靠——尤其在安全关键和合规敏感领域——而现有神经符号集成多为定制化方案,缺乏标准化接口。② 提出 Euclid-MCP,一个基于 MCP 协议的开源服务器,通过 SWI-Prolog 提供确定性逻辑推理。核心创新是 Euclid-IR(引擎无关的 Horn 子句逻辑中间表示),人类可读、LLM 易生成、可编译到 Prolog 等多种后端。③ 实现 translate-run-inspect-repair 闭环:LLM 将自然语言规则翻译为 Euclid-IR → Prolog 执行推理 → 返回证明轨迹供检查 → 如有错误则修复。④ 在 IT 安全合规场景中验证:小规模知识库上 LLM 单独推理尚可,大规模问题上 LLM 系统性幻觉,而 Euclid-MCP 给出精确答案且延迟更低。⑤ 提出重要论点:语义 RAG 从根本上不适合规则执行场景,需要 Euclid-MCP 这样的确定性推理基底。
- 工程关联: 对合规审核、安全策略验证、业务规则引擎等需要严格逻辑推理的场景有直接应用价值。MCP 标准化接口意味着可以即插即用到任何支持 MCP 的 Agent 框架中。translate-run-inspect-repair 的闭环设计适合生产环境的可审计推理需求。
- 价值点: 精准打击了 LLM 的致命弱点——逻辑推理中的幻觉。提出「语义 RAG 不适合规则执行」的论点极具工程洞察。MCP 标准化 + Prolog 确定性的组合简洁优雅,且完全开源,可以作为 Agent 推理基础设施的可信组件直接集成。
5. MemTools:面向可互操作 Agent 记忆的统一研究框架
- 原标题: MemTools: A Unified Research Framework for Interoperable Agent Memory
- 作者/机构: Chengfeng Zhao, Jinhui Chen, Sirui Liang, Shizhu He, Yequan Wang, Jun Zhao, Kang Liu(中国科学院自动化研究所)| arXiv
- 核心贡献: ① 指出 Agent 记忆系统存在普遍的架构碎片化——现有实现将记忆生命周期的不同阶段耦合、将评估逻辑与特定数据集绑定、对异构记忆类型支持有限,阻碍了系统化研究。② 提出 MemTools:通过声明式数据契约标准化记忆生命周期,实现跨系统的组件可互换组装;将基准数据集与执行协议正交分离,支持受控评估;提供统一计算接口协调符号、神经和多模态记忆表示。③ 在跨系统组件集成、评估协议重配置、异构记忆协调三项实验中验证了 MemTools 能够系统性地隔离和分析记忆设计变量。
- 工程关联: 对 Agent 记忆系统的学术研究和工程选型都有参考价值。如果团队在评估不同记忆方案(如向量检索 vs 图谱存储 vs 摘要压缩),MemTools 提供的声明式契约和可互换组件设计可以帮助进行受控对比实验。声明式数据契约的思路也可以指导内部记忆中间件的接口设计。
- 价值点: 中科院自动化所出品。在 Agent 记忆这一关键但碎片化的领域提供了难得的统一框架,解决了「不同论文的记忆方案无法公平对比」的痛点。强调互操作性和正交分离的设计哲学值得 Agent 平台开发者借鉴。
今日关键词
Agent 上下文管理 · Agentic Context Management · 测试时推理扩展 · Test-Time Scaling · 错误定位 · Error Localization · Harness 原生训练 · Harness-Native RL Training · 神经符号推理 · Neuro-Symbolic Reasoning · MCP 服务器 · Model Context Protocol · Agent 记忆框架 · Agent Memory Framework · Prolog 确定性推理 · Deterministic Prolog Reasoning