来源:arXiv cs.AI / cs.LG / cs.CL · 精选 5 篇(论文日期 2026-07-23,滞后执行日期 4 天)

今日精选

1. OpenForgeRL:在任意环境中训练 Harness 原生 Agent

  • 原标题: OpenForgeRL: Train Harness-native Agents in Any Environment
  • 作者/机构: Xiao Yu, Baolin Peng, Ruize Xu, Hao Zou, Qianhui Wu, Hao Cheng, Wenlin Yao, Nikhil Singh, Zhou Yu, Jianfeng Gao(Microsoft Research)| arXiv
  • 核心贡献: ① 解决当前 Agent 训练的核心矛盾——Claude Code、Codex 等推理 Harness 功能强大但其复杂的多进程、有状态架构使得端到端 RL 训练无法原生支持。② 提出 OpenForgeRL 开源框架:通过轻量级代理(Proxy)接管 Harness 的模型调用并记录为训练数据,配合 Kubernetes 编排器在独立容器中运行每个 Rollout,实现训练与推理的解耦。③ 在 ClawEval 上达到 55.9 pass@3,OSWorld-Verified 上达到 37.7,在 GUI 场景下匹配或超越数倍参数量的模型。
  • 工程关联: 对 Agent 训练基础设施建设和 RLHF/RLAIF 管线设计有直接参考价值。核心创新「训练-推理分离 + K8s 容器化 Rollout」的架构模式可直接迁移到企业级 Agent 训练平台。开源框架 + 多 Harness(ZeroClaw/OpenClaw/Codex)对比实验,工程可复现性高。
  • 价值点: 微软研究院出品。首次系统性解决了「如何在真实推理 Harness 中训练 Agent」这一工程难题,将 Agent 训练从理想化的模拟环境推向真实部署环境。开源 + 多基准验证 + 架构分析,是该方向的里程碑工作。

2. MemTools:面向 Agent 记忆系统的统一互操作研究框架

  • 原标题: MemTools: A Unified Research Framework for Interoperable Agent Memory
  • 作者/机构: Chengfeng Zhao, Jinhui Chen, Sirui Liang, Shizhu He, Yequan Wang(中国人民大学)| arXiv
  • 核心贡献: ① 识别 Agent 记忆系统的架构碎片化问题——现有实现将记忆生命周期的不同阶段耦合、评估逻辑与特定数据集纠缠、对异构记忆类型支持有限。② 提出 MemTools 互操作框架:将记忆系统解耦为标准化阶段(编码/存储/检索/更新),支持不同类型记忆(短期/长期/情景/语义)的统一接口和可组合实验。③ 提供跨框架的评估协议,使不同记忆架构可在相同条件下公平比较。
  • 工程关联: 对构建长对话 Agent、个人助理、代码助手等需要持久记忆的 AI 系统有直接架构参考价值。标准化接口设计可指导团队设计自己的记忆模块,避免重复造轮子。评估协议可直接用于对比不同记忆方案的效果。
  • 价值点: 填补了「Agent 记忆系统缺乏统一研究框架」的空白。人大团队出品,将记忆从黑盒实现提升为可组合、可评估、可互操作的研究对象。对正在构建 Agent 记忆模块的工程团队有直接的架构设计指导意义。

3. Agentic 上下文管理:将 Agent 记忆与成本问题视为生命周期与架构问题

  • 原标题: Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems
  • 作者/机构: Gaurav Dadhich(Maximem AI)| arXiv
  • 核心贡献: ① 提出生产环境 Agent 失败的根本原因并非推理能力不足,而是无法管理推理上下文——对话历史、大型 Prompt、工具定义、膨胀的工具输出在每轮对话中持续累积,导致召回缺失和 Token 成本失控。② 将上下文管理重新定义为生命周期和架构问题(而非单纯的 Prompt 压缩问题),提出包含上下文生命周期管理、架构级优化、成本感知路由的系统性方案。③ 提供评估框架和实验数据(github.com/maximem-ai),验证方案在多轮对话和复杂工具调用场景下的有效性。
  • 工程关联: 对生产环境 Agent 系统的成本和可靠性优化有直接价值。核心洞察——「Agent 被自己的历史淹没」——精准命中了长对话 Agent 的工程痛点。生命周期管理思路可指导团队设计上下文分层策略(哪些保留、哪些归档、哪些压缩)。
  • 价值点: 来自一线 Agent 工程实践的问题定义和解决方案。不是学术性的 Prompt 压缩算法,而是从架构层面系统性解决 Agent 的上下文膨胀问题。对正在部署长对话 Agent 的团队有即时的工程参考价值。

4. Euclid-MCP:基于 Prolog 的确定性逻辑推理 MCP 服务器

  • 原标题: Euclid-MCP: A Model Context Protocol Server for Deterministic Logical Reasoning via Prolog
  • 作者/机构: Bartolomeo Bogliolo | arXiv
  • 核心贡献: ① 解决 LLM 在多步逻辑推理中的不可靠问题——尤其在安全关键或合规敏感领域,神经网络模型无法保证逻辑正确性。② 提出 Euclid-MCP:将 Prolog 符号推理引擎封装为 MCP(Model Context Protocol)服务器,使 LLM 可通过标准化工具接口调用确定性逻辑推理能力,实现神经-符号混合架构。③ 标准化接口设计使该方案可被任何支持 MCP 的 Agent 框架(Claude、GPT 等)即插即用,无需定制化集成。
  • 工程关联: 对需要逻辑保证的 Agent 应用(合规审查、形式化验证、规则引擎)有直接价值。MCP 标准化接口设计使其可无缝集成到现有 Agent 工具链中。神经-符号混合架构是提升 LLM 可靠性的实用路径。
  • 价值点: 将经典的符号推理(Prolog)与现代 MCP 协议结合,为 LLM 提供了「确定性逻辑推理」这一关键能力补充。对金融、法律、医疗等需要逻辑正确性保证的场景有直接应用价值。开源 + 标准化接口,工程落地门槛低。

5. 基于错误定位的测试时计算扩展

  • 原标题: Test-Time Scaling via Error Localization
  • 作者/机构: Rajiv Shailesh Chitale, Rahul Madhavan, Taneesh Gupta, Deepanway Ghosal, Aravindan Raghuveer | arXiv
  • 核心贡献: ① 揭示测试时计算扩展(Test-Time Scaling)的核心低效问题——独立采样和顺序多轮精炼方法缺乏 Token 级信用分配,导致有效的推理前缀被频繁丢弃,计算资源浪费严重。② 提出基于错误定位的改进方案:通过 Token 级信用分配识别推理链中的错误位置,仅对错误部分进行重新计算,保留正确的推理前缀。③ 在复杂推理和编程任务上,相比标准方法显著降低计算开销,同时保持或提升输出质量。
  • 工程关联: 对 LLM 推理部署的成本优化有直接价值。在 RAG、代码生成、数学推理等需要多步推理的场景中,错误定位可显著减少重复计算。对 vLLM/SGLang 等推理框架的优化策略设计有参考意义。
  • 价值点: 精准定位了 Test-Time Scaling 的工程瓶颈——「盲目重试整个推理链」的低效模式。Token 级错误定位是一种可泛化的优化策略,可直接集成到推理引擎中。对降低 LLM 推理成本、提升复杂任务的可靠性有即时工程价值。

今日关键词

Agent 训练 · Agent Training · Harness 原生 · Harness-native · 记忆系统 · Memory System · 上下文管理 · Context Management · 神经-符号混合 · Neuro-Symbolic · MCP 协议 · Model Context Protocol · 测试时计算 · Test-Time Scaling · 错误定位 · Error Localization · 推理优化 · Inference Optimization