来源:arXiv cs.AI / cs.LG / cs.CL · 精选 5 篇(论文日期 2026-07-15,滞后执行日期 2 天)
今日精选
1. Agent 优化器能否持续复合?基于 Terminal-Bench 2.0 的持续学习评估
- 原标题: Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0
- 作者/机构: Wenxiao Wang, Priyatham Kattakinda, Soheil Feizi(马里兰大学 UMD / RELAI)| arXiv
- 核心贡献: ① 指出当前 Agent 优化方法(GEPA、Meta Harness 等)的评测均为”一次性”——在固定 benchmark 上优化一次就报告收益,忽略了真实部署中优化需要反复进行的场景。② 核心问题:Agent 被优化一次后,面对新任务能否再次优化而不破坏上一轮的收益?提出基于 Terminal-Bench 2.0 硬任务的两阶段持续学习评测协议。③ 对比三种优化方法:GEPA 在新任务上表现退化到比未优化基线更差;Meta Harness 迁移良好但无法从第二轮优化中继续提升;RELAI-VCL 是唯一同时做到正向迁移+持续改进的方法,在每轮评测中均取得最高通过率,终身平均通过率 76.4%(vs. GEPA 66.0%、Meta Harness 64.6%、基线 58.7%)。
- 工程关联: 对所有做 Agent 自动优化(prompt tuning / harness 调参)的团队都有直接警示意义。RELAI-VCL 的核心发现——必须在优化循环中内置”回归控制”以防止短视过拟合——是一个可泛化的设计原则,适用于任何 Agent 持续改进 pipeline。
- 价值点: RELAI(Soheil Feizi 创立)技术报告。首次把 Agent 优化从”跑分思维”升级到”持续学习”评估范式。回归控制作为优化循环的必需组件,是可直接落地的工程洞察。
2. HealthClaw:面向长期个人健康管理的自演化 Agent 架构
- 原标题: A Self-Evolving Agent for Longitudinal Personal Health Management
- 作者/机构: Haoran Li, Jiebi Deng, Tong Jin, Jinghong Han 等 13 人(复旦大学类脑智能科学与技术研究院)| arXiv
- 核心贡献: ① 指出现有健康 AI 系统每次请求独立处理,无法追踪用户长期的日常习惯、偏好、测量数据和风险变化。② 提出 HealthClaw——开源 Agent 架构,将共享安全规则和医学知识与私人纵向记忆(个人档案事实、可复用流程、偶发事件记录)解耦。每次交互后通过归纳模块决定:更新档案、修订流程、保留为偶发记录或丢弃。③ 评测:在 900 道纵向支持探针上,答案准确率从当前查询 prompt 的 0.2% 提升到 45.7%;prompt 端上下文暴露比全历史方案低 71.7%;在 100 道隐私探针上同时实现了更高的隐私感知质量和更少的不安全泄露。生物医学任务的绝对增益中位数为 27.0 个百分点。代码开源在 GitHub。
- 工程关联: 对构建长期记忆 Agent(不仅是健康领域)有通用参考价值。HealthClaw 的”安全规则/知识 vs. 私有纵向记忆”分离架构 + 交互后归纳决策(更新/修订/保留/丢弃)——是一种可复用的长期用户建模模式,适用于个人助手、教育辅导、客服等所有需要跨会话记忆的场景。
- 价值点: 复旦出品,开源,20 页完整论文含 6 张补充表。71.7% 的上下文缩减对于 token 成本敏感的部署极具吸引力。纵向记忆的归纳更新策略设计精巧,方法论可直接迁移到其他 Agent 系统。
3. 体验记忆图谱:Agent 的一次性纠错框架
- 原标题: Experience Memory Graph: One-Shot Error Correction for Agents
- 作者/机构: Wenjun Wang, Yuchen Fang, Fengrui Liu, Zibo Liang, Kai Zheng(电子科技大学 UESTC)| arXiv
- 核心贡献: ① 指出 LLM Agent 在长周期任务中的纠错依赖 prompt 反思——这种方式本身脆弱、API 和时间成本高(反复试错),且产生的记忆难以跨任务泛化。② 提出 Experience Memory Graph(EMG):将失败探索轨迹和成功专家轨迹分别建模为有向动作决策图,通过图匹配提取成功子图(共通工作流)和图编辑路径(明确指出如何纠正失败:增/删/改哪些动作),存储为带任务内节点和跨任务边的经验记忆图。③ 测试时单次、无循环执行,在 ALFWorld 和 ScienceWorld 上一致超越 SOTA 反思基线,同时消除了测试时的试错成本。
- 工程关联: 直接面向 Agent 工程中”失败后如何有效恢复”这一核心难题。EMG 的图匹配思路——从成功/失败轨迹对中提取结构化的纠正规则——比 prompt 反思更可靠、可复用且零 API 试错开销。适合集成到任何 Agent 框架的故障恢复模块中。
- 价值点: 电子科技大学出品。将 Agent 纠错从”靠模型自己反思”升级为”基于图匹配的结构化知识检索”——这是一个范式的转变。图编辑路径(增/删/改动作)的输出形式对 Agent 可解释性和调试也极有价值。
4. MemCon:将记忆建模为受控过程的自适应记忆管理
- 原标题: Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents
- 作者/机构: Eric Hanchen Jiang, Zhi Zhang, Yuchen Wu, Levina Li 等 14 人(UCLA + 华盛顿大学 + 北京大学)| arXiv
- 核心贡献: ① 指出几乎所有 Agent 记忆系统使用固定、手工设计的启发式规则访问记忆,忽视了记忆行为高度上下文依赖的本质——任务初期不需要检索、重复目标类型应复用计划而非做通用最近邻查询、卡住的 Agent 应用替代查询重新检索。② 提出 MemCon:将记忆操作建模为马尔可夫决策过程,在线学习自适应策略,决定”何时、检索什么、检索多少、何时注入蒸馏计划、何时整合或遗忘”。③ MemCon 后端无关,包裹任何现有记忆实现,通过任务级二值反馈学习,无需预训练、无需额外 LLM 调用,使用轻量表格化上下文赌博机(UCB 探索),数十个任务内收敛。在 6 个 benchmark、3 个 Agent 框架、3 个 LLM 主模型上,MemCon 一致超越多种记忆基线,最高 +15.2 任务成功率,同时降低 5-20% token 消耗。
- 工程关联: 对任何使用外部记忆的 Agent 系统都是即插即用的增强。MemCon 的三大优势:① 后端无关——不绑定特定记忆实现;② 学习轻量——无需预训练或额外 LLM 调用;③ 同时提升成功率和降低 token 成本。可直接作为现有 Agent 框架的记忆层”智能开关”。
- 价值点: UCLA Kai-Wei Chang 团队出品。将记忆管理从手工规则提升到学习策略——这个方向非常正确。UCB 上下文赌博机的选择简洁高效,数十个任务即收敛,适合快速冷启动部署。
5. GitHub 项目中 Agentic Coding 工具的早期采用实证研究
- 原标题: Early Adoption of Agentic Coding Tools by GitHub Projects
- 作者/机构: Maliha Noushin Raida, Daqing Hou(克拉克森大学 Clarkson University)| arXiv
- 核心贡献: ① 分析 2361 个热门 GitHub 仓库的 25,264 个 Agentic PR,研究三个维度:(a) 采用模式;(b) 项目级 Agentic PR 生产力;(c) 人-Agent 协作模式。② 发现中位仓库三个月内仅产生 1-2 个 Agentic PR——激进采用仍高度集中在少数项目。小项目(1-5 贡献者)的参与率和平均 PR 活动显著高于中大型项目。③ 人-Agent 协作以”单人监督”模式为主(一个开发者审查/修改 Agent 贡献),多人类协作模式仍不常见。结论:Agent 代码的集成成功不单取决于 Agent 能力,更依赖人类和组织流程。
- 工程关联: 对正在评估或推进 Agentic Coding 工具(Cursor Agent、Claude Code、OpenAI Codex 等)引入团队的工程管理者极具参考价值。数据表明:小团队反而比大团队更积极采用——这为小团队的”AI-first”开发策略提供了实证支持。单人监督模式是当前最佳实践。
- 价值点: KDD 2026 Workshop 接收论文。首批大规模 GitHub 层面 Agentic 编码采用实证研究之一。25,264 个 PR 的数据量提供了具有统计意义的发现。对于制定团队 AI 编码工具采用策略的管理者,这是必读的数据报告。
今日关键词
Agent 优化持续学习 · Continual Agent Optimization · 纵向记忆管理 · Longitudinal Memory Management · 图匹配纠错 · Graph-Based Error Correction · 自适应记忆控制 · Adaptive Memory Control (MemCon) · Agentic Coding 采用 · Agentic Coding Adoption · 自演化 Agent 架构 · Self-Evolving Agent Architecture · 上下文赌博机 · Contextual Bandit · 回归控制 · Regression Control