来源:arXiv cs.AI / cs.LG / cs.CL · 精选 5 篇(论文日期 2026-07-28,较执行日期延迟 2 天)

今日精选

1. MemLens:面向 LLM Agent 的价值感知记忆管理系统

  • 原标题: MemLens: A Value-Aware Memory Management System with Interactive Analytics for LLM-based Agents
  • 作者/机构: Shuyue Wei, Chang Liu, Zimu Zhou, Yongxin Tong, Lizhen Cui 等(北京航空航天大学)| arXiv
  • 核心贡献: ① 针对 LLM Agent 记忆系统中「粗粒度、无差别存储」导致冗余记录堆积的问题,提出价值感知的细粒度记忆管理方案。② 引入 Shapley 风格的记忆价值评估,通过交互式分析仪表盘展示完整记忆生命周期(评估→存储→辅助响应)。③ 支持对比不同记忆管理策略在响应质量、检索延迟和 Token 消耗三个维度上的表现。
  • 工程关联: 直接服务于 LLM Agent 长期记忆管理,为 Agent 框架的记忆模块设计提供可量化的评估标准;Shapley 价值评估方法可复用至 RAG 系统的文档权重排序。
  • 价值点: 提供了一套可解释的记忆价值量化方案和可视化工具,帮助开发者识别并清理低效记忆记录,降低 Agent 长对话的 Token 成本。

2. RSIBench-Data:面向递归自我改进的数据中心化研究基准

  • 原标题: RSIBench-Data: Benchmarking Data-Centric Research for Recursive Self-Improvement
  • 作者/机构: Fanqing Meng, Lingxiao Du, Qiguang Chen 等(Evolvent AI)| arXiv
  • 核心贡献: ① 构建首个可控的 LLM Agent 作为数据研究员(data-centric researcher)的基准测试,Agent 需迭代修订训练数据策略以改进固定目标模型。② 在软件工程、终端使用、科学问答和数学 6 个基准上评估 4 个前沿 Agent,58.33% 的设定中 Agent 能通过反馈改进初始结果。③ 轨迹分析揭示改进不一致问题:78.26% 的后续搜索最终得到更差分,优秀结果往往出现在早期运行中,提示当前 Agent 尚无法稳定地将反馈转化为持续改进。代码开源:https://github.com/evolvent-ai/RSIBench-Data
  • 工程关联: 为自动化的后训练数据迭代(post-training data iteration)提供标准化测试框架,直接关联 RLHF / DPO / 指令微调的数据策略优化,以及 AI 辅助 AI 研究(automated research)方向。
  • 价值点: 提供了递归自我改进能力的可度量基准和失败模式分析,帮助团队评估当前 Agent 在数据策略自动化迭代中的真实瓶颈——「能发现问题」不等于「能稳定修复问题」。

3. WorkSurface-Bench:企业 Agent 多表面知识路由基准

  • 原标题: WorkSurface-Bench: Benchmarking Enterprise Agents on Multi-Surface Knowledge Routing
  • 作者/机构: Hao Liang, Meiyi Qiang, Sizhe Qiu, Linzhuang Sun, Wentao Zhang 等(北京大学)| arXiv
  • 核心贡献: ① 针对企业 Agent 需同时处理文档(叙述事实)、表格(计算)和依赖图(文件关系)三种异构知识源的场景,提出「表面路由(surface routing)」能力评估框架。② 构建含 1,151 道原子任务的测试集,所有答案均可审计(表格通过 DuckDB 查询复现、文档基于验证文本片段、图答案可追溯依赖标注)。③ 实验揭示:在工具受控条件下,Agent 的路由 F1 高达 98.7-99.8%,但答案准确率仅 56.1-75.3%,说明「选对知识源」必要但不充分。代码开源:https://github.com/haolpku/WorkSurface-Bench
  • 工程关联: 为企业在构建 Agent 时的知识源编排策略提供量化参考——将路由决策与答案生成解耦评估,有助于诊断企业 RAG + Agent 系统在真实多源环境下的失败点。
  • 价值点: 提供了首个将「知识源选择」作为独立维度评估的基准,配套可审计的答案验证管道,可直接用于企业 Agent 系统的能力瓶颈诊断。

4. AngelSpec:面向真实世界高性能推理的统一推测解码框架

  • 原标题: AngelSpec: Towards Real-World High Performance Inference with Speculative Decoding
  • 作者/机构: Hong Liu, Rui Cen, Junhan Shi, Guangshuo Qin 等(13 人大型研究团队)| arXiv
  • 核心贡献: ① 识别推测解码中单一 drafting 结构无法适配所有真实工作负载的问题——自回归 MTP 适合高熵开放对话,Block-Diffusion 适合代码/数学等长可预测序列。② 提出三层统一框架:训练层按数据分布共特化两类 drafter;架构层提出 DFly(混合目标条件主干 + 前置条件自回归头),改善目标特征利用和块内依赖建模;推理层以共享批级资源动态分配验证深度。③ 在 Hy3 系列模型上,DFly 相比单结构 drafter 在对话和代码场景同时获得加速。
  • 工程关联: 直接服务于 LLM 推理优化(降低首 Token 延迟和吞吐提升),其「按数据域共特化 drafter + 在线自适应」的设计思路可指导生产环境中推测解码的部署策略。
  • 价值点: 提供了一个训练层面(非仅推理层面)解决推测解码异质性的方案,DFly 的块并行扩散 + 自适应验证深度设计对自建推理服务的团队有直接参考意义。

5. UniMem:面向无边界任务流的互补式情景-参数化记忆框架

  • 原标题: UniMem: Complementary Episodic-to-Parametric Memory for Boundary-Agnostic Task Streams
  • 作者/机构: Siyu Xia, Chenheng Zhang, Yanting Wu 等(北京大学 & 伦敦大学学院)| arXiv
  • 核心贡献: ① 针对 LLM Agent 在无边界的流式任务序列中面临「稳定性-可塑性」困境——检索记忆吸收快但推理开销大,参数化记忆执行高效但依赖明确任务边界。② 受人脑互补记忆系统启发,提出 UniMem 自路由框架:新颖/稀疏任务保留在情景缓冲区用于检索增强执行,重复可靠模式逐步整合到可扩展参数化记忆。③ 通过可学习路由 Token 解耦任务识别与执行,实现按需扩展记忆,在长期流式任务序列上平均提升 4.0 EM 点。
  • 工程关联: 提出了一种将 RAG(情景记忆)与微调 LoRA 模块(参数化记忆)融合的自动化框架,为构建自进化的 Agent 系统提供了记忆架构参考。
  • 价值点: 路由 Token + 记忆块解耦的设计提供了一条中间路径——既不依赖外部向量数据库做全量检索,也不要求离线训练阶段明确划分任务边界,更适合在线持续部署场景。

今日关键词

LLM Agent 记忆管理 · LLM Agent Memory Management · 递归自我改进 · Recursive Self-Improvement · 推测解码 · Speculative Decoding · 企业智能体 · Enterprise Agents · 参数化记忆 · Parametric Memory · 知识路由 · Knowledge Routing · 后训练优化 · Post-Training Optimization · 情景记忆巩固 · Episodic Memory Consolidation