来源:arXiv cs.AI / cs.LG / cs.CL · 精选 5 篇(论文日期 2026-07-16,滞后执行日期 2 天)
今日精选
1. SearchOS-V1:面向鲁棒开放域信息搜索的 Agent 协作框架
- 原标题: SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration
- 作者/机构: Yuyao Zhang, Junjie Gao, Zhengxian Wu 等 14 人(中国人民大学高瓴人工智能学院)| arXiv
- 核心贡献: ① 指出现有工具集成式 LLM Agent 在长周期信息搜索中随交互历史增长逐步失去任务进度追踪能力——搜索失败时陷入重复循环,浪费搜索预算并降低输出质量。② 提出 SearchOS:将脆弱、隐式的搜索进度转化为显式、持久、共享状态——用关联模式补全(relational schema completion)建模信息搜索,用 Search-Oriented Context Management(SOCM)外化 Frontier Task、Evidence Graph、Coverage Map、Failure Memory 四维状态。③ 基于 SOCM 设计 pipeline 并行调度——子 Agent 执行重叠、空闲 slot 持续用未覆盖缺口任务回填,并通过 Search Tool Middleware Harness 拦截模型-工具交互、记录证据、应对停滞和预算耗尽。在 WideSearch 和 GISA 上全面领先单/多 Agent 基线。代码开源。
- 工程关联: 对所有构建 deep search / deep research 类 Agent 系统的团队有直接参考价值。SOCM 的四维状态管理(任务前沿/证据图/覆盖图/失败记忆)是信息搜索 Agent 生产化的关键工程组件;pipeline 并行调度 + 工具中间件 harness 的设计可直接借鉴。
- 价值点: 中国人民大学窦志成(Zhicheng Dou)团队出品,开源代码。将信息搜索 Agent 从”扔给模型自己搜”提升为”系统级状态管理 + 并行调度”——这是 Agent 工程从 demo 到生产的关键一步。
2. T²MLR:带时序中层递归的 Transformer 推理架构
- 原标题: T^2MLR: Transformer with Temporal Middle-Layer Recurrence
- 作者/机构: Ziyang Cai, Xingyu Zhu, Yihe Dong, Yinghui He, Sanjeev Arora(普林斯顿大学)| arXiv
- 核心贡献: ① 指出 Transformer 自回归解码的瓶颈:每次解码将丰富的隐藏计算压缩回 token 空间,中间推理状态难以跨时间步持久化。② 提出 T²MLR:将前一步的中间层表示缓存,直接融合到当前步的更浅层——实现抽象中间计算的跨步持久化,推理开销极低。仅对局部中间层(仅 20% 的网络)施加递归即超越全层递归。③ 无需从头预训练:将递归通路改装到已有 1.7B Transformer 并短暂微调即可显著提升数学推理——大幅降低实际应用门槛。
- 工程关联: 对推理型 LLM(数学、代码、多跳 QA)的架构改进有直接启发。T²MLR 的核心洞见——有效潜在推理不需要全层循环,局部中间层递归更优——是成本极低的架构增强,且支持对现有模型的 retrofitting,对推理加速和推理质量提升均有价值。
- 价值点: Sanjeev Arora(普林斯顿)团队出品。颠覆了”循环 Transformer 需要整层循环”的假设——仅 20% 中层递归即可超越全层。retrofitting 兼容现有预训练模型,是罕见的”低成本、高收益”推理增强方案。
3. On-Policy Delta Distillation:更高效的推理能力蒸馏
- 原标题: On-Policy Delta Distillation
- 作者/机构: Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han(NAVER AI Lab)| arXiv
- 核心贡献: ① 指出 on-policy distillation 虽然已是 RL 后训练的重要替代方案(用教师模型 token 级监督替代奖励模型),但其基础设计——直接模仿教师输出分布——仍未经充分审视。② 提出 delta 信号蒸馏:不直接模仿教师输出,而是用”教师模型与推理调优前基座模型的输出差异”作为奖励信号。这个差异(delta)捕获了推理调优引入的变化本身,是比教师分布更直接的推理能力迁移信号。③ 在数学、科学、代码推理 benchmark 上,OPD² 一致超越传统 on-policy distillation,仅需短周期后训练即可让推理 LLM 达到强劲性能。代码将开源(github.com/naver-ai/opd2)。
- 工程关联: 对做 LLM 推理后训练(post-training)的团队是即插即用的蒸馏升级。OPD² 的 delta 信号思想——用”教师-基座差异”替代”教师分布”——是简洁且高收益的改进,可直接集成到现有 RLHF/蒸馏 pipeline 中。
- 价值点: NAVER AI Lab 出品,19 页完整实验报告含 4 图 12 表。delta 信号概念优雅简洁——不增加计算量,仅改变奖励定义即可显著提升蒸馏效率。短后训练周期即可生效,适合快速迭代。
4. 掩码感知策略梯度:为扩散语言模型解锁强化学习推理
- 原标题: Mask-Aware Policy Gradients for Diffusion Language Models
- 作者/机构: Haran Raajesh, Kulin Shah, Adam Klivans, Philipp Krähenbühl(德克萨斯大学奥斯汀分校)| arXiv
- 核心贡献: ① 指出 RL 在自回归 LLM 推理上已证明有效,但扩展到 Masked Diffusion Language Models (MDLMs) 时面临对数似然不可估计的挑战。现有方法仅建模 token 预测,忽略了去掩码顺序。② 发现 MDLM 生成包含两个决策:每个掩码位置放什么 token + 哪些位置重新掩码。将其形式化为两阶段动作 MDP,策略梯度自然分解为 token 项和掩码项。③ 联合优化两项在数学推理和编码 benchmark 上取得 SOTA:GSM8K 87.1%、MBPP 53.4%。论文被 COLM 2026 接收。
- 工程关联: 对关注扩散语言模型(如 LLaDA、Dream 等)作为自回归替代方案的团队有重要参考。两阶段动作 MDP 的形式化为扩散 LM 的 RL 微调提供了严谨的理论框架——是扩散 LM 从生成到推理的关键突破。
- 价值点: UT Austin × COLM 2026。首次将策略梯度完整适配到扩散 LM——不是简单的”移植”,而是对生成机制(token + masking)的结构性建模。GSM8K 87.1% 的数字验证了扩散 LM 在推理任务上的竞争力。
5. Bridge Evidence:静态检索有用性无法预测多步 Agent 搜索中的因果效用
- 原标题: Bridge Evidence: Static Retrieval Utility Does Not Predict Causal Utility in Multi-Step Agentic Search
- 作者/机构: Debayan Mukhopadhyay, Utshab Kumar Ghosh, Shubham Chatterjee(加尔各答大学 / 密苏里科技大学)| arXiv
- 核心贡献: ① 提出核心问题:RAG 系统的检索质量评估基于”文档对当前问题的回答贡献”(静态效用),但当 LLM 作为多步搜索 Agent 时,文档的价值在于”下一步搜索引导了什么”(因果效用)——两者是否一致?② 在 HotpotQA 上用 ReAct Agent 回放 1000 个问题:对 Agent 读过的每个文档,删除它并重跑剩余轨迹,计算反事实轨迹效用(CTU)。与静态 RAG 效用(SRU)比较 23,322 个文档观测,发现两者接近统计独立(Spearman ρ = -0.026)。③ 约 1/3 Agent 读取的文档是”桥接文档”(bridge documents)——静态读者认为无用,但对 Agent 因果负载关键——它们提供”判别性实体”让 Agent 重定向搜索。判别性实体出现在下一步查询的频率是普通实体的 4.02 倍。
- 工程关联: 对构建 RAG 系统和 Agentic Search 的团队是颠覆性的评估洞察。结论直接:为静态 RAG 优化的检索器,不一定会让 Agent 搜索更好。Bridge document 的发现意味着 agentic search 评估需要因果框架,而非静态相关性指标。
- 价值点: 实证研究,方法论扎实(反事实干预 + 23K 文档观测)。“桥接文档”概念是原创发现——它解释了为什么好的 RAG 检索器未必让 Agent 表现更好,为 Agentic RAG 评估体系的重新设计提供了因果视角。
今日关键词
多 Agent 信息搜索 · Multi-Agent Information Seeking · 中间层递归 Transformer · Middle-Layer Recurrence · Delta 信号蒸馏 · Delta Signal Distillation · 扩散语言模型推理 · Diffusion LM Reasoning · 桥接文档 · Bridge Evidence · 反事实轨迹评估 · Counterfactual Trajectory Evaluation · Agent 状态管理 · Agent State Management · 策略梯度分解 · Policy Gradient Decomposition