来源:arXiv cs.AI / cs.LG / cs.CL · 精选 5 篇(论文日期 2026-07-16,滞后执行日期 4 天)
今日精选
1. SearchOS-V1:面向开放域信息搜索的多 Agent 协作框架
- 原标题: SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration
- 作者/机构: Yuyao Zhang, Junjie Gao, Zhengxian Wu 等(中国人民大学高瓴人工智能学院 / 蚂蚁集团)| arXiv
- 核心贡献: ① 指出现有 Tool-Integrated LLM Agent 在长交互中缺乏任务进度追踪机制——搜索失败时单/多 Agent 系统易陷入重复循环、耗尽搜索预算。② 提出 SearchOS:将脆弱隐式的搜索进度转化为显式、持久、共享的系统级状态——将开放域信息搜索形式化为带引证的关系模式补全问题,设计 Search-Oriented Context Management(SOCM)将演化状态外化为 Frontier Task、Evidence Graph、Coverage Map 和 Failure Memory 四类结构化组件。③ 在此基础上,SearchOS 引入流水线并行调度机制(重叠执行子 Agent、持续填补空闲槽位以覆盖未解决的证据缺口),以及 Search Tool Middleware Harness(拦截模型-工具交互以记录证据、响应停滞或预算耗尽)和可复用层级技能系统(strategy skill + access skill,避免跨轮次重复失败搜索模式)。在 WideSearch 和 GISA 两个基准上全面领先单/多 Agent 基线。
- 工程关联: 对构建企业级搜索 Agent(Deep Research 类产品、客服知识检索、竞品分析 Agent)的团队是即插即用的架构参考。SOCM 的四类结构化状态(证据图/覆盖图/失败记忆/前沿任务)可直接作为 RAG pipeline 的状态管理层复用——将「搜索了什么、找到了什么、还缺什么」从 Agent 的隐式记忆转为显式可控状态,是搜索 Agent 从 demo 走向可靠生产的关键基础设施。
- 价值点: 人大高瓴 + 蚂蚁集团联合出品,代码开源。首次将搜索 Agent 的进度管理提升为系统级设计——四类结构化状态的抽象(Evidence Graph / Coverage Map / Failure Memory / Frontier Task)具有通用参考价值,流水线并行调度 + 失败记忆复用显著提升多 Agent 搜索的吞吐和鲁棒性。
2. 桥接证据:静态检索效用无法预测多步 Agent 搜索中的因果效用
- 原标题: Bridge Evidence: Static Retrieval Utility Does Not Predict Causal Utility in Multi-Step Agentic Search
- 作者/机构: Debayan Mukhopadhyay(加尔各答大学), Utshab Kumar Ghosh, Shubham Chatterjee(密苏里科技大学)| arXiv
- 核心贡献: ① 提出核心挑战:传统检索系统按「静态有用性」评估文档——把文档和问题喂给 reader 模型,看答案是否提升——但当 LLM 作为搜索 Agent 进行多轮查询和跨轮推理时,一篇文档的真正价值可能在于它为 Agent 的下一步提供了什么(而非它本身包含什么答案)。② 首次通过反事实实验量化这一差距:在 HotpotQA 上用 ReAct Agent 回放 1000 个问题,对 Agent 读过的每个文档执行「删除后重新运行剩余轨迹」——引入 Counterfactual Trajectory Utility(CTU,由最终答案质量、下一查询检索质量和所需轮数三个 delta 组成)。在 23,322 个文档观测上,CTU 与 Static RAG Utility(SRU)几乎统计独立(Spearman ρ = -0.026)。③ 发现约 1/3 的文档是「桥接文档」(causally load bearing 但对静态 reader 看起来无用)——机制分析显示桥接文档通过提供可区分相关/不相关候选的实体(discriminative entity),使该实体 4.02 倍更频繁地出现在 Agent 的下一查询中。
- 工程关联: 对构建 RAG/search Agent pipeline 的团队是方法论级别的纠正。当前所有 RAG 评估指标(recall、NDCG、answer faithfulness)都基于静态相关性假设——这篇论文用严格的反事实实验证明这套逻辑在 Agent 多步搜索中不成立。工程启示:不应仅优化「文档与问题的相似度」,更需关注「文档是否能引导 Agent 提出更好的下一步查询」——这对检索器训练目标和 Agent 搜索策略设计有直接影响。
- 价值点: 首次以实验而非观点论证的方式揭示「静态检索效用 ≠ Agent 搜索因果效用」——23K 文档级别的反事实分析(Spearman ρ = -0.026 接近零相关)极具说服力。「桥接文档」概念的提出和 discriminative entity 机制的发现为新一代 Agent-aware 检索系统提供了明确的设计方向。
3. Mask-Aware Policy Gradient:将强化学习引入扩散语言模型
- 原标题: Mask-Aware Policy Gradients for Diffusion Language Models
- 作者/机构: Haran Raajesh, Kulin Shah, Adam Klivans, Philipp Krähenbühl(德克萨斯大学奥斯汀分校 / UT Austin)| arXiv
- 核心贡献: ① 指出当前强化学习(RL)在自回归 LLM 上成熟有效,但扩展到 Masked Diffusion Language Models(MDLM)时面临对数似然不可计算的根本障碍——现有方法仅对 token 预测建模、忽略了解码过程中掩码位置的去掩顺序(remasking order)。② 首次将 MDLM 生成形式化为两阶段动作 MDP:每步包含「在哪些位置放什么 token」和「哪些位置重新掩码」两个决策——由此证明策略梯度自然分解为 token term 和 masking term,需联合优化两者。③ 基于 LLaDA-8B-Instruct 验证:GSM8K 达 87.1%(+2.5pp)、MATH500 达 37.4%(+4.0pp)、MBPP 达 47.1%(+2.2pp,基于更难的 128 token 生成长度设置)——在数学推理和代码生成基准上全面超越现有 MDLM-RL 方法(D1、GDPO、StepMerge、SPG)。COLM 2026 接收。
- 工程关联: 对探索非自回归架构(MDLM、扩散模型)的团队是关键的 RL 方法论突破。当前 RLHF/GRPO 等对齐技术完全围绕自回归架构设计——本文的两阶段 MDP 公式和 token + masking 联合梯度为扩散语言模型的对齐训练提供了数学基础和工程模板。随着 MDLM 并行解码优势(低延迟生成)的吸引力上升,这一方法将成为扩散 LM 对齐的核心组件。
- 价值点: UT Austin 出品,COLM 2026 接收。首次填补扩散语言模型与强化学习之间的方法论鸿沟——两阶段 MDP 的分析框架(token term + masking term)优雅且通用。LLaDA-8B 上的 SOTA 结果验证了联合优化 masking order 的必要性,为扩散 LM 的实用化对齐铺平了道路。
4. OmniaBench:面向多样化场景的通用 AI Agent 综合评测基准
- 原标题: OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios
- 作者/机构: Chengyu Shen 等(华为云 Post-Training 团队 / 北京大学 DCAI 团队)| arXiv
- 核心贡献: ① 指出现有 Agent 评测基准聚焦于有限场景、工具生态或交互格式,难以系统刻画模型在不同应用环境下的能力边界。② 从应用商店、产品文档、行业资源、Web 检索和人工精炼中抽取场景知识,构建跨 ToC/ToB/ToE 的层级分类体系(90 个一级领域、354 个二级领域)——基于此搭建可执行环境,通过 DAG/DAG-S/Solver/Program 四条互补路线合成单轮与多轮任务。③ 引入十维能力分类和八项原子难度因子,最终数据集 1,431 个任务(含 644 个挑战子集)。前沿模型表现:Claude-Sonnet-5 仅 58.54% Overall Pass@1,GPT-5.6-Sol 仅 57.14%,揭示在规划、约束维护和自适应纠错上的持续局限。代码和项目页面已公开。
- 工程关联: 对开发和评估通用 AI Agent 的团队是当前最综合的 benchmark。90 个 ToC/ToB/ToE 领域覆盖远超现有评测,十维能力分析(规划/约束/纠错等)和八项难度因子提供了细粒度诊断工具——团队可据此定位自身 Agent 系统在哪些能力维度/难度因子上落后于前沿模型,有针对性地优化。挑战子集(644 任务)减少了全量评测成本且避免了公开后的数据污染风险。
- 价值点: 华为云 + 北大联合出品,开源。1,431 任务 × 90 领域的覆盖量级在当前 Agent benchmark 中少见——Claude-Sonnet-5 和 GPT-5.6-Sol 双双不到 60% 的结果表明通用 Agent 距离可靠部署仍有显著差距。十维能力分类为 Agent 开发者提供了从 Pass@1 到「哪里不行」的诊断路径。
5. 预训练数据可通过计算宣传被投毒:HalfLife 分析与 Web 级攻击向量
- 原标题: Pretraining Data Can Be Poisoned through Computational Propaganda
- 作者/机构: Victoria Graf, Hannaneh Hajishirzi, Noah A. Smith, David Kohlbrenner, Kyle Lo(华盛顿大学 / Allen Institute for Artificial Intelligence)| arXiv
- 核心贡献: ① 指出此前预训练数据投毒研究主要利用 Wikipedia 等已知数据源——未覆盖真实预训练语料的规模和异构性,且忽略了投毒内容与数据清洗管线(curation pipeline)之间的交互。② 首次展示通过 Web 级内容注入机制——公共讨论接口(如评论区、论坛回帖)——进行预训练数据投毒的可行性。③ 提出 HalfLife:一种评估对抗内容是否被 Web 爬取和清洗管线纳入 LM 训练数据的新分析方法。HalfLife 分析表明第三方网页内容(如评论区注入)构成攻击 LM 预训练的可行向量——即使低量注入,若存活过清洗管线也可生效。
- 工程关联: 对负责 LLM 训练数据安全的数据工程团队是直接的安全预警。HalfLife 分析框架可作为训练数据管线中的安全门控组件——在爬取后、训练前评估对抗内容可能被纳入的风险——而「公共讨论接口」这一攻击面提醒团队需要在数据清洗策略中增加对 UGC(用户生成内容)/评论区内容的专门过滤和来源可信度评估。
- 价值点: UW + AI2(Noah Smith、Hannaneh Hajishirzi 等知名作者)联合出品。首次将「通过公共评论接口投毒」系统论证为 Web 级预训练数据攻击的新范式——HalfLife 分析填补了「投毒内容是否真正进入最终训练集」这一关键评估环节的空白。对正在构建大规模 Web 爬取数据管线的所有团队都具有安全警示价值。
今日关键词
多 Agent 搜索协作 · Multi-Agent Search Collaboration · 反事实检索评估 · Counterfactual Retrieval Evaluation · 桥接文档 · Bridge Documents · 扩散语言模型强化学习 · Diffusion LM Reinforcement Learning · 通用 Agent 综合评测 · General Agent Benchmarking · 预训练数据投毒 · Pretraining Data Poisoning · 搜索进度状态管理 · Search Progress State Management · 两阶段动作 MDP · Two-Stage Action MDP