来源:arXiv cs.AI / cs.LG / cs.CL · 精选 5 篇(论文日期 2026-07-30,较执行日期延迟 4 天)

今日精选

1. MANTA:多智能体网络拓扑自适应与自演化框架

  • 原标题: MANTA: Multi-Agent Network Topology Adaptation for Self-Evolving Multi-Agent Systems
  • 作者/机构: Mao-Xun Huang, Jerry Wang, Yi-Cheng Lai 等(Cornell University / UIUC / Academia Sinica)| arXiv
  • 核心贡献: ① 现有多智能体系统通常将通信拓扑视为固定设计或离线优化目标,无法在运行时动态调整。MANTA 提出推理时自演化的通信结构框架:执行前从先验结构经验初始化任务条件拓扑,部署时监控协作轨迹并在当前组织不足时应用有界结构更新。② 更新可修改智能体角色、通信链路、执行顺序、信息可见性和验证路径,同时保持任务接口和智能体预算不变。③ 在信息检索、工具使用、规划、工作流执行和数学推理五个基准上超越单智能体和多智能体基线。
  • 工程关联: 直接适用于复杂多智能体系统的部署优化——无需重新设计即可让通信结构随任务需求自适应演化;框架可集成到现有 Agent 编排系统中实现动态拓扑调整。
  • 价值点: 将「多智能体通信拓扑」从静态设计决策转化为运行时可自适应的能力,为大规模 Agent 系统的灵活部署提供了无需重训练的演化方案。

2. 重新思考本地计算机使用智能体的推理时计算扩展

  • 原标题: Rethinking Inference-Time Scaling in Local Computer-Use Agents: Failure Modes and Compute Tradeoffs
  • 作者/机构: Woongkyu Lee, Jungwook Choi(Hanyang University)| arXiv
  • 核心贡献: ① 指出现有推理时计算扩展研究主要关注前沿模型,对资源受限的本地计算机使用智能体(CUA)效果知之甚少。系统研究本地 CUA 在上下文、时间、结构和并行四个维度的推理时扩展。② 在 OSWorld 基准上评估 Qwen3-VL-8B/30B-A3B、UI-TARS-1.5-7B 和 OpenCUA-7B,发现额外计算往往带来递减收益并改变失败模式:上下文扩展提高轨迹稳定性但收益随 token 成本饱和;时间扩展减少最大步数停滞但未能显著提升任务成功率;结构分解引入新的协调开销。③ 揭示本地 CUA 与前沿模型在推理时扩展上的根本差异,为资源受限场景提供针对性优化方向。
  • 工程关联: 对本地部署 CUA 的隐私/成本敏感场景有直接指导意义——揭示了「更多计算≠更好性能」的边界条件;失败模式分析可指导本地 Agent 的调试和优化策略。
  • 价值点: 首次系统量化本地计算机使用智能体的推理时计算权衡,打破了「推理时扩展普适有效」的假设,为资源受限 Agent 部署提供了实证依据。

3. OSReward:跨平台计算机使用奖励模型标准化评测

  • 原标题: OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models
  • 作者/机构: Qiushi Sun, Kanzhi Cheng, Yian Wang 等(Nanjing University / HKUST / U of Washington / 等,含 Tianbao Xie, Ben Kao, Lingpeng Kong 等知名作者)| arXiv
  • 核心贡献: ① 指出计算机使用智能体(CUA)轨迹验证是评估、数据策划和强化学习的核心,但 VLM-as-Judge 的可靠性长期未被审视。构建 OSReward 基准:包含跨平台真实轨迹、多阶段人工标注的真实标签,以及 OSReward-Hard(困难子集)和 OSReward-Multi(细粒度效率/对齐评分)。② 发现即使最先进的 VLM 也达不到理想裁判标准,存在系统性宽容偏差(将失败运行误标为成功);可靠的裁判成本过高,而低成本的开源模型差距巨大。③ 构建并发布 OS-Shepherd-100K(推理注释轨迹判断语料),训练 OS-Shepherd(9B/35B)开源奖励模型,以比前沿模型低 30-60% 的成本匹配商业裁判性能。
  • 工程关联: 为 CUA 系统的 RL 训练和评估提供了可靠且低成本的奖励信号来源;OS-Shepherd 可直接用于替代昂贵的商业 VLM 裁判,降低 CUA 开发成本。
  • 价值点: 揭示了「VLM 裁判不可靠」这一 CUA 领域的隐藏瓶颈,并提供从评测基准到开源奖励模型的完整解决方案,为 CUA 的规模化 RL 训练扫清了奖励信号障碍。

4. DualG-MRAG:解耦宏观推理与微观匹配的多模态检索增强生成

  • 原标题: DualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal Retrieval-Augmented Generation
  • 作者/机构: Jiacheng Tao, Qingyun Sun, Haonan Yuan 等(Beihang University / 北京航空航天大学)| arXiv
  • 核心贡献: ① 指出现有多模态 RAG 在复杂多跳推理任务上的困境:图增强方法引入细粒度视觉特征导致图快速膨胀和检索噪声,而粗粒度表示则丢弃关键局部证据。提出 DualG-MRAG 双层框架:解耦宏观推理图和微观匹配图。② 宏观推理图捕获跨模态和跨文档的显式关系,支持多跳推理;微观匹配图保留细粒度视觉特征用于精确证据检索。两层通过协调机制交互,避免图膨胀同时保持证据完整性。③ 在多跳问答和视觉推理基准上显著优于现有 MM-RAG 方法,同时保持检索效率。
  • 工程关联: 为复杂多模态 RAG 系统提供了可扩展的架构设计——解耦推理和匹配可独立优化两层性能;框架可应用于需要跨文档/跨模态推理的企业知识库场景。
  • 价值点: 解决了多模态 RAG 中「图膨胀 vs 证据丢失」的两难困境,为构建能处理复杂多跳推理的视觉-语言检索系统提供了实用架构。

5. Frontis-MA1:面向机器学习工程递归自我改进的 AI4AI 模型

  • 原标题: Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering
  • 作者/机构: Junlin Yang, Che Jiang, Yu Fu, Tianwei Luo, Can Ren(机构未标注,推测为中国 AI 研究机构)| arXiv
  • 核心贡献: ① 提出递归自我改进(RSI)需要 AI 系统改进构建 AI 的过程(AI4AI),机器学习工程(MLE)为研究此能力提供了具体可执行测试平台。引入 OpenMLE:覆盖可验证任务环境(OpenMLE-Gym)、算子学习(OpenMLE-RL)和长程搜索(OpenMLE-Evo)的全栈开放系统。② 在此栈上后训练 Frontis-MA1(35B)作为元演化智能体,能够自主改进 MLE 工作流。③ 实验显示 Frontis-MA1 在 MLE 任务上超越基线,并展示出初步的递归自我改进能力。
  • 工程关联: 为 AI 系统的自我改进研究提供了从环境到算法的完整基础设施;OpenMLE 框架可复用于其他需要自动化 ML 工作流优化的场景。
  • 价值点: 将「AI 改进 AI」从理论概念转化为可执行的工程框架,为研究递归自我改进和自动化机器学习工程提供了首个全栈开放平台。

今日关键词

多智能体拓扑自适应 · Multi-Agent Topology Adaptation · 推理时计算扩展 · Inference-Time Scaling · 计算机使用智能体 · Computer-Use Agent · 奖励模型 · Reward Model · 多模态检索增强生成 · Multimodal RAG · 递归自我改进 · Recursive Self-Improvement · AI4AI · 机器学习工程自动化 · MLE Automation