来源:arXiv cs.AI / cs.LG / cs.CL · 精选 5 篇(论文日期 2026-07-30,较执行日期延迟 2 天)

今日精选

1. MANTA:推理时自演化的多智能体通信拓扑框架

  • 原标题: MANTA: Multi-Agent Network Topology Adaptation for Self-Evolving Multi-Agent Systems
  • 作者/机构: MaoXun Huang, Jerry Wang, Yi-Cheng Lai, Zhenxing Zhang, Claire Cardie 等(康奈尔大学 / UIUC / 台湾中央研究院)| arXiv
  • 核心贡献: ① 现有 LLM 多智能体系统将通信拓扑视为固定设计或离线优化目标,缺乏运行时自适应能力。MANTA 提出推理时自演化框架:执行前基于任务初始化拓扑结构,运行中监控协作轨迹并在组织不足时应用有界结构更新。② 更新操作覆盖智能体角色、通信链路、执行顺序、信息可见性和验证路径,同时保持任务接口和智能体预算不变。③ 在信息检索、工具使用、规划、工作流执行和数学推理 5 个基准上,MANTA 平均得分 74.0,比最强基线高 5.8 个百分点,在 PlanCraft 上排名第一。
  • 工程关联: 直接适用于多智能体编排系统(如 AutoGen/CrewAI/Swarm),提供推理时拓扑自适应的可落地框架;对 Agent 系统的通信效率和任务成功率有直接优化价值。
  • 价值点: 将多智能体系统的「通信架构设计」从离线调参问题转变为推理时自适应问题,为生产级多 Agent 编排提供了新的设计范式。

2. OSReward:跨平台 GUI Agent 奖励模型的标准化评测基准

  • 原标题: OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models
  • 作者/机构: Qiushi Sun, Kanzhi Cheng, Yian Wang 等(香港大学)| arXiv
  • 核心贡献: ① 针对 GUI 操作 Agent (CUA) 轨迹验证这一核心难题,首次系统评估 VLM 裁判的可靠性——发现即使是 SOTA 模型也存在系统性宽容偏见(将失败标记为成功)。② 构建 OSReward 基准(含 OSReward-Hard 挑战集和 OSReward-Multi 细粒度评分),经多阶段人工标注生成真实标签。③ 开源 OS-Shepherd-100K 推理标注语料库,训练 OS-Shepherd(9B/35B)开源奖励模型,以商业裁判 30-60% 的成本实现匹敌性能。
  • 工程关联: 直接服务于 GUI Agent(Computer Use)的自动化评估、数据筛选和强化学习训练;OS-Shepherd 可作为开源替代方案降低 CUA 开发的评估成本。
  • 价值点: 揭示了当前 VLM-as-Judge 在 Agent 评估中的系统性缺陷(宽容偏见),并提供了可落地的开源解决方案,对 Agent 评测管线建设有直接参考意义。

3. Frontis-MA1:面向递归自我改进的 AI4AI 模型训练

  • 原标题: Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering
  • 作者/机构: Junlin Yang, Che Jiang, Yu Fu 等(Frontis.AI / 前沿人工智能)| arXiv
  • 核心贡献: ① 提出 OpenMLE 全栈系统用于研究 ML 工程中的递归自我改进(RSI),包含可验证任务环境(OpenMLE-Gym)、算子学习(OpenMLE-RL)和长程搜索(OpenMLE-Evo)。② 后训练 Frontis-MA1(35B)作为 ML 工程的元进化 Agent,围绕四个原子程序进化算子(Draft/Improve/Debug/Crossover)进行 SFT+RL 训练,并与长程进化搜索耦合。③ 在 MLE-Bench Lite 上(单 RTX 4090,12GB VRAM,12h 预算),Medal Average 从 39.39% 提升至 71.21%,超越 GPT-5.5+Codex,逼近 GPT-5.6 Sol 和 Kimi K3(2.8T);在 NatureBench Lite 上实现跨组件迁移。
  • 工程关联: AI 自动改进 AI 系统的落地实践——对 ML 工作流自动化、代码 Agent 自我优化、自动化 ML 实验等方向有直接参考价值;OpenMLE 栈可复用于自研 AI4AI 场景。
  • 价值点: 提供了「AI 自我改进」从概念到可执行系统的完整路径,开源模型权重和全栈代码,是可复现 AI4AI 研究的重要基础设施。

4. SaliTrap:揭示 LLM 常识推理中的「显著性偏见」——知识被抑制而非缺失

  • 原标题: Would You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense Reasoning
  • 作者/机构: Zheng Wu, Chenhao Xue, Shijie Zheng 等(上海交通大学 / 字节跳动)| arXiv
  • 核心贡献: ① 发现并命名「显著性偏见」(Salience Bias):LLM 在常识推理中被显式干扰项(如无关数值)劫持,忽略隐式的物理/常识前提。② 构建 SaliTrap 基准(覆盖四种陷阱维度),评估 12 个 SOTA 模型,发现所有主流模型均严重受此影响。③ 关键诊断:通过剥离任务框架重新引出模型,发现超过 90% 的失败是知识抑制而非知识缺失——模型内在具备常识知识,但被显著性干扰项挤出。轻量级推理时提示即可大幅缩小差距,无需重新训练。
  • 工程关联: 对 LLM 推理质量有直接诊断价值——表明许多推理失败可通过更好的 prompt 设计而非模型升级解决;SaliTrap 可作为推理鲁棒性测试集嵌入评估流程。
  • 价值点: 将 LLM 推理失败的瓶颈从「模型能力」重新定位到「知识激发」,为 Prompt Engineering 和推理优化提供了新的理论依据和实用方向。

5. Lightning OPD 2.0:消除跨教师在线策略蒸馏中的风格偏见

  • 原标题: Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models
  • 作者/机构: Yecheng Wu, Song Han, Han Cai(NVIDIA)| arXiv
  • 核心贡献: ① 发现在线策略蒸馏(OPD)在跨教师场景中存在严重失效——当 SFT 数据生成者与蒸馏教师不一致时,即使更强的 OPD 教师也难以提升性能。② 提出交叉拟合风格残差化方法:用 rollout 级交叉拟合估计风格 token 偏见的操作代理,在构建 token 级 OPD 更新前减去该分量。③ 从 Klear-Reasoner-8B-SFT 出发,Lightning OPD 2.0 在 AIME 2024 达 82.4%、LiveCodeBench v5 达 63.0%,在跨教师设定下持续优于原版 Lightning OPD。
  • 工程关联: 直接用于推理模型的蒸馏训练流程——解耦了 SFT 数据来源与蒸馏教师的选择,使训练管线设计更灵活;方法可迁移至其他需要 teacher-student 知识迁移的场景。
  • 价值点: 解决了 LLM 蒸馏中的「教师一致性」瓶颈,使得可以独立选择最优数据源和最优蒸馏教师,对推理模型生产流程有实际降本增效意义。

今日关键词

多智能体通信拓扑 · Multi-Agent Topology · GUI Agent 奖励模型 · CUA Reward Model · 递归自我改进 · Recursive Self-Improvement · 显著性偏见 · Salience Bias · 在线策略蒸馏 · On-Policy Distillation · 推理时自适应 · Inference-Time Adaptation · AI4AI · 计算机使用 Agent