来源:arXiv cs.AI / cs.LG / cs.CL · 精选 5 篇(论文日期 2026-07-24,滞后执行日期 4 天)

今日精选

1. Nanbeige4.2-3B:在 3B 参数规模下释放 Agent 能力

  • 原标题: Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Mode
  • 作者/机构: Nanbeige Lab(南北阁实验室)| arXiv
  • 核心贡献: ① 解决小模型在 Agent 场景下能力不足的问题——现有 3B 级模型难以胜任代码 Agent、办公 Agent 和复杂工具调用任务。② 提出 Nanbeige4.2-3B:仅 3B 非嵌入参数,采用 Looped Transformer(复用层堆栈以增加容量而不增加参数),配合混合模式 RLHF(Think/Non-Think 响应)、长度控制推理 RL、以及带结果和过程奖励的 Agentic RL 三阶段训练管线。③ 在多个 Agent 基准上超越 Qwen3.5-9B 和 Gemma4-12B 等更大模型,同时保持数学/编码/科学推理竞争力。
  • 工程关联: 对本地部署个人助理和边缘设备 Agent 有直接价值。3B 参数 + 强 Agent 能力的组合使其可在消费级 GPU 甚至 CPU 上运行,大幅降低部署门槛。Looped Transformer 的架构创新对模型设计有参考意义。
  • 价值点: 南北阁实验室出品。证明了「小模型也能做强 Agent」——通过架构创新(Looped Transformer)+ 精细化 RL 训练管线,3B 模型可在 Agent 任务上匹敌 9-12B 模型。对资源受限场景下的 Agent 部署有里程碑意义。

2. Skill Self-Play:通过协同进化技能推动 LLM 能力前沿

  • 原标题: Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills
  • 作者/机构: Siyuan Huang, Pengyu Cheng, Haotian Liu 等(Qwen 团队相关)| arXiv
  • 核心贡献: ① 解决 LLM 自进化中的核心矛盾——环境绑定方法反馈精确但任务多样性受限,开放式自生成任务空间广但验证不可靠。② 提出 Skill Self-Play(Skill-SP)框架:以 Agent 技能作为中间层,包含 proposer(生成任务)、solver(探索解法)、dynamic skill controller(更新技能库)三个组件,通过 RL 循环实现协同进化。③ 在工具使用和推理基准上持续推高性能上限,甚至能让初始未对齐的模型实现显著逆转。
  • 工程关联: 对 LLM 自改进和持续学习系统设计有直接参考价值。技能库的动态更新机制可指导构建自适应 Agent 系统。开源代码(github.com/Qwen-Applications/skill-self-play)便于复现和扩展。
  • 价值点: Qwen 团队相关出品。首次系统性地将「技能」作为连接结构化验证和开放式探索的桥梁,解决了 LLM 自进化的核心矛盾。协同进化框架的设计思路对构建可持续学习的 AI 系统有深远影响。开源 + 多基准验证。

3. TRACE-ROUTER:面向 Agentic AI 的任务一致自适应在线路由

  • 原标题: TRACE-ROUTER: Task-Consistent and Adaptive Online Routing for Agentic AI
  • 作者/机构: Ritik Raj, Souvik Kundu, Sarbartha Banerjee 等 | arXiv
  • 核心贡献: ① 揭示现有 LLM 路由器的根本缺陷——逐调用独立路由无法正确归因延迟的任务级反馈,导致无法为 Agentic 长程工作流优化成本-质量权衡。② 提出 TRACE-Router:在任务准入时一次性分配模型,固定后续所有 LLM 调用到选定后端,使用任务终端奖励(联合考虑准确率和延迟)更新路由策略。③ 在 tau2-Bench 上比延迟匹配插值高 7-8 准确率点,在 Terminal-Bench 上比最强单模型高 7.1 准确率点且延迟降低 36%。
  • 工程关联: 对企业级 Agent 部署的成本优化有直接价值。任务级路由策略可显著降低多步 Agent 工作流的 API 成本,同时提升任务完成率。Contextual bandit 的轻量级实现易于集成到现有路由层。
  • 价值点: 精准识别了「逐调用路由」在 Agentic 场景下的失效模式,提出任务级路由这一更符合 Agent 工作流特性的解决方案。对正在部署多模型 Agent 系统的团队有即时的成本优化价值。

4. 回归税:分解技能如何帮助和伤害 LLM Agent

  • 原标题: The Regression Tax: Decomposing Why Skills Help and Hurt LLM Agents
  • 作者/机构: Darshan Tank, Baran Nama | arXiv
  • 核心贡献: ① 揭示 Agent 技能评估的盲区——仅关注平均改进会掩盖技能使 Agent 变差的「回归」成本。② 通过近 6000 次运行(跨 2 个办公自动化基准和 3 个模型栈)系统分解:回归(无技能时能解决但添加技能后失败)和残留失败(有无技能都失败)。发现最佳技能的优势主要来自「更少回归」而非「更多增益」。③ 识别三种回归机制:技能描述渗透(技能仅存在于上下文就改变行为)、基础置换(技能程序覆盖输入解读)、验证置换(程序抑制输出自检)。
  • 工程关联: 对 Agent 技能系统的设计和评估有直接指导价值。提示工程团队不应仅看平均改进,而需分解增益和回归。三种回归机制的识别可指导技能设计——强化基础(grounding)和验证(verification)而非过度依赖程序指导。
  • 价值点: 来自大规模实证研究的关键洞察:Agent 技能的可靠性更多依赖基础能力和验证能力,而非程序性技能本身。对正在构建技能库/工具库的 Agent 团队有重要的设计警示——避免「技能描述渗透」等隐性成本。

5. 足矣如盛宴:RL 如何缓解 LLM 中的任务冲突

  • 原标题: Enough is as good as a feast: A Comprehensive Analysis of How Reinforcement Learning Mitigates Task Conflicts in LLMs
  • 作者/机构: Zixuan Ren, Jinliang Lu, Junhong Wu 等(中科院自动化所)| arXiv
  • 核心贡献: ① 系统探索 RL 训练的 LLM 在模型合并(model merging)中相比 SFT 训练模型的优势——RL 显著减少任务冲突,合并后性能退化更小。② 通过五个代表性任务的综合评估,揭示三个关键因素:on-policy 训练数据控制梯度更新幅度更小、RL 优化目标(「足矣如盛宴」)逐步减少冲突参数的幅度和数量、正负样本联合优化引导模型进入无偏任务特定参数子空间。③ 为 RL 训练范式的优越性提供了理论和实证双重支撑。
  • 工程关联: 对多任务 LLM 训练和模型合并策略有直接指导价值。提示在需要合并多个专家模型时,优先使用 RL 训练而非 SFT,可显著减少任务冲突。对 MoE 架构和模型蒸馏场景也有参考意义。
  • 价值点: 中科院自动化所出品。首次系统性揭示 RL 训练在模型合并中的独特优势,为「为什么 RL 训练的模型更适合多任务整合」提供了清晰的机制解释。对正在构建多任务统一模型的团队有重要的训练策略指导意义。

今日关键词

小模型 Agent · Small Model Agent · 技能自进化 · Skill Self-Play · 任务级路由 · Task-Level Routing · 回归分析 · Regression Analysis · 模型合并 · Model Merging · RL 训练 · RL Training · Looped Transformer · Agentic RL