来源:arXiv cs.AI / cs.LG / cs.CL · 精选 5 篇(论文日期 2026-07-22,滞后执行日期 2 天)

今日精选

1. Notes to Self:LLM 能否从经验抽象中受益?

  • 原标题: Notes to Self: Can LLMs Benefit from Experiential Abstractions?
  • 作者/机构: Chang Liu, Xinyu Li, Artur Dubrawski 等(Carnegie Mellon University, Auton Lab)| arXiv
  • 核心贡献: ① 提出「经验抽象」概念:让 LLM 从自己的 MATH 解题轨迹中提取可复用的自然语言策略和警示(类似人类的「做题笔记」),存入可检索知识库。② 验证两种使用模式:推理时检索注入 prompt 和 RL 后训练时用抽象增强训练样本。③ 关键发现:LLM 自提取的抽象效果媲美教师模型提取的抽象,且本框架可跨数据集、跨模型迁移。代码已开源。
  • 工程关联: 对 LLM 数学推理和代码生成场景有直接价值。可视为 RAG 的进阶形态——不是检索外部文档,而是检索模型自己的「经验」。RL 后训练中的抽象增强方法可直接集成到现有 GRPO/DAPO 训练流程,提升模型在困难样本上的学习效率。
  • 价值点: CMU 出品。「自提取 → 自检索 → 自改进」的闭环思路很有工程启发——LLM 可以像人类一样从自己的解题经验中提炼规律并迭代改进,而无需外部教师。代码已发布,可快速复现。

2. PyroDash:Token 级大小模型协同推理的成本优化框架

  • 原标题: PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference
  • 作者/机构: Niqi Lyu, Pengtao Shi, Wei Qiu 等(Pyromind Dynamics Inc.)| arXiv
  • 核心贡献: ① 提出 PyroDash:SLM 在生成过程中通过发射控制 Token 自主决定是否请求 LLM 协助,无需独立路由器、无需修改 LLM、无需访问 LLM logits。② 三阶段训练:控制 Token 嵌入学习 → 卸载导向 SFT → 基于 GRPO 的成本感知对齐。③ 惊人效果:λ=0.05 时准确率 64.04%(超 LLM 单独推理 6.36pp),同时成本降低 20.4%;λ=0.6 时仅消耗 1.90% LLM Token,成本从 1.78(降低 96.4%)。
  • 工程关联: 对部署 LLM 推理服务且成本敏感的团队极其有价值。核心思路——SLM 自主判断难度、只在必要时调用 LLM——可直接应用于 Agent 工作流、RAG 系统、客服机器人等高频推理场景的降本。三阶段训练方法(特别是 GRPO 成本感知对齐)可复现到其他 SLM-LLM 协作系统。
  • 价值点: 企业级(Pyromind Dynamics)实用方案。将 SLM-LLM 协同的成本-准确率权衡做到了极致的可控性——不是「总是调用 LLM」也不是「总是用 SLM」,而是一个可调节的成本-性能连续谱(λ 参数)。从 1.78 的降本幅度对生产落地有直接吸引力。

3. PoTRE:基于认知异质性的测试时推理框架(TMLR 2026 录用)

  • 原标题: PoTRE: Test-Time Reasoning inspired by Cognitive Heterogeneity
  • 作者/机构: Anmol Kankariya, Sercan Ö. Arık(Google Cloud AI / Google DeepMind)| arXiv
  • 核心贡献: ① 将推理拆分为四个异质 Agent 的协同:对抗性改进 Agent、分层策略规划 Agent、频谱搜索 Agent、直接链式 Agent,最后通过自适应聚合层(候选选择 / 语义合成 / 神经符号验证)产生最终答案。② 在三个前沿基准上取得 SOTA:HLE(人类终极考试)49.92% 准确率创纪录,ARC-AGI-2 和金融推理 PRBench 上也表现优异。③ 关键优势:以更少或相当的推理 Token 超越大规模同质基线。
  • 工程关联: 对做复杂推理和 Agent 系统的团队是直接可用的架构范式。多 Agent 异质协同 + 任务自适应聚合的框架比简单的「多次采样投票」更高效,可应用于代码修复、数学证明、金融分析等需要「换个角度再想一次」的场景。
  • 价值点: Google DeepMind 出品,TMLR 2026 正式录用。在 HLE 上创 SOTA 证明异质 Multi-Agent 路线比同质 Scaling 更高效——这是一个重要的架构信号:不是继续堆 Token,而是让不同「认知风格」的 Agent 互相补充。

4. SLAI T-Rex:在华为 Ascend SuperPOD 上全参数后训练 DeepSeek-V4 万亿参数 MoE 模型

  • 原标题: SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD
  • 作者/机构: Dongfang Li, Xiaodong Luo, Ruoyu Sun 等(60+ 作者,Huawei Ascend 生态团队)| arXiv
  • 核心贡献: ① 在华为 Ascend NPU SuperPOD 上实现 DeepSeek-V4 万亿参数 MoE 模型的全参数后训练,构建跨模型并行、计算-通信编排、底层 Kernel 执行的层次化优化框架。② 达成 34.22% MFU(模型浮点利用率),较开源基线提升 2.93 倍且保持训练稳定。③ 在 DeepSeek-V4-Flash 上构建运筹学(OR)领域的 CPT+SFT 数据管线(10K 高质量样本),零样本 Pass@1 达 71.81%,超越 GPT-5.4-Mini 3.98pp、超越基础版 11.27pp。
  • 工程关联: 对关注国产芯片生态和自主算力的团队是里程碑式参考。证明了在非 GPU 架构(Ascend NPU)上进行万亿参数级全参数后训练的可行性,34.22% MFU 和 2.93x 优化倍数具有直接工程参考价值。领域 SFT 数据管线(运筹学)的方法论可迁移到其他专业领域。
  • 价值点: 华为 Ascend 生态重大突破。首次在国产 NPU 集群上完整演示「万亿参数 MoE 全参数后训练 → 领域特化 SFT → 超越 GPT-5.4-Mini」的全栈路径,对国产 AI 基础设施的可信度和工程实践有深远意义。73 页长文,22 图 20 表,细节丰富。

5. OpenSkillRisk:使用现实世界第三方技能的 Agent 安全基准测试

  • 原标题: OpenSkillRisk: Benchmarking Agent Safety When Using Real-World Risky Third-Party Skills
  • 作者/机构: Qiyuan Liu 等(City University of Hong Kong / 香港 AI 科学研究所 / 北京邮电大学 / 理想汽车)| arXiv
  • 核心贡献: ① 构建首个聚焦第三方技能安全的 Agent 安全基准 OpenSkillRisk,从公开技能市场收集 263 个高风险技能,划分 7 种威胁类型,配备标准化用户任务和沙盒环境。② 全面评测 3 种主流 CLI Agent 框架 + 13 个 SOTA LLM,结论严峻:最安全的配置仍有约 17% 的情况下执行了不安全操作。③ 识别三种失败模式:未识别风险、识别但未干预、超出用户意图范围执行技能指令。
  • 工程关联: 对在生产中使用 Agent 框架(如 Claude Code、OpenCode、Codex CLI 等)调用第三方工具/插件的团队是「必读」级安全参考。OpenSkillRisk 的分类体系和评估框架可直接用于内部 Agent 安全审计。17% 的「安全地板」率是强烈的安全警示。
  • 价值点: 城大 + 理想汽车联合出品。在 Agent 安全领域填补了「第三方技能风险」的关键空白——此前安全研究多聚焦 prompt 注入或模型自身安全,而忽略了 Agent 执行第三方代码时的隐蔽风险。263 个真实技能 + 7 类威胁 + 13 个模型的全景评测,数据驱动的方法论值得所有 Agent 产品团队重视。

今日关键词

经验抽象 · Experiential Abstractions · 大小模型协同推理 · SLM-LLM Collaborative Inference · Token 级路由 · Token-Level Routing · 多智能体推理 · Multi-Agent Reasoning · 认知异质性 · Cognitive Heterogeneity · NPU 万亿参数后训练 · Trillion-Parameter NPU Post-Training · 第三方技能安全 · Third-Party Skill Safety · GRPO 成本感知对齐 · Cost-Aware GRPO Alignment