来源:arXiv cs.AI / cs.LG / cs.CL · 精选 5 篇(论文日期 2026-07-30,较执行日期延迟 3 天)

今日精选

1. SVR:无外部验证器的自适应推理时计算控制框架

  • 原标题: SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute
  • 作者/机构: Hongyu Chen, Liang Lin, Guangrun Wang(中山大学 / 广东省大数据分析处理重点实验室 / X-Era AI Lab)| arXiv
  • 核心贡献: ① 现有推理时计算扩展要么统一分配预算(浪费简单样本),要么依赖外部验证器引导精炼(引入额外成本)。SVR 提出无外部验证器的多轮 RL 框架:模型同时输出答案、离散正确性判断和置信度分数,仅在判断正确且置信度超阈值时停止,否则继续自精炼。② 使用 GRPO 在固定长度轨迹上联合训练「解题-验证-置信度」三个能力,真实标签仅用于构建奖励、推理时完全不可见。③ 在数学推理和代码生成任务上,SVR 以相同平均 token 预算显著优于统一分配策略和外部验证器引导方法。
  • 工程关联: 直接适用于推理模型的部署优化——在不增加外部验证器成本的前提下实现自适应计算分配;GRPO 训练框架可复用于其他需要「知道何时停止」的 Agent 场景。
  • 价值点: 将「模型知道何时停止思考」从需要外部裁判的问题转化为可端到端 RL 训练的能力,为推理时计算效率优化提供了无需额外基础设施的落地方案。

2. ORCA-bench:LLM Agent 生产环境 Oncall 根因分析基准

  • 原标题: ORCA-bench: How Ready Are Language Model Agents for Oncall?
  • 作者/机构: Albert Gong, Kyuseong Choi, Abhineet Agarwal, Jason Schechner 等(Cornell Tech / Traversal / Columbia University)| arXiv
  • 核心贡献: ① 指出现有编码 Agent 基准无法覆盖生产环境 oncall 根因分析(RCA)场景——需要从模糊的用户报告出发,在噪声指标/日志/链路追踪/源码中推理。② 构建 ORCA-bench:基于 OpenTelemetry 的微服务系统(暴露 Prometheus/Jaeger/OpenSearch 真实遥测接口 + 完整源码),包含 1,079 个 RCA 任务,系统变化报告具体性、检测延迟和并发故障场景。③ 发现即使最强编码 Agent 在 RCA 任务上仍远未达到生产可用水平,LLM-as-Judge 经专家 SRE 独立重评分验证有效。
  • 工程关联: 为 AI 辅助 SRE/Oncall 场景提供了首个高保真评测基准;基准架构(OpenTelemetry + Grafana 全栈)可直接复用于企业内部 Agent 能力评估。
  • 价值点: 揭示了 LLM Agent 从「写代码」到「诊断生产故障」之间的巨大能力鸿沟,为 AI 运维(AIOps)方向定义了可量化的评估标准。

3. Change2Task:从仓库历史自动生成可执行编码 Agent 任务

  • 原标题: Change2Task: From Repository Changes to Executable Coding Agent Tasks and Environments
  • 作者/机构: Haomin Qi, Xingliang Wang, Xuanqi Gao 等(Microsoft / UC San Diego / 浙江大学 / 西安交通大学 / 南京大学)| arXiv
  • 核心贡献: ① 编码 Agent 的扩展面临可执行数据(任务+环境+验证)供给不足的核心瓶颈。Change2Task 将已合并 PR 转化为在现代仓库版本上可执行的验证任务。② 提出三种状态重建方法:Patch Reversal(逆向补丁回到任务前状态)、Code Mapping(将历史代码映射到当前版本)、Agent Reconstruction(Agent 自主重建),并通过生命周期验证确保任务一致性。③ 生成的任务基于真实开发者证据、运行在现代维护中的仓库环境上,可直接用于训练/评测/持续评估。
  • 工程关联: 解决了编码 Agent 开发中的核心数据瓶颈——从仓库历史自动生产高质量训练和评测数据;三种重建方法可集成到现有 CI/CD 流程中实现持续基准更新。
  • 价值点: 将「仓库 PR 历史」转化为「可执行 Agent 任务」的完整管线,为编码 Agent 的规模化训练和持续评测提供了可复用的数据基础设施。

4. AISPA:以用户为中心的 LLM 系统提示审计框架

  • 原标题: AISPA: User-Centric System Prompt Auditing for Large Language Model Applications
  • 作者/机构: Xiangning Lin, Shenzhe Zhu, Shu Yang 等(Stanford / CMU / MIT / UT Austin / U of Toronto / UCSB 等 14 所机构)| arXiv
  • 核心贡献: ① 系统提示(System Prompts)是开发者控制基础模型行为的核心指令,贯穿所有商业 AI 产品,但极少向公众或监管方披露,形成严重的信任和问责缺口。② 提出 AISPA 框架:以用户为中心的系统提示审计方法,支持对 AI 应用的系统提示进行透明化检查和合规性验证。③ 构建 System Prompt Index(SystemPromptIndex.com),首次系统收集和索引商业 AI 产品的系统提示,为监管和用户提供可审计的基础设施。
  • 工程关联: 对 AI 产品合规性建设有直接参考价值——随着 AI 监管趋严,系统提示的透明化和可审计性将成为产品上线的必要条件;框架可集成到 AI 产品的发布流程中。
  • 价值点: 首次将「系统提示审计」从学术概念转化为可操作的工程框架,为 AI 治理和合规提供了从工具到索引的完整解决方案。

5. Sample More, Reflect Less:重复采样在等 token 预算下胜过自我反思

  • 原标题: Sample More, Reflect Less: Self-Refine and Reflexion Lose to Repeated Sampling at Equal Token Cost, from 1.5B to 7B
  • 作者/机构: Iliya Mirzaei(Stony Brook University)| arXiv
  • 核心贡献: ① 自我反思(Self-Refine)、Reflexion、自我批评重写等方法承诺让 LLM 无需重训练即可提升推理能力,但这些方法同时让模型生成更多文本——而更多文本本身就提高准确率。② 以实验设计方法重新对比 7 种方法(1.5B/3B/7B 模型),在严格控制 token 预算条件下,发现简单重复采样+多数投票在等成本下持续优于所有自我反思方法。③ 提供了置信区间和显著性检验,弥补了先前工作仅有单点估计的不足。
  • 工程关联: 对推理时计算分配策略有直接指导意义——在预算有限时,优先选择多次采样+投票而非复杂的反思链;结论可立即应用于 Agent 系统的推理策略设计。
  • 价值点: 用严格实验设计推翻了「自我反思优于简单采样」的工程直觉,为推理时计算优化提供了更简洁高效的基线策略。

今日关键词

自适应推理时计算 · Adaptive Test-Time Compute · 系统提示审计 · System Prompt Auditing · 编码 Agent 数据生成 · Coding Agent Data Pipeline · 重复采样 · Repeated Sampling · 根因分析 · Root Cause Analysis · GRPO · 多数投票 · Majority Voting · AI 治理 · AI Governance