来源:arXiv cs.AI / cs.LG / cs.CL · 精选 5 篇(论文日期 2026-07-29,较执行日期延迟 2 天)
今日精选
1. ROPD:基于路由式在线蒸馏的 LLM 安全重新对齐
- 原标题: On-Policy Distillation for LLM Safety: A Routing Approach to Template-Robust Realignment
- 作者/机构: Yongjian Guo(清华大学), Wanlun Ma(斯威本科技大学), Lingyu Shen(EPFL), Xi Xiao(清华大学), Sheng Wen(斯威本科技大学)| arXiv
- 核心贡献: ① 针对微调后 LLM 安全对齐的三大痛点——灾难性遗忘、模板失配导致防御崩溃、系统提示词切换即可重新越狱——提出 Routing-based On-Policy Distillation (ROPD) 框架。② 不同于拟合特定提示模板,ROPD 直接建模对齐模型与被攻击模型输出概率分布的差异,实现模板鲁棒的安全重新对齐。③ 在 3 个数据集、3 个不同对齐强度的基座模型上对比 4 种 SOTA 基线方法,ROPD 在模板失配场景下显著优于基线——当基线方法因模板偏移出现严重能力退化时,ROPD 的性能衰减可忽略不计。
- 工程关联: 直接服务于微调后模型的安全部署,尤其适用于第三方微调模型或使用不可信训练数据的场景;ROPD 的思路可迁移至 RLHF/DPO 后训练流程中的安全策略注入。
- 价值点: 提供了一种模板鲁棒的 LLM 安全修复方案,解决「对齐→微调→破防」循环中的能力保持难题,对生产环境中模型安全更新有直接参考意义。
2. InferScale:面向个性化 LLM 推理的 GPU 原生 KV 注入系统
- 原标题: InferScale: GPU-Native KV Injection for Personalized LLM Serving
- 作者/机构: Peter Li, Prashant Pandey(美国东北大学)| arXiv
- 核心贡献: ① 针对 LLM 个性化推理中重复 prefill 共享记忆内容的问题(如 Mem0/MemGPT/Zep 每次请求都需重新编码用户记忆),提出 GPU 原生 KV 缓存复用方案。② 预计算每条记忆事实的 KV 表示并存储在 GPU 上,推理时直接注入 vLLM 的分页缓存,省去重复 prefill;配套提出 Chunked RoPE(存储未旋转的 key,注入时按实际位置旋转)和 Context-Window Encoding(编码时保留小窗口上下文以补偿独立编码损失)。③ 基于 vLLM KV-connector 接口实现,无需修改推理引擎或模型权重;在 LoCoMo 数据集上,k=50 时 TTFT 降低 72-79%(3.6-4.8×),准确率 60.3% vs Mem0 的 63.3%。
- 工程关联: 直接优化 LLM 推理服务中个性化记忆场景的延迟瓶颈,与 vLLM 生态无缝集成;Chunked RoPE 方案对任意需要 KV 缓存预计算+动态组装的场景均有参考价值。
- 价值点: 将个性化 LLM 服务的 TTFT 从「随记忆量线性增长」变为「近乎恒定」,对实际部署中用户体验改善显著,且无需模型改造即可落地。
3. OmegaUse-OfficeVal:面向长周期办公任务的 LLM Agent 经济化评估基准
- 原标题: OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding
- 作者/机构: Jingbo Zhou, Yusai Zhao, Qi Bao 等(百度 · Agent 前沿团队)| arXiv
- 核心贡献: ① 构建首个以经济成本为锚点的长周期办公自动化 Agent 评估基准,包含 100 个从实际从业者需求中提取的真实办公任务,平均每任务需 2.32 小时人工完成。② 每个任务附带两组经济信号——人工耗时与任务价格代理,支持直接比较人类成本与 LLM 推理成本,以及按价值加权的评估。③ 开发基于代码的细粒度确定性验证器,对比多个前沿 LLM Agent 与人类基线:所有 LLM 在速度和成本上远低于人类,但交付质量尚未达到人类水平。代码与数据集全开源。
- 工程关联: 为办公自动化 Agent 的产品化评估提供了「成本-质量」双维度的可量化框架,直接指导企业 Agent 部署的 ROI 评估和任务分配策略。
- 价值点: 将 Agent 评估从「能完成任务吗」升级为「值得用 Agent 替代人工吗」,为办公场景 Agent 落地的商业决策提供数据支撑。
4. CAM-DF:LLM Agent 工具获取的成本感知停止策略
- 原标题: Scores Are Not Decisions: Cost-Aware Stopping for Tool Acquisition in LLM Agents
- 作者/机构: Yicheng Feng(北京大学), Yan Zhang(麦吉尔大学), Yan Cheng(上海财经大学), Wei Qi(清华大学)| arXiv
- 核心贡献: ① 提出 LLM Agent 工具选择的新问题形式化:现有工具路由器/检索器能排序工具相关性,但不能决定「选择几个工具」——太少信息不足,太多增加成本/上下文/隐私风险。② 形式化为成本感知的边缘决策聚焦停止(CAM-DF),直接在离线 gap 上训练决策边界——训练目标的符号标记决策方向,幅度按 payoff 风险加权;理论证明纯分数规则在异构成本下是次优的。③ 在 5 个工具使用域的 1,343 个任务上评估,τ-bench Retail 上获所有可部署方法中的最高 payoff;在实时执行中,CAM-DF 使用比全量工具少 37% 的工具,同时保持相当的任务成功率。无需微调底层 LLM,即插即用。
- 工程关联: 为 Agent 框架的工具路由模块提供轻量级后处理插件,直接降低每次工具调用的 token 成本和延迟,适用于任何已有工具排序器的 Agent 系统。
- 价值点: 将工具选择从「排个序都给你」变成「按需取用、适可而止」,在成本敏感的生产环境中可节省约 1/3 的工具调用开销。
5. TREK:面向复杂旅行规划的 LLM Agent 推理与评估套件
- 原标题: TREK: A Travel Reasoning and Evaluation Kit for LLM Agents in Complex Trip Planning
- 作者/机构: Jinhu Qi, Wentao Zhang(澳门理工大学), Siu Man Ng, Feiyang Xu, Yanyu Chen, Yaoman Li, Irwin King(香港中文大学)| arXiv
- 核心贡献: ① 将旅行规划定位为 LLM Agent 工具使用的压力测试:一份可用行程需要同时在航班/酒店/景点真实性、时空可执行性、预算约束、未明说的旅行者偏好等多个维度上正确。② 构建 TREK 基准,包含 800 个多约束任务(533 个可行 + 267 个可证明不可行),覆盖 375 个城市、13 种旅行者画像,内置 212,530 条一致性知识库,通过生产级 RESTful API 沙箱提供工具。③ 采用全确定性、基于规则的评估器,无需 LLM 评判,每个任务附带人工验证的黄金参考答案(满分 1.0)——天花板可证明可达,剩余差距全部来自 Agent 能力不足而非评分器严苛。代码与数据开源。
- 工程关联: 为 Agent 的多约束联合推理、工具编排、幻觉检测(所有实体必须真实存在)提供标准化测试平台;确定性评估器的设计思路可直接用于其他 Agent 基准的评分方案改进。
- 价值点: 提供了当前最严格的 Agent 多约束推理测试——不是「答对了吗」,而是「能拿出一份可执行、无幻觉、合预算的完整方案吗」,推动 Agent 评估从软评分走向硬验证。
今日关键词
LLM 安全对齐 · On-Policy Distillation · KV Cache 注入 · 个性化 LLM 推理 · Agent 经济评估 · 工具获取成本 · 多约束推理 · 确定性 Agent 评估 · LLM Safety Alignment · KV Injection · Tool Acquisition Cost · Deterministic Evaluation