来源:arXiv cs.AI / cs.LG / cs.CL · 精选 4 篇(论文日期 2026-07-16,滞后执行日期 3 天)
今日精选
1. Plover:以计划为中心的人机协同 GUI 自动化
- 原标题: Plover: Steering GUI Agents through Plan-Centric Interaction
- 作者/机构: Madhumitha Venkatesan, Shicheng Wen, Dongyu Liu 等(加州大学戴维斯分校 / Bosch Research North America)| arXiv
- 核心贡献: ① 指出现有视觉驱动的 GUI Agent 在真实环境中面临动态布局、意外弹窗等挑战时,规划和适应过程完全内部化,用户无法检查、监督或纠正系统行为。② 提出 Plover:一种以计划(plan)为中心的 GUI 自动化系统——通过 planner-executor 架构将任务计划和重规划外化为持久、可检查和可编辑的 artifacts。③ 支持显式执行监督、可编辑计划的局部修正、自然语言引导和基于截图的干预,且在修复过程中保留已有进度。6 人形成性实验 + benchmark 失败案例修复 + 场景化工作流分析验证有效性。
- 工程关联: 对构建企业级 GUI Agent(浏览器自动化、RPA、桌面操作 Agent)的团队有直接参考。Plover 的核心洞察——将 Agent 的计划外化给人、支持局部修正而非整体重启——是 GUI Agent 从 demo 走向可靠生产的关键设计模式。
- 价值点: UC Davis + Bosch 联合出品,6 人形成性实验提供了扎实的交互设计依据。将「计划」提升为一等公民,实现了人机协同的 GUI 自动化——这是当前纯自主 Agent 范式的重要补充。
2. PRISM:当话语安全但行为致命——LLM 具身 Agent 的物理危险检测
- 原标题: When Words Are Safe But Actions Kill: Probing Physical Danger Beyond Text Safety in Hidden-State Risk Space
- 作者/机构: Weimeng Wang, Ziqiang Wang, Zihang Zhan 等(清华大学)| arXiv
- 核心贡献: ① 提出核心安全悖论:LLM 作为具身 Agent 的高层规划器时,语言层面良性的指令一旦落地到物理世界可能不安全——文本内容危险(CD)与物理危险(PD)是否可分离?② 通过隐藏状态方向分析和随机分割零检验,首次证明 CD 与 PD 在 Qwen2.5/Phi-3.5/SmolLM2 全系列的 LLM 表征空间中构成可分离信号。③ 基于 CD/PD 可分离性提出 PRISM(单层 L2 正则化逻辑探针):SafeAgentBench 上 86.2–87.7% 准确率,FPR 仅 11.7–13.7%(同规模 LLM judge 过阻率达 24.7–39.0%)。构建 PSB-1K(1000 对物理风险对比基准,不含直接伤害关键词),PRISM 达 99.6% 准确率、0.7% FPR,而 Qwen2.5-3B judge 拒绝 67.8% 的安全任务。
- 工程关联: 对构建具身 Agent(机器人、自动驾驶、智能家居)安全防护系统的团队是关键技术。PRISM 的隐藏状态探针方法轻量高效——单层逻辑回归,无需大规模微调——可作为 LLM Agent 部署前的 safety gate 直接集成。
- 价值点: 清华出品,首次严格论证「文本安全 ≠ 物理安全」并通过表征空间可分离性提供工程化解决方案。PSB-1K 基准弥补了具身 Agent 安全评估的关键空白——不含明显伤害关键词的场景才是真实世界的常态。
3. 预训练 LLM 分词器原地扩展:低资源语言推理加速 2–4 倍
- 原标题: In-Place Tokenizer Expansion for Pre-trained LLMs
- 作者/机构: Jimmy T. H. Smith, Maxime Labonne, Alexander Amini 等(Liquid AI / MIT)| arXiv
- 核心贡献: ① 指出预训练时固定分词器带来的语言公平性问题:后加入的语言被拆分成更多 token,导致延迟和能耗上升。云端大模型可承受大词表,但端侧模型因嵌入矩阵/LM-head 矩阵占比高,被迫使用小词表。② 提出分词器原地扩展方案:在已有分词器的 BPE merge 上接续多语言语料训练新 merge,使得已有 token 保持不变、新 token 可精确分解为源 token。嵌入矩阵中已有行直接复制、新行初始化为源 sub-token 嵌入的均值,经两阶段调适(仅嵌入训练 + 全模型继续预训练)恢复源 checkpoint 质量。③ 在 LFM2-8B-A1B(8B MoE)上应用,产出 LFM2.5-8B-A1B(128K 词表),印地语和越南语 token 数降至约 1/2.4–1/2.6(泰语高达 1/4),实测解码速度提升 2.2–3.7 倍。模型权重和扩展分词器已开源。
- 工程关联: 对部署多语言 LLM 的团队是即插即用的基础组件升级。两阶段调适策略(先冻结模型训嵌入、再全模型继续预训练)可作为任何 LLM 分词器升级的标准流程——特别适合端侧和 MoE 模型场景。
- 价值点: Liquid AI 出品,开源模型权重。解决了端侧 LLM 部署的核心痛点:小词表限制多语言能力、大词表加重解码带宽。首次量化了分词器升级对实际硬件解码速度的增益(2–4 倍),有直接工程落地价值。
4. Rubrics on Trial:无需人工标注、从单条 Query 自演进评分标准
- 原标题: Rubrics on Trial: Evolving Rubrics from a Single Query via Synthetic Pairwise Evidence
- 作者/机构: Haocheng Yang(新加坡国立大学), Licheng Pan(小红书/浙江大学)等(NUS / 小红书 / 浙大 / 北大 / 上财多机构联合)| arXiv
- 核心贡献: ① 指出当前 LLM 评分标准(rubric)构建依赖人工标注、偏好数据或模型采样——直接 query-to-rubric 生成虽无需外部资源,但缺乏对 rubric 有用性的验证,可能生成无法区分答案质量、奖励无关风格或惩罚合理替代方案的无效 rubric。② 提出 Rubrics on Trial:完全基于单条 query、无需任何外部标注或模型训练的 rubric 自演进框架——从空集出发,仅利用合成 rubric 条件化的响应对作为监督信号,在添加每个候选 rubric 前进行验证:筛除不具区分力、过度特化、仅依赖风格三类无效 rubric。③ 在 5 个偏好基准套件上达到最佳平均准确率,7 个评估集中 6 个领先。
- 工程关联: 对构建 LLM-as-a-Judge / 自动评估系统的团队是颠覆性的方法。Rubrics on Trial 免除了人工构建评分标准的高昂成本——从一条 query 即可自动生成经过验证的细粒度评分维度。三类无效 rubric 的筛选机制(非区分性/过度特化/仅风格)可作为 LLM 评估 pipeline 的质量门控组件直接复用。
- 价值点: NUS + 小红书 + 浙大 + 北大 + 上财多机构联合。将「评分标准设计」这一 LLM 评估中最耗时、最依赖专家经验的环节完全自动化——三阶段验证筛选机制(区分力/特化度/风格依赖)保证了自动生成 rubric 的可靠性,对大规模 LLM 评估有直接降本增效价值。
今日关键词
GUI Agent 人机协同 · Human-AI GUI Collaboration · 具身 Agent 物理安全 · Embodied Agent Physical Safety · 隐藏状态安全探针 · Hidden-State Safety Probing · 分词器原地扩展 · Tokenizer In-Place Expansion · 评分标准自动演进 · Automatic Rubric Evolution · 计划外化交互 · Plan-Externalized Interaction · 两阶段模型调适 · Two-Stage Model Adaptation · 合成证据验证 · Synthetic Evidence Validation