← 回總覽

论文秀 Live#42 | ICML 2026 论文解读

📅 2026-07-14 17:33 蚂蚁技术AntTech 人工智能 2 分鐘 1527 字 評分: 92
ICML AI Agent 移动GUI 扩散模型 数据集剪枝
📌 一句话摘要 本期论文秀深度解读 ICML 2026 的三篇前沿论文,分别聚焦移动 GUI 智能体用户中心化评测、扩散语言模型推理优化与数据集剪枝框架,展示大模型高效落地的最新突破。 📝 详细摘要 本期「论文秀」精选 ICML 2026 三篇前沿研究,针对大模型落地的三大核心挑战——移动智能体评测难以反映真实用户需求、扩散模型解码顺序敏感性高、数据集剪枝方法适配性差——提出系统性解决方案。第一篇《VenusBench-Mobile》构建用户意图驱动的能力诊断体系,揭示当前移动 GUI 智能体在感知与记忆能力上的短板,并通过细粒度评测暴露其在真实场景中的脆弱性;第二篇《Lookahead

📌 一句话摘要

本期论文秀深度解读 ICML 2026 的三篇前沿论文,分别聚焦移动 GUI 智能体用户中心化评测、扩散语言模型推理优化与数据集剪枝框架,展示大模型高效落地的最新突破。

📝 详细摘要

本期「论文秀」精选 ICML 2026 三篇前沿研究,针对大模型落地的三大核心挑战——移动智能体评测难以反映真实用户需求、扩散模型解码顺序敏感性高、数据集剪枝方法适配性差——提出系统性解决方案。第一篇《VenusBench-Mobile》构建用户意图驱动的能力诊断体系,揭示当前移动 GUI 智能体在感知与记忆能力上的短板,并通过细粒度评测暴露其在真实场景中的脆弱性;第二篇《Lookahead Path Likelihood Optimization for Diffusion LLMs》提出 POKE-SMC 框架,通过路径似然前瞻估计与 SMC 搜索动态优化解码顺序,在多个基准测试中实现 3%-5%的准确率提升;第三篇《Selecting Samples on Graphs》将数据集剪枝转化为最大权重团问题,通过图结构统一框架在 ImageNet 上实现 40%训练加速且精度无损。三篇论文均由作者亲自分享设计思路与验证过程,展现 AI 工程化落地的最新进展。

💡 主要观点

- VenusBench-Mobile 构建用户意图驱动的移动 GUI 智能体评测基准,暴露当前智能体感知与记忆能力短板。 该论文通过用户中心化任务设计与能力导向标注体系,对主流移动 GUI 智能体进行大规模评测,发现现有模型在真实场景中表现脆弱,且粗粒度评测无法揭示感知/记忆等核心能力缺陷。

POKE-SMC 框架通过路径似然前瞻估计与 SMC 搜索,动态优化扩散语言模型解码顺序。 针对扩散模型推理性能对解码顺序的高度敏感性,论文提出 POKE 估计器与 SMC 搜索结合的方法,在 GSM8K 等 6 个基准上实现 3%-5%准确率提升,并展现出对高吞吐推理场景的良好鲁棒性。
图结构数据剪枝框架将 NP 难问题转化为高效贪心求解,实现 ImageNet 上 40%训练加速且精度无损。 论文将数据集剪枝建模为最大权重团问题,通过节点/边权重表征样本价值与关联性,设计规范化贪心算法在理论保障下实现高效求解,为数据治理提供通用解决方案。

💬 文章金句

- VenusBench-Mobile 为推动移动 GUI 智能体走向稳健的真实世界部署提供了重要基础。

  • POKE-SMC 在准确率-计算的 Pareto 前沿上持续优于已有方法。
  • 该方法全面优于现有传统数据集剪枝算法,在完全不损失模型精度的前提下,大幅降低训练成本。

📊 文章信息

AI 初评:92

来源:蚂蚁技术AntTech

作者:蚂蚁技术AntTech

分类:人工智能

语言:中文

阅读时间:12 分钟

字数:2826

标签: ICML, AI Agent, 移动GUI, 扩散模型, 数据集剪枝

阅读完整文章

查看原文 → 發佈: 2026-07-14 17:33:00 收錄: 2026-07-14 22:00:38

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。