中国浙大与快手提出MemGUI-Agent解决长程GUI记忆问题
维度网讯,浙江大学和快手研究团队提出了MemGUI-Agent,使手机GUI Agent在长程任务中能够主动管理上下文记忆,避免关键信息丢失。该团队来自浙江大学APRIL实验室和快手主站技术部,同期开源了平均步数最长的手持设备GUI Agent数据集MemGUI-3K。基于该数据集训练的MemGUI-8B-SFT模型在长程任务基准MemGUI-Bench和MobileWorld上刷新了开放数据模型的最好成绩。
在过去,手机GUI Agent在执行跨多App、多步骤的长程任务时,容易出现信息退化。前期获取的价格、联系人、规格、日期等关键信息,在后续步骤中会被稀释、转述错误或完全遗忘。传统ReAct风格的Agent将每一步的思考、动作和结果追加到上下文中,这导致两个问题:一是历史记录线性增长,输入长度和计算成本持续攀升;二是关键事实被噪声淹没,Agent可能记得自己查过参数,但忘记了具体数值。
MemGUI-Agent的核心设计是Context-as-Action(ConAct),将上下文管理提升为与UI点击、输入、滑动同级的动作。每一步,Agent不只输出下一步操作,还同时输出如何整理自己的工作记忆。ConAct将上下文拆解为三个结构化字段:折叠动作历史(Folded Action History),保存被压缩后的历史轨迹,由模型将完成的任务折叠为摘要;折叠UI状态(Folded UI State),保存完整的UI关键事实,如电话号码、商品价格、规格参数等;最近步骤记录(Recent Step Record),记录最近一步的观察、意图、动作和结果。
研究者进一步构建了MemGUI-3K数据集,用于训练较小规模的模型。该数据集由MemGUI-Bench的128个种子任务扩展而来,经过实体替换、记忆操作增强和任务简化,最终包含2956条成功轨迹,覆盖26个Android App和7类功能场景,提取出64430个SFT样本。平均轨迹长度为28.8步,65.1%的轨迹使用了至少一次记忆操作,88.7%的轨迹包含至少一次跨度级折叠。这些统计说明,数据集旨在教模型如何管理长程任务中的工作记忆。
在MemGUI-Bench基准上,MemGUI-Agent-235B(零样本)达到37.5% Pass@1、62.5% Pass@3和46.8% IRR,相比同一235B基线的ReAct风格,Pass@1提升13.3个百分点。MemGUI-8B-SFT在相同基准上达到23.4% Pass@1、35.9% Pass@3和30.2% IRR,相比Qwen3-VL-8B-Instruct基线分别提升14.0、15.6和15.1个百分点。在分布外基准MobileWorld GUI-Only上,MemGUI-Agent-235B获得29.1%成功率,比基线高14.6个百分点;MemGUI-8B-SFT获得17.9%成功率,超过OpenMobile-8B的17.7%。
组件消融实验表明,单独添加UI记忆操作、历史折叠或自我描述步骤均能带来提升,但三者缺一不可。完整ConAct在MemGUI-Bench-40上的Pass@1为40.0%,相比ReAct基线的5.0%有显著改善。失败分析显示,ConAct主要减少了上下文诱发的幻觉,总失败数下降约41%,其中过程幻觉和输出幻觉改善最为明显。这项研究将GUI Agent的记忆问题从外部工程模块推进到策略模型内部,使Agent在执行动作的同时学会管理执行过程本身。

论文第一作者为浙江大学APRIL实验室博士生刘广义,通讯作者为浙江大学刘勇教授。MemGUI-Agent全链路开源,代码、数据、模型、训练和评测管线均已开放。

长程手机任务的瓶颈在于模型需要保存跨屏幕、跨步骤、跨App的UI衍生事实,包括价格、电话号码、商品规格、社交媒体帖子内容和待复制文本等。被动追加历史记录既不紧凑也不可靠。ConAct使Agent在每一步输出五段结构化内容:思考、折叠、工具调用、UI观察和动作意图。工具调用既包括常规UI动作,也包括记忆操作,如memory_add、memory_update和memory_delete。这意味着上下文管理由同一个多模态策略模型在单次前向推理中完成。

研究者发现,将ConAct协议套用到现有模型上并不能自动提升效果。在Qwen3-VL不同规模模型上做的零样本实验显示,只有最强的Qwen3-VL-235B-Thinking能明显受益于ConAct,较小规模模型或235B-Instruct在零样本下使用ConAct时性能反而下降。这证实主动上下文管理并非简单的提示词技巧,模型必须学会何时压缩历史、何时写入UI记忆以及如何生成可复用的步骤描述。

在数据收集阶段,作者使用Qwen3-VL-235B-Thinking作为教师模型,按照完整ConAct协议在Android环境中执行任务。随后通过轨迹级过滤和步骤级合理性过滤,确保监督训练数据中没有冗余、错误或绕路步骤。

该数据集提取出57951个合理训练步骤和6479个合理测试步骤。从数据统计看,MemGUI-3K的平均轨迹长度为28.8步,中位数为25步;23.8%的折叠是跨度级折叠,即把多个步骤压缩成一个子任务摘要。

实验报告了两类Agent设定:第一类是MemGUI-Agent-235B,保持Qwen3-VL-235B-Thinking权重不变,在零样本设置下使用ConAct协议;第二类是MemGUI-8B-SFT,从Qwen3-VL-8B-Instruct出发,在MemGUI-3K上进行LoRA SFT。在MemGUI-Bench上,MemGUI-Agent-235B达到37.5% Pass@1、62.5% Pass@3和46.8% IRR。相比同一235B backbone的ReAct风格基线,Pass@1提升13.3个百分点,Pass@3提升15.6个百分点,IRR提升16.8个百分点。与Gemini-2.5-Pro驱动的agentic workflow相比,它也取得了更强的整体表现。

在MobileWorld GUI-Only上,MemGUI-Agent-235B获得29.1%成功率,比Qwen3-VL-235B-Thinking基线高14.6个百分点。MemGUI-8B-SFT获得17.9%成功率,比Qwen3-VL-8B-Instruct高8.5个百分点,也超过了OpenMobile-8B的17.7%。

组件消融实验在MemGUI-Bench-40上开展。ReAct基线的Pass@1只有5.0%。单独加入UI记忆操作后,Pass@1提升到17.5%;单独加入历史折叠后,Pass@1提升到22.5%;单独加入自我描述步骤后,Pass@1提升到25.0%。完整ConAct使Pass@1达到40.0%,Pass@3达到62.5%,IRR达到51.0%。这三个组件分别处理不同问题:历史折叠控制上下文增长,UI记忆保存精确事实,自我描述步骤为后续记忆和折叠提供可靠原料。

案例显示,在长程手机GUI任务中,关键信息往往只在中间某个页面短暂出现,但Agent需要在几十步后甚至切换App后继续准确使用。MemGUI-Agent的做法是:在看到关键事实时主动写入UI记忆,在完成阶段性子任务后把历史折叠成compact history,使模型可以直接读取结构化状态,将前面看到的信息带到后续App中使用。

失败案例分类显示,在MemGUI-Bench-40的零样本消融设置中,完整ConAct将总失败数从99降到58,下降约41%。其中,过程幻觉从52降到30,输出幻觉从30降到13,改善最明显。这表明ConAct主要解决上下文导致的幻觉,而知识缺陷和意图理解方面的改进较小,说明模型的App知识、任务意图理解和环境鲁棒性仍然是后续瓶颈。

对于长程移动自动化任务而言,将GUI Agent的记忆问题从外部模块推向策略模型内部,让Agent不仅执行动作,还要学会管理执行过程本身,是从能点走向能办成事的重要一步。





















