哈工深团队打造的“懂你“AI助手:让手机帮你跨应用办事,越用越聪明

发布时间:2026/7/25 4:34:08

哈工深团队打造的“懂你“AI助手:让手机帮你跨应用办事,越用越聪明 这项由哈尔滨工业大学深圳与深圳湾区研究院联合开展的研究以预印本形式发布于2026年7月论文编号为arXiv:2607.12625感兴趣的读者可通过该编号查阅完整原文。手机里装了几十个App但每次要办一件稍微复杂点的事还是得自己一个一个打开、一步一步操作AI助手明明挂着嘴边真正能帮上忙的时候却少得可怜。哈工深的研究团队就是奔着这个现实痛点去的。他们造出了一个叫做KnowAct-GUIClaw的系统核心思路可以用一句话概括**一个真正懂你的AI助手应该像一个经验丰富的老秘书——不仅知道你要什么还记得上次怎么做、哪里踩过坑下次直接走捷径。**这篇研究诞生的背景是当前AI智能体领域一个尚未解决的尴尬市面上已有OpenClaw这类优秀的AI智能体框架能帮人自动分解任务、调用工具、完成复杂目标。但这些框架有两个硬伤——第一它们不擅长操作手机和电脑屏幕上的图形界面遇到需要点开App、找到按钮、填写内容这类操作就力不从心第二它们没有学习记忆机制每次执行任务都像第一次完全不会从过去的经历中积累经验。KnowAct-GUIClaw就是为了同时解决这两个问题而生的。---一、老秘书的工作哲学懂得深才能做得好所谓老秘书从不是接到一个任务就埋头干活的人。在动手之前他会先翻翻手头的记录——上次帮你订机票走的哪个App、某个平台的设置在哪个角落、你的偏好是什么。这正是KnowAct-GUIClaw系统的核心设计哲学研究团队将其概括为Know Deeply, Act Perfectly深度理解精准执行。这套系统的整体架构由两个角色分工协作。一个是主控智能体相当于那位老秘书本人负责理解用户意图、分解任务、调配资源、监督全局另一个是GUI执行器相当于一双擅长操作屏幕的手专门负责在具体的App界面上完成一系列点击、滑动、输入等操作。这两个角色之间有明确的边界主控智能体管做什么GUI执行器管怎么在屏幕上做。两者之间的分工为什么重要因为AI操作图形界面本质上是一个盲人摸象式的困境。每次截图只能看到屏幕当前显示的内容看不到后台状态也不知道用户是否已经登录、权限是否已经授予、某个按钮点下去会触发什么。研究团队用一个专业词汇描述这种困境部分可观测的马尔可夫决策过程POMDP——简单说就是智能体在不完整的信息下需要连续做决策还得能从错误中恢复。把这个复杂的屏幕操作问题单独交给一个专门的执行器处理主控智能体就能集中精力在更高层的任务规划上整体效率和准确性都大幅提升。---二、从任务到行动的四步流水线知、路、行、思KnowAct-GUIClaw的整个执行过程分为四个环节研究团队称之为Know-Route-Act-Reflect知-路-行-思这四步首尾相连、循环迭代构成一个不断进化的闭环。第一步知是动手之前的准备功课。系统会主动去翻阅自己积累的历史记录和知识库把与这次任务相关的信息都调出来备用——比如这类任务通常用哪个App、上次有没有遇到过类似情况、有没有现成的操作捷径可以复用。这些记忆不会强制覆盖当前指令而是作为参考建议提供给后续环节。当用户的指令比较模糊时系统还会结合历史中记录的用户偏好自动补全合理的默认假设并向用户明确说明等待确认或修改。第二步路是任务分解和路径规划。面对一个可能横跨多个App的复杂任务系统会把它切分成若干个子任务每个子任务对应一个具体的App并明确规定这个子任务需要哪些输入信息、完成后要输出哪些信息。这些中间信息不是靠模型脑补传递而是写进一块公共的黑板上下游子任务直接从黑板上取数据。如果某块数据取不到任务就直接中止而不是让系统胡乱猜一个继续跑——这种缺数据就停的设计有效防止了AI凭空捏造信息导致连锁错误的问题。第三步行是具体的屏幕操作执行阶段。GUI执行器在这一步登场它拥有一套完整的操作工具箱点击、滑动、输入文字、返回主界面、等待加载……除了这些基础动作它还能调用系统预先验证过的快捷方式比如Android深度链接直接跳转到某个App的特定页面和系统意图通过系统级命令触发特定功能。这些快捷方式能绕过大量繁琐的导航步骤但只有在系统确认目标页面确实存在且参数正确之后才会使用避免了因盲目走捷径而跑偏的风险。第四步思是任务结束后的复盘和沉淀。系统会把这次任务的执行轨迹梳理成简洁的经验笔记成功的路径提炼成可复用的技能模板失败的经历提炼成警示教训。下次遇到类似任务这些沉淀的经验就会在知这一步被调取出来让整个执行过程走得更快更稳。---三、记忆系统AI版的工作日志KnowAct-GUIClaw的记忆系统分为两种形态各司其职相辅相成。第一种是经验记忆存储的是文字形式的经验教训。每次任务跑完系统会把执行过程浓缩成一段简洁的描述分成成功笔记和失败笔记两类分别写入。成功笔记记录这类任务这样走效率最高、这个App的目标功能在这个入口失败笔记记录这条路走不通、这个界面设置不在手机App里而在网页管理后台。这些记忆不会被无限堆积系统会过滤掉重复的内容每种任务最多保留几条最有价值的经验保持知识库的精炼和有效。论文里有一个非常生动的案例用Mastodon这个社交平台创建邀请链接。没有记忆系统的情况下AI老老实实打开Mastodon的手机App在设置里翻来翻去最终走到死路——因为带高级选项的邀请链接功能根本不在手机App里只在网页管理后台。有了记忆系统之后系统在知这一步就调出了一条经验笔记Mastodon邀请链接需要通过网页管理后台操作手机App不支持。于是直接打开浏览器登录管理后台找到邀请设置任务顺利完成。从走错路到精准导航差别就在于那一条几行字的经验记录。第二种是技能库存储的是可以直接复用的操作程序。技能库里的每一项技能都是一段标准化的操作流程比如在拼多多搜索商品打开App → 点击搜索栏 → 输入关键词 → 点击搜索按钮。这段流程里固定不变的内容按钮位置、界面元素直接写死会随任务变化的内容搜索关键词用占位符表示执行时动态填入。技能不是一成不变的。当系统在执行中发现某个技能失效了比如App更新后界面布局变了它不会直接丢掉这个技能另起炉灶而是触发技能进化机制记录失败的步骤、截图证据和错误原因然后针对这个技能做定向修复——也许是更新按钮坐标也许是加一个处理弹窗的可选步骤也许是收窄技能的适用范围。修复优先于重建保证了技能库的稳定积累。---四、跨App信息传递黑板机制杜绝信息丢失处理横跨多个App的复杂任务最容易出的问题不是某个单步操作失误而是信息在传递过程中丢失或变形。设想这样一个场景用户让AI助手去我的邮件里找今晚派对的时间然后提前一小时给我设一个闹钟。这其实是两个子任务——先从邮件App读取时间再去时钟App设定闹钟。如果这两步之间没有可靠的信息交接机制AI很可能读完邮件就忘了时间或者把7:00 PM误记成7:00 AM。KnowAct-GUIClaw的黑板机制专门解决这个问题。每个子任务开始前系统会在黑板上声明我需要哪些数据我会产出哪些数据执行完成后严格按照声明把结果写回黑板下一个子任务只从黑板上读取前面子任务明确写入的数据不做任何自由发挥的推断。论文展示的派对-闹钟案例中邮件子任务把派对时间晚上7点写进黑板主控智能体在黑板上做了减法7点减去1小时等于6点然后把设置时间晚上6点传给时钟子任务闹钟准确设定。整个过程透明、可追溯数据不会在模糊的自然语言摘要中悄悄跑偏。还有一个更复杂的案例用户让AI助手检查邮件找到我参加的会议酒店地址发短信告诉Tom再用地图查一下从MIT步行过去要多久。邮件子任务找到了Harvard Square Hotel这个名字但没有完整地址。主控智能体发现这个信息不够用直接调用网络搜索工具补全了地址然后把完整地址Harvard Square Hotel, 110 Mount Auburn St, Cambridge, MA 02138分别传给短信子任务和地图子任务。地图最终报告步行需要13分钟。当GUI操作获取的信息不足时主控智能体可以主动用非GUI的工具比如搜索补全而不是让整个任务卡死这种灵活的救场能力是系统设计的一大亮点。---五、混合操作模式能走捷径就不绕弯路操作手机屏幕不是什么功能都需要从桌面一步一步点进去。Android系统本身提供了深度链接和意图两种机制允许直接跳转到某个App内的特定页面甚至直接触发某个功能。KnowAct-GUIClaw把这些系统级捷径集成进了操作工具箱。论文里的跨App比价案例把这个优势展示得非常直观用户让AI比较同款SSD在京东和淘宝的价格。京东那边系统触发了一个预先验证过的搜索意图直接跳转到了包含该商品搜索结果的页面淘宝那边系统没有可用的已验证捷径于是老老实实走了5步普通GUI操作——打开App、关掉促销弹窗、点击搜索框、输入商品名、点击搜索。京东1步淘宝5步差距清晰可见。两边的价格都通过黑板机制汇总到主控智能体手里主控智能体综合比较后给出购买建议。捷径的使用有严格的前置验证——系统不会看到一个深度链接就直接用而是先在设备上实际测试这个链接能不能打开正确的页面、参数有没有被正确传递通过验证的才会被收录进捷径库未通过的只作为候选记录保留。这种先验证后使用的原则避免了因为捷径无效而导致任务出错的风险。---六、在真实测试中的表现开源模型打败闭源巨头研究团队在两个主要的基准测试上评估了KnowAct-GUIClaw的性能。第一个是MobileWorld基准测试包含117个长流程手机任务覆盖20个真实App难度较高。这是研究团队的主战场也是本文最核心的实验数据来源。在这个测试中单独使用Qwen3.5-35B这个参数量较小的开源模型作为GUI执行器成功率只有24.8%——约莫四分之一任务能完成。把它接入KnowAct-GUIClaw框架、加上主控智能体和经验记忆之后成功率跳升到34.5%再开启技能库成功率进一步升至37.9%。更令人关注的是一组跨模型迁移实验用Kimi-K2.6这个较强的模型跑过任务之后把它积累下来的经验记忆和技能库移植给Qwen3.5-35B来用后者的成功率一路升至41.0%比它单独跑的24.8%整整高出16.2个百分点。这说明系统积累的知识财富具有真正的可迁移性——不是和某个特定模型绑定的私有财产而是任何接入系统的模型都能受益的共享资产。当使用Kimi-K2.6同时担任主控智能体和GUI执行器时系统达到了64.1%的成功率超过了榜单上所有其他参与者包括Seed-2.0-Pro63.2%和GPT-5.562.4%这两个强力闭源商业模型。这是一个完全由开源模型驱动的系统在长流程手机任务上的表现超越了当时最先进的闭源AI意义相当显著。从效率角度看技能库的价值不只体现在成功率上还体现在操作步数的减少上。在那些实际用上了技能的任务中使用技能库让每个任务平均减少了3.3个GUI操作步骤总体界面截图和操作的计算量也减少了约6%——也就是说任务做对了花的力气还更少了。第二个测试是AndroidDaily基准包含235个任务需要真实操作iOS设备测试了跨平台能力部分任务还要求不只是完成操作、还要给出具体答案。在194个可用任务上KnowAct-GUIClaw的成功率达到78.61%大幅领先于专门为GUI任务设计的对比系统UI-TARS-1.5的56.64%。系统在需要跨App分析和给出明确答案的复杂任务上优势尤为突出正是因为黑板信息传递和经验记忆两个机制在这类任务上发挥了最关键的作用。---七、跨平台验证安卓之外HarmonyOS和Windows同样能用研究团队没有把系统限定在安卓平台上做测试还在HarmonyOS华为鸿蒙和Windows上进行了验证。鸿蒙测试选取了63个任务包括跨App的日历管理、地图规划、社交软件操作等最终完成了48个成功率76.2%。Windows测试设计了30个桌面任务覆盖浏览器操作、文件管理、Office文档、终端命令、系统控制等场景完成了21个成功率70.0%。两个平台都暴露出了各自独特的难题研究团队对此做了坦诚的分析。鸿蒙上的失败案例之一是设置一个8:25的闹钟——问题出在分钟的选择界面上采用了一种惯性滚轮式选择器AI反复在附近区域滑动就是无法精准停在25这个位置最终步骤耗尽任务失败。另一个失败案例是在淘宝下单后移交控制权AI在订单确认页面就停下来了误以为那就是支付页面其实支付页面要再点一下立即付款才会出现——这是对App界面流程语义的误判。Windows上的失败案例则揭示了另一层困难让AI从内置表情面板里找到大笑表情并发送AI能找到表情面板但选错了表情——因为面板里的表情图标没有文字标签只有图形AI需要把大笑这个语言描述映射到一个视觉符号这种语言-图形的对应是当前AI模型的一个普遍短板。这些失败案例并非被轻描淡写地带过而是被研究团队当作开放性挑战列出为后续研究指明了方向精细的几何控制、短暂出现的界面元素如通知弹窗的实时响应、以及自然语言到视觉符号的语义对应都还有大量工作可以深入。---说到底KnowAct-GUIClaw干的这件事是在尝试让AI助手真正用过就不白用。现有的很多AI系统每次执行任务都像新手上路路上踩过的坑下次还会再踩而KnowAct-GUIClaw设计了一套系统性的记忆和学习机制让每一次成功和失败都能转化为下一次任务的财富。这项研究对普通用户意味着什么从理论上说如果这类系统真的落地到日常使用的手机助手里用户委托AI完成跨App复杂任务的可靠性会大幅提升不再需要自己一个一个App地切换操作。经过一段时间的使用积累助手会越来越熟悉你的手机环境和操作习惯常用的路径会越走越快踩过的坑不会重复踩。当然研究团队自己也坦承当前的系统在精细手势控制、实时弹窗响应、复杂图形界面语义理解上还存在明显局限距离能稳定服务所有用户的实用级产品还有一段路要走。未来他们计划把知识检索、外部工具调用和GUI操作三件事合并到一个统一的决策周期里而不是现在这种分阶段的流水线结构从而进一步减少主控智能体和执行器之间的来回通信开销。读到这里你可能会好奇如果AI助手真的能记住我的操作习惯那隐私怎么办记忆存在哪里、谁能看到、怎么删除这些工程落地层面的问题是这类系统真正走进千家万户之前必须回答的现实挑战也是学界和产业界共同需要持续关注的议题。对这项研究感兴趣的读者可以通过arXiv:2607.12625查阅完整论文和实验日志实验日志还公开在GitHub上地址在论文中有明确标注。---QAQ1KnowAct-GUIClaw的记忆系统和普通AI聊天记录有什么不同A普通AI聊天记录只是保存对话文本下次对话不一定会参考。KnowAct-GUIClaw的记忆系统是主动提炼的经验库分为经验记忆文字版操作教训和技能库可直接复用的操作流程两类会在每次新任务开始前主动检索相关内容来指导执行而且这些知识可以跨不同AI模型共享使用不绑定某个特定模型。Q2KnowAct-GUIClaw能操作iPhone上的App吗A可以部分支持。论文中的AndroidDaily基准测试就是在iOS设备上进行的系统成功率达到78.61%。不过系统目前的技能库和快捷方式机制主要针对Android平台设计如深度链接和系统意图iOS上只能依赖基础的屏幕操作动作深度集成程度相对有限。Q3开源模型用KnowAct-GUIClaw框架后为什么能超过闭源大模型A闭源大模型如GPT-5.5、Seed-2.0-Pro在MobileWorld测试中直接操作屏幕靠模型本身的能力硬扛复杂任务。KnowAct-GUIClaw给开源模型加上了经验记忆和技能库相当于让模型站在了此前积累的所有经验肩膀上——知道哪个App哪个功能在哪里、哪条路走不通、有哪些捷径可用。这种知识加持弥补了模型规模上的差距让较小的开源模型在长流程任务中表现反超了更大的闭源模型。

相关新闻