1、构建可理解界面、可构建可理解界面、可执行任务的智能体:执行任务的智能体:移移动端动端 GUI Agent 技技术拆解术拆解演演讲嘉宾讲嘉宾:崔宸:崔宸目目录录CONTENT01背景与痛点背景与痛点02核心架构核心架构设计设计03关关键技术难点攻克键技术难点攻克04实际效果与未来展望实际效果与未来展望01背景与痛点背景与痛点什么是GUI agentGUI(图形用户界面图形用户界面)AI Agent(AI 智能体智能体)AI agent的范式跨应用自动化的强烈需求个人用个人用户场景户场景订票、比价、记账、数据迁移这些看似简单的任务,往往需要在多个 App 之间反复切换,消耗大量时间和精力。企企业级
2、场景业级场景财务报表的跨系统填报、客户信息的多平台同步、合规审计的数据收集企业面临更复杂的自动化挑战。无障碍需求无障碍需求对于老年人或视障人群,即使是简单的 App 操作也可能成为障碍。自动化 Agent 可以成为他们的数字助手。App 孤岛与自动化的困境现实的尴尬现实的尴尬在移动互联网时代,每个 App 都是一座封闭的围墙花园(Walled Gardens)。不同于 Web 时代的开放 API 生态,App 之间缺乏标准化的互联互通机制。用户想要比较三个电商平台的价格?需要手动打开三个 App,逐个搜索、截图、对比。企业想要自动化填报系统?传统方式要么依赖昂贵的定制开发,要么使用脆弱的 RP
3、A 脚本。自自动化的两难动化的两难传统 RPA(机器人流程自动化)基于 DOM 节点或控件 ID 进行操作,这种方式极其脆弱。App 一旦更新 UI 布局或改变元素标识,脚本立即失效。而 API 集成虽然稳定,但成本高昂:需要获取权限、理解文档、维护版本兼容性。对于普通用户和中小企业来说,这几乎是不可能完成的任务。各个终端的GUI agentWeb-端端 Agent(Manus)桌面端桌面端 Agent(UI-Tar)移移动端动端 Agent(豆包手机助手)(豆包手机助手)02核心架构核心架构设计设计GUI Agent 通用架构感知感知层层(Perception)AI 的眼睛截图获取与预处理X
4、ML/DOM 树解析多模态信息融合语义化 UI 元素识别决策决策层层(Planning)AI 的大脑意图理解与任务拆解操作序列规划异常检测与修正上下文记忆管理执行层执行层(Action)AI 的手原子操作执行多种接口适配执行结果验证性能优化策略感知层:AI 如何看懂屏幕多模多模态输入的必要性态输入的必要性单纯的截图包含了视觉信息,但缺少结构化的语义。一个红色的圆角矩形,人类能够凭借上下文判断它是购买按钮,但对于 AI 来说,仅靠像素信息很难做出准确判断。因此,现代 GUI Agent 会同时获取:截截图(图(Screenshot):包含完整的视觉信息UI 树(树(Accessibility T
5、ree):提供元素的类型、文本、层级关系坐坐标信息标信息:精确的位置和尺寸数据语义化UI 元素识别的挑战1视觉歧义性视觉歧义性相同的视觉元素在不同上下文中可能有完全不同的含义。一个蓝色的矩形可能是按钮、链接、或纯装饰元素。2UI 框架的多框架的多样性样性原生 Android 控件有完整的 Accessibility 信息,但 Flutter、React Native、Unity 等跨平台框架往往将整个界面渲染为一个 Canvas,节点信息缺失。3动态内容加载动态内容加载现代 App 大量使用懒加载和虚拟列表,屏幕上看到的内容可能在 UI 树中并不存在,或者只是占位符。决策层:从意图到行动高高层
6、意图层意图用户的原始需求子任子任务序列务序列拆解为步骤原子操作原子操作具体的 UI 交互系系统调用统调用底层 API 执行例如:订票 打开 App 点击搜索框 输入北京 选择日期 筛选车次 确认支付。每一层都需要考虑失败重试和异常处理。反思与自我修正机制为什么需要反思为什么需要反思这是 GUI Agent 区别于传统脚本的核心能力。脚本是线性执行的,一旦遇到意外情况就会崩溃。而 Agent 需要像人类一样,能够:识别执行失败(按钮没点到、页面没跳转)分析失败原因(是元素位置变了,还是网络超时?)制定修正策略(重新定位元素,或者换一条路径)实现方式实现方式执行后验证:每次操作后检查屏幕状态是否符