AI智能助理的终极形态是像人类一样操作屏幕。东吴证券研报指出,苹果2024年4月推出Ferret-UI模型,通过任意分辨率(Anyres)技术解决UI小型对象识别,基础任务准确率全面超越GPT-4V(屏幕理解S2W达115.6 vs GPT-4V的34.8)。谷歌同步推出ScreenAI可读屏模型,5B版本性能提升尚未饱和。Transformer架构打破了任务与UI元素之间的隐含关系壁垒,GUI Agent正从实验室走向大规模应用。
从API到UI——Agent交互方式的范式转移
AI智能助理的任务执行分为规划和定位两个环节。根据交互模式,任务执行方法可分为基于API和基于用户界面(UI)两种。API交互方式依赖公开可用的API,存在应用程序支持不够全面、人类轻松执行但API难以实现的任务、拓展性和自动化能力较弱等不足。
UI界面方式在Transformer架构下较好克服了任务和UI元素之间的隐含关系,大幅提升了GUI Agent的可行性。GUI交互可进一步分为基于文本的GUI交互和多模态GUI交互。当前多模态GUI交互中,视觉定位阶段(Grounding)难度甚至比规划决策更大——设备兼容性、指令多样性、场景复杂性使元素识别成为当前LMMs GUI模型的主要错误来源。多模态GUI交互方式还面临数据不足、屏幕录制要求高、推理能力有限等困扰。
UI界面方式在Transformer架构下较好克服了任务和UI元素之间的隐含关系,大幅提升了GUI Agent的可行性。GUI交互可进一步分为基于文本的GUI交互和多模态GUI交互。当前多模态GUI交互中,视觉定位阶段(Grounding)难度甚至比规划决策更大——设备兼容性、指令多样性、场景复杂性使元素识别成为当前LMMs GUI模型的主要错误来源。多模态GUI交互方式还面临数据不足、屏幕录制要求高、推理能力有限等困扰。
苹果Ferret-UI——任意分辨率技术破解小型对象识别难题
苹果2024年4月推出Ferret-UI模型,专为解决移动UI理解问题设计。Ferret-UI通过视觉编码器对图像编码,加入任意分辨率(Anyres)技术切割放大子图像来解决UI交互中的小型对象识别问题。采用混合区域表示方法进一步提高图像的特征提取能力,将图像特征和文本指令联合编码后推理,精准根据任务要求执行。
从测试结果看,Ferret-UI-anyres在基础任务中表现极为优异:Referring任务iPhone达82.4%、Android达81.4%;Grounding任务iPhone达81.4%、Android达83.4%。高级任务中Android平台达93.9%。GPT-4V虽在高级任务表现更优(128.2),但在基础任务如S2W(34.8 vs Ferret-UI 115.6)和WiC(23.5 vs 140.3)上大幅落后。Ferret-UI证明了专门针对UI优化的视觉语言模型在屏幕理解基础任务上的巨大优势。
从测试结果看,Ferret-UI-anyres在基础任务中表现极为优异:Referring任务iPhone达82.4%、Android达81.4%;Grounding任务iPhone达81.4%、Android达83.4%。高级任务中Android平台达93.9%。GPT-4V虽在高级任务表现更优(128.2),但在基础任务如S2W(34.8 vs Ferret-UI 115.6)和WiC(23.5 vs 140.3)上大幅落后。Ferret-UI证明了专门针对UI优化的视觉语言模型在屏幕理解基础任务上的巨大优势。
谷歌ScreenAI——统一编码方式的多模态UI理解
谷歌2024年2月推出ScreenAI可读屏AI视觉语言模型,专门设计用于理解和处理用户界面和信息图标。架构上使用视觉编码器(ViT)和语言编码器组成的多模态编码器,视觉编码器将屏幕截图编码为图像嵌入,语言编码器处理UI元素标签和描述等文本信息,输出传递给T5解码器生成自然语言响应。采用灵活屏幕分割策略适用于不同尺寸的手机和电脑屏幕。
ScreenAI支持屏幕信息理解、问题回答、UI导航指令、内容摘要四类任务。模型参数提升对性能影响较大,尤其是在复杂任务中。谷歌发布670M、2B和5B三个模型,参数差异主要在图像和文本编解码器大小。所有任务中增加模型规模都会提升性能,5B模型时性能提升尚未饱和。复杂任务中2B到5B的性能提升远大于670M到2B的提升——屏幕问答从49.0到52.9(+3.9),导航从64.6到70.9(+6.3),继续增大参数量有望带来持续性能改善。
ScreenAI支持屏幕信息理解、问题回答、UI导航指令、内容摘要四类任务。模型参数提升对性能影响较大,尤其是在复杂任务中。谷歌发布670M、2B和5B三个模型,参数差异主要在图像和文本编解码器大小。所有任务中增加模型规模都会提升性能,5B模型时性能提升尚未饱和。复杂任务中2B到5B的性能提升远大于670M到2B的提升——屏幕问答从49.0到52.9(+3.9),导航从64.6到70.9(+6.3),继续增大参数量有望带来持续性能改善。
GUI Agent的产业落地前景与挑战
GUI Agent的产业落地正从技术验证向规模化应用迈进。智能手机、PC、车载系统等拥有丰富UI界面的终端是率先落地的场景。AI智能助理通过理解屏幕内容,可完成跨应用操作、自动化任务执行、个性化服务推荐等功能,解放用户双手。
当前面临的挑战包括:第一,模型精度与响应速度的平衡——端侧运行需兼顾推理质量和实时性。第二,跨应用兼容性问题——不同App UI设计差异巨大,模型需具备泛化能力。第三,用户隐私与数据安全——屏幕内容涉及敏感信息,端侧处理是优选方案。苹果Ferret-UI的端侧部署潜力和谷歌ScreenAI的多尺寸屏幕适配能力,为GUI Agent在消费电子终端的大规模落地铺平了道路。
当前面临的挑战包括:第一,模型精度与响应速度的平衡——端侧运行需兼顾推理质量和实时性。第二,跨应用兼容性问题——不同App UI设计差异巨大,模型需具备泛化能力。第三,用户隐私与数据安全——屏幕内容涉及敏感信息,端侧处理是优选方案。苹果Ferret-UI的端侧部署潜力和谷歌ScreenAI的多尺寸屏幕适配能力,为GUI Agent在消费电子终端的大规模落地铺平了道路。
| 维度 | 苹果Ferret-UI | 谷歌ScreenAI |
|---|---|---|
| 发布时间 | 2024年4月 | 2024年2月 |
| 核心技术 | 任意分辨率(Anyres)+混合区域表示 | ViT+T5多模态编码器 |
| 任务类型 | 屏幕理解、定位、交互 | 屏幕理解、问答、导航、摘要 |
| 模型规模 | 基础模型 | 670M/2B/5B三档 |
| 创新亮点 | 解决UI小型对象识别 | 灵活屏幕分割策略 |
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共50套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-30
电子行业
21页
34张图表
0731-84720580
商务合作:really158d
友链申请 (QQ):1737380874
微信扫码登录
手机快捷登录
账号登录