您的当前位置:首页 > 标签 > 多模态UI交互Agent
电子行业深度报告:端侧AI模型创新快速迭代看好苹果引领AI硬件起飞-250223(21页).pdf
多模态UI交互Agent:苹果Ferret-UI与谷歌ScreenAI突破,GUI Agent可行性大幅提升|东吴证券
东吴证券研报显示,苹果Ferret-UI任意分辨率技术解决小型对象识别,基础任务准确率全面超越GPT-4V(S2W 115.6 vs 34.8)。谷歌ScreenAI 5B模型性能提升尚未饱和,UI导航任务准确率达70.9%。Transformer架构驱动GUI Agent可行性提升,多模态UI交互革命历史机遇深度解读。
 2026-07-30
 电子行业
 21页
34张图表
数据来源:
电子行业深度报告:端侧AI模型创新快速迭代看好苹果引领AI硬件起飞-250223(21页) 查看报告
AI智能助理的终极形态是像人类一样操作屏幕。东吴证券研报指出,苹果2024年4月推出Ferret-UI模型,通过任意分辨率(Anyres)技术解决UI小型对象识别,基础任务准确率全面超越GPT-4V(屏幕理解S2W达115.6 vs GPT-4V的34.8)。谷歌同步推出ScreenAI可读屏模型,5B版本性能提升尚未饱和。Transformer架构打破了任务与UI元素之间的隐含关系壁垒,GUI Agent正从实验室走向大规模应用。

从API到UI——Agent交互方式的范式转移

AI智能助理的任务执行分为规划和定位两个环节。根据交互模式,任务执行方法可分为基于API和基于用户界面(UI)两种。API交互方式依赖公开可用的API,存在应用程序支持不够全面、人类轻松执行但API难以实现的任务、拓展性和自动化能力较弱等不足。

UI界面方式在Transformer架构下较好克服了任务和UI元素之间的隐含关系,大幅提升了GUI Agent的可行性。GUI交互可进一步分为基于文本的GUI交互和多模态GUI交互。当前多模态GUI交互中,视觉定位阶段(Grounding)难度甚至比规划决策更大——设备兼容性、指令多样性、场景复杂性使元素识别成为当前LMMs GUI模型的主要错误来源。多模态GUI交互方式还面临数据不足、屏幕录制要求高、推理能力有限等困扰。

苹果Ferret-UI——任意分辨率技术破解小型对象识别难题

苹果2024年4月推出Ferret-UI模型,专为解决移动UI理解问题设计。Ferret-UI通过视觉编码器对图像编码,加入任意分辨率(Anyres)技术切割放大子图像来解决UI交互中的小型对象识别问题。采用混合区域表示方法进一步提高图像的特征提取能力,将图像特征和文本指令联合编码后推理,精准根据任务要求执行。

从测试结果看,Ferret-UI-anyres在基础任务中表现极为优异:Referring任务iPhone达82.4%、Android达81.4%;Grounding任务iPhone达81.4%、Android达83.4%。高级任务中Android平台达93.9%。GPT-4V虽在高级任务表现更优(128.2),但在基础任务如S2W(34.8 vs Ferret-UI 115.6)和WiC(23.5 vs 140.3)上大幅落后。Ferret-UI证明了专门针对UI优化的视觉语言模型在屏幕理解基础任务上的巨大优势。

谷歌ScreenAI——统一编码方式的多模态UI理解

谷歌2024年2月推出ScreenAI可读屏AI视觉语言模型,专门设计用于理解和处理用户界面和信息图标。架构上使用视觉编码器(ViT)和语言编码器组成的多模态编码器,视觉编码器将屏幕截图编码为图像嵌入,语言编码器处理UI元素标签和描述等文本信息,输出传递给T5解码器生成自然语言响应。采用灵活屏幕分割策略适用于不同尺寸的手机和电脑屏幕。

ScreenAI支持屏幕信息理解、问题回答、UI导航指令、内容摘要四类任务。模型参数提升对性能影响较大,尤其是在复杂任务中。谷歌发布670M、2B和5B三个模型,参数差异主要在图像和文本编解码器大小。所有任务中增加模型规模都会提升性能,5B模型时性能提升尚未饱和。复杂任务中2B到5B的性能提升远大于670M到2B的提升——屏幕问答从49.0到52.9(+3.9),导航从64.6到70.9(+6.3),继续增大参数量有望带来持续性能改善。

GUI Agent的产业落地前景与挑战

GUI Agent的产业落地正从技术验证向规模化应用迈进。智能手机、PC、车载系统等拥有丰富UI界面的终端是率先落地的场景。AI智能助理通过理解屏幕内容,可完成跨应用操作、自动化任务执行、个性化服务推荐等功能,解放用户双手。

当前面临的挑战包括:第一,模型精度与响应速度的平衡——端侧运行需兼顾推理质量和实时性。第二,跨应用兼容性问题——不同App UI设计差异巨大,模型需具备泛化能力。第三,用户隐私与数据安全——屏幕内容涉及敏感信息,端侧处理是优选方案。苹果Ferret-UI的端侧部署潜力和谷歌ScreenAI的多尺寸屏幕适配能力,为GUI Agent在消费电子终端的大规模落地铺平了道路。
苹果Ferret-UI与谷歌ScreenAI核心对比
维度苹果Ferret-UI谷歌ScreenAI
发布时间2024年4月2024年2月
核心技术任意分辨率(Anyres)+混合区域表示ViT+T5多模态编码器
任务类型屏幕理解、定位、交互屏幕理解、问答、导航、摘要
模型规模基础模型670M/2B/5B三档
创新亮点解决UI小型对象识别灵活屏幕分割策略
客服
商务合作
小程序
服务号
折叠