1、大语言模型在计算机视觉领大语言模型在计算机视觉领域的应用域的应用演讲人:冯佳时目 录01背景介绍02基于LLM的图像理解03基于LLM的视频生成04总结展望背景介绍01计算机视觉的基本问题物体识别物体检测物体分割猫草地草地,猫猫,树,天空天空计算机视觉的基本问题图像生成视频生成3D生成大脑乘着火箭飞向月球大象戴着生日帽海底漫步图像和视频来自 Google Imagen黏土做的火车引擎LLM统一模型大语言模型(例如 ChatGPT)情感分析问答翻译生成输入文本视觉基础模型 生成与理解的统一基础模型“在草地上奔跑的小猫在草地上奔跑的小猫”“在草地上奔跑的小猫在草地上奔跑的小猫”图像理解图像生成是否
2、可基于LLM搭一个生成理解统一的视觉基础模型?基于LLM的图像理解02LLM在图像理解中的应用LLM 图像理解与文字描述生成映射层图像编码器“图片中的动物是什么图片中的动物是什么?”“左边是一只羊驼左边是一只羊驼,右边是一只美洲驼,右边是一只美洲驼”映射层:将图像的特征对齐到大语言模型的特征图像编码器:抽取图像的特征一些问题缺少细节理解幻觉只是对图像内容全局的描只是对图像内容全局的描述。述。缺少图像内容像素级别的缺少图像内容像素级别的理解,例如分割、检测等。理解,例如分割、检测等。限制了模型与实际物理环限制了模型与实际物理环境交互的能力。境交互的能力。语言模型缺少对图像内容语言模型缺少对图像内
3、容的参考,容易虚构不存在的参考,容易虚构不存在的内容。的内容。从语言模型的训练语料中,从语言模型的训练语料中,构造出常见的内容,例如构造出常见的内容,例如“红色的”。“红色的”。“左边是一只羊驼左边是一只羊驼,右边是一只右边是一只红色的红色的美洲驼美洲驼”带定位能力的 LLM图片来源:Wang et al.GRUtopia:Dream General Robots in a City at Scale相关工作图片来源:LISA:Reasoning Segmentation via Large Language Model拓展LLM的输出:文字描述-文字+相关物体图像中的定位提供更明确的答案和真
4、实世界建立对应相关物体的分割结果LLM我们的方案:PixelLM高效性使用使用SAMSAM增加了模型的计增加了模型的计算成本。算成本。将分割模型将分割模型SAMSAM替换成轻替换成轻量的量的MLPMLP,提高响应速度。,提高响应速度。多物体之前的工作只能检测分割之前的工作只能检测分割出单个物体。出单个物体。引入多个引入多个tokentoken,模型能,模型能够完成多个物体的分割。够完成多个物体的分割。现有模型的局限需要借助一个大规模的分需要借助一个大规模的分割模型割模型(例如例如 metameta 的的 SAM),SAM),严重拖慢严重拖慢响应速度。响应速度。只能定位和分割一个物体只能定位和分
5、割一个物体,无法应用于需要输出多个无法应用于需要输出多个物体的场景。物体的场景。PixelLM 的模型架构代表多个物体的分割码本图像编码器1轻量级的物体分割2大语言模型PixelLM 模型细节 图像特征提取目标物体可能有不同的尺寸大目标物体可能有不同的尺寸大小小(如右图所示)(如右图所示)利用利用 OpenAIOpenAI 的的 CLIPCLIP 模型作为模型作为图像编码器,并且提取多个尺图像编码器,并且提取多个尺度的图像特征,方便识别分割度的图像特征,方便识别分割不同尺寸的物体。不同尺寸的物体。只定位分割出一个尺寸的物体OpenAI CLIP:Learning Transferable Vi
6、sual Models From Natural Language SupervisionPixelLM 模型细节 分割词表的设计分割词表包含多个分割词表包含多个tokentoken组组,每一每一个对应图像的一个尺度的个对应图像的一个尺度的CLIPCLIP 特特征。征。每个每个tokentoken组包含多个组包含多个tokenstokens,一,一起捕捉目标物体的语意特征。起捕捉目标物体的语意特征。将多个将多个tokentoken组的解码结果融合,组的解码结果融合,可以得到多个物体的分割结果。可以得到多个物体的分割结果。第一组分割 tokens第二组分割 tokensPixelLM 模型高效的