1、1迈向情境智能迈向情境智能MOSSMOSS多模态模型的交互新范式多模态模型的交互新范式邱锡鹏复旦大学、上海创智学院、模思智能2026 年 6 月 26 日目录目录0101背景背景0202MOSS-VLMOSS-VL0303MOSS-AudioMOSS-Audio0404MOSS-TTSMOSS-TTS0505总结总结0101背景背景多模态需求、情境智能与总体能力格局情境智能时代:交互回到最自然的方式情境智能时代:交互回到最自然的方式交互交互智能智能碳基生物交互的信息传递渠道碳基生物交互的信息传递渠道(%)空间信息:只进不出只进不出的单向交互视觉视觉听觉听觉文本文本声音:边进边出边进边出的双工交
2、互语言内容:人类压缩的信息语言内容:人类压缩的信息55%55%38%38%7%7%6人与人之间最自然的交互方式人与人之间最自然的交互方式拓展下沉与未来市场拓展下沉与未来市场不受屏幕限制不受屏幕限制信息含量更高信息含量更高特性特性拓展下沉用户群体面向新一代人群,更酷的交互无GUI交互流程预设天然适配多任务并行语气、语调、真实情感信息环境、空间等情境信息视觉视觉 55 55,听觉,听觉 38 38,文字只占,文字只占 7 7纯文本模型,恰好漏掉了那纯文本模型,恰好漏掉了那 93%93%早期尝试:早期尝试:SpeechGPT SpeechGPT 原生跨模态语音对话(原生跨模态语音对话(2023202
3、3)SpeechGPT 把语音转换为离散离散词元词元,统一进 LLM、再还原为语音早期首创早期首创首个端到端模型,把语音离散成词元、纳入 LLM 词表,实现原生跨模态对话统一离散建模统一离散建模语音与文本共享同一自回归框架,跨模态对话内生于模型,无需 ASRLLMTTS 级联。离散离散 token 统一建模统一建模路线路线延展出 AnyGPT(万物皆 token)与 MOSS-Speech(真语音到语音)。早期尝试:早期尝试:AnyGPT AnyGPT:任意模态的统一离散建模(:任意模态的统一离散建模(20242024)四种模态各自离散成 token,经统一 LLM 实现任意模态互转万物万物皆
4、词元皆词元文本、语音、图像、音乐各用专属 tokenizer 离散成词元,统一进同一个 LLM。Any-to-Any 生成生成任意模态输入、任意模态输出;基于 LLaMA-2 仅扩词表、不改 LLM 架构,训练稳定。AnyInstruct-108k构建 10.8 万条多模态交错指令数据,支撑跨模态指令对话。MOSSMOSS多模态能力总览多模态能力总览VL、Audio、TTS 是同一多模态基础模型体系的三类能力面VLVL:看得懂:看得懂图像与视频理解时序定位与空间推理面向长视频和实时交互AudioAudio:听得清:听得清通用音频理解ASR、说话人、环境声、音乐、问答与推理面向复杂真实场景TTS
5、TTS:说得自然:说得自然语音与音频生成零样本音色克隆、低延迟本地生成支撑智能体交互闭环机遇与挑战:多模态模型进入情境智能阶段机遇与挑战:多模态模型进入情境智能阶段机遇机遇视频与音频成为下一代交互入口视频与音频成为下一代交互入口真实场景天然包含画面、声音、说话人和环境信息,单文本模型难以完整承载。长上下文让模型理解过程与因果长上下文让模型理解过程与因果长视频、长音频和多轮对话把模型从静态识别推向事件追踪、状态变化和时序推理。端侧与实时部署打开应用空间端侧与实时部署打开应用空间低延迟语音生成、视频问答和音频理解可以进入会议、教育、智能体与具身场景。挑战挑战多模态多模态 token token 量
6、急剧膨胀量急剧膨胀视频帧、音频片段和图文交错输入会显著增加 prefill 成本和显存占用。跨模态对齐与时间建模更难跨模态对齐与时间建模更难模型需要同时处理空间位置、绝对时间、说话节奏和多源事件之间的依赖关系。推理系统必须和模型协同优化推理系统必须和模型协同优化mm_features 生命周期、cross-attention、流式解码和本地小模型需要一体化设计。MOSSMOSS多模态:用多模态:用 VL/Audio/TTS VL/Audio/TTS 三条能力链,支撑统一的情境智能系统三条能力链,支撑统一的情境智能系统多模态模型的发展轨迹多模态模型的发展轨迹2020 2022单图理解单图理解图文