1、数据表征到数据流编排的数据表征到数据流编排的存算协同优化存算协同优化2026-6-30刘方鑫刘方鑫上海交通大学上海交通大学 计算机学院计算机学院研究背景:研究背景:AI发展引发算力发展引发算力/存储瓶颈存储瓶颈2 万亿级万亿级参数规模大模型需要百百GB级级存储容量容量,为主要成本挑战成本挑战;算力增速1.4倍倍/年、年、存储器带宽带宽每每6年增长年增长2倍倍,滞后于AI算力需求,为主要性能瓶颈性能瓶颈模型规模指数上升,存储容量成本瓶颈模型规模指数上升,存储容量成本瓶颈存不下存不下算不快算不快用不满用不满1.5倍倍/年年4.7倍/年1.3倍倍/年年1.4倍倍/年年硬件算力增速硬件算力增速滞后于滞
2、后于AIAI算力需求算力需求硬件算力增速硬件算力增速AIAI计算需求计算需求迈向通用智能的关键:协同智能迈向通用智能的关键:协同智能3端侧模型部署端侧模型部署大模型大模型端云协同计算端云协同计算协同微调提升协同微调提升部署模型性能部署模型性能协同推理提升协同推理提升计算效率与精度计算效率与精度协同决策提升协同决策提升智能体泛化能力智能体泛化能力协同推理设备A设备B智能体 充分利用端、云侧的充分利用端、云侧的泛在资源泛在资源,建立大模型,建立大模型协同计算体系协同计算体系,弥补端侧大模型的性,弥补端侧大模型的性能衰减,实现高效的能衰减,实现高效的端云智能体构建与协同端云智能体构建与协同云云/端端
3、云云 侧侧端端 侧侧硬件硬件范式轻量化范式轻量化软件软件模型轻量化模型轻量化缓解部署压力的通用技术缓解部署压力的通用技术4剪枝量化知识蒸馏低秩分解二值化删去不必要连接10 降低数值精度11只使用1-bit值(-1 or+1)12将知识迁移到小模型13将大矩阵分解为小因子矩阵14教师模型学生模型WUV5.12-2.113.891.755-242WW5.12-2.113.891.75+1-1+1+1WW10 Hoefler,Torsten,et al.Sparsity in deep learning:Pruning and growth for efficient inference and t
4、raining in neural networks.JMLR 22.241(2021).11 Nagel,Markus,et al.A white paper on neural network quantization.arXiv preprint arXiv:2106.08295(2021).12 Zhang,Baochang,et al.Binary neural networks:Algorithms,architectures,and applications.CRC Press(2023).13 Gou,Jianping,et al.Knowledge distillation:
5、A survey.IJCV 129.6(2021).14 Liu,Xingyi,and Keshab K.Parhi.Tensor decomposition for model reduction in neural networks:A review Feature.IEEE CAS Magazine 23.2(2023).基础:模型基础:模型“轻量化轻量化”模型压缩模型压缩5DNN模型包含大量的冗余冗余,移除不重要的权值模型稀疏化模型稀疏化数值量化数值量化用更低精度低精度来表示操作数,简化算子执行计算Ampere GPU Source:NVIDIAA1006AI模型核心挑战核心挑战7AI
6、模型稀疏化稀疏化 元素级稀疏元素级稀疏列级稀疏列级稀疏行级稀疏行级稀疏块级稀疏块级稀疏核心挑战核心挑战8AI模型量化量化稀疏化稀疏化 元素级稀疏元素级稀疏列级稀疏列级稀疏行级稀疏行级稀疏块级稀疏块级稀疏核心挑战核心挑战全网一致量化全网一致量化8-bitcatcatdogdog层间混合量化层间混合量化8-bit4-bit8-bit8-bit4-bit4-bit层内混合量化层内混合量化9AI模型量化量化稀疏化稀疏化 元素级稀疏元素级稀疏列级稀疏列级稀疏行级稀疏行级稀疏块级稀疏块级稀疏粗粗粒度粒度细细粒度粒度核心挑战核心挑战全网一致量化全网一致量化8-bitcatcatdogdog层间混合量化层间混