当前位置:首页 > 报告详情

电子行业AI系列之国产算力:2026关注1~N放量-260206(72页).pdf

上传人: 小*** 编号:1114491 2026-02-09 72页 5.22MB

下载:

1、【中泰电子】AI系列之国产算力:2026关注1-N放量算力芯片:GPUvsASIC二、国产趋势一:算力自主可控是确定方向三、国产趋势二:大厂自研芯片是必经之路四、国产趋势三:芯片逐渐由单卡走向系统集成五、投资建议&风险提示GPU芯片与ASIC芯片是算力解决方案的两大支柱:AI芯片在人工智能的算法和应用上做针对性设计,可高效处理人工智能应用的计算任务(其他非计算任务仍由CPU负责)。当前主流的AI芯片分为三类GPU、FPGA、ASIC,GPU、FPGA均是前期较为成熟的芯片架构,属于通用型芯片,其中GPU并行计算能力强,在AI训练和推理场景应用最多,ASIC属于为AI特定场景定制的芯片,具有较佳

2、的性能和能效比,和GPU构成目前AI芯片的两大核心。GPU适用于AI计算,相比于传统GPU主要执行图形之外的通用计算任务,利用GPU的并行计算优势,加速科学计算、大数据分析、深度学习等领域,尤其在大规模并行计算时,比传统CPU更为高效。ASIC芯片适用于推理:ASIC芯片设计目的是高效处理特定算法,通过针对特定任务进行硬件优化,其能够最大限度利用硬件资源实现高性能计算,同时保持极低功耗,因此ASIC芯片在AI推理等任务中表现出色。GPU专为通用并行计算任务设计,具有高度并行性、高内存带宽与多级缓存的特征:1)高度并行性:拥有大量并行计算单元,多条流水线可在单一控制部件的集中控制下运行;2)高内

3、存带宽:通常集成高速的GDDR或HBM显存颗粒,提供高访存带宽以处理数据密集型运算;3)多级缓存:包括全局内存、共享内存、寄存器等,大幅提高数据访问效率、降低延迟。GPU广泛应用于AI计算、深度学习训练等领域:GPU主要进行非图形相关程序的运算,如科学模拟、数据分析、机器学习、高性能计算,广泛应用于科学计算、深度学习训练等场景。相较于NPU、TPU等AI芯片,GPGPU通用性更强、生态壁垒和开发难度更低:GPGPU采用SIMT架构可实现“开箱即用”,NPU/TPU仍沿用传统SIMD架构,需手动编排流水线,时延隐藏效率远不及SIMT,导致编写高性能内核难度大、效率低,既难以实现易用性,生态完善程

4、度也落后于GPGPU。1.1.1英伟达是GPU领先企业,其架构持续迭代升级英伟达作为GPU的代表企业,其架构经历了Volta(12nm)Ampere(7nm)Hopper(4nm)Blackwell(4nm)迭代,新一代Rubin(3nm)架构将于26年下半年推出,随AI持续迭代的过程也伴随形态、价值量快速提升。TensorCore(张量核心)专为深度学习和Transformer加速设计:矩阵乘加(MMA,D=AstarB+Ccdot)是深度学习训练和推理中最核心的操作,而TensorCore作为专用张量加速单元,能以矩阵块为单位在较短时间内完成大量矩阵乘加运算,这种并行计算方式显著加快神经网

5、络模型的训练和推断过程;同时采用混合精度计算(如用半精度FP16作为输入和输出,利用全精度FP32存储中间结果,确保计算精度的同时最大限度地提高计算效率)。英伟达GPU产品架构迭代本质主要是TensorCore的不断升级,架构由Volta演进至目前的Blackwell,TensorCore经历了1.0至5.0的版本升级。1、算术规模一V100:以8Thread(线程)为一组(warp线程组),协作执行8star8star4矩阵乘法A100:以32Thread为一组,执行16ast8ast16矩阵乘法(同8个周期A100完成的MACs/乘加运算是V100的2倍);2、精度:增加INT8/INT4

6、,首次引入BF16;3、引入异步复制技术(Async-Copy),优化数据移动路径(SMEM带宽提高3倍)1)实现数据直接从L2到SMEM,绕开RF中转,显著降低RF压力并提升内存带宽利用率、减少数据移动时间:V100读+写6次A100读2次(带宽提升了3x);2)V100:数据加载与计算严格串行mathsfA100:异步数据加载可与计算并行。A100longrightarrowH100核心升级点在于:引入线程块集群概念(4SMs同时执行指令,性能显著提升且共享内存)+TMA(实现数据加载和计算的解耦,提升并行效率)+FP8精度。RangePrecisionsignexponentmantis

word格式文档无特别注明外均可编辑修改,预览文件经过压缩,下载原文更清晰!
三个皮匠报告文库所有资源均是客户上传分享,仅供网友学习交流,未经上传用户书面授权,请勿作商用。
客服
商务合作
小程序
服务号
折叠