您的当前位置:首页 > 标签 > DiT技术发展趋势
【国元证券】AI应用系列报告:AI视频生成:商业化加速,国产厂商表现亮眼-250627(24页).pdf
DiT技术发展趋势:Sora验证架构有效性,国产厂商全面跟进|国元证券
国元证券研报显示,DiT架构将扩散模型U-Net替换为Transformer,Sora验证其可扩展性,可灵/Seedance全面跟进,Veo3支持2分钟4K视频,时长/速度/声音多维度突破推动AI视频迈向商用。
 2026-07-27
 互联网产业
 24页
1张图表
数据来源:
【国元证券】AI应用系列报告:AI视频生成:商业化加速,国产厂商表现亮眼-250627(24页) 查看报告
国元证券AI视频生成报告对DiT技术的发展趋势进行了深入分析。2022年12月《Scalable Diffusion Models with Transformers》论文发表,提出将传统扩散模型的U-Net替换为Transformer。2024年2月OpenAI发布Sora,验证了Diffusion和Transformer结合的有效性,并带动DiT架构成为当前重点方向。国内厂商迅速跟进:可灵采用DiT架构并对隐空间编/解码、时序建模等模块进行升维处理;Seedance1.0引入精确描述模型和统一预训练框架。时长、速度、质量、声音等多维度持续突破,AI视频生成正从技术验证走向规模化商用。

从Diffusion到DiT——U-Net到Transformer的架构革命

扩散模型已成为视觉生成领域的主导技术路线,但在DiT之前,扩散模型主要基于U-Net架构。2022年12月William Peebles等发表《Scalable Diffusion Models with Transformers》,提出将传统扩散模型的U-Net替换为Transformer,采用AdaLN-Zero(自适应归一化)注入条件信息(文本/图像/轨迹),取代交叉注意力,从而提升传统扩散模型的可扩展性。DiT的核心优势在于:Transformer架构具备更强的扩展性,能够有效利用更大规模的数据和参数;注意力机制能更好地建模像素点之间的上下文关系;统一的架构便于多模态输入的融合。这一架构革命为后续Sora的成功奠定了理论基础。

Sora验证DiT有效性——60秒视频与世界模拟器

2024年2月OpenAI发布Sora,成为DiT架构的里程碑式验证。根据Sora发布的技术文章,Sora先将视频压缩到低维潜在空间中,然后将表示分解为时空patch,实现视频“patch化”,采用DiT架构在多个领域展示了显著的扩展性能。对比过去的视频生成模型,Sora生成视频时长显著提升至60秒,对于自然语言和物理世界规律有了更强的理解能力。Sora不仅能够生成高质量视频,还展现出模拟物理世界某些方面的能力,如物体持久性、简单交互等,被业界视为“世界模拟器”的初步实现。Sora的成功为行业带来深刻启发,不少厂商迅速跟进DiT架构并进行差异化创新。

国产厂商全面跟进——可灵、Seedance的差异化创新

国内厂商在DiT架构上进行了大量创新。可灵使用DiT架构,同时对模型中的隐空间编/解码、时序建模等模块进行了升维处理。在隐空间编/解码上,快手自研了3D VAE网络,实现时空同步压缩;在时序信息建模上,设计了计算高效的含注意力机制作为时空建模模块,能精准捕捉视频帧内局部空间特征及跨帧时间动态特征。Seedance1.0引入精确描述模型提升数据多样性与可用性,统一高效的预训练框架实现多镜头切换与多模态输入,后训练构建复合奖励系统提升画面生动性、稳定性和美感。MiniMax Hailuo02在模型架构上构建了解耦空间层和时间层的扩散Transformer模型,多镜头多模态旋转位置编码,统一的任务框架使一个模型可实现多种任务。国内厂商在DiT基础架构上的差异化创新,正推动视频生成能力持续向商用标准迈进。

DiT技术趋势——更长、更快、更丰富

DiT架构下的视频生成正沿着多个维度持续突破。时长方面,Veo2支持理论最高2分钟的4K视频生成,可灵大师版可以通过续写方式将视频延长至3分钟,时长突破有望进一步满足叙事需求、扩展下游应用。生成速度方面,以Seedance1.0为例,5秒1080p视频生成推理耗时仅41.4秒(基于L20测试),效率大幅提升。生成质量方面,随着产品迭代“抽卡率”有望降低。丰富度方面,Veo3通过将视频像素转化为语义信号实时生成匹配声音,大大增强视频生成可用性。DiT架构的可扩展性意味着未来模型能力仍有巨大提升空间,AI视频生成正加速从“辅助工具”向“核心生产力工具”演进。
DiT架构核心优势与国产厂商创新
架构/厂商核心创新关键突破
DiT(基础架构)U-Net→Transformer可扩展性大幅提升
Sora时空patch化60秒视频,物理模拟
可灵3D VAE+时序注意力视频延长至3分钟
Seedance1.0精确描述模型+复合奖励多镜头切换,多模态输入
Hailuo02解耦时空扩散Transformer统一任务框架
客服
商务合作
小程序
服务号
折叠