gubit.cn-股比特.中国
查股网
云天励飞(688343)内幕信息消息披露
 
个股最新内幕信息查询:    
 

以软件栈释放算力潜能,云天励飞实现视频生成推理3.7倍加速

http://www.gubit.cn  2026-08-20  云天励飞内幕信息

来源 :云天励飞2026-08-20

  近日,云天励飞围绕开源视频生成模型 Wan2.1 完成推理加速优化实践。在相同硬件环境、相同模型以及同等生成任务条件下,团队将一段 5 秒 720P 视频的端到端生成耗时优化至 22.2 秒,在保持视频质量基本稳定的同时,显著提升了视频生成模型的推理效率。

  在本次测试中,FastVideo 完成同等任务需要 82.1 秒,TurboDiffusion 需要 33.5 秒,云天励飞优化后的端到端耗时为 22.2 秒。

  这一结果并非单一参数调整或单点算法替换带来的偶然提升,而是云天励飞依托模型适配、算子优化、量化部署、访存优化、调度优化和 VAE 解码加速等全链路软件栈系统性优化能力共同达成。

  视频生成模型为什么“跑不快”

  以 Wan2.1 为代表的视频生成模型,近年来在画面质量、运动一致性和文本对齐等方面持续提升,但在实际应用中,推理速度仍是影响落地体验的重要瓶颈。

  一段视频从提示词输入到最终生成完成,并不只是一次简单的模型计算。其背后包含多步去噪、DiT 注意力计算、数据搬运、显存访问、VAE 解码等多个环节。任何一个环节效率不足,都会直接体现在用户等待时间上。

  首先,DiT 注意力计算是视频生成模型的核心瓶颈。视频生成不仅要理解单帧图像中的空间关系,还要建模多帧之间的时间连续性。以 5 秒 720P 视频为例,其对应 81 帧画面,时空展开后的序列长度可达到数万 token。Full Attention 的计算量会随着序列长度平方级增长,因此 DiT 很容易成为整体推理链路中最重的计算环节。

  其次,扩散模型的推理过程本质上是多步迭代去噪。默认配置下,模型往往需要运行数十个去噪步,每一步都要进行一次完整的 DiT 前向计算。步数越多,总耗时就越高,这也使得视频生成天然面临较高的推理成本。

  第三,VAE 解码是过去容易被忽视的长尾瓶颈。很多加速方案主要关注 DiT 部分,但在真实服务中,视频最终还需要通过 VAE 从 latent 表示还原为可观看画面。对于 720P、5 秒这样的视频生成任务,VAE 解码耗时同样不可忽视,并且会随着视频分辨率和时长同步增长。

  也就是说,视频生成推理慢,并不是某一个模块单独造成的结果,而是模型结构、计算密度、访存压力、调度链路和解码环节共同作用的结果。

  因此,仅仅“头痛医头、脚痛医脚”式的局部优化,很难从根本上释放推理效率。

  从单点加速走向端到端优化

  当前,开源社区和学术界已经围绕 Wan2.1 等视频生成模型提出了多种加速方案。其中,FastVideo 和 TurboDiffusion 具有一定代表性。

  FastVideo 将 SageAttention、TeaCache 等技术集成进推理流水线,是开源生态中较为典型的工程化加速方案,具有较好的易用性和集成度。根据本次测试,在消费级显卡上生成 81 帧 720P 视频,FastVideo 的 DiT 部分耗时为 72.6 秒,端到端含 VAE 耗时为 82.1 秒。

  TurboDiffusion 则代表了学术界对系统协同加速的进一步探索。其通过 SageAttention2++、稀疏线性注意力、步数蒸馏和 W8A8 量化等技术组合,将 Wan2.1-T2V-14B-720P 的 DiT 推理时间压缩至 24 秒,取得了较高的 DiT 加速效果。但从端到端视角来看,VAE 解码仍需要 9.5 秒,因此整体生成耗时为 33.5 秒。

  这也说明,在真实应用场景中,仅展示 DiT 单模块的加速并不等同于用户侧体验的全面提升。用户真正感知到的是从输入提示词到生成视频完成的总时间。

  云天励飞如何把端到端耗时压缩到 22.2 秒

  云天励飞此次优化的核心思路,正是从单点加速走向端到端优化。

  围绕 Wan2.1 推理加速,团队从三个层次切入,构建了一套覆盖 DiT 算子、注意力计算、VAE 解码的全链路优化体系。概括来说,就是用“三板斧”打通视频生成推理的关键链路。

  第一板斧:通用加速技术组合,把最优实践彻底落实。

  通用加速技术是基础,但“知道”和“做好”之间存在巨大的工程鸿沟。云天励飞团队将 SageAttention、SLA 稀疏线性注意力、步数蒸馏、FP8 量化等技术集成进 Wan2.1 推理流水线,并针对视频生成场景进行专项适配。

  在注意力计算方面,团队将 SageAttention 集成至 DiT 的关键注意力层,利用低比特量化注意力计算提升吞吐效率,并针对视频长序列特性对 tiling 策略进行专项调优,使其更好适配硬件的 Tensor Core 计算能力。

  在稀疏计算方面,团队引入 SLA 稀疏线性注意力机制,利用视频帧间冗余特征,减少低价值注意力位置的无效计算。在视频生成中,相邻帧之间往往具有较高相似性,背景、纹理和局部运动存在明显冗余。通过更高效地分配注意力计算资源,可以在尽量保持语义理解和画面质量的前提下,减少不必要的算力消耗。

  在去噪步数方面,团队针对 Wan2.1 的调度机制进行步数蒸馏,将原本需要多步迭代的推理过程压缩至 3—4 步,并通过一致性约束保持输出分布稳定。步数减少带来的收益非常直接:每减少一次去噪迭代,就意味着少运行一次完整的 DiT 前向计算。

  在低精度部署方面,团队对 DiT 线性层进行 FP8 量化,在权重和激活精度降低的同时,通过精细校准控制误差,使模型在获得计算加速和显存压缩收益的同时,维持可接受的视频质量。

  第二板斧:DiT 算子级优化,减少计算过程中的隐性浪费。

  通用技术解决了“用什么算”的问题,但要进一步提升效率,还需要解决“算的过程本身有多少浪费”的问题。这也是云天励飞与其他方案拉开差距的关键能力之一。

  云天励飞团队围绕 Wan2.1 的 DiT 结构进行了算子级 profiling 和优化,重点减少 kernel launch、HBM 读写和冗余类型转换等开销。

  在算子融合方面,团队将 Norm、AdaLN Gate、Scale、FP8 反量化、残差加法、QKV Projection、RoPE 等高频共现算子进行融合,减少碎片化执行带来的多次显存读写和 kernel 启动开销。实测显示,在 DiT 单步前向中,相关融合优化使 HBM 读写量减少 35%,kernel launch 数下降 64.45%,耗时减少 3.85 秒。

  图 1 fused AdaLN 算子融合

  图 2 gelu_fp8_quant_xbound 算子融合

  在类型转换消除方面,团队对 FP8 量化推理过程中的数据类型流进行全局分析,合并或消除不必要的 BF16 与 FP8 转换节点,减少由冗余类型转换引入的额外 kernel 和访存开销。实测显示,相关优化使 HBM 读写量减少 78%,kernel launch 数下降 56%,耗时减少 3.23 秒。

  图 3 类型转换消除路径

  在访存优化方面,团队针对视频 DiT 长序列场景重新调整 tiling size 和 thread block 绑定策略,提升 L2 cache 中热数据复用效率,降低对 HBM 的访问压力。对于视频生成这类长序列、高带宽压力的推理任务而言,访存效率往往与计算效率同样重要。

  第三板斧:VAE 瘦身,打通端到端生成的最后一段链路。

  在真实视频生成服务中,VAE 解码不是可有可无的后处理环节,而是影响端到端延迟的重要组成部分。Wan2.1 的 3D 因果 VAE 在解码阶段需要对时空 latent 进行完整上采样重建,随着视频分辨率和时长提升,VAE 的耗时会进一步放大。

  云天励飞团队对 VAE 解码器进行了逐层 profiling,定位高收益替换点,并通过算子替换和蒸馏训练在效率与质量之间取得平衡。

  针对深层结构,团队以深度可分离卷积替换部分三维卷积,在保留时间因果建模能力和跨通道表达能力的同时降低计算开销;针对浅层结构,团队以二维卷积替换部分三维卷积,更聚焦于高分辨率空间细节恢复。与此同时,团队通过多尺度蒸馏训练,使替换后的 VAE 在全局布局、纹理细节和视觉观感上与原始模型保持较高一致性。

  图 4 替换前后算子示意图

  实测显示,经过优化后,VAE 解码耗时从 9.5 秒降至 4.6 秒,降幅约 52%。这使得云天励飞不仅在 DiT 部分实现加速,也真正把端到端生成耗时进一步压缩。

  通过这“三板斧”,云天励飞将通用加速技术、算子级深度优化和端到端链路重构结合起来,把 Wan2.1 的视频生成推理从局部优化推进到系统优化,也进一步验证了公司在推理软件栈建设上的工程深度。

云天励飞方案与其他方案的速度对比

云天励飞方案与原始Wan2.1的精度对比

  软硬件深度结合释放算力价值,推动走向 AI 推理时代

  视频生成模型的加速,不只是把某一个算子跑得更快,也不只是把某一个模块的耗时压得更低。真正进入应用场景后,用户感受到的是从提示词输入到视频生成完成的全链路体验;企业需要面对的,则是延迟、吞吐、显存、功耗、成本和稳定性等一系列工程约束。

  这也是软硬件结合的重要价值所在。面对不断变化的应用负载和不断演进的硬件架构,软件栈的优化需要充分利用硬件特性,在模型适配、算子优化、量化部署、编译调度、访存优化和端到端服务链路之间持续协同,尽可能减少每一个环节中的低效损耗,让既有算力释放出更高效率。

  本次优化实践面向云天励飞自研的 DeepVerse100P 云端推理芯片,上述软件栈优化创新能够与芯片自身的架构特性形成深度耦合。在低精度计算层面,DeepVerse100P 原生支持 FP4/FP8/BF16/FP16 多精度算力,且均支持稀疏加速,这为 DiT 线性层的 FP8 量化推理、SageAttention 低比特量化加速提供了坚实的硬件基础,使量化收益能够真正兑现为端到端的推理加速。在缓存层面,DeepVerse100P 具备大容量内存与高带宽,配合团队针对 tiling size 和 thread block 绑定策略的专项调优,使 L2 cache 热数据复用效率与算子融合带来的内存读写量下降收益能够被充分放大,有效缓解长序列场景下的访存瓶颈,从容应对视频生成任务对长序列、高带宽的突出需求。此外,DeepVerse100P 支持高带宽卡间互联,为后续视频生成任务在云端多卡场景下的进一步扩展与调优预留了充足的硬件空间。可以说,此次端到端推理加速优化,既是软件栈系统性优化的成果,也是云天励飞软硬件协同设计理念在真实大模型场景下的一次充分验证。

  对于 AI 芯片企业而言,这种能力具有显著的现实意义。芯片从"能跑模型"到"高效跑模型",中间需要大量软件栈面向硬件架构特性的针对性优化;而每一次真实场景的深度优化,也在沉淀为软件栈的通用能力——本次实践中的算子融合与类型转换消除模式可固化为图编译器的优化规则,长序列访存调优经验可纳入算子库的自动调优体系,FP8 校准与 VAE 瘦身方法可打包为量化部署工具链。由于主流视频生成模型普遍基于 DiT 架构,这些能力对同类模型具有直接的可移植性,将显著降低后续模型在 DeepVerse100P 上的适配门槛与部署周期。

  当前,AI 产业正从模型训练竞争走向推理效率与算力性价比竞争,大模型服务、视频生成、具身智能等场景都需要更高效、更低成本的推理基础设施支撑。云天励飞长期聚焦 AI 推理方向,持续推进自研芯片、推理软件栈和行业应用的协同创新,此次围绕 Wan2.1 的优化正是这一路线在复杂大模型场景下的工程实践。

  面向 AI 推理时代,云天励飞将继续坚持软硬协同的技术路线,围绕芯片架构、软件栈和场景应用持续深耕,提升每一份算力的使用效率,推动 AI 从“可展示”走向“可规模化应用”。

有问题请联系 767871486@qq.com 商务合作广告联系 QQ:767871486
Copyright 2007-2026
www.gubit.cn 查股网