暂无图片
暂无图片
暂无图片
暂无图片
暂无图片

FPGA 2025 | FlightVGM:基于在线稀疏化与混合精度的FPGA高效视频生成模型推理

时空实验室 2026-07-14
29

视频生成模型VGM正成为继大语言模型之后迈向通用人工智能的又一里程碑。然而,其计算密集的特性使得传统GPU在推理时面临能效瓶颈FPGA凭借可重构性和并行优势,成为加速稀疏模型的理想选择,但受限于峰值算力差距,始终难以超越GPU本文介绍的FlightVGM正是首款在FPGA上实现性能与能效双超GPU的视频生成模型加速器,相关工作发表在计算机体系结构与硬件系统域顶级会议FPGA并荣获最佳论文奖。

一.背景

通过利用由扩散模型和Transformer架构结合而成的视频生成模型(Video Generation Model, VGM),业界已经实现了从文本到高质量视频的跨越式内容生成。以OpenAISoraGoogleVeo以及开源的LatteOpen-Sora为代表,VGM被视为继大语言模型(LLM)之后,通往通用人工智能(AGI)道路上的第二个里程碑。然而,与LLM不同,VGM所依赖的扩散TransformerDiT)结构在推理过程中涉及大量的矩阵乘法运算(如QKV投影、前馈网络FFN),且由于引入了额外的时间维度和空间维度作为批处理(Batch)维度,其操作强度(FLOPs/Byte)高达LLM40倍以上,属于典型的计算密集型任务。

尽管稀疏化是加速计算密集型模型的经典手段,但在GPU上部署稀疏VGM面临严峻挑战。GPU采用单指令多线程(SIMT)架构,对规则稠密计算友好,但VGM中因视频帧间与帧内相似性产生的稀疏激活,会引入不规则的内存访问和同步开销,导致实际加速比远低于理论峰值,甚至存在高达10倍的性能差距。FPGA凭借其可重构的流水线架构和位级并行能力,被视为加速稀疏深度学习模型的理想载体。然而,受限于峰值计算性能(PCP)的巨大鸿沟——以AMD V80 FPGA为例,其FP16峰值算力仅为6.5TOPS,而NVIDIA 3090 GPU高达142TOPS(差距超21倍),导致此前最先进的FPGA加速器(如FlightLLM)在VGM上的吞吐量不足2 TOPS,始终难以逾越GPU的高墙。为此,FlightVGM旨在通过算法-硬件协同设计,充分挖掘VGM的时空稀疏性与混合精度潜力,在FPGA上实现对GPU的全面超越。

二、方法介绍

2.1 总体框架

图1展示了FlightVGM提出的系统总体框架。FlightVGM的输入是经过变分自编码器(VAE)编码后的含噪视频潜在特征,其维度表示为F×T×d(其中 F 为帧数,T为每帧的空间令牌数,d为隐藏维度)。输出为去噪后的视频潜空间特征。整个系统在AMD V80 FPGA上实现,包含片上执行部分、片外存储(32GB HBM提供819GB/s带宽,32GB DDR提供32GB/s带宽)以及嵌入式CPU(双核ARM A72)。

在片上执行部分,每个超级逻辑区域(SLR)对应一个计算核心,共三个核心。每个核心包含四大功能单元:

(1)稀疏化单元(SU:负责在线计算时空相似度,生成索引表以指导计算剪枝;

(2)矩阵处理引擎(MPE:包含异构DSP阵列,支持INT8FP16混合精度的矩阵乘法加速;

(3)恢复单元(RU:根据索引表将稀疏计算结果恢复为完整激活张量,以保证后续非线性运算(如LayerNorm、Softmax)的正确性;

(4)专用函数单元(SFU:负责SoftmaxGELULayerNorm等元素级和规约级非线性操作。内存管理单元(MMU)负责全局缓冲与计算单元间的数据搬运,嵌入式CPU则负责在线指令调度与负载均衡。

图1 FlightVGM总体框架图

2.2 时空激活稀疏化

论文提出了一种同时考虑帧间与帧内相似性的激活稀疏化方法。其核心思想是:如果两个令牌(Token)高度相似,则只需计算其中一个,将其结果复制共享给另一个。相似度采用余弦相似度计算,如下所示,其中 Vref 为参考向量,Vin 为输入向量。

如图2所示,稀疏化分为两步。第一步是帧间稀疏化:将连续 GG 帧分为一组,选取第一帧为参考帧,其余帧的令牌与参考帧对应令牌逐对计算相似度,若超过预设阈值(如QKV投影为0.95,FFN为0.92),则将该令牌标记为“剪枝”(计算省略)。第二步是帧内稀疏化:在每帧内将 T 个令牌分成 K个块,每个块内选择第一个令牌为参考令牌,其余令牌与参考令牌计算相似度,若超过阈值则继续剪枝。需要强调的是,若某个令牌在帧间阶段已被剪枝,其在帧内阶段的相似度直接置为0。

图2 时空激活稀疏化与恢复流程

针对计算量,我们以通用的线性层为例进行分析。原始计算量为FTd 2。引入稀疏化后,设密度为s(实验中约为0.3),主要矩阵乘法计算降为s ∙ FTd 2由于隐藏维度 dd 通常高达数千(如1152),额外引入的仅是关于d的线性项,几乎可以忽略。

激活恢复是逆过程。基于稀疏化生成的索引表(Index Table),恢复单元在矩阵乘法结果输出后,通过帧内恢复(将参考令牌结果拷贝至同一块内被剪枝位置)和帧间恢复(将参考帧结果拷贝至对应被剪枝帧位置),最终还原出完整的激活张量。

2.3 混合精度DSP58扩展(DSP-E

针对VGM中线性层对INT8精度容忍度高、而注意力图(Attention Map)对FP16精度敏感的混合精度需求,论文提出了DSP-EDSP-Expansion架构,以解决DSP58在运行时不支持精度模式动态切换的痛点。如图3所示,DSP-E在原生DSP58周围增加了额外的INT8乘法器、INT加法器以及浮点指数对齐与规格化单元。

图3 DSP-E架构示意图

FP16模式下,DSP-E采用了Overpacking技术FP16的小数位为10位,即相当于两个11位(含隐含位)乘法。为了在原生仅支持27x24位标量乘法的DSP58中塞入两个乘法,FlightVGM将两个11位被乘数间隔7位打包进27位中,利用外部逻辑计算被污染的低位和高位,再通过减法器恢复干净结果,最终使单个DSP58配合DSP-E外部逻辑支持两个FP16乘加(MAC操作。

INT8模式下,DSP-EDSP58配置为标量定点模式,并复用外部INT8乘法器和加法器,使整体支持四个INT8 MAC操作。通过合理配置DSP-E与原生DSPDSP-N)的比例,FlightVGMV80 FPGA上实现了等效INT8峰值算力20.3 TOPS,相比仅使用FP16原生模式,PCP提升了3.26倍

2.4 动态-静态自适应调度

在线激活稀疏化使得各算子的实际计算负载动态变化,传统静态调度(依赖离线预测)因无法感知实时稀疏度而导致负载不均衡,而纯动态调度则受限于FPGA嵌入式CPU性能,无法处理复杂的DiT图结构。为此,论文提出动静结合的自适应调度方法,如图4所示。

图4 动态-静态调度流程示例

调度分为两阶段。静态编译阶段:编译器执行算子融合与权重量化,并根据模型结构预估每个算子的最早完成时间(EFT),存入调度器数据库。动态调整阶段:运行时,当某个算子的输入激活完成稀疏化处理后,调度器获得实际稀疏度并更新其实际EFT。若实际EFT与预估EFT发生偏差,则触发重调度。调度器维护一个优先级队列,依据实际EFT决定执行顺序,优先执行高优先级算子。

具体策略包括:(1)尽可能早地预加载权重,实现权重加载(WL)与计算(COM)阶段的重叠;(2)当某算子优先级因实EFT缩短而降低时,调度器暂停当前算子的COM阶段,转而执行WL段中优先级更高的新算子。实验表明,该调度方法将计算单元(PE)的平均利用率从34.2%提升至92.5%(即提升2.75倍),且引入的调度开销几乎可忽略不计。

三、实验

论文采用两个先进的DiT-based VGM模型(Latte-1Open-Sora 1.2)进行评估,数据集包含UCF-101及公开提示词文本。硬件平台为AMD V80 FPGA,对比基线包括NVIDIA 3090 GPUFPGA速器(HiSpMVFlightLLM)以及DiT专用ASIC加速器(InterArch、CMC)。评估指标涵盖模型精度(CLIPSIMVBench)、端到端推理吞吐、能效以及硬件资源利用率。

3.1 模型精度

图5展示了不同压缩策略下的模型精度损失与生成视频质量示例。我们将原始FP16密集模型设为基线。实验表明,FlightVGM(采用混合精度量化+激活稀疏化)相比基线,平均精度损失仅为0.008。作为对比,若采用全INT8量化,精度损失高达0.042,验证了FlightVGM在保留关键注意力图FP16精度方面的有效性。从生成视频的视觉效果看,FlightVGM生成的视频在色彩、纹理和运动连贯性上与原始模型几乎无差异,而全INT8量化则出现了明显的失真。这表明FlightVGM在实现3.17倍端到端计算缩减的同时,完美保持了模型的生成能力。

图5 不同压缩方法下的模型精度与视频生成示例

3.2 性能与能效对比

图6给出了FlightVGM与各基线的性能和能效对比。与NVIDIA 3090 GPU相比,FlightVGM实现了1.30倍的性能提升和4.49倍的能效提升。与DiT专用加速器InterArchCMC相比,性能分别提升1.74倍1.56倍,能效提升1.33倍1.27倍。与FPGA加速器HiSpMVFlightLLM相比,性能提升分别达7.69倍3.12倍

图6 性能与能效对比(归一化至3090 GPU

3.3 消融实验

图7展示了三个关键的消融实验结果。

图7 消融实验结果

(a)DSP-E架构贡献:在相同硬件资源约束下,相比不使用DSP-E的原生设计,DSP-E单独提升计算性能1.20倍。结合混合精度带来的INT8算力提升,整体等效PCP较纯FP16设计提升3.26倍。论文还发现,INT8FP16算力比例存在最优值(约为6),该比例由VGM模型中线性层与注意力层的计算比例决定。

(b)自适应调度贡献:引入动态-静态调度后,由于消除了在线稀疏化导致的负载不均,PE平均利用率从34.2%提升至92.5%,即利用效率提升2.75倍

(c)AIEFPGA讨论:若采用搭载AI EngineFPGA(如AMD VEK280,提供228 TOPS INT8性能),FlightVGMAIE-based)在配备HBM的情况下,理论上可额外获得5.79倍加速,但若仅使用DDR,低带宽将严重制约性能,这说明内存带宽是未来FPGA加速VGM的主要瓶颈。

四、总结

本文提出了FlightVGM,一个面向视频生成模型的高效FPGA推理加速器,通过时空激活稀疏化、混合精度DSP扩展与动静结合的自适应调度三方面的协同设计,首次在VGM任务中实现了性能与能效对GPU的全面超越。实验结果表明,在AMD V80 FPGA上,FlightVGM相比NVIDIA 3090 GPU实现了1.30倍的性能提升和4.49倍的能效提升,且视频生成质量与原始模型几乎无异(精度损失仅为0.008)。该工作不仅为视频生成模型的边缘部署提供了可行的硬件加速路径,也为可重构计算在生成式AI时代的应用提供了新思路。后续研究将进一步探索AI引擎与高带宽存储的融合,以突破内存墙瓶颈,支撑更大规模的多模态模型实时推理。

-End-
本文作者
何梦梅
重庆大学计算机科学与技术专业2024级本科生,重庆大学 Start Lab团队成员。


重庆大学时空实验室(Spatio-Temporal Art Lab,简称Start Lab),旨在发挥企业和高校的优势,深入探索时空数据收集、存储、管理、挖掘、可视化相关技术,并积极推进学术成果在产业界的落地!年度有3~5名研究生名额,欢迎计算机、GIS等相关专业的学生报考!
       


              图文|何梦梅

              校稿|徐小龙

              编辑|刘苧锐

              审核|李瑞远

              审核|杨广超 

文章转载自时空实验室,如果涉嫌侵权,请发送邮件至:contact@modb.pro进行举报,并提供相关证据,一经查实,墨天轮将立刻删除相关内容。

评论