GPU 工作负载指南
AI 视频应该租用哪种 GPU?
一份以工作流为先的指南,涵盖 VRAM、渲染时长、编解码器、存储,以及如何在 RTX、L40S 和数据中心 GPU 之间做出选择。
由 AnchorGPU · 更新于 · 6 分钟阅读从流水线中选择,而非按型号名称层级
首先记录确切的流水线:文本到视频、图像到视频或视频到视频;检查点和精度;目标宽度和高度;生成帧数;批大小;去噪步数;条件输入;以及任务是否包含放大或插值。视频内存并非仅由参数数量决定。模型权重、注意力和时序激活、潜在张量以及 VAE 解码在不同阶段都会占用内存。
将流水线支持的维度和帧范围作为约束条件。能够加载检查点的 GPU 仍可能在目标片段上失败,因此容量规划应复现生产请求,而非最小样本。
帧数和分辨率决定工作集
Diffusers 对 Stable Video Diffusion 的说明指出,帧是一起生成的,类似于一个大型图像批次。更多帧和更多像素通常会扩大中间张量,但确切曲线取决于架构和实现。每秒帧数不能替代生成帧数:导出 FPS 控制播放时序,而 num_frames 控制模型创建的帧数。
请按实际宽高比和时长进行性能分析。如果模型需要分窗生成或片段拼接,请评估边界处的时间一致性以及运行是否可行。
卸载与分块以内存换取时间
模型 CPU 卸载将不活跃的流水线组件保留在主机内存中,并在需要时将其移动到加速器上。顺序卸载在更细粒度上工作,可以节省更多设备内存,但反复传输可能会慢得多。前向分块可减少一次执行的前馈工作量。这些是不同的调节手段,且都不会凭空产生容量。
记录每种配置的峰值设备内存和端到端时间。观察主机内存压力和传输行为,而不是假设固定的系统内存需求;检查点格式、数据类型、流水线设计和卸载策略都会改变这一需求。
将去噪与 VAE 解码分离
VAE 将潜变量转换为可视帧,并可能产生自身的内存峰值。在 Stable Video Diffusion 中,decode_chunk_size 控制 VAE 一次解码多少帧;较小的分块可降低峰值内存,而极小的分块可能影响时序一致性。通用 Diffusers VAE 切片跨批次项工作,而 VAE 平铺将大帧划分为重叠的空间瓦片,可能引入瓦片间的色调差异。
检查所选的 VAE 是否支持该优化,然后同时比较输出质量和内存。解决解码峰值并不一定能解决去噪器的峰值。
包括解码、编码和交付
如果工作流需要摄取视频素材或导出多种变体,编解码器硬件与 AI 计算同样重要。NVIDIA 文档说明 NVENC 是独立于 CUDA 核心的专用编码器,在受支持的工作流中,编码和解码可与 CUDA 处理并行运行。编解码器和功能支持因 GPU 代际、驱动程序和 SDK 而异,因此请核实具体显卡,而不要仅凭品牌推断支持情况。
在租用之前,运行一个有代表性的样本,并记录软件版本、条件输入、种子、维度、帧数、步骤、卸载设置、VAE 分块、墙钟时间、峰值 VRAM 和导出编解码器。选择能够以实际余量完成该测试的最小配置,然后仅在重复运行证明确实有吞吐量需求时再扩展。
来源与编辑方法
官方文档支持这些技术说明。硬件推荐是我们根据工作负载做出的解读,并非经过实测的性能保证。
Hugging Face Diffusers — Stable Video Diffusion ↗Hugging Face Diffusers — 减少内存使用 ↗NVIDIA Video Codec SDK 13.1 — NVENC 应用说明 ↗