GPU 工作负载指南
为生产环境中的 LLM 推理选择 GPU
模型大小、量化、上下文、批处理和延迟目标如何改变最佳 GPU——以及每次请求的真实成本。
由 AnchorGPU · 更新于 · 7 分钟阅读明确服务契约
将交互式推理服务与离线批处理工作分开。定义最大提示长度、典型和最大输出长度、目标并发数、首 token 时间、token 间延迟和容错要求。单个短请求不是容量测试。
在比较硬件时,请保持模型和分词器版本、量化格式、聊天模板及解码设置不变。否则更快的速度可能来自不同的工作负载或质量取舍,而非 GPU 本身。
预算应高于模型权重
推理需要模型权重、运行时缓冲区、激活值,并且通常还需要用于活动序列的 KV 缓存。更多的并发序列和更长的上下文会改变所需内存。量化支持及其对输出质量的影响需要在所选运行时上进行验证。
24 GB 或 48 GB 显卡是适合的模型的候选,并不保证某个参数规模类别中的每个模型都能运行。请测试实际模型和上下文限制。当更大显存的加速器能减少分区或提供可测量的并发余量时,它们会很有用。
副本还是分布式模型?
如果模型适合单个 GPU,独立副本可能是处理更多请求的直接方式。张量并行会分布模型的部分内容,并在加速器之间引入通信。流水线并行则具有不同的放置和利用率权衡。
在选择卡数之前,请查看当前的 vLLM 指南和交付的机器拓扑。不要假设 SXM、PCIe、四卡或聚合 VRAM 数值就意味着特定的互联结构。
在计时之前先验证软件栈
确认驱动程序、CUDA 或 ROCm 构建版本、GPU 架构支持以及模型所需算子的可用性。容器标签应固定,全新环境应能复现相同的推理结果。
将第一个测试绑定到回环地址,使用 API 密钥,并且不要暴露未经身份验证的模型端点。远程访问、TLS、入口控制和服务监控需要显式部署配置;它们不会通过选择目录镜像自动创建。
测量真实流量
预热服务器,并将模型加载时间与稳态结果分开。回放具有代表性的提示长度、输出长度和并发请求组合。同时报告已接受的请求吞吐量、p95 延迟、错误和内存使用情况。
逐步增加流量,直到延迟或可靠性目标不再满足,然后保留容量余量。将冷启动和恢复测试分开进行:运营就绪包括在进程或节点故障后恢复服务。
比较有效输出的成本
对于测量区间,将该区间可归属的完整分配成本除以成功交付的输出。如果报告每百万 token 的成本,请说明是否包含输入和输出 token,并对每个候选方案使用相同的约定。
固定 7 天或 30 天的租用需为整个期限付费,包括空闲时间。在比较配置之前,请明确规划利用率并纳入可选项目。AnchorGPU 目录价格是建模输入;此处不声明任何实时服务基准或生产可用性。
来源与编辑方法
官方文档支持这些技术说明。硬件推荐是我们根据工作负载做出的解读,并非经过实测的性能保证。
vLLM — 快速入门与服务 ↗vLLM — 分布式推理与并行 ↗vLLM — GPU 安装要求 ↗