AGAnchorGPU
← 所有工程指南

GPU 工作负载指南

为生产环境中的 LLM 推理选择 GPU

模型大小、量化、上下文、批处理和延迟目标如何改变最佳 GPU——以及每次请求的真实成本。

AnchorGPU · 更新于 · 7 分钟阅读

明确服务契约

将交互式推理服务与离线批处理工作分开。定义最大提示长度、典型和最大输出长度、目标并发数、首 token 时间、token 间延迟和容错要求。单个短请求不是容量测试。

在比较硬件时,请保持模型和分词器版本、量化格式、聊天模板及解码设置不变。否则更快的速度可能来自不同的工作负载或质量取舍,而非 GPU 本身。

预算应高于模型权重

推理需要模型权重、运行时缓冲区、激活值,并且通常还需要用于活动序列的 KV 缓存。更多的并发序列和更长的上下文会改变所需内存。量化支持及其对输出质量的影响需要在所选运行时上进行验证。

24 GB 或 48 GB 显卡是适合的模型的候选,并不保证某个参数规模类别中的每个模型都能运行。请测试实际模型和上下文限制。当更大显存的加速器能减少分区或提供可测量的并发余量时,它们会很有用。

副本还是分布式模型?

如果模型适合单个 GPU,独立副本可能是处理更多请求的直接方式。张量并行会分布模型的部分内容,并在加速器之间引入通信。流水线并行则具有不同的放置和利用率权衡。

在选择卡数之前,请查看当前的 vLLM 指南和交付的机器拓扑。不要假设 SXM、PCIe、四卡或聚合 VRAM 数值就意味着特定的互联结构。

在计时之前先验证软件栈

确认驱动程序、CUDA 或 ROCm 构建版本、GPU 架构支持以及模型所需算子的可用性。容器标签应固定,全新环境应能复现相同的推理结果。

将第一个测试绑定到回环地址,使用 API 密钥,并且不要暴露未经身份验证的模型端点。远程访问、TLS、入口控制和服务监控需要显式部署配置;它们不会通过选择目录镜像自动创建。

测量真实流量

预热服务器,并将模型加载时间与稳态结果分开。回放具有代表性的提示长度、输出长度和并发请求组合。同时报告已接受的请求吞吐量、p95 延迟、错误和内存使用情况。

逐步增加流量,直到延迟或可靠性目标不再满足,然后保留容量余量。将冷启动和恢复测试分开进行:运营就绪包括在进程或节点故障后恢复服务。

比较有效输出的成本

对于测量区间,将该区间可归属的完整分配成本除以成功交付的输出。如果报告每百万 token 的成本,请说明是否包含输入和输出 token,并对每个候选方案使用相同的约定。

固定 7 天或 30 天的租用需为整个期限付费,包括空闲时间。在比较配置之前,请明确规划利用率并纳入可选项目。AnchorGPU 目录价格是建模输入;此处不声明任何实时服务基准或生产可用性。

来源与编辑方法

官方文档支持这些技术说明。硬件推荐是我们根据工作负载做出的解读,并非经过实测的性能保证。

vLLM — 快速入门与服务vLLM — 分布式推理与并行vLLM — GPU 安装要求