Guía de cargas de trabajo de GPU
Elegir una GPU para inferencia de LLM en producción
Cómo el tamaño del modelo, la cuantización, el contexto, el procesamiento por lotes y los objetivos de latencia cambian la mejor GPU—y el coste real por solicitud.
Por AnchorGPU · Actualizado · 7 min de lecturaEspecifique el contrato de servicio
Separa el servicio interactivo del trabajo por lotes sin conexión. Define la longitud máxima del prompt, la longitud de salida típica y máxima, la concurrencia objetivo, el tiempo hasta el primer token, la latencia entre tokens y la tolerancia a errores. Una sola solicitud corta no es una prueba de capacidad.
Mantenga fijas las revisiones del modelo y del tokenizador, el formato de cuantización, la plantilla de chat y la configuración de decodificación al comparar hardware. De lo contrario, un resultado más rápido puede provenir de una carga de trabajo diferente o de una compensación de calidad en lugar de la GPU.
Presupueste más que los pesos del modelo
La inferencia necesita pesos del modelo, búferes de tiempo de ejecución, activaciones y normalmente una caché KV para secuencias activas. Más secuencias simultáneas y contextos más largos cambian la memoria requerida. El soporte de cuantización y su efecto en la calidad de salida deben validarse en el tiempo de ejecución elegido.
Una tarjeta de 24 GB o 48 GB es candidata para un modelo que quepa, no una promesa de que todos los modelos de una clase de tamaño de parámetros funcionarán. Pruebe el modelo real y el límite de contexto. Los aceleradores con más memoria son útiles cuando reducen la partición o proporcionan un margen de concurrencia medido.
¿Réplicas o un modelo distribuido?
Si el modelo cabe en una GPU, las réplicas independientes pueden ser una forma directa de atender más solicitudes. El paralelismo de tensor distribuye partes del modelo e introduce comunicación entre aceleradores. El paralelismo de tubería tiene diferentes compensaciones de ubicación y utilización.
Consulte la guía actual de vLLM y la topología de la máquina entregada antes de elegir un número de tarjetas. No asuma que SXM, PCIe, cuatro tarjetas o una cifra agregada de VRAM impliquen una estructura de interconexión concreta.
Cualifique la pila de software antes de medir tiempos
Confirme el controlador, la compilación de CUDA o ROCm, la compatibilidad con la arquitectura de GPU y la disponibilidad de los operadores que necesita su modelo. Las etiquetas de contenedor deben fijarse y un entorno nuevo debe reproducir el mismo resultado de inferencia.
Vincula una primera prueba a loopback, usa una clave API y no expongas un endpoint de modelo sin autenticación. El acceso remoto, TLS, los controles de entrada y la supervisión del servicio requieren una configuración de despliegue explícita; no se crean al seleccionar una imagen del catálogo.
Mida el tráfico realista
Caliente el servidor y separe el tiempo de carga del modelo de los resultados en estado estable. Reproduzca una mezcla representativa de longitudes de indicaciones, longitudes de salida y solicitudes concurrentes. Informe juntos el rendimiento de solicitudes aceptadas, la latencia p95, los errores y el uso de memoria.
Aumente el tráfico hasta que deje de cumplirse el objetivo de latencia o fiabilidad y deje margen de capacidad. Mantenga las pruebas de arranque en frío y de recuperación por separado: la preparación operativa incluye restaurar el servicio tras un fallo de proceso o de nodo.
Compare el coste de la salida útil
Para un intervalo medido, divida el coste total de asignación atribuible a ese intervalo por la salida entregada con éxito. Si informa del coste por millón de tokens, indique si se incluyen los tokens de entrada y de salida y use la misma convención para todos los candidatos.
Un alquiler fijo de 7 o 30 días se paga por todo el período, incluido el tiempo de inactividad. Proyecte la utilización de forma explícita e incluya las opciones antes de comparar configuraciones. Los precios del catálogo de AnchorGPU son datos modelados; aquí no se afirma ninguna referencia de servicio en vivo ni disponibilidad de producción.
Fuentes y método editorial
La documentación oficial respalda las explicaciones técnicas. Las recomendaciones de hardware son nuestra interpretación dependiente de la carga de trabajo, no una garantía de rendimiento medida.
vLLM: inicio rápido y servicio ↗vLLM: servicio distribuido y paralelismo ↗vLLM — requisitos de instalación de GPU ↗