AGAnchorGPU
← Todas las guías de ingeniería

Guía de cargas de trabajo de GPU

Elegir una GPU para inferencia de LLM en producción

Cómo el tamaño del modelo, la cuantización, el contexto, el procesamiento por lotes y los objetivos de latencia cambian la mejor GPU—y el coste real por solicitud.

Por AnchorGPU · Actualizado · 7 min de lectura

Especifique el contrato de servicio

Separa el servicio interactivo del trabajo por lotes sin conexión. Define la longitud máxima del prompt, la longitud de salida típica y máxima, la concurrencia objetivo, el tiempo hasta el primer token, la latencia entre tokens y la tolerancia a errores. Una sola solicitud corta no es una prueba de capacidad.

Mantenga fijas las revisiones del modelo y del tokenizador, el formato de cuantización, la plantilla de chat y la configuración de decodificación al comparar hardware. De lo contrario, un resultado más rápido puede provenir de una carga de trabajo diferente o de una compensación de calidad en lugar de la GPU.

Presupueste más que los pesos del modelo

La inferencia necesita pesos del modelo, búferes de tiempo de ejecución, activaciones y normalmente una caché KV para secuencias activas. Más secuencias simultáneas y contextos más largos cambian la memoria requerida. El soporte de cuantización y su efecto en la calidad de salida deben validarse en el tiempo de ejecución elegido.

Una tarjeta de 24 GB o 48 GB es candidata para un modelo que quepa, no una promesa de que todos los modelos de una clase de tamaño de parámetros funcionarán. Pruebe el modelo real y el límite de contexto. Los aceleradores con más memoria son útiles cuando reducen la partición o proporcionan un margen de concurrencia medido.

¿Réplicas o un modelo distribuido?

Si el modelo cabe en una GPU, las réplicas independientes pueden ser una forma directa de atender más solicitudes. El paralelismo de tensor distribuye partes del modelo e introduce comunicación entre aceleradores. El paralelismo de tubería tiene diferentes compensaciones de ubicación y utilización.

Consulte la guía actual de vLLM y la topología de la máquina entregada antes de elegir un número de tarjetas. No asuma que SXM, PCIe, cuatro tarjetas o una cifra agregada de VRAM impliquen una estructura de interconexión concreta.

Cualifique la pila de software antes de medir tiempos

Confirme el controlador, la compilación de CUDA o ROCm, la compatibilidad con la arquitectura de GPU y la disponibilidad de los operadores que necesita su modelo. Las etiquetas de contenedor deben fijarse y un entorno nuevo debe reproducir el mismo resultado de inferencia.

Vincula una primera prueba a loopback, usa una clave API y no expongas un endpoint de modelo sin autenticación. El acceso remoto, TLS, los controles de entrada y la supervisión del servicio requieren una configuración de despliegue explícita; no se crean al seleccionar una imagen del catálogo.

Mida el tráfico realista

Caliente el servidor y separe el tiempo de carga del modelo de los resultados en estado estable. Reproduzca una mezcla representativa de longitudes de indicaciones, longitudes de salida y solicitudes concurrentes. Informe juntos el rendimiento de solicitudes aceptadas, la latencia p95, los errores y el uso de memoria.

Aumente el tráfico hasta que deje de cumplirse el objetivo de latencia o fiabilidad y deje margen de capacidad. Mantenga las pruebas de arranque en frío y de recuperación por separado: la preparación operativa incluye restaurar el servicio tras un fallo de proceso o de nodo.

Compare el coste de la salida útil

Para un intervalo medido, divida el coste total de asignación atribuible a ese intervalo por la salida entregada con éxito. Si informa del coste por millón de tokens, indique si se incluyen los tokens de entrada y de salida y use la misma convención para todos los candidatos.

Un alquiler fijo de 7 o 30 días se paga por todo el período, incluido el tiempo de inactividad. Proyecte la utilización de forma explícita e incluya las opciones antes de comparar configuraciones. Los precios del catálogo de AnchorGPU son datos modelados; aquí no se afirma ninguna referencia de servicio en vivo ni disponibilidad de producción.

Fuentes y método editorial

La documentación oficial respalda las explicaciones técnicas. Las recomendaciones de hardware son nuestra interpretación dependiente de la carga de trabajo, no una garantía de rendimiento medida.

vLLM: inicio rápido y serviciovLLM: servicio distribuido y paralelismovLLM — requisitos de instalación de GPU