AGAnchorGPU

Guías de cargas de trabajo

Servir un LLM con vLLM

Planifique la memoria y la concurrencia, configure un punto final de vLLM y valide una carga de trabajo de inferencia representativa.

9 min de lectura · Actualizado

Defina el contrato de la interfaz de inferencia

Registra el identificador y la revisión del modelo, el formato de los pesos, la cuantización, la longitud máxima de contexto, la distribución de longitudes de prompt, la concurrencia y el objetivo de latencia. Estos ajustes forman parte de la carga de trabajo, no son notas opcionales de evaluación.

Los pesos comparten la memoria de la GPU con la caché KV y los espacios de trabajo temporales. Un modelo que se carga correctamente con un prompt corto puede quedarse sin memoria bajo el tráfico previsto. Mantén margen operativo y prueba las solicitudes más largas permitidas.

Comience con una GPU cuando sea suficiente

Una sola GPU evita la comunicación entre GPU y facilita el diagnóstico de un primer despliegue. Considera el paralelismo de tensores cuando el modelo y el estado de ejecución requerido no quepan en un acelerador, o cuando una medición representativa justifique dividirlo.

Las réplicas independientes atienden solicitudes separadas; el paralelismo de tensores divide el cálculo del modelo. Resuelven problemas diferentes. Un nodo del catálogo con varias tarjetas no demuestra, por sí solo, una interconexión concreta.

Comparar H100 SXM con H100 PCIe

Cualifique el entorno completo

La imagen vllm de AnchorGPU está disponible para NVIDIA y AMD en el catálogo. Antes de la ejecución real, identifique el controlador real, el entorno de ejecución de CUDA o ROCm, las versiones de PyTorch, Python y vLLM. Compruebe conjuntamente la arquitectura del modelo, la compatibilidad con la cuantización y los núcleos de atención compilados.

Este sitio local guarda configuraciones pero no ejecuta un servidor de modelos remoto. Los siguientes comandos pertenecen a un nodo Linux real y aprovisionado con el software y el acceso al modelo necesarios.

Lanzar un punto de conexión privado

Establezca el modelo y una clave API privada en el shell utilizado para iniciar el servidor. Reemplace ambos marcadores de posición. La clave es una credencial de servicio de vLLM, no su clave API de la cuenta de AnchorGPU. Vincule a loopback mientras valida; el acceso remoto necesita una ruta TLS autenticada o de red privada.

export MODEL_ID="your-organization/your-model"
export VLLM_API_KEY="replace-with-a-private-serving-key"
vllm serve "$MODEL_ID" --host 127.0.0.1 --port 8000

Para un modelo dividido intencionadamente entre cuatro GPU visibles en el mismo nodo, añada --tensor-parallel-size 4. Confirme la disposición del hardware y la compatibilidad del software antes de realizar ese cambio.

Compruebe la API antes de las pruebas de carga

En otra terminal, establezca la misma clave VLLM_API_KEY y consulte la lista de modelos. Una solicitud de finalización de chat también requiere un modelo con una plantilla de chat adecuada; un lanzamiento exitoso del servidor no garantiza que se admita cada tarea de API.

curl http://127.0.0.1:8000/v1/models \
  -H "Authorization: Bearer $VLLM_API_KEY"

Utilice el identificador de modelo comunicado por el servidor en las solicitudes del cliente. Mantenga la autenticación habilitada durante las pruebas.

Mida la capacidad sostenida

Reproduce solicitudes saneadas con las longitudes de prompt previstas, los límites de salida y la concurrencia. Registra el tiempo hasta el primer token, la latencia de extremo a extremo, el rendimiento, la tasa de errores, el uso de memoria de GPU y la capacidad de caché KV informada por el servidor.

Mida la carga del modelo en frío por separado del servicio en estado estable. Aumente la concurrencia gradualmente. Si la memoria se convierte en el límite, evalúe un contexto/concurrency menor, un formato de cuantificación adecuado o más memoria antes de asumir que más cómputo ayudará.

Convierta el trabajo completado en coste utilizando el precio fijo de reserva. Una cifra destacada de tokens por segundo no es una promesa de capacidad, y no afirmamos resultados de referencia de AnchorGPU en esta guía.

Resuelva los modos de fallo habituales

Fallo en la solicitud de chat: verifica la plantilla de chat del modelo y la tarea API admitida. Fallo de memoria tras aumentar la carga: verifica la presión de la caché KV, el contexto y la concurrencia. La inicialización multi-GPU se bloquea: confirma los dispositivos visibles, las bibliotecas colectivas y la validez de la división de paralelismo de tensores.

Guarde la revisión del modelo, el resumen del contenedor, la configuración de lanzamiento, los resultados de validación y el contrato de API del cliente. Copie los artefactos operativos fuera del nodo antes de liberarlo.

Lea la guía del ciclo de vida de la instancia

Fuentes y lecturas adicionales

Instalación de GPU con vLLMParalelismo y escalado de vLLMInicio rápido y autenticación de vLLMServicio en línea con vLLM
Configurar un nodo de inferencia