AGAnchorGPU

Guias de carga de trabalho

Servir um LLM com vLLM

Planeje memória e concorrência, configure um endpoint vLLM e valide uma carga de trabalho de inferência representativa.

9 min de leitura · Atualizado

Defina o contrato de serviço

Registre o identificador e a revisão do modelo, formato de peso, quantização, comprimento máximo de contexto, distribuição de comprimento de prompt, concorrência e objetivo de latência. Essas configurações fazem parte da carga de trabalho, não são notas opcionais de benchmark.

Os pesos compartilham a memória da GPU com o cache KV e espaços de trabalho temporários. Um modelo que carrega com sucesso com um prompt curto ainda pode ficar sem memória sob o tráfego pretendido. Mantenha margem operacional e teste as solicitações mais longas permitidas.

Comece com uma GPU quando couber

Uma única GPU evita a comunicação entre GPUs e facilita o diagnóstico de uma primeira implantação. Considere o paralelismo de tensor quando o modelo e o estado de execução necessário não couberem em um acelerador, ou quando uma medição representativa justificar a divisão.

Réplicas independentes atendem solicitações separadas; o paralelismo de tensor divide a computação do modelo. Elas resolvem problemas diferentes. Um nó do catálogo com várias placas não prova, por si só, uma interconexão específica.

Comparar H100 SXM com H100 PCIe

Qualifique o ambiente completo

A imagem vllm do AnchorGPU está disponível para NVIDIA e AMD no catálogo. Antes da execução real, identifique o driver real, o runtime CUDA ou ROCm, as versões de PyTorch, Python e vLLM. Verifique em conjunto a arquitetura do modelo, o suporte à quantização e quaisquer kernels de atenção compilados.

Este site local salva configurações, mas não executa um servidor de modelo remoto. Os comandos a seguir pertencem a um nó Linux real e provisionado com o software necessário e acesso ao modelo.

Iniciar um endpoint privado

Defina o modelo e uma chave API privada no shell usado para iniciar o servidor. Substitua ambos os espaços reservados. A chave é uma credencial de serviço vLLM, não sua chave API da conta AnchorGPU. Vincule ao loopback durante a validação; o acesso remoto requer um caminho TLS autenticado ou de rede privada.

export MODEL_ID="your-organization/your-model"
export VLLM_API_KEY="replace-with-a-private-serving-key"
vllm serve "$MODEL_ID" --host 127.0.0.1 --port 8000

Para um modelo intencionalmente dividido em quatro GPUs visíveis no mesmo nó, adicione --tensor-parallel-size 4. Confirme o layout do hardware e o suporte de software antes de fazer essa alteração.

Verifique a API antes do teste de carga

Em outro shell, defina a mesma VLLM_API_KEY e consulte a lista de modelos. Uma solicitação de chat-completions também exige um modelo com um template de chat apropriado; um lançamento bem-sucedido do servidor não garante que todas as tarefas API sejam suportadas.

curl http://127.0.0.1:8000/v1/models \
  -H "Authorization: Bearer $VLLM_API_KEY"

Use o identificador do modelo informado pelo servidor nas solicitações do cliente. Mantenha a autenticação ativada durante os testes.

Meça a capacidade sustentada

Reproduza solicitações sanitizadas com os comprimentos de prompt pretendidos, limites de saída e concorrência. Registre o tempo até o primeiro token, a latência de ponta a ponta, o throughput, a taxa de erro, o uso de memória da GPU e a capacidade de cache KV relatada pelo servidor.

Meça o carregamento a frio do modelo separadamente do serviço em estado estável. Aumente a concorrência gradualmente. Se a memória se tornar o limite, avalie um contexto/concurrency menor, um formato de quantização adequado ou mais memória antes de presumir que mais computação ajudará.

Converta o trabalho concluído em custo usando o preço fixo da reserva. Um número de tokens por segundo em destaque não é uma promessa de capacidade, e não reivindicamos resultados de benchmark do AnchorGPU neste guia.

Resolva os modos de falha comuns

Falha na solicitação de chat: verifique o modelo de chat do modelo e a tarefa API suportada. Falha de memória após o carregamento aumentar: verifique a pressão do cache KV, o contexto e a concorrência. Inicialização multi-GPU travada: confirme os dispositivos visíveis, as bibliotecas coletivas e a validade da divisão em paralelo de tensor.

Salve a revisão do modelo, o digest do contêiner, a configuração de inicialização, os resultados de validação e o contrato de API do cliente. Copie os artefatos operacionais para fora do nó antes de liberá-lo.

Leia o guia do ciclo de vida da instância

Fontes e leituras adicionais

Instalação de GPU vLLMParalelismo e escalonamento do vLLMvLLM início rápido e autenticaçãoServiço online vLLM
Configurar um nó de inferência