Guias de carga de trabalho
Servir um LLM com vLLM
Planeje memória e concorrência, configure um endpoint vLLM e valide uma carga de trabalho de inferência representativa.
9 min de leitura · AtualizadoDefina o contrato de serviço
Registre o identificador e a revisão do modelo, formato de peso, quantização, comprimento máximo de contexto, distribuição de comprimento de prompt, concorrência e objetivo de latência. Essas configurações fazem parte da carga de trabalho, não são notas opcionais de benchmark.
Os pesos compartilham a memória da GPU com o cache KV e espaços de trabalho temporários. Um modelo que carrega com sucesso com um prompt curto ainda pode ficar sem memória sob o tráfego pretendido. Mantenha margem operacional e teste as solicitações mais longas permitidas.
Comece com uma GPU quando couber
Uma única GPU evita a comunicação entre GPUs e facilita o diagnóstico de uma primeira implantação. Considere o paralelismo de tensor quando o modelo e o estado de execução necessário não couberem em um acelerador, ou quando uma medição representativa justificar a divisão.
Réplicas independentes atendem solicitações separadas; o paralelismo de tensor divide a computação do modelo. Elas resolvem problemas diferentes. Um nó do catálogo com várias placas não prova, por si só, uma interconexão específica.
Comparar H100 SXM com H100 PCIeQualifique o ambiente completo
A imagem vllm do AnchorGPU está disponível para NVIDIA e AMD no catálogo. Antes da execução real, identifique o driver real, o runtime CUDA ou ROCm, as versões de PyTorch, Python e vLLM. Verifique em conjunto a arquitetura do modelo, o suporte à quantização e quaisquer kernels de atenção compilados.
Este site local salva configurações, mas não executa um servidor de modelo remoto. Os comandos a seguir pertencem a um nó Linux real e provisionado com o software necessário e acesso ao modelo.
Iniciar um endpoint privado
Defina o modelo e uma chave API privada no shell usado para iniciar o servidor. Substitua ambos os espaços reservados. A chave é uma credencial de serviço vLLM, não sua chave API da conta AnchorGPU. Vincule ao loopback durante a validação; o acesso remoto requer um caminho TLS autenticado ou de rede privada.
export MODEL_ID="your-organization/your-model"
export VLLM_API_KEY="replace-with-a-private-serving-key"
vllm serve "$MODEL_ID" --host 127.0.0.1 --port 8000Para um modelo intencionalmente dividido em quatro GPUs visíveis no mesmo nó, adicione --tensor-parallel-size 4. Confirme o layout do hardware e o suporte de software antes de fazer essa alteração.
Verifique a API antes do teste de carga
Em outro shell, defina a mesma VLLM_API_KEY e consulte a lista de modelos. Uma solicitação de chat-completions também exige um modelo com um template de chat apropriado; um lançamento bem-sucedido do servidor não garante que todas as tarefas API sejam suportadas.
curl http://127.0.0.1:8000/v1/models \
-H "Authorization: Bearer $VLLM_API_KEY"Use o identificador do modelo informado pelo servidor nas solicitações do cliente. Mantenha a autenticação ativada durante os testes.
Meça a capacidade sustentada
Reproduza solicitações sanitizadas com os comprimentos de prompt pretendidos, limites de saída e concorrência. Registre o tempo até o primeiro token, a latência de ponta a ponta, o throughput, a taxa de erro, o uso de memória da GPU e a capacidade de cache KV relatada pelo servidor.
Meça o carregamento a frio do modelo separadamente do serviço em estado estável. Aumente a concorrência gradualmente. Se a memória se tornar o limite, avalie um contexto/concurrency menor, um formato de quantização adequado ou mais memória antes de presumir que mais computação ajudará.
Converta o trabalho concluído em custo usando o preço fixo da reserva. Um número de tokens por segundo em destaque não é uma promessa de capacidade, e não reivindicamos resultados de benchmark do AnchorGPU neste guia.
Resolva os modos de falha comuns
Falha na solicitação de chat: verifique o modelo de chat do modelo e a tarefa API suportada. Falha de memória após o carregamento aumentar: verifique a pressão do cache KV, o contexto e a concorrência. Inicialização multi-GPU travada: confirme os dispositivos visíveis, as bibliotecas coletivas e a validade da divisão em paralelo de tensor.
Salve a revisão do modelo, o digest do contêiner, a configuração de inicialização, os resultados de validação e o contrato de API do cliente. Copie os artefatos operacionais para fora do nó antes de liberá-lo.
Leia o guia do ciclo de vida da instância