AGAnchorGPU

Workloadhandleidingen

Serveer een LLM met vLLM

Plan geheugen en gelijktijdigheid, configureer een vLLM-eindpunt en valideer een representatieve inferentieworkload.

9 min leestijd · Bijgewerkt

Definieer het servingcontract

Leg de modelidentificatie en revisie vast, het gewichtsformaat, de kwantisering, de maximale contextlengte, de verdeling van promptlengtes, de gelijktijdigheid en het latentiedoel. Deze instellingen maken deel uit van de workload, niet van optionele benchmarknotities.

Gewichten delen GPU-geheugen met de KV-cache en tijdelijke werkruimten. Een model dat met één korte prompt succesvol laadt, kan onder het beoogde verkeer nog steeds zonder geheugen komen te zitten. Houd operationele speelruimte aan en test de langst toegestane verzoeken.

Begin met één GPU wanneer dat past

Eén enkele GPU vermijdt communicatie tussen GPU's en maakt een eerste implementatie eenvoudiger te diagnosticeren. Overweeg tensorparallellisme wanneer het model en de vereiste runtime-status niet op één accelerator passen, of wanneer een representatieve meting het splitsen rechtvaardigt.

Onafhankelijke replica's bedienen afzonderlijke verzoeken; tensorparallellisme splitst modelberekeningen. Ze lossen verschillende problemen op. Een catalogusnode met meerdere kaarten bewijst op zichzelf geen bepaalde interconnect.

Vergelijk H100 SXM met H100 PCIe

Kwalificeer de volledige omgeving

De AnchorGPU vllm-image is beschikbaar voor NVIDIA en AMD in de catalogus. Identificeer vóór daadwerkelijke uitvoering de werkelijke driver-, CUDA- of ROCm-runtime-, PyTorch-, Python- en vLLM-versies. Controleer modelarchitectuur, kwantiseringsondersteuning en eventuele gecompileerde attentiekernels samen.

Deze lokale site slaat configuraties op, maar draait geen externe modelserver. De volgende opdrachten horen thuis op een echte, ingerichte Linux-node met de vereiste software en modeltoegang.

Start een privé-eindpunt

Stel het model en een privé-API-sleutel in de shell in die wordt gebruikt om de server te starten. Vervang beide placeholders. De sleutel is een vLLM-servingcredential, niet uw AnchorGPU-account-API-sleutel. Bind aan loopback tijdens het valideren; externe toegang vereist een geauthenticeerd TLS- of privénetwerkpad.

export MODEL_ID="your-organization/your-model"
export VLLM_API_KEY="replace-with-a-private-serving-key"
vllm serve "$MODEL_ID" --host 127.0.0.1 --port 8000

Voeg voor een model dat bewust over vier zichtbare GPU's op dezelfde node is gesplitst --tensor-parallel-size 4 toe. Bevestig de hardware-indeling en softwareondersteuning voordat u die wijziging doorvoert.

Controleer de API vóór belastingtests

Stel in een andere shell dezelfde VLLM_API_KEY in en vraag de modellijst op. Een chat-completions-verzoek vereist ook een model met een geschikte chatsjabloon; een geslaagde serverstart garandeert niet dat elke API-taak wordt ondersteund.

curl http://127.0.0.1:8000/v1/models \
  -H "Authorization: Bearer $VLLM_API_KEY"

Gebruik de door de server gerapporteerde modelidentificator in clientverzoeken. Houd authenticatie ingeschakeld tijdens het testen.

Meet duurzame capaciteit

Herhaal gesaneerde verzoeken met de beoogde promptlengtes, uitvoerlimieten en gelijktijdigheid. Leg de tijd tot het eerste token, end-to-end-latentie, doorvoer, foutpercentage, GPU-geheugengebruik en de door de server gerapporteerde KV-cachecapaciteit vast.

Meet het laden van koude modellen afzonderlijk van steady-state serving. Verhoog de gelijktijdigheid geleidelijk. Als geheugen de beperking wordt, evalueer dan lagere context/concurrency, een geschikt kwantisatieformaat of meer geheugen voordat u aanneemt dat meer rekenkracht helpt.

Zet voltooid werk om in kosten met behulp van de vaste reserveringsprijs. Een opvallend aantal tokens per seconde is geen capaciteitsbelofte en wij claimen geen AnchorGPU-benchmarkresultaten in deze handleiding.

Los de veelvoorkomende storingsmodi op

Chatverzoek mislukt: controleer de chatsjabloon van het model en de ondersteunde API-taak. Geheugenfout na toename van de belasting: controleer de KV-cachedruk, context en concurrency. Multi-GPU-initialisatie loopt vast: bevestig zichtbare apparaten, collectieve bibliotheken en de geldigheid van de tensor-parallelle splitsing.

Bewaar de modelrevisie, container-digest, startconfiguratie, validatieresultaten en het client-API-contract. Kopieer operationele artefacten weg van het knooppunt voordat u het vrijgeeft.

Lees de handleiding voor de levenscyclus van instances

Bronnen en verder lezen

vLLM GPU-installatievLLM-parallelisme en schalingvLLM quickstart en authenticatievLLM online serving
Configureer een inference-node