AGAnchorGPU

Workload-Leitfäden

Ein LLM mit vLLM bereitstellen

Planen Sie Speicher und Parallelität, konfigurieren Sie einen vLLM-Endpunkt und validieren Sie eine repräsentative Inferenz-Workload.

9 Min. Lesezeit · Aktualisiert

Definieren Sie den Serving-Vertrag

Erfassen Sie die Modellkennung und -revision, das Gewichtsformat, die Quantisierung, die maximale Kontextlänge, die Verteilung der Prompt-Längen, die Parallelität und das Latenzziel. Diese Einstellungen sind Teil der Arbeitslast, keine optionalen Benchmark-Notizen.

Gewichte teilen sich den GPU-Speicher mit dem KV-Cache und temporären Arbeitsbereichen. Ein Modell, das mit einem kurzen Prompt erfolgreich geladen wird, kann unter dem beabsichtigten Datenverkehr dennoch nicht genügend Speicher haben. Halten Sie Betriebsreserven ein und testen Sie die längsten zulässigen Anfragen.

Beginnen Sie mit einer GPU, wenn es passt

Eine einzelne GPU vermeidet GPU-übergreifende Kommunikation und erleichtert die Diagnose einer ersten Bereitstellung. Ziehen Sie Tensor-Parallelität in Betracht, wenn das Modell und der erforderliche Laufzeitzustand nicht auf einen Beschleuniger passen oder wenn eine repräsentative Messung die Aufteilung rechtfertigt.

Unabhängige Replikate bedienen getrennte Anfragen; Tensor-Parallelität teilt die Modellberechnung auf. Sie lösen unterschiedliche Probleme. Ein Katalogknoten mit mehreren Karten beweist für sich genommen noch keine bestimmte Verbindungstechnologie.

H100 SXM mit H100 PCIe vergleichen

Qualifizieren Sie die vollständige Umgebung

Das AnchorGPU-vllm-Image ist für NVIDIA und AMD im Katalog verfügbar. Ermitteln Sie vor der tatsächlichen Ausführung den tatsächlichen Treiber, die CUDA- oder ROCm-Laufzeit, PyTorch, Python- und vLLM-Versionen. Prüfen Sie Modellarchitektur, Quantisierungsunterstützung und etwaige kompilierte Attention-Kernel gemeinsam.

Diese lokale Website speichert Konfigurationen, führt aber keinen entfernten Modellserver aus. Die folgenden Befehle gehören auf einen echten, bereitgestellten Linux-Knoten mit der erforderlichen Software und dem Modellzugriff.

Privaten Endpunkt starten

Legen Sie das Modell und einen privaten API-Schlüssel in der Shell fest, die zum Starten des Servers verwendet wird. Ersetzen Sie beide Platzhalter. Der Schlüssel ist eine vLLM-Serving-Anmeldeinformation, nicht Ihr AnchorGPU-Konto-API-Schlüssel. Binden Sie während der Validierung an Loopback; Fernzugriff erfordert einen authentifizierten TLS- oder privaten Netzwerkpfad.

export MODEL_ID="your-organization/your-model"
export VLLM_API_KEY="replace-with-a-private-serving-key"
vllm serve "$MODEL_ID" --host 127.0.0.1 --port 8000

Fügen Sie für ein Modell, das absichtlich auf vier sichtbare GPUs auf demselben Knoten aufgeteilt ist, --tensor-parallel-size 4 hinzu. Bestätigen Sie das Hardware-Layout und die Softwareunterstützung, bevor Sie diese Änderung vornehmen.

Prüfen Sie die API vor Lasttests

Setzen Sie in einer anderen Shell denselben VLLM_API_KEY und fragen Sie die Modellliste ab. Eine Chat-Completions-Anfrage erfordert außerdem ein Modell mit einer passenden Chat-Vorlage; ein erfolgreicher Serverstart garantiert nicht, dass jede API-Aufgabe unterstützt wird.

curl http://127.0.0.1:8000/v1/models \
  -H "Authorization: Bearer $VLLM_API_KEY"

Verwenden Sie die vom Server gemeldete Modellkennung in Client-Anfragen. Halten Sie die Authentifizierung während des Tests aktiviert.

Nachhaltige Kapazität messen

Wiederholen Sie bereinigte Anfragen mit den vorgesehenen Prompt-Längen, Ausgabelimits und der vorgesehenen Parallelität. Erfassen Sie Zeit bis zum ersten Token, End-to-End-Latenz, Durchsatz, Fehlerrate, GPU-Speichernutzung und die vom Server gemeldete KV-Cache-Kapazität.

Messen Sie das Laden kalter Modelle getrennt vom stationären Serving. Erhöhen Sie die Parallelität schrittweise. Wenn der Speicher zum Limit wird, bewerten Sie niedrigeren Kontext/concurrency, ein geeignetes Quantisierungsformat oder mehr Speicher, bevor Sie annehmen, dass mehr Rechenleistung hilft.

Rechnen Sie abgeschlossene Arbeit mithilfe des festen Reservierungspreises in Kosten um. Eine herausragende Tokens-pro-Sekunde-Zahl ist kein Kapazitätsversprechen, und wir erheben in diesem Leitfaden keinen Anspruch auf AnchorGPU-Benchmark-Ergebnisse.

Die häufigen Fehlerursachen beheben

Chat-Anfrage schlägt fehl: Überprüfen Sie die Chat-Vorlage des Modells und die unterstützte API-Aufgabe. Speicherfehler nach zunehmender Last: Überprüfen Sie KV-Cache-Druck, Kontext und Parallelität. Multi-GPU-Initialisierung hängt: Bestätigen Sie sichtbare Geräte, Collective-Bibliotheken und die Gültigkeit der Tensor-Parallel-Aufteilung.

Speichern Sie die Modellrevision, den Container-Digest, die Startkonfiguration, die Validierungsergebnisse und den Client-API-Vertrag. Kopieren Sie operative Artefakte vom Knoten, bevor Sie ihn freigeben.

Lesen Sie den Leitfaden zum Instanzlebenszyklus

Quellen & weiterführende Literatur

vLLM GPU-InstallationvLLM-Parallelität und SkalierungvLLM Schnellstart und AuthentifizierungvLLM-Online-Bereitstellung
Einen Inferenz-Knoten konfigurieren