워크로드 가이드
vLLM로 LLM 서빙하기
메모리와 동시성을 계획하고 vLLM 엔드포인트를 구성한 다음 대표적인 추론 워크로드를 검증하세요.
9분 읽기 · 업데이트됨서빙 계약 정의
모델 식별자와 리비전, 가중치 형식, 양자화, 최대 컨텍스트 길이, 프롬프트 길이 분포, 동시성, 지연 시간 목표를 기록하세요. 이러한 설정은 워크로드의 일부이지 선택적인 벤치마크 메모가 아닙니다.
가중치는 KV 캐시 및 임시 작업 공간과 GPU 메모리를 공유합니다. 짧은 프롬프트 하나로 성공적으로 로드된 모델도 의도된 트래픽에서는 메모리가 부족할 수 있습니다. 운영 여유 공간을 유지하고 허용된 가장 긴 요청을 테스트하세요.
적합할 때 GPU 하나로 시작하세요
단일 GPU는 GPU 간 통신을 피하고 첫 배포를 더 쉽게 진단할 수 있게 합니다. 모델과 필요한 런타임 상태가 하나의 가속기에 맞지 않거나 대표 측정이 분할을 정당화할 때 텐서 병렬화를 고려하세요.
독립 복제본은 별도의 요청을 처리하고, 텐서 병렬화는 모델 계산을 분할합니다. 이들은 서로 다른 문제를 해결합니다. 여러 카드가 있는 카탈로그 노드 자체가 특정 인터커넥트를 증명하지는 않습니다.
H100 SXM와(과) H100 PCIe 비교전체 환경 검증
AnchorGPU vllm 이미지는 카탈로그에서 NVIDIA 및 AMD용으로 제공됩니다. 실제 실행 전에 실제 드라이버, CUDA 또는 ROCm 런타임, PyTorch, Python 및 vLLM 버전을 확인하세요. 모델 아키텍처, 양자화 지원, 컴파일된 어텐션 커널도 함께 확인하세요.
이 로컬 사이트는 구성을 저장하지만 원격 모델 서버를 실행하지는 않습니다. 다음 명령은 필요한 소프트웨어와 모델 액세스가 갖춰진 실제 프로비저닝된 Linux 노드에서 실행해야 합니다.
프라이빗 엔드포인트 시작
서버를 시작하는 데 사용되는 셸에서 모델과 개인 API 키를 설정하세요. 두 자리 표시자를 모두 교체하세요. 이 키는 vLLM 서빙 자격 증명이지 AnchorGPU 계정 API 키가 아닙니다. 검증하는 동안 루프백에 바인딩하세요. 원격 액세스에는 인증된 TLS 또는 사설 네트워크 경로가 필요합니다.
export MODEL_ID="your-organization/your-model"
export VLLM_API_KEY="replace-with-a-private-serving-key"
vllm serve "$MODEL_ID" --host 127.0.0.1 --port 8000동일한 노드의 4개의 가시 GPU에 걸쳐 의도적으로 분할된 모델의 경우 --tensor-parallel-size 4을(를) 추가하십시오. 변경하기 전에 하드웨어 레이아웃과 소프트웨어 지원을 확인하십시오.
부하 테스트 전에 API를 확인하세요
다른 셸에서 동일한 VLLM_API_KEY를 설정하고 모델 목록을 조회하세요. 채팅 완성 요청에는 적절한 채팅 템플릿이 있는 모델도 필요합니다. 서버가 성공적으로 시작되었다고 해서 모든 API 작업이 지원되는 것은 아닙니다.
curl http://127.0.0.1:8000/v1/models \
-H "Authorization: Bearer $VLLM_API_KEY"클라이언트 요청에서 서버가 보고한 모델 식별자를 사용하세요. 테스트하는 동안 인증을 활성화된 상태로 유지하세요.
지속 가능한 용량 측정
의도한 프롬프트 길이, 출력 제한, 동시성으로 정제된 요청을 재생하세요. 첫 토큰까지의 시간, 종단 간 지연 시간, 처리량, 오류율, GPU 메모리 사용량, 서버가 보고한 KV 캐시 용량을 기록하세요.
콜드 모델 로딩은 정상 상태 서빙과 별도로 측정하세요. 동시성을 점진적으로 늘리세요. 메모리가 제한 요인이 되면 더 많은 컴퓨팅이 도움이 될 것이라고 가정하기 전에 더 낮은 컨텍스트/concurrency, 적절한 양자화 형식 또는 더 많은 메모리를 평가하세요.
완료된 작업을 고정 예약 가격을 사용하여 비용으로 변환하십시오. 초당 토큰 수라는 헤드라인 수치는 용량 약속이 아니며, 이 가이드에서는 AnchorGPU 벤치마크 결과를 주장하지 않습니다.
일반적인 실패 모드 해결
채팅 요청 실패: 모델의 채팅 템플릿과 지원되는 API 작업을 확인하세요. 로드 후 메모리 실패 증가: KV 캐시 압력, 컨텍스트 및 동시성을 확인하세요. 다중 GPU 초기화 중단: 표시되는 장치, 집합 통신 라이브러리 및 텐서 병렬 분할의 유효성을 확인하세요.
모델 리비전, 컨테이너 다이제스트, 시작 구성, 검증 결과 및 클라이언트 API 계약을 저장하십시오. 노드를 해제하기 전에 운영 산출물을 노드 밖으로 복사하십시오.
인스턴스 수명 주기 가이드 읽기