GPU 워크로드 가이드
프로덕션 LLM 추론을 위한 GPU 선택
모델 크기, 양자화, 컨텍스트, 배치 처리, 지연 시간 목표가 최적의 GPU와 요청당 실제 비용을 어떻게 바꾸는지 알아보세요.
작성자 AnchorGPU · 업데이트 · 7분 읽기서빙 계약을 명시하세요
대화형 서빙과 오프라인 배치 작업을 분리하세요. 최대 프롬프트 길이, 일반 및 최대 출력 길이, 목표 동시성, 첫 토큰까지의 시간, 토큰 간 지연 시간, 오류 허용 범위를 정의하세요. 단일 짧은 요청은 용량 테스트가 아닙니다.
하드웨어를 비교할 때 모델 및 토크나이저 리비전, 양자화 형식, 채팅 템플릿, 디코딩 설정을 고정하세요. 그렇지 않으면 더 빠른 결과가 GPU가 아닌 다른 워크로드나 품질 절충에서 비롯될 수 있습니다.
모델 가중치보다 더 많은 예산을 확보하세요
추론에는 모델 가중치, 런타임 버퍼, 활성화 및 일반적으로 활성 시퀀스를 위한 KV 캐시가 필요합니다. 동시 시퀀스가 많고 컨텍스트가 길수록 필요한 메모리가 달라집니다. 양자화 지원과 출력 품질에 미치는 영향은 선택한 런타임에서 검증해야 합니다.
24 GB 또는 48 GB 카드는 적합한 모델의 후보이지, 매개변수 크기 클래스의 모든 모델이 실행된다는 약속이 아닙니다. 실제 모델과 컨텍스트 한도를 테스트하세요. 더 큰 메모리 가속기는 파티셔닝을 줄이거나 측정된 동시성 여유를 제공할 때 유용합니다.
복제본인가요, 분산 모델인가요?
모델이 하나의 GPU에 맞는 경우 독립 복제본이 더 많은 요청을 처리하는 간단한 방법일 수 있습니다. 텐서 병렬 처리는 모델의 일부를 분산하고 가속기 간 통신을 도입합니다. 파이프라인 병렬 처리는 배치 및 활용도 측면에서 다른 트레이드오프가 있습니다.
카드 수를 선택하기 전에 현재 vLLM 지침과 제공된 머신 토폴로지를 확인하세요. SXM, PCIe, 4개 카드 또는 총 VRAM 수치가 특정 연결 패브릭을 의미한다고 가정하지 마세요.
타이밍 측정 전에 소프트웨어 스택을 검증하세요
드라이버, CUDA 또는 ROCm 빌드, GPU 아키텍처 지원, 모델에 필요한 연산자의 가용성을 확인하세요. 컨테이너 태그는 고정되어야 하며 새 환경에서도 동일한 서빙 결과가 재현되어야 합니다.
첫 번째 테스트는 루프백에 바인딩하고 API 키를 사용하며 인증되지 않은 모델 엔드포인트를 노출하지 마세요. 원격 액세스, TLS, 인그레스 제어, 서비스 모니터링은 명시적인 배포 구성이 필요하며 카탈로그 이미지를 선택한다고 자동으로 생성되지 않습니다.
현실적인 트래픽 측정
서버를 예열하고 모델 로딩 시간을 정상 상태 결과와 분리하세요. 프롬프트 길이, 출력 길이, 동시 요청의 대표적인 혼합을 재현하세요. 허용된 요청 처리량, p95 지연 시간, 오류, 메모리 사용량을 함께 보고하세요.
지연 시간이나 안정성 목표를 더 이상 충족하지 못할 때까지 트래픽을 늘린 다음 용량 여유를 남겨 두세요. 콜드 스타트 및 복구 테스트는 별도로 유지하세요. 운영 준비성에는 프로세스 또는 노드 장애 후 서비스 복원도 포함됩니다.
유용한 출력 비용 비교
측정된 구간에 대해 해당 구간에 귀속되는 전체 할당 비용을 성공적으로 전달된 출력으로 나누십시오. 백만 토큰당 비용을 보고하는 경우 입력 및 출력 토큰이 포함되는지 명시하고 모든 후보에 동일한 규칙을 사용하십시오.
고정 7일 또는 30일 임대는 유휴 시간을 포함하여 전체 기간에 대해 지불됩니다. 구성을 비교하기 전에 활용률을 명시적으로 예측하고 옵션을 포함하십시오. AnchorGPU 카탈로그 가격은 모델링된 입력값이며, 여기에는 실시간 서빙 벤치마크나 프로덕션 가용성이 주장되지 않습니다.
출처 및 편집 방법
공식 문서가 기술 설명을 뒷받침합니다. 하드웨어 권장 사항은 워크로드에 따른 당사의 해석이며 측정된 성능 보장이 아닙니다.
vLLM — 빠른 시작 및 서빙 ↗vLLM — 분산 서빙 및 병렬 처리 ↗vLLM — GPU 설치 요구 사항 ↗