VRAM
가속기에 로컬로 존재하는 메모리입니다. 워크로드 용량에는 모델 가중치 이상이 포함됩니다. 활성화, 버퍼, 캐시된 상태 및 프레임워크 할당도 이를 소비할 수 있습니다.
KV 캐시
자기회귀 서빙이 활성 시퀀스를 위해 보유하는 키 및 값 텐서입니다. 모델 아키텍처, 캐시 정밀도, 토큰 수, 동시성이 필요한 용량에 영향을 미칩니다.
양자화
일부 모델 값을 감소된 수치 정밀도로 표현하는 것입니다. 실제 메모리 사용량에는 형식 메타데이터와 런타임 작업 공간이 포함되며, 지원되는 커널과 출력 품질을 확인해야 합니다.
텐서 병렬화
모델 텐서 연산의 일부를 여러 가속기에 분산하는 것입니다. 모델을 여러 카드에 분산할 수 있지만 통신이 발생하며 명시적으로 지원되는 서빙 또는 학습 전략이 필요합니다.
DistributedDataParallel (DDP)
프로세스 전반에 걸쳐 모델 복제본을 실행하고 그래디언트를 동기화하는 PyTorch 학습 접근 방식입니다. 복제는 기기 메모리를 하나의 연속 풀로 결합하지 않습니다.
완전 분할 데이터 병렬(FSDP)
모델 매개변수, 기울기 및 옵티마이저 상태를 분할하는 분산 학습입니다. 메모리 절약에는 통신, 조정 및 체크포인트 요구 사항이 따릅니다.
CUDA
NVIDIA의 병렬 컴퓨팅 플랫폼 및 프로그래밍 모델. CUDA 종속 워크로드에는 여전히 호환되는 하드웨어, 드라이버, 런타임 및 라이브러리가 필요합니다.
ROCm
GPU 컴퓨팅을 위한 AMD의 소프트웨어 스택. 정확한 GPU, 운영 체제, 프레임워크 빌드 및 워크로드 종속성에 대해 지원 여부를 확인해야 합니다.
학습 체크포인트
학습을 재개하거나 재현하는 데 사용되는 저장된 상태입니다. 실행에 따라 모델, 옵티마이저, 스케줄, 무작위 상태 및 데이터 진행 상황이 포함됩니다. 기록뿐만 아니라 복원도 확인하십시오.
변분 오토인코더(VAE)
확산 파이프라인에서 잠재 표현과 볼 수 있는 출력 간을 매핑하는 구성 요소입니다. 디코딩은 디노이징과 별도의 메모리 피크를 가질 수 있으며, 지원되는 청킹 또는 타일링에는 품질 검사가 필요합니다.
고정 임대 기간
이 카탈로그에서 1주는 정확히 7일이고 1개월은 정확히 30일입니다. 모델링된 할당을 중지해도 결제 기간은 일시 중지되지 않습니다. GPU 가격과 선택한 옵션이 전체 견적을 구성합니다.
멱등성 키
지원되는 작업이 반복된 요청을 인식하여 동일한 작업이 두 번 적용되지 않도록 하는 식별자입니다. 다른 구매나 구성이 아닌 동일한 작업의 재시도에 재사용하세요.
정의는 개념을 설명하며, 특정 워크로드, 라이브러리 버전 또는 토폴로지가 AnchorGPU 할당에서 지원된다는 것을 보장하지 않습니다.