AGAnchorGPU

GPU 워크로드 용어집

구성 뒤에 있는 조건.

GPU 메모리, KV 캐시, 양자화, CUDA, ROCm, 텐서 병렬화, 학습 및 고정 기간 청구에 대한 평이한 언어 정의.

#

VRAM

가속기에 로컬로 존재하는 메모리입니다. 워크로드 용량에는 모델 가중치 이상이 포함됩니다. 활성화, 버퍼, 캐시된 상태 및 프레임워크 할당도 이를 소비할 수 있습니다.

실용 가이드 →공식 문서 ↗
#

KV 캐시

자기회귀 서빙이 활성 시퀀스를 위해 보유하는 키 및 값 텐서입니다. 모델 아키텍처, 캐시 정밀도, 토큰 수, 동시성이 필요한 용량에 영향을 미칩니다.

실용 가이드 →공식 문서 ↗
#

양자화

일부 모델 값을 감소된 수치 정밀도로 표현하는 것입니다. 실제 메모리 사용량에는 형식 메타데이터와 런타임 작업 공간이 포함되며, 지원되는 커널과 출력 품질을 확인해야 합니다.

실용 가이드 →공식 문서 ↗
#

텐서 병렬화

모델 텐서 연산의 일부를 여러 가속기에 분산하는 것입니다. 모델을 여러 카드에 분산할 수 있지만 통신이 발생하며 명시적으로 지원되는 서빙 또는 학습 전략이 필요합니다.

실용 가이드 →공식 문서 ↗
#

DistributedDataParallel (DDP)

프로세스 전반에 걸쳐 모델 복제본을 실행하고 그래디언트를 동기화하는 PyTorch 학습 접근 방식입니다. 복제는 기기 메모리를 하나의 연속 풀로 결합하지 않습니다.

실용 가이드 →공식 문서 ↗
#

완전 분할 데이터 병렬(FSDP)

모델 매개변수, 기울기 및 옵티마이저 상태를 분할하는 분산 학습입니다. 메모리 절약에는 통신, 조정 및 체크포인트 요구 사항이 따릅니다.

실용 가이드 →공식 문서 ↗
#

CUDA

NVIDIA의 병렬 컴퓨팅 플랫폼 및 프로그래밍 모델. CUDA 종속 워크로드에는 여전히 호환되는 하드웨어, 드라이버, 런타임 및 라이브러리가 필요합니다.

실용 가이드 →공식 문서 ↗
#

ROCm

GPU 컴퓨팅을 위한 AMD의 소프트웨어 스택. 정확한 GPU, 운영 체제, 프레임워크 빌드 및 워크로드 종속성에 대해 지원 여부를 확인해야 합니다.

실용 가이드 →공식 문서 ↗
#

학습 체크포인트

학습을 재개하거나 재현하는 데 사용되는 저장된 상태입니다. 실행에 따라 모델, 옵티마이저, 스케줄, 무작위 상태 및 데이터 진행 상황이 포함됩니다. 기록뿐만 아니라 복원도 확인하십시오.

실용 가이드 →공식 문서 ↗
#

변분 오토인코더(VAE)

확산 파이프라인에서 잠재 표현과 볼 수 있는 출력 간을 매핑하는 구성 요소입니다. 디코딩은 디노이징과 별도의 메모리 피크를 가질 수 있으며, 지원되는 청킹 또는 타일링에는 품질 검사가 필요합니다.

실용 가이드 →공식 문서 ↗
#

고정 임대 기간

이 카탈로그에서 1주는 정확히 7일이고 1개월은 정확히 30일입니다. 모델링된 할당을 중지해도 결제 기간은 일시 중지되지 않습니다. GPU 가격과 선택한 옵션이 전체 견적을 구성합니다.

실용 가이드 →제품 참조 ↗
#

멱등성 키

지원되는 작업이 반복된 요청을 인식하여 동일한 작업이 두 번 적용되지 않도록 하는 식별자입니다. 다른 구매나 구성이 아닌 동일한 작업의 재시도에 재사용하세요.

실용 가이드 →제품 참조 ↗

정의는 개념을 설명하며, 특정 워크로드, 라이브러리 버전 또는 토폴로지가 AnchorGPU 할당에서 지원된다는 것을 보장하지 않습니다.