AGAnchorGPU

Glosario de cargas de trabajo GPU

Los términos detrás de la configuración.

Definiciones en lenguaje sencillo de memoria de GPU, caché KV, cuantización, CUDA, ROCm, paralelismo de tensores, entrenamiento y facturación de plazo fijo.

#

VRAM

Memoria local de un acelerador. La capacidad de carga de trabajo incluye más que los pesos del modelo: las activaciones, los búferes, el estado en caché y las asignaciones del marco también pueden consumirla.

Guía práctica →Documentación oficial ↗
#

caché KV

Tensores de clave y valor retenidos por el servicio autorregresivo para secuencias activas. La arquitectura del modelo, la precisión de la caché, el número de tokens y la concurrencia afectan a la capacidad requerida.

Guía práctica →Documentación oficial ↗
#

Cuantización

Representación de algunos valores del modelo con precisión numérica reducida. El uso real de memoria incluye metadatos de formato y espacios de trabajo del tiempo de ejecución; los kernels compatibles y la calidad de salida deben comprobarse.

Guía práctica →Documentación oficial ↗
#

Paralelismo de tensores

Distribuir partes de las operaciones de tensores del modelo entre aceleradores. Puede repartir un modelo entre tarjetas, pero introduce comunicación y requiere una estrategia de servicio o entrenamiento explícitamente compatible.

Guía práctica →Documentación oficial ↗
#

DistributedDataParallel (DDP)

Un enfoque de entrenamiento de PyTorch que ejecuta réplicas del modelo en varios procesos y sincroniza los gradientes. La replicación no combina las memorias de los dispositivos en un único grupo contiguo.

Guía práctica →Documentación oficial ↗
#

Paralelismo de datos totalmente fragmentado (FSDP)

Entrenamiento distribuido que fragmenta los parámetros del modelo, los gradientes y el estado del optimizador. El ahorro de memoria conlleva requisitos de comunicación, coordinación y puntos de control.

Guía práctica →Documentación oficial ↗
#

CUDA

La plataforma de computación paralela y el modelo de programación de NVIDIA. Una carga de trabajo dependiente de CUDA sigue requiriendo hardware, controlador, tiempo de ejecución y bibliotecas compatibles.

Guía práctica →Documentación oficial ↗
#

ROCm

La pila de software de AMD para computación con GPU. El soporte debe verificarse para la GPU exacta, el sistema operativo, la compilación del marco y las dependencias de la carga de trabajo.

Guía práctica →Documentación oficial ↗
#

Punto de control de entrenamiento

Estado guardado utilizado para reanudar o reproducir el entrenamiento. Según la ejecución, incluye el modelo, el optimizador, la programación, el estado aleatorio y el progreso a través de los datos. Verifique la restauración, no solo la escritura.

Guía práctica →Documentación oficial ↗
#

Autoencoder variacional (VAE)

En un proceso de difusión, un componente que asigna entre representaciones latentes y salidas visibles. La decodificación puede tener un pico de memoria separado del de eliminación de ruido; el troceo o mosaico compatible requiere comprobaciones de calidad.

Guía práctica →Documentación oficial ↗
#

Plazo de alquiler fijo

En este catálogo, una semana equivale exactamente a 7 días y un mes exactamente a 30 días. Detener una asignación modelada no pausa el período pagado. Los precios de GPU y las opciones seleccionadas forman el presupuesto completo.

Guía práctica →Referencia del producto ↗
#

Clave de idempotencia

Un identificador que permite a una operación compatible reconocer una solicitud repetida, de modo que la misma acción no se aplique dos veces. Reutilícelo para un reintento de la misma operación, no para una compra o configuración diferente.

Guía práctica →Referencia del producto ↗

Las definiciones explican el concepto; no garantizan que una carga de trabajo, versión de biblioteca o topología específica sea compatible con una asignación de AnchorGPU.