VRAM
Memoria local de un acelerador. La capacidad de carga de trabajo incluye más que los pesos del modelo: las activaciones, los búferes, el estado en caché y las asignaciones del marco también pueden consumirla.
caché KV
Tensores de clave y valor retenidos por el servicio autorregresivo para secuencias activas. La arquitectura del modelo, la precisión de la caché, el número de tokens y la concurrencia afectan a la capacidad requerida.
Cuantización
Representación de algunos valores del modelo con precisión numérica reducida. El uso real de memoria incluye metadatos de formato y espacios de trabajo del tiempo de ejecución; los kernels compatibles y la calidad de salida deben comprobarse.
Paralelismo de tensores
Distribuir partes de las operaciones de tensores del modelo entre aceleradores. Puede repartir un modelo entre tarjetas, pero introduce comunicación y requiere una estrategia de servicio o entrenamiento explícitamente compatible.
DistributedDataParallel (DDP)
Un enfoque de entrenamiento de PyTorch que ejecuta réplicas del modelo en varios procesos y sincroniza los gradientes. La replicación no combina las memorias de los dispositivos en un único grupo contiguo.
Paralelismo de datos totalmente fragmentado (FSDP)
Entrenamiento distribuido que fragmenta los parámetros del modelo, los gradientes y el estado del optimizador. El ahorro de memoria conlleva requisitos de comunicación, coordinación y puntos de control.
CUDA
La plataforma de computación paralela y el modelo de programación de NVIDIA. Una carga de trabajo dependiente de CUDA sigue requiriendo hardware, controlador, tiempo de ejecución y bibliotecas compatibles.
ROCm
La pila de software de AMD para computación con GPU. El soporte debe verificarse para la GPU exacta, el sistema operativo, la compilación del marco y las dependencias de la carga de trabajo.
Punto de control de entrenamiento
Estado guardado utilizado para reanudar o reproducir el entrenamiento. Según la ejecución, incluye el modelo, el optimizador, la programación, el estado aleatorio y el progreso a través de los datos. Verifique la restauración, no solo la escritura.
Autoencoder variacional (VAE)
En un proceso de difusión, un componente que asigna entre representaciones latentes y salidas visibles. La decodificación puede tener un pico de memoria separado del de eliminación de ruido; el troceo o mosaico compatible requiere comprobaciones de calidad.
Plazo de alquiler fijo
En este catálogo, una semana equivale exactamente a 7 días y un mes exactamente a 30 días. Detener una asignación modelada no pausa el período pagado. Los precios de GPU y las opciones seleccionadas forman el presupuesto completo.
Clave de idempotencia
Un identificador que permite a una operación compatible reconocer una solicitud repetida, de modo que la misma acción no se aplique dos veces. Reutilícelo para un reintento de la misma operación, no para una compra o configuración diferente.
Las definiciones explican el concepto; no garantizan que una carga de trabajo, versión de biblioteca o topología específica sea compatible con una asignación de AnchorGPU.