Calculadora de VRAM para IA
Estima cuánta memoria de video (VRAM) necesitas para ejecutar grandes modelos de lenguaje (LLMs) localmente en tu hardware.
No cabe en VRAM
67.05 GB / 12 GB
VRAM Requerida:67.05 GB
VRAM Disponible:12.00 GB
Utilización estimada:558.7%
Margen disponible:0.00 GB
4-bit (Q4_K_M)
8.192K contexto
Batch 1
El consumo real puede variar según el runtime utilizado.
¿Cómo funciona el cálculo de memoria?
Ejecutar un modelo de IA de forma local requiere alojar distintos componentes en la memoria de tu tarjeta gráfica. Nuestra calculadora considera tres aspectos fundamentales:
- Pesos del modelo: El modelo en sí mismo. Depende de la cantidad total de parámetros y del nivel de compresión (cuantización). Incluso en modelos Mixture of Experts (MoE), donde solo una fracción de los parámetros se activan por token, todos los pesos deben estar cargados en memoria.
- KV Cache: Memoria que el modelo utiliza para recordar el contexto de la conversación (los tokens enviados y procesados previamente). Aumenta significativamente al usar ventanas de contexto largas (ej. 128K tokens).
- Overhead del Runtime: Memoria extra necesaria por motores de inferencia como llama.cpp, Ollama o vLLM para manejar buffers del sistema y el contexto de CUDA.