Calculadora de VRAM para IA

Estima cuánta memoria de video (VRAM) necesitas para ejecutar grandes modelos de lenguaje (LLMs) localmente en tu hardware.

Configuración
Selecciona el modelo y tu hardware para estimar si podrás ejecutarlo.
109B Paramsmoe
Parámetros Activos17B
Contexto Máximo10,000,000 tokens

Formatos más pequeños reducen la memoria a cambio de una ligera pérdida de precisión.

No cabe en VRAM

67.05 GB / 12 GB
VRAM Requerida:67.05 GB
VRAM Disponible:12.00 GB
Utilización estimada:558.7%
Margen disponible:0.00 GB
4-bit (Q4_K_M)
8.192K contexto
Batch 1

El consumo real puede variar según el runtime utilizado.

Desglose de Memoria

Pesos del Modelo59.95 GB
x
KV Cache (Contexto)1.00 GB
x
Overhead & Margen de Seguridad6.10 GB
x
Total Estimado67.05 GB

* Estos resultados son estimaciones aproximadas asumiendo que los pesos y el KV cache se guardan completamente en la VRAM de la GPU. El consumo real puede variar dependiendo del runtime (Ollama, llama.cpp, vLLM, etc.) y la arquitectura específica.

¿Cómo funciona el cálculo de memoria?

Ejecutar un modelo de IA de forma local requiere alojar distintos componentes en la memoria de tu tarjeta gráfica. Nuestra calculadora considera tres aspectos fundamentales:

  • Pesos del modelo: El modelo en sí mismo. Depende de la cantidad total de parámetros y del nivel de compresión (cuantización). Incluso en modelos Mixture of Experts (MoE), donde solo una fracción de los parámetros se activan por token, todos los pesos deben estar cargados en memoria.
  • KV Cache: Memoria que el modelo utiliza para recordar el contexto de la conversación (los tokens enviados y procesados previamente). Aumenta significativamente al usar ventanas de contexto largas (ej. 128K tokens).
  • Overhead del Runtime: Memoria extra necesaria por motores de inferencia como llama.cpp, Ollama o vLLM para manejar buffers del sistema y el contexto de CUDA.