Calculadora de VRAM
Indica tu GPU y un modelo. Calcula pesos, caché KV y overhead, y te dice si cabe — o qué cambiar.
| Componente | VRAM |
|---|
Cómo se calcula esto
Tres cosas ocupan VRAM cuando ejecutas un modelo local.
Los pesos son el número de parámetros multiplicado por los bytes por parámetro. FP16 son dos bytes; los formatos cuantizados lo comprimen, y la tasa efectiva de los k-quants de GGUF queda algo por encima del ancho de bits nominal porque algunos tensores se quedan con más precisión.
La caché KV guarda las claves y los valores de atención de cada
token en contexto. Es 2 × layers × kv_heads × head_dim ×
context × 2 bytes. Los modelos con grouped-query attention tienen muchas
menos cabezas KV que cabezas de atención, y por eso un modelo 8B moderno usa una
fracción de la caché que usaría uno antiguo.
El overhead es el contexto CUDA, las activaciones y los búferes. Varía según el runtime; aquí se asumen unos 0.8 GB, lo típico en llama.cpp.
Toma el resultado como una estimación cercana, no como una garantía. Las cifras de arquitectura de los presets son aproximadas, los asignadores de memoria reales fragmentan y los runtimes difieren. Si un resultado queda a menos de un 10% de la capacidad de tu tarjeta, da por hecho que no cabrá.
Por qué construimos esto
Varven ejecuta un modelo de lenguaje en tu propia máquina para ordenar y resumir tus notas, así que “qué va a funcionar aquí de verdad” es la primera pregunta que tiene que responder cada instalación. El fallo es poco útil: un modelo que no cabe no se niega a cargar, simplemente se desborda a la RAM del sistema y va diez veces más lento. Varven lo comprueba por ti al instalar — esta es la misma aritmética, hecha pública.
Mira qué hace Varven · Lee la documentación
Preguntas frecuentes
¿Cuánta VRAM necesito para un modelo 7B?
Con Q4_K_M, unos 4.4 GB de pesos más la caché KV y alrededor de 0.8 GB de overhead. Una tarjeta de 8 GB lo lleva de sobra con 8k de contexto. En FP16 el mismo modelo pide unos 14 GB y no cabe.
¿Qué pasa si un modelo no cabe?
Las capas se desbordan a la RAM del sistema y corren en la CPU. Sigue funcionando, pero el rendimiento suele caer más de diez veces. Para cualquier cosa interactiva, elige un modelo más pequeño o una cuantización más agresiva que quepa entera en la VRAM.
¿Importa la longitud del contexto?
Sí, y más de lo que la gente espera. La caché KV crece linealmente con el contexto, así que pasar de 8k a 16k la duplica. Un modelo que carga bien puede quedarse sin memoria en mitad de una conversación larga.
¿Qué cuantización elijo?
Q4_K_M es el valor por defecto sensato. Q5_K_M y Q6_K son mejores si tienes sitio. Por debajo de Q3 la pérdida de calidad se nota en cualquier cosa que exija razonar.