Varven

Calculateur de VRAM

Indiquez votre GPU et un modèle. L'outil calcule les poids, le cache KV et l'overhead, et vous dit si ça tient — ou ce qu'il faut changer.

8192 tokens

Utilisation estimée de la VRAM par composant
ComposantVRAM

Comment c'est calculé

Trois choses occupent la VRAM quand vous faites tourner un modèle en local.

Les poids, c'est le nombre de paramètres multiplié par le nombre d'octets par paramètre. FP16 fait deux octets ; les formats quantifiés compressent, et le taux effectif des k-quants GGUF est un peu au-dessus de la largeur nominale en bits parce que certains tenseurs restent en plus haute précision.

Le cache KV conserve les clés et les valeurs d'attention de chaque token en contexte. Il vaut 2 × layers × kv_heads × head_dim × context × 2 bytes. Les modèles à grouped-query attention ont beaucoup moins de têtes KV que de têtes d'attention, et c'est pourquoi un modèle 8B récent utilise une fraction du cache qu'un ancien demanderait.

L'overhead, c'est le contexte CUDA, les activations et les buffers. Il varie selon le runtime ; on suppose ici environ 0,8 GB, ce qui est typique pour llama.cpp.

Traitez le résultat comme une estimation serrée, pas comme une garantie. Les chiffres d'architecture des préréglages sont approximatifs, les vrais allocateurs fragmentent, et les runtimes diffèrent. Si un résultat arrive à moins de 10 % environ de la capacité de votre carte, considérez qu'il ne tiendra pas.

Pourquoi nous avons fait cet outil

Varven fait tourner un modèle de langage sur votre propre machine pour trier et résumer vos notes, donc « qu'est-ce qui va réellement tourner ici » est la première question à laquelle chaque installation doit répondre. L'échec n'aide en rien : un modèle qui ne tient pas ne refuse pas de se charger, il déborde simplement sur la RAM système et devient dix fois plus lent. Varven vérifie ça pour vous à l'installation — voici le même calcul, rendu public.

Voir ce que fait Varven · Lire la doc

Questions fréquentes

Combien de VRAM faut-il pour un modèle 7B ?

En Q4_K_M, environ 4,4 GB pour les poids, plus le cache KV et à peu près 0,8 GB d'overhead. Une carte de 8 GB s'en sort sans peine à 8k de contexte. En FP16, le même modèle réclame environ 14 GB et ne tiendra pas.

Que se passe-t-il si un modèle ne tient pas ?

Des couches débordent sur la RAM système et tournent sur le CPU. Ça marche encore, mais le débit chute souvent de plus de dix fois. Pour tout ce qui est interactif, prenez un modèle plus petit ou une quantification plus forte qui tient entièrement en VRAM.

La longueur de contexte compte-t-elle ?

Oui, et plus qu'on ne le croit. Le cache KV grandit linéairement avec le contexte : passer de 8k à 16k le double. Un modèle qui se charge sans problème peut quand même manquer de mémoire au fond d'une longue conversation.

Quelle quantification choisir ?

Q4_K_M est le défaut raisonnable. Q5_K_M et Q6_K sont meilleurs si vous avez de la place. En dessous de Q3, la perte de qualité devient évidente dès qu'il faut raisonner.