Quelle quantité de VRAM est nécessaire pour faire tourner des LLM en local ?

La principale question à se poser lors de l'exécution d'un LLM local est simple : le modèle tient-il dans votre GPU ? La réponse dépend de la taille du modèle, de la quantification et de la longueur du contexte. Ce guide vous offre un point de départ pratique pour choisir la quantité de VRAM appropriée.

L'impact de la quantification sur la VRAM

La quantification réduit la précision utilisée pour stocker les poids du modèle. Une quantification sur moins de bits réduit la taille du modèle et diminue l'utilisation de la VRAM, au prix d'une certaine perte de qualité.

Quant Bits par poids Usage typique
Q8_0 8 Qualité très élevée
Q6_K ~6,6 Qualité très bonne
Q5_K_M ~5,5 Bonne qualité et taille raisonnable
Q4_K_M ~4,5 Bon équilibre entre taille et qualité
Q3_K_M ~3,5 VRAM réduite, perte de qualité plus importante

Q4_K_M est un choix courant lorsque la VRAM est limitée. Si vous disposez de plus de VRAM, les formats Q5 ou Q6 vous permettent d'exécuter le même modèle avec une quantification moins agressive.

VRAM approximative selon la taille du modèle

Ces valeurs sont des estimations brutes pour les poids du modèle. La quantité réelle de VRAM requise est supérieure, car le temps d'exécution, le cache KV et le contexte utilisent également de la mémoire.

Taille du modèle Q8_0 Q6_K Q4_K_M Q3_K_M
4B ~5 Go ~4 Go ~3 Go ~2,5 Go
8B ~9 Go ~7 Go ~5,5 Go ~4,5 Go
12B ~13 Go ~10 Go ~8 Go ~6,5 Go
14B ~16 Go ~12 Go ~9 Go ~7,5 Go
27B ~30 Go ~22 Go ~17 Go ~13 Go
32B ~36 Go ~27 Go ~20 Go ~16 Go
70B ~80 Go ~60 Go ~42 Go ~34 Go

Ces chiffres sont des estimations, pas des limites absolues. Les différentes architectures de modèles et formats de quantification peuvent modifier la taille réelle.

Types de modèles exécutables selon la quantité de VRAM

VRAM Plage pratique Exemples actuels
8 Go Modèles petits, d'environ 4B à 9B Gemma 4 E4B, Qwen3.5 9B
12 Go Modèles petits à moyens, d'environ 9B à 14B Gemma 4 12B, Qwen3.5 9B
16 Go Modèles de 12B à 27B avec une quantification plus faible Gemma 4 26B-A4B, Qwen3.6 27B en Q4
24 Go Modèles de 27B à 35B en Q4 à Q6 Qwen3.8 27B, Gemma 4 31B
32 Go Modèles de 27B à 35B avec une quantification plus élevée Qwen3.8 27B, Gemma 4 31B
48 Go Modèles denses de grande taille avec une quantification plus faible Modèles de la classe 70B en Q3 à Q4
80 Go Modèles denses de grande taille avec une quantification plus élevée Modèles de la classe 70B en Q4 à Q6

Ces plages concernent les modèles dont les poids peuvent tenir entièrement sur le GPU. Les grands modèles MoE (Mixture of Experts) sont différents : seulement certains de leurs paramètres sont actifs pour chaque jeton, mais le modèle doit tout de même stocker l'ensemble de ses poids. Un modèle avec 100B de paramètres totaux ou plus ne tiendra donc pas dans un budget VRAM de 100B simplement parce qu'il a moins de paramètres actifs.

Modèles MoE

Les modèles Mixture-of-Experts contiennent plusieurs groupes de paramètres appelés experts. Seuls certains experts sont utilisés pour chaque jeton, ce qui peut rendre l'inférence plus efficace qu'un modèle dense ayant le même nombre total de paramètres.

Cependant, les experts inactifs font toujours partie du modèle. Les grands modèles MoE peuvent donc nécessiter bien plus de mémoire que ce que leur nombre de paramètres actifs suggère. Les très grands modèles peuvent exiger plusieurs GPU ou le déchargement de la mémoire système (RAM).

La longueur du contexte utilise également la VRAM

Les poids du modèle ne représentent qu'une partie des besoins en mémoire. Le cache KV augmente à mesure que le contexte s'allonge, donc exécuter le même modèle avec un contexte de 64K peut nécessiter considérablement plus de VRAM que pour un contexte de 4K.

  • Un contexte plus long requiert plus de VRAM.
  • La précision du cache KV affecte l'utilisation de la mémoire.
  • La taille du lot (batch size) et le nombre d'utilisateurs simultanés augmentent également l'utilisation de la mémoire.
  • Laissez une part de VRAM disponible pour le temps d'exécution au lieu de remplir complètement le GPU avec les poids du modèle.

Conseils pratiques

  • Vérifiez la taille réelle du modèle quantifié que vous souhaitez exécuter.
  • N'utilisez pas la taille du fichier du modèle comme besoin exact en VRAM. Laissez de la place pour le cache KV et le temps d'exécution.
  • Si un modèle ne tient pas entièrement dans la VRAM, une partie peut être déchargée dans la RAM système, mais l'inférence sera généralement plus lente.
  • Pour les contextes longs ou les charges de travail autonomes (agentic), prévoyez plus de VRAM que ce que les poids du modèle seul ne requièrent.
  • Plusieurs GPU peuvent partager le traitement d'un modèle lorsqu'un seul GPU ne dispose pas de suffisamment de VRAM.

Lancez-le sur DaDesktop

Vous n'avez pas besoin d'acheter un GPU pour exécuter un LLM local. DaDesktop vous offre un bureau cloud disposant de la VRAM dont vous avez besoin, vous permettant d'exécuter le modèle directement sans posséder le matériel.

Choisissez le niveau de VRAM adapté à votre modèle, chargez-le et commencez à l'utiliser. Aucune configuration, aucun achat de matériel, aucun problème de pilote. Consultez les GPU disponibles pour voir les options.