IA en local : que peut-on vraiment faire tourner avec 12 ou 16 Go de VRAM ?
Faire tourner une intelligence artificielle sur son propre ordinateur n’est plus réservé aux laboratoires. Mais une question revient sans cesse : que peut-on vraiment installer avec une carte graphique de 12 ou 16 Go de mémoire vidéo (VRAM) ? Voici les ordres de grandeur, les pièges à éviter et les outils pour démarrer, sans jargon inutile.

Pourquoi faire tourner une IA chez soi ?
Un modèle de langage « local » est un programme d’intelligence artificielle téléchargé une fois, puis exécuté sur votre machine. Les textes que vous lui soumettez ne quittent pas votre ordinateur : c’est l’intérêt le plus évident pour des documents sensibles ou des brouillons que l’on ne veut pas confier à un service en ligne.
Deuxième avantage : l’indépendance vis-à-vis de la connexion. Une fois le modèle téléchargé, il fonctionne sans internet, ce qui peut compter sur un territoire insulaire comme La Réunion, où la qualité du réseau varie selon les lieux et les moments. Troisième avantage : pas d’abonnement, ni de limite de messages. En contrepartie, vous devez composer avec votre matériel, et c’est là que la VRAM entre en jeu.
La VRAM, le vrai critère
La VRAM est la mémoire de la carte graphique. Pour être rapide, un modèle doit tenir en entier dans cette mémoire. S’il déborde vers la mémoire vive de l’ordinateur, il continue de fonctionner, mais nettement plus lentement.
La taille d’un modèle se mesure en milliards de paramètres (noté « B »). Elle dépend aussi de la quantification : une technique qui compresse les nombres du modèle pour réduire son poids, au prix d’une légère perte de précision. Le format Q4_K_M, très répandu, est présenté par plusieurs guides comme le meilleur compromis pour le matériel grand public.
Ces chiffres donnent une règle pratique : en Q4, le fichier d’un modèle pèse environ 0,6 Go par milliard de paramètres (4,92 Go pour un 8B), auquel il faut ajouter une à deux gigaoctets de marge. C’est une estimation tirée de ces mesures, pas une garantie : vérifiez toujours la taille indiquée sur la page du modèle.
Le contexte, ce coût qu’on oublie
La « fenêtre de contexte » est la quantité de texte que le modèle garde en mémoire pendant une conversation. Plus elle est longue, plus la mémoire de travail (le « cache KV ») grossit, de façon presque linéaire. Pour un modèle 8B, la même source indique environ 0,3 Go pour 2 000 jetons, 5 Go pour 32 000 et 20 Go pour 128 000.
Conséquence concrète : sur une carte de 12 Go, un modèle qui « tient » avec un contexte court peut saturer dès que vous lui envoyez un long document. Si le résultat ralentit brutalement, réduire la fenêtre de contexte est souvent le premier réglage à essayer.

Ce qui tient dans 8, 12 et 16 Go
Selon le guide de LocalLLM.in, voici les paliers usuels en quantification Q4_K_M :
| VRAM | Modèles envisageables | Remarque |
|---|---|---|
| 8 Go | 7 à 8 milliards de paramètres | Plus de 40 jetons par seconde mesurés sur une RTX 4060, d’après la source |
| 12 Go | 12 à 14 milliards de paramètres | Bon compromis, contexte à surveiller |
| 16 à 24 Go | 22 à 35 milliards de paramètres | Modèles plus « raisonneurs », meilleure qualité |
| 48 Go et plus | 70 milliards et plus | Réservé aux configurations multi-cartes ou professionnelles |
Retenez donc qu’avec 12 Go, on vise le segment 12-14B, et qu’avec 16 Go, on commence à toucher les modèles de 22 à 35 milliards de paramètres, à condition de rester en Q4 et de garder un contexte raisonnable.
Quels modèles essayer, et d’où viennent-ils ?
Le paysage des modèles ouverts est international. Un guide publié par Stéphane Robert (26 mai 2026, mis à jour le 29 juillet 2026) recommande, pour un usage généraliste ou pour des agents, la famille Qwen 3 (développée par le groupe chinois Alibaba), Gemma 4 (Google) et Llama 4 Scout (Meta), en indiquant que Qwen 3 et Gemma 4 sont sous licence Apache 2.0 et que les modèles Llama relèvent de la licence communautaire de Meta. La licence compte : elle détermine ce que vous avez le droit de faire, notamment à titre professionnel. Vérifiez-la sur la page de chaque modèle avant tout usage commercial.
L’Europe n’est pas absente : Mistral AI, société française, propose elle aussi des modèles ouverts, à rechercher dans le catalogue de votre logiciel. Pour comprendre pourquoi les modèles ouverts chinois dominent aujourd’hui les classements, notre article IA open source : les quatre meilleurs modèles ouverts du monde sont chinois détaille les enjeux.

Ollama ou LM Studio : comment démarrer
Ollama est un logiciel libre qui télécharge et lance les modèles en une commande. Il expose aussi une interface locale que d’autres applications peuvent appeler, ce qui en fait le choix naturel si vous voulez brancher l’IA sur vos propres scripts. LM Studio propose au contraire une interface graphique : on cherche un modèle dans un catalogue, on le télécharge, on discute. C’est le plus simple pour un premier essai sous Windows.
Un conseil de méthode : commencez par un modèle plus petit que ce que votre carte permet, mesurez la vitesse, puis montez d’un cran. Et si vous cherchez une configuration économe, notre tutoriel Installer un agent IA sur un vieux PC Windows : VRAM et mémoire unifiée expliquées complète bien cet article.
Les limites à connaître
Un modèle de 8 à 14 milliards de paramètres est utile pour résumer, reformuler, classer, traduire ou répondre à des questions courantes, mais il reste en général moins performant que les grands modèles hébergés en ligne sur les tâches complexes. Les chiffres de vitesse dépendent enfin du logiciel, du pilote et de la carte : ceux cités ici sont des mesures ponctuelles de sources tierces, pas des promesses. Enfin, l’électricité consommée par une carte sollicitée en continu n’est pas nulle : elle mérite d’être prise en compte si vous laissez la machine tourner.
Trois erreurs fréquentes à éviter
Choisir un modèle trop gros. Un modèle qui déborde de la VRAM fonctionne, mais si lentement que l’expérience devient pénible. Mieux vaut un modèle plus petit qui répond vite qu’un grand modèle qui rame.
Oublier le contexte. Un modèle qui tient avec un contexte de 2 000 jetons peut saturer à 32 000, comme le montre le cache KV. Adaptez la fenêtre à l’usage réel : résumer une page ne demande pas les mêmes ressources qu’analyser un livre.
Négliger la licence. « Ouvert » ne veut pas dire « libre de tout usage ». Lisez la licence, surtout si vous prévoyez un usage professionnel ou la redistribution d’un résultat.
À mes yeux, l’IA locale est l’étape la plus concrète pour que chacun se réapproprie cette technologie : on comprend ce qu’on installe, on choisit ses données, on apprend les vrais ordres de grandeur. Mon conseil : ne courez pas après le plus gros modèle, cherchez celui qui tient confortablement dans votre VRAM. C’est un avis, pas un fait établi.
Conclusion : la bonne taille, pas la plus grande
Avec 12 Go de VRAM, on vise les modèles de 12 à 14 milliards de paramètres ; avec 16 Go, on s’ouvre aux modèles de 22 à 35 milliards, à condition de surveiller la quantification et la taille du contexte. Le vrai enjeu n’est pas de battre un record, mais d’adapter la taille du modèle à son matériel et à ses usages. Prochaine étape naturelle : comparer, sur votre propre machine, un modèle chinois, un américain et un européen sur une même tâche, et voir lequel vous convient le mieux.
Sources
- LocalLLM.in, « Ollama VRAM Requirements: Complete 2026 Guide to GPU Memory for Local LLMs » (30 novembre 2025, mis à jour le 3 février 2026).
- Stéphane Robert, « Quel modèle Ollama choisir en 2026 ? » (26 mai 2026, mis à jour le 29 juillet 2026).
- Photos : Wikimedia Commons, licence CC BY 4.0 (PantheraLeo1359531 ; TheStriker).
Les chiffres proviennent de guides tiers et de mesures ponctuelles : ils donnent des ordres de grandeur, à vérifier sur votre matériel.
Cet article vous a plu ?
Temps de lecture : environ 9 min