Guide pratique de l’IA privée

Le bon modèle.
Sur le matériel que vous avez.

Choisissez plateforme et mémoire. Obtenez une estimation prudente, le bon serveur et une commande exécutable.

Primary-source linked16 languagesSources vérifiées 2026-08-31
8 GB
24 GB
80GB
ollama runqwen3:8b
LOCAL / 24G
MEMORY MAP01—80 GB
01 / FIT FINDER

Votre enveloppe locale

L’estimation inclut les poids et une marge de base, sans promesse de vitesse.

Plateforme
Mémoire disponible24 GB
43264128 GB
~22.8 GB model budget after reserve
RECOMMENDED ENVELOPE6 models
Confortable Serré
01
30B total~22.5 GBGGUF Q4 MoEOllama
ollama run qwen3:30b-a3b
02
27B total~20.5 GBINT4Ollama
ollama run gemma3:27b
04
gpt-oss-20bConfortable
21B total~16 GBMXFP4Ollama
ollama run gpt-oss:20b
05
Qwen3 14BConfortable
14B total~11.2 GBGGUF Q4Ollama
ollama run qwen3:14b
06
Gemma 3 12BConfortable
12B total~9.4 GBINT4Ollama
ollama run gemma3:12b
02 / EVIDENCE FIRST

Une carte, pas un classement

Nous séparons paramètres totaux, paramètres MoE actifs, poids quantifiés, support et performances mesurées.

Weight fit ≠ speedTotal ≠ active parametersDocs ≠ benchmark
03 / HARDWARE MAP

Du portable discret à l’accélérateur 80 Go

Chaque classe a son budget mémoire, son moteur et sa limite réaliste.

11
Tout le matériel
04 / MODEL FIELD NOTES

Modèles open-weight représentatifs

15
Tous les modèles
05 / SERVING LAYER

Choisir la couche d’inférence

06
06 / METHOD

Notre méthode

Nous partons des tailles et quantifications documentées, réservons de la mémoire au système et traitons le cache comme un coût en plus. MoE utilise le total.

CONSERVATIVE FITweights + runtime + cache
total params×bits / 8+headroom
No universal tokens/s claims.
07 / FAQ

Avant de télécharger 40 Go

Does a 24 GB GPU run a 30B model?+

Often at Q4/INT4 with a conservative context. Qwen3 30B-A3B and Gemma 3 27B are representative fits, but cache and runtime overhead still matter.

Are active MoE parameters the memory requirement?+

No. Active parameters affect compute per token; total parameters still need to be stored in memory or offloaded.

Which runtime should a beginner choose?+

Ollama for a terminal-first setup or LM Studio for a visual desktop. llama.cpp is the portable fallback; vLLM is for higher-throughput GPU serving.

Do you benchmark speed?+

Not yet. Launch recommendations are transparent memory-fit estimates backed by primary documentation. We do not invent tokens-per-second numbers.