निजी AI की व्यावहारिक गाइड

सही मॉडल चलाएँ।
अपने मौजूदा हार्डवेयर पर।

प्लेटफ़ॉर्म और मेमोरी चुनें। सावधानीपूर्ण मॉडल फ़िट, सही इन्फ़रेंस सर्वर और चलने योग्य कमांड पाएँ।

Primary-source linked16 languagesसाक्ष्य अपडेट 2026-08-31
8 GB
24 GB
80GB
ollama runqwen3:8b
LOCAL / 24G
MEMORY MAP01—80 GB
01 / FIT FINDER

आपकी लोकल मॉडल सीमा

मेमोरी अनुमान में बुनियादी रनटाइम जगह शामिल है, गति की गारंटी नहीं।

प्लेटफ़ॉर्म
उपलब्ध मेमोरी24 GB
43264128 GB
~22.8 GB model budget after reserve
RECOMMENDED ENVELOPE6 models
आराम से सीमित
01
Qwen3 30B-A3Bसीमित
30B total~22.5 GBGGUF Q4 MoEOllama
ollama run qwen3:30b-a3b
02
Gemma 3 27Bसीमित
27B total~20.5 GBINT4Ollama
ollama run gemma3:27b
03
Devstral Small 2 24Bसीमित
24B total~18.5 GBGGUF Q4 / BF16Ollama
ollama run <model-tag>
04
gpt-oss-20bआराम से
21B total~16 GBMXFP4Ollama
ollama run gpt-oss:20b
05
Qwen3 14Bआराम से
14B total~11.2 GBGGUF Q4Ollama
ollama run qwen3:14b
06
Gemma 3 12Bआराम से
12B total~9.4 GBINT4Ollama
ollama run gemma3:12b
02 / EVIDENCE FIRST

रैंकिंग नहीं, एक नक्शा

कुल पैरामीटर, सक्रिय MoE पैरामीटर, क्वांटाइज़्ड फ़िट, रनटाइम समर्थन और मापी गई गति को अलग रखते हैं।

Weight fit ≠ speedTotal ≠ active parametersDocs ≠ benchmark
03 / HARDWARE MAP

लैपटॉप से 80GB एक्सेलेरेटर तक

हर डिवाइस की मेमोरी सीमा, रनटाइम रास्ता और ईमानदार ऊपरी सीमा अलग है।

11
सभी हार्डवेयर
04 / MODEL FIELD NOTES

प्रतिनिधि ओपन-वेट मॉडल

15
सभी मॉडल
05 / SERVING LAYER

काम के लिए सही सर्विंग लेयर

06
06 / METHOD

अनुमान कैसे बनते हैं

आधिकारिक आकार और क्वांटाइज़ेशन से शुरू करके OS और रनटाइम के लिए जगह रखते हैं; कॉन्टेक्स्ट कैश अतिरिक्त है। MoE में कुल पैरामीटर गिने जाते हैं।

CONSERVATIVE FITweights + runtime + cache
total params×bits / 8+headroom
No universal tokens/s claims.
07 / FAQ

40GB डाउनलोड से पहले

Does a 24 GB GPU run a 30B model?+

Often at Q4/INT4 with a conservative context. Qwen3 30B-A3B and Gemma 3 27B are representative fits, but cache and runtime overhead still matter.

Are active MoE parameters the memory requirement?+

No. Active parameters affect compute per token; total parameters still need to be stored in memory or offloaded.

Which runtime should a beginner choose?+

Ollama for a terminal-first setup or LM Studio for a visual desktop. llama.cpp is the portable fallback; vLLM is for higher-throughput GPU serving.

Do you benchmark speed?+

Not yet. Launch recommendations are transparent memory-fit estimates backed by primary documentation. We do not invent tokens-per-second numbers.