RUNTIME / MEDIUM
llama.cpp
GGUF models, CPU/GPU offload, embedded and unusual hardware
一次情報DifficultyMediumSetup profile
Platforms5cpu · apple · nvidia · amd · intel
APIOpenAI-compatible server:8080
01 / INSTALL & RUN
- 1Install
brew install llama.cpp # or use upstream binaries - 2Start a model
llama-server -hf google/gemma-3-1b-it --port 8080 - 3Connect your app
OpenAI-compatible server · :8080. Keep the service bound to localhost unless you add authentication and network controls.
注意
New architectures may require a recent build. Backend availability does not imply equal performance.
02 / COMPATIBLE MODELS
代表的なオープンウェイトモデル
Google
Gemma 3 1B
1BINT4 / GGUF Q4
- 推定メモリ
- ~1.4 GB
- コンテキスト
- 32K
Meta
Llama 3.2 3B
3BGGUF Q4
- 推定メモリ
- ~2.8 GB
- コンテキスト
- 128K
Alibaba Qwen
Qwen3 4B
4BGGUF Q4
- 推定メモリ
- ~3.6 GB
- コンテキスト
- 32K+
Google
Gemma 3 4B
4BINT4 / GGUF Q4
- 推定メモリ
- ~4.2 GB
- コンテキスト
- 128K
Alibaba Qwen
Qwen3 8B
8BGGUF Q4
- 推定メモリ
- ~6.8 GB
- コンテキスト
- 32K+
Google
Gemma 3 12B
12BINT4
- 推定メモリ
- ~9.4 GB
- コンテキスト
- 128K