ガイドへ戻る
RUNTIME / ADVANCED

vLLM

Linux GPU servers, concurrency and OpenAI-compatible production APIs

一次情報
DifficultyAdvancedSetup profile
Platforms3nvidia · amd · intel
APIOpenAI-compatible server:8000
01 / INSTALL & RUN
  1. 1
    Installuv pip install vllm --torch-backend=auto
  2. 2
    Start a modelvllm serve google/gemma-3-1b-it --dtype auto
  3. 3
    Connect your app

    OpenAI-compatible server · :8000. Keep the service bound to localhost unless you add authentication and network controls.

注意

CUDA, ROCm and XPU feature coverage differs. Driver, shared-memory and quantization compatibility are version-specific.

02 / COMPATIBLE MODELS

代表的なオープンウェイトモデル

Google

Gemma 3 1B

1BINT4 / GGUF Q4
推定メモリ
~1.4 GB
コンテキスト
32K
Meta

Llama 3.2 3B

3BGGUF Q4
推定メモリ
~2.8 GB
コンテキスト
128K
Alibaba Qwen

Qwen3 4B

4BGGUF Q4
推定メモリ
~3.6 GB
コンテキスト
32K+
Google

Gemma 3 4B

4BINT4 / GGUF Q4
推定メモリ
~4.2 GB
コンテキスト
128K
Alibaba Qwen

Qwen3 8B

8BGGUF Q4
推定メモリ
~6.8 GB
コンテキスト
32K+
Google

Gemma 3 12B

12BINT4
推定メモリ
~9.4 GB
コンテキスト
128K