Parametri
21B MoE (3.6B active)
Contesto
128K
Licenza
Apache 2.0
Visione
No

gpt-oss-20b è il modello che ha reso il 'ragionamento in stile ChatGPT in casa' accessibile su hardware ordinario: un mixture-of-experts da 21B con soli 3,6B di parametri attivi per token, distribuito nativamente in MXFP4 a 4-bit — quindi l'intero modello pesa ~13GB senza perdita da quantizzazione post-hoc. Pensa prima di rispondere (con uno sforzo di ragionamento impostabile su low, medium o high) ed è ottimizzato per tool calling e loop agentici. Il design MoE lo rende insolitamente veloce per la sua fascia di qualità, e insolitamente tollerante all'offload su CPU.

VRAM per livello di quantizzazione

QuantPesiEntra su
MXFP4 (native) ~13 GB scheda 16GB (contesto stretto) o 16GB RAM unificata; 24GB comodo
MXFP4 + long context ~16–18 GB scheda 24GB con spazio per contesto 64K+
BF16 (upcast) ~44 GB 48GB — raramente ne vale la pena: MXFP4 è il formato di training

Solo pesi — aggiungi la KV-cache (cresce con contesto e concorrenza) e ~1–2GB di overhead. Formula e matematica della cache nella guida VRAM.

Avvio rapido

$ ollama run gpt-oss:20b # build MXFP4 nativa

Ollama e LM Studio gestiscono automaticamente il formato chat harmony — usa una versione recente, le build vecchie corrompono il canale di ragionamento. Imposta lo sforzo di ragionamento nel system prompt ('Reasoning: high') per i problemi difficili; tienilo low per chat e riassunti. Nelle pipeline, mostra agli utenti solo il canale finale, non il canale analysis (pensiero).

Prestazioni attese

HardwareVelocità di generazione
RTX 4060 Ti 16GB ~30–45 tok/s
RTX 3090 ~70–100 tok/s
RTX 4090 ~100–140 tok/s
Mac M-series Max ~50–70 tok/s

Valori indicativi single-user (runtime classe llama.cpp/Ollama); il serving multi-utente via vLLM moltiplica il throughput totale 10–20× col batching.

Consigli e insidie

  • Lo sforzo di ragionamento è la manopola principale della qualità: 'high' rivaleggia con modelli molto più grandi su matematica e codice, ma moltiplica la latenza — impostalo per task, non globalmente.
  • La sua memoria dei fatti è più fragile di quella dei modelli densi di pari qualità — per i compiti che richiedono conoscenza abbinalo al RAG, invece di fidarti delle risposte date a memoria.
  • Eccellente tool-caller: è stato addestrato per i loop agentici, il che lo rende un'ottima spina dorsale locale per app con function calling.
  • Pienamente permissiva — il primo rilascio open-weight di OpenAI dai tempi di GPT-2, libero per uso commerciale.

FAQ

gpt-oss-20b è davvero libero per uso commerciale?

Sì — Apache 2.0, la stessa licenza pienamente permissiva dei modelli aperti Qwen e Mistral. È open-weight (pesi pubblicati), non open-source (niente dati/codice di training).

gpt-oss-20b o Phi-4 su una scheda piccola?

gpt-oss-20b è più forte su ragionamento e lavoro agentico/tool ed è molto più veloce per token; Phi-4 entra in schede più piccole (8–12GB). Se hai 16GB, gpt-oss è la scelta più capace.

Perché è così veloce per un modello da 21B?

Mixture-of-experts: solo ~3,6B parametri calcolano per token, quindi genera alla velocità di un modello piccolo attingendo a 21B di capacità.