gpt-oss-20b è il modello che ha reso il 'ragionamento in stile ChatGPT in casa' accessibile su hardware ordinario: un mixture-of-experts da 21B con soli 3,6B di parametri attivi per token, distribuito nativamente in MXFP4 a 4-bit — quindi l'intero modello pesa ~13GB senza perdita da quantizzazione post-hoc. Pensa prima di rispondere (con uno sforzo di ragionamento impostabile su low, medium o high) ed è ottimizzato per tool calling e loop agentici. Il design MoE lo rende insolitamente veloce per la sua fascia di qualità, e insolitamente tollerante all'offload su CPU.
VRAM per livello di quantizzazione
| Quant | Pesi | Entra su |
|---|---|---|
| MXFP4 (native) | ~13 GB | scheda 16GB (contesto stretto) o 16GB RAM unificata; 24GB comodo |
| MXFP4 + long context | ~16–18 GB | scheda 24GB con spazio per contesto 64K+ |
| BF16 (upcast) | ~44 GB | 48GB — raramente ne vale la pena: MXFP4 è il formato di training |
Solo pesi — aggiungi la KV-cache (cresce con contesto e concorrenza) e ~1–2GB di overhead. Formula e matematica della cache nella guida VRAM.
Avvio rapido
Ollama e LM Studio gestiscono automaticamente il formato chat harmony — usa una versione recente, le build vecchie corrompono il canale di ragionamento. Imposta lo sforzo di ragionamento nel system prompt ('Reasoning: high') per i problemi difficili; tienilo low per chat e riassunti. Nelle pipeline, mostra agli utenti solo il canale finale, non il canale analysis (pensiero).
Prestazioni attese
| Hardware | Velocità di generazione |
|---|---|
| RTX 4060 Ti 16GB | ~30–45 tok/s |
| RTX 3090 | ~70–100 tok/s |
| RTX 4090 | ~100–140 tok/s |
| Mac M-series Max | ~50–70 tok/s |
Valori indicativi single-user (runtime classe llama.cpp/Ollama); il serving multi-utente via vLLM moltiplica il throughput totale 10–20× col batching.
Consigli e insidie
- Lo sforzo di ragionamento è la manopola principale della qualità: 'high' rivaleggia con modelli molto più grandi su matematica e codice, ma moltiplica la latenza — impostalo per task, non globalmente.
- La sua memoria dei fatti è più fragile di quella dei modelli densi di pari qualità — per i compiti che richiedono conoscenza abbinalo al RAG, invece di fidarti delle risposte date a memoria.
- Eccellente tool-caller: è stato addestrato per i loop agentici, il che lo rende un'ottima spina dorsale locale per app con function calling.
- Pienamente permissiva — il primo rilascio open-weight di OpenAI dai tempi di GPT-2, libero per uso commerciale.
FAQ
gpt-oss-20b è davvero libero per uso commerciale?
Sì — Apache 2.0, la stessa licenza pienamente permissiva dei modelli aperti Qwen e Mistral. È open-weight (pesi pubblicati), non open-source (niente dati/codice di training).
gpt-oss-20b o Phi-4 su una scheda piccola?
gpt-oss-20b è più forte su ragionamento e lavoro agentico/tool ed è molto più veloce per token; Phi-4 entra in schede più piccole (8–12GB). Se hai 16GB, gpt-oss è la scelta più capace.
Perché è così veloce per un modello da 21B?
Mixture-of-experts: solo ~3,6B parametri calcolano per token, quindi genera alla velocità di un modello piccolo attingendo a 21B di capacità.