gpt-oss-120b è il modello con licenza aperta più potente che puoi servire su un singolo acceleratore: 117B parametri totali, 5,1B attivi per token, distribuito in MXFP4 nativo, così i pesi si fermano attorno ai 61GB. Vuol dire una H100/A100 da 80GB — o, sorprendentemente, le macchine a memoria unificata di fascia alta: un Mac Studio da 96GB+ o un mini-PC Ryzen AI Max da 128GB lo fanno girare a velocità utilizzabili, perché il MoE calcola solo 5,1B parametri per token. Nei benchmark si colloca sul ragionamento in classe o4-mini: è il modello aperto a cui passi quando la fascia 20–70B non basta più.
VRAM per livello di quantizzazione
| Quant | Pesi | Entra su |
|---|---|---|
| MXFP4 (native) | ~61 GB | GPU 80GB (H100/A100); Mac Studio 96GB+; mini-PC 128GB a memoria unificata |
| MXFP4 + 128K context | ~70+ GB | GPU 80GB con KV-cache quantizzata; 128GB unificata comodamente |
| Multi-GPU split | 2×48GB / 4×24GB | alternativa workstation — split layer o tensor con llama.cpp/vLLM |
Solo pesi — aggiungi la KV-cache (cresce con contesto e concorrenza) e ~1–2GB di overhead. Formula e matematica della cache nella guida VRAM.
Avvio rapido
Sulle macchine a memoria unificata chiudi tutto il resto — al sistema operativo serve margine oltre i ~65GB occupati dal modello. Per il serving, vLLM su una scheda da 80GB è la via di produzione (il MoE sfrutta benissimo il batching). Valgono le stesse note su formato harmony e sforzo di ragionamento di gpt-oss-20b. Noleggiare una H100 a ore è il modo più economico per provarlo prima di investire in hardware.
Prestazioni attese
| Hardware | Velocità di generazione |
|---|---|
| H100 80GB | ~120–180 tok/s |
| A100 80GB | ~60–90 tok/s |
| Mac Studio M-Ultra 96GB+ | ~40–70 tok/s |
| Ryzen AI Max 128GB (unified) | ~25–40 tok/s |
Valori indicativi single-user (runtime classe llama.cpp/Ollama); il serving multi-utente via vLLM moltiplica il throughput totale 10–20× col batching.
Consigli e insidie
- I 5,1B parametri attivi rendono la velocità di generazione più vicina a un 7B che a un 70B — il collo di bottiglia sulla memoria unificata è la banda, non il calcolo.
- Confrontalo con Llama 3.3 70B sul tuo carico prima di comprare qualsiasi cosa: il 70B richiede meno memoria ma risponde più lentamente e ragiona peggio.
- Pienamente permissiva — pesi open di classe frontiera senza vincoli d'uso.
FAQ
Un setup consumer può davvero eseguire un modello da 117B?
Sì — il trucco è il MoE nativo a 4-bit. I mini-PC con 128GB di memoria unificata e i Mac da 96GB+ lo eseguono a 25–70 tok/s. Funziona anche una workstation quad-3090 via layer split.
gpt-oss-120b o Llama 3.3 70B?
gpt-oss-120b ragiona meglio e genera più velocemente, ma richiede ~61GB contro ~43GB. Llama resta più forte come puro scrittore long-form. Per agenti, codice e analisi: gpt-oss.