Il più grande dei distill R1: il comportamento di ragionamento di DeepSeek trasferito su una base Llama 3.3 70B. Ottieni lo schema <think>-prima-di-rispondere dell'R1 completo, con una potenza di base nettamente superiore al distill 32B — a prezzi hardware di classe 70B (~43GB di pesi a Q4). È il modello per i problemi più difficili che puoi affrontare in locale: matematica da gara, debugging ostico, pianificazione multi-step. Per tutto il resto è sovradimensionato — i token di pensiero a velocità da 70B rendono costosa ogni risposta.
VRAM per livello di quantizzazione
| Quant | Pesi | Entra su |
|---|---|---|
| Q4_K_M | ~43 GB | scheda 48GB, o 2×24GB (layer split) |
| IQ2/IQ3 | ~26–32 GB | singola 32GB — perdita di qualità; di solito il distill 32B a Q4 è il compromesso migliore |
| Q8_0 | ~75 GB | scheda datacenter 80GB |
Solo pesi — aggiungi la KV-cache (cresce con contesto e concorrenza) e ~1–2GB di overhead. Formula e matematica della cache nella guida VRAM.
Avvio rapido
Stesse regole operative del distill 32B, amplificate: num_ctx 16K+ perché il pensiero non si tronchi mai, temperature ~0,6, togli il blocco <think> nelle pipeline. Il vero nodo progettuale è gestire la latenza — a ~14 tok/s su doppia 3090, una catena di pensiero da 3.000 token aggiunge ~3,5 minuti prima della prima parola visibile. Manda qui solo i problemi davvero difficili.
Prestazioni attese
| Hardware | Velocità di generazione |
|---|---|
| 2× RTX 3090 (Q4, layer split) | ~12–16 tok/s |
| RTX A6000 48GB (Q4) | ~10–14 tok/s |
| A100/H100 80GB | ~25–35 tok/s |
| Mac Studio 96GB+ (Q4) | ~6–9 tok/s |
Valori indicativi single-user (runtime classe llama.cpp/Ollama); il serving multi-utente via vLLM moltiplica il throughput totale 10–20× col batching.
Consigli e insidie
- Tempo totale di risposta = (pensiero + risposta) ÷ tok/s. A velocità da 70B sono minuti, non secondi — progetta interfaccia e timeout di conseguenza.
- L'instradamento a tre livelli funziona benissimo: modello piccolo → R1 32B → R1 70B, con escalation solo in caso di fallimento. Il rapporto ragionamento/costo resta ragionevole.
- MIT da DeepSeek; costruito su Llama 3.3, quindi si applica anche la community license di Meta — va bene per quasi ogni uso aziendale.
FAQ
Vale 2× la VRAM del distill 32B?
Solo se raggiungi abitualmente il tetto del 32B su matematica, codice difficile o pianificazione. Per la maggior parte dei carichi il 32B risponde alle stesse domande con metà memoria e doppia velocità.
R1 70B o gpt-oss-120b?
Conti diversi: R1 70B entra in 48GB ma genera lentamente; gpt-oss-120b richiede ~61GB ma genera diverse volte più in fretta. Se la memoria lo consente, di solito gpt-oss vince in throughput per risposta.