Parametri
70B dense (reasoning)
Contesto
128K
Licenza
MIT (Llama-derived)
Visione
No

Il più grande dei distill R1: il comportamento di ragionamento di DeepSeek trasferito su una base Llama 3.3 70B. Ottieni lo schema <think>-prima-di-rispondere dell'R1 completo, con una potenza di base nettamente superiore al distill 32B — a prezzi hardware di classe 70B (~43GB di pesi a Q4). È il modello per i problemi più difficili che puoi affrontare in locale: matematica da gara, debugging ostico, pianificazione multi-step. Per tutto il resto è sovradimensionato — i token di pensiero a velocità da 70B rendono costosa ogni risposta.

VRAM per livello di quantizzazione

QuantPesiEntra su
Q4_K_M ~43 GB scheda 48GB, o 2×24GB (layer split)
IQ2/IQ3 ~26–32 GB singola 32GB — perdita di qualità; di solito il distill 32B a Q4 è il compromesso migliore
Q8_0 ~75 GB scheda datacenter 80GB

Solo pesi — aggiungi la KV-cache (cresce con contesto e concorrenza) e ~1–2GB di overhead. Formula e matematica della cache nella guida VRAM.

Avvio rapido

$ ollama run deepseek-r1:70b # Q4_K_M di default — richiede ~45GB+ totali

Stesse regole operative del distill 32B, amplificate: num_ctx 16K+ perché il pensiero non si tronchi mai, temperature ~0,6, togli il blocco <think> nelle pipeline. Il vero nodo progettuale è gestire la latenza — a ~14 tok/s su doppia 3090, una catena di pensiero da 3.000 token aggiunge ~3,5 minuti prima della prima parola visibile. Manda qui solo i problemi davvero difficili.

Prestazioni attese

HardwareVelocità di generazione
2× RTX 3090 (Q4, layer split) ~12–16 tok/s
RTX A6000 48GB (Q4) ~10–14 tok/s
A100/H100 80GB ~25–35 tok/s
Mac Studio 96GB+ (Q4) ~6–9 tok/s

Valori indicativi single-user (runtime classe llama.cpp/Ollama); il serving multi-utente via vLLM moltiplica il throughput totale 10–20× col batching.

Consigli e insidie

  • Tempo totale di risposta = (pensiero + risposta) ÷ tok/s. A velocità da 70B sono minuti, non secondi — progetta interfaccia e timeout di conseguenza.
  • L'instradamento a tre livelli funziona benissimo: modello piccolo → R1 32B → R1 70B, con escalation solo in caso di fallimento. Il rapporto ragionamento/costo resta ragionevole.
  • MIT da DeepSeek; costruito su Llama 3.3, quindi si applica anche la community license di Meta — va bene per quasi ogni uso aziendale.

FAQ

Vale 2× la VRAM del distill 32B?

Solo se raggiungi abitualmente il tetto del 32B su matematica, codice difficile o pianificazione. Per la maggior parte dei carichi il 32B risponde alle stesse domande con metà memoria e doppia velocità.

R1 70B o gpt-oss-120b?

Conti diversi: R1 70B entra in 48GB ma genera lentamente; gpt-oss-120b richiede ~61GB ma genera diverse volte più in fretta. Se la memoria lo consente, di solito gpt-oss vince in throughput per risposta.