Qwen3-Coder 30B è il modello da eseguire se il tuo obiettivo è un assistente di coding locale più che un chatbot generale: un mixture-of-experts ottimizzato specificamente per il coding agentico — modifiche multi-file, uso di tool, loop test-e-correggi in harness come Cline e Continue — con un contesto nativo di 256K che ingoia interi repository. Con soli 3,3B parametri attivi per token genera alla velocità di un modello piccolo, cosa che conta enormemente nei loop agentici dove un task significa decine di generazioni. A Q4 entra in una scheda da 24GB.
VRAM per livello di quantizzazione
| Quant | Pesi | Entra su |
|---|---|---|
| Q4_K_M | ~19 GB | scheda 24GB con contesto di lavoro |
| Q4 + 128K context | ~24+ GB | 32GB, o 24GB con KV-cache Q8 |
| Q8_0 | ~33 GB | scheda 48GB, piena qualità + contesto lungo |
Solo pesi — aggiungi la KV-cache (cresce con contesto e concorrenza) e ~1–2GB di overhead. Formula e matematica della cache nella guida VRAM.
Avvio rapido
Alza num_ctx aggressivamente (32K minimo, 64K+ per lavoro agentico) — il contesto di default di Ollama spreca la funzione di punta di questo modello. Collegalo a VS Code via Continue o Cline puntando all'endpoint compatibile OpenAI di Ollama; abbinalo a un modello minuscolo (1–3B) per il tab-autocomplete, tenendo il 30B per chat, modifiche e task agentici. Per scelta progettuale è un modello non-thinking: le risposte arrivano subito, senza preamboli di ragionamento.
Prestazioni attese
| Hardware | Velocità di generazione |
|---|---|
| RTX 3090 (Q4) | ~60–90 tok/s |
| RTX 4090 (Q4) | ~90–130 tok/s |
| Mac M-series Max | ~40–60 tok/s |
Valori indicativi single-user (runtime classe llama.cpp/Ollama); il serving multi-utente via vLLM moltiplica il throughput totale 10–20× col batching.
Consigli e insidie
- Negli harness agentici la velocità conta doppio: con 3,3B parametri attivi, un task Cline da 30 passi si chiude in minuti, non in mezz'ora.
- Il contesto lungo non è gratis — 256K token di KV-cache fanno impallidire i pesi. Vedi la nostra guida alla KV-cache per i conti veri della memoria.
- Per la pura latenza del tab-autocomplete, un piccolo modello denso batte qualsiasi 30B — usa questo dove conta l'intelligenza: modifiche, refactor, loop agentici.
- Pienamente permissiva — uso commerciale, modifica e redistribuzione consentiti.
FAQ
Come si confronta con il gigante Qwen3-Coder 480B?
Stessa famiglia e stessa ricetta di training; l'ammiraglia 480B-A35B è roba da cloud/API. Il 30B cattura gran parte del comportamento agentico a 1/16 della dimensione — è lo sweet spot locale.
Qwen3-Coder 30B o Qwen3.6 27B per il coding?
Coder per gli harness agentici, il contesto a scala repo e la velocità pura; il 27B denso per uso misto chat+codice e quando vuoi un thinking mode. Entrambi entrano in 24GB.
Può davvero usare 256K di contesto in locale?
Il modello sì; la tua memoria di solito no. 256K di KV-cache aggiungono decine di GB. Le finestre locali realistiche sono 32–128K con cache quantizzata su hardware 24–48GB.