Topic / Trend Rising

Modelli Qwen Open-Weight e Deployment Locale

I modelli open-weight di Qwen, in particolare Qwen3.8-27B, vengono testati su GPU consumer e prosumer tramite GGUF quantizzati, pruning, fusioni e lunghe sessioni di coding agentico. Questa attività sposta la pressione del TCO verso deployment open-weight locali.

Detected: 2026-08-23 · Updated: 2026-08-23

Articoli Correlati

2026-08-23 LocalLLaMA

Dopo Qwen 3.8 27B: il silenzio che sposta il TCO verso il locale

Il silenzio dei vendor chiusi dopo Qwen 3.8 27B segnala un cambio di pressione competitiva: la retorica della sicurezza si affievolisce quando un LLM da 27B può girare in locale con 16 GB di VRAM. La barriera hardware scende, il TCO si sposta dal cos...

2026-08-23 LocalLLaMA

Dopo Qwen 3.8 27B i modelli chiusi tacciono: non è solo sicurezza

Un post di settore nota il silenzio dei vendor di modelli chiusi dopo l'arrivo di Qwen 3.8 27B. Prima, con GLM 5.2 e Kimi K3, la narrazione sulla pericolosità dell'open source serviva a difendere il valore dei modelli a pagamento. Ora un LLM da 27 mi...

#Hardware #LLM On-Premise #DevOps
2026-08-21 LocalLLaMA

Qwen3.8-27B Q6: 20 ore di coding agentico su due GPU consumer

Un report riferisce una sessione di quasi venti ore di coding agentico con Qwen3.8-27B Q6 su una RTX 3090 e una RTX 3060, a 60–63 token/s. Il caso mostra come un LLM di fascia media con quantization Q6 possa sostenere carichi prolungati on-prem su ha...

#Hardware #LLM On-Premise #DevOps
2026-08-21 LocalLLaMA

Qwen 3.8 27B: il Q3_xxs smette di essere un tabù su una 4060 Ti

Un test su RTX 4060 Ti da 16 GB mostra Qwen 3.8 27B a 30-35 token/s con quantization Q3_xxs, buona tenuta su coding e logica, ma fragilità conversazionali. Emerge un cambio di prospettiva per chi self-hosta LLM su GPU consumer.

#Hardware #LLM On-Premise #DevOps
2026-08-21 LocalLLaMA

NVFP4 per Qwen3.8 27B: 6.250 token/s su RTX 5090

Su una RTX 5090 da 32 GB, un nuovo GGUF NVFP4 per Qwen3.8 27B raggiunge 6.250 token/s nel prefill con prompt da 2048 token, il 50% in più di un Q4_0 con uguale ingombro di memoria e il 4-7% in più di altri NVFP4. Include una testa MTP quantizzata e i...

#Hardware #LLM On-Premise #DevOps
2026-08-21 LocalLLaMA

Sette ore senza Claude Code: Qwen3.8-27b su GPU locale da 24GB

La scadenza dell'abbonamento Pro a Claude Code ha spinto un utente a passare a un LLM locale Qwen3.8-27b su GPU 5090M con 24GB di VRAM e a Pi. Il test su un'app per previsioni aurorali ha mostrato tempi simili, UI migliore per Pi ma scienza migliore ...

#Hardware #LLM On-Premise #DevOps
2026-08-20 LocalLLaMA

QwenMix-3.7: quando unire Qwen 3.8 e 3.6 è questione di sette token

Un esperimento di merge tra Qwen3.8-27B e Qwen3.6-27B, condotto partendo da un file GGUF con quantization Q6_K_XL, ha prodotto QwenMix-3.7. L'autore segnala la compatibilità strutturale tra i due modelli, differenziati nell'addestramento da soli sett...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-20 LocalLLaMA

Depth pruning su Qwen3.8-27B: la leggerezza non è gratuita

Uno sviluppatore ha ridotto Qwen3.8-27B a 22,7 miliardi di parametri con pruning di profondità, senza fine-tuning. Distribuito solo in MLX per Apple Silicon, mostra trade-off: meno pressione su memoria e calcolo, ma perdite nei casi limite. Per l'on-...

2026-08-20 LocalLLaMA

Qwen3.8-27B ridotto a 22,7 miliardi con pruning di profondità

Uno sviluppatore ha applicato un pruning di profondità a Qwen3.8-27B, portandolo a circa 22,7 miliardi di parametri senza fine-tuning. Il modello, disponibile in versioni bf16, q8 e q4 su MLX, gestisce coding, uso agentico e conversazioni multi-turno...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-19 LocalLLaMA

Qwen3.8-27B: Unsloth alza l'accuratezza del 10% con nuovi GGUF

Unsloth ha pubblicato nuovi file GGUF per Qwen3.8-27B basati su Dynamic v3.0. La promessa è un miglioramento dell'accuratezza di oltre il 10% a parità di dimensione, con quantizzazioni a 1 bit che mantengono il 77% di accuratezza e girano in 8GB di R...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-19 LocalLLaMA

Qwen3.8-27B locale: 218 token/s su due RTX 3090 con vLLM e DFlash2

Un test bare-metal con due RTX 3090, vLLM e decodifica speculativa DFlash2 porta Qwen3.8-27B a 218 token/s su singola richiesta, con prefill fino a 1342 token/s e contesto massimo di 131k. Il setup usa quantization INT4 AutoRound, 22,3 GB di VRAM per...

#Hardware #LLM On-Premise #DevOps
2026-08-18 LocalLLaMA

Qwen3.8-27B su RTX PRO 6000: 8 ore e 650 dollari di API evitati

Un carico agentico di oltre otto ore su una singola RTX PRO 6000, con DeepSeek Harness e NInfer, ha gestito 966 chiamate modello, 131,2 milioni di token in input e 853,3 mila in output con zero errori di generazione. Il confronto con i listini API st...

#Hardware #LLM On-Premise #DevOps
← Torna ai Topic