Topic / Trend Rising

Inference LLM Self-Hosted e Quantization Locale

Un'ondata di test della community mostra modelli grandi da 27B e MoE come Qwen 3.8, DeepSeek V4, GLM-Air e Kimi K3 eseguiti su GPU consumer e prosumer tramite GGUF quantizzati, decodifica speculativa e runtime come llama.cpp, vLLM e KTransformers.

Detected: 2026-08-24 · Updated: 2026-08-24

Articoli Correlati

2026-08-24 LocalLLaMA

DeepSeek V4 Flash in cantina: Epyc, RTX 5090 e 24 token/s

Un utente ha testato DeepSeek V4 Flash in self-hosted con un Epyc 7663, 256 GB di RAM ECC e una RTX 5090 da 32 GB. Con quantization Q8_K_XL e contesti da 100-128k token, ottiene 23,8-24,6 token/s. Il dato mostra come un LLM da circa 151 GB di pesi po...

#Hardware #LLM On-Premise #DevOps
2026-08-24 LocalLLaMA

Qwen 3.8 27B, Docker e Home Assistant: un'ora per l'agente locale

Un utente di Reddit racconta come i suggerimenti della community abbiano trasformato un setup frustrante in un LLM locale funzionante con Home Assistant e input visivi. La barriera del self-hosted non è l'hardware ma la configurazione, e la community...

#Hardware #LLM On-Premise #DevOps
2026-08-24 LocalLLaMA

MTP sbarca in GLM-Air: il MoE da 106B accelera sulle GPU locali

llama.cpp abilita MTP per GLM-4.5-Air, un MoE da 106 miliardi di parametri con soli 12 miliardi attivi. La novità accelera l'inference su macchine con molta memoria ma calcolo limitato, come Strix Halo, DGX Spark e RTX 3090, e rafforza l'ecosistema d...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-23 LocalLLaMA

Qwen 3.8 27B quantizzato: il divario tra Q4 e Q8 su RTX PRO 6000

Un team ha creato quantizzazioni GGUF di Qwen 3.8 27B e le ha confrontate su una RTX PRO 6000 con un compito di costruzione di isole voxel. Il Q4_K_M occupa 17,1 GB e decodifica a 67 token/s, con un accordo top-1 del 95,6% rispetto a BF16. Le differe...

#Hardware #LLM On-Premise #DevOps
2026-08-23 LocalLLaMA

Qwen 3.8 35B A3B: la richiesta dal basso che ridisegna l'inference locale

Un utente con M1 Max non ne può più: Qwen 3.8 27B in modalità xhigh impiega una notte per un singolo task. Chiede una variante 35B A3B, meno brillante ma più veloce. La richiesta mette a nudo il conflitto tra long-thinking e hardware consumer nel sel...

#Hardware #LLM On-Premise #DevOps
2026-08-23 LocalLLaMA

Kimi K3 su 8 B300: 92 token/s e 190 dollari per milione di token

Un test di hosting su Modal con 8 B300 mostra 92 token/s in decode e 190 dollari per milione di token di output. La variante 1-bit su 8 A100 costa meno all'ora ma triplica il costo per token. L'analisi della prova rivela perché il prezzo orario è una...

#Hardware #LLM On-Premise #DevOps
2026-08-22 LocalLLaMA

Llama.cpp 0.2.0: il runtime locale per LLM cambia passo

La nuova release di llama.cpp, con sorgenti e build precompilate, segna una tappa per l'inference self-hosted. Meno attrito per sviluppatori e aziende che vogliono eseguire LLM in locale, più pressione sui servizi cloud-only.

#Hardware #LLM On-Premise #DevOps
2026-08-21 LocalLLaMA

Qwen3.8-27B Q6: 20 ore di coding agentico su due GPU consumer

Un report riferisce una sessione di quasi venti ore di coding agentico con Qwen3.8-27B Q6 su una RTX 3090 e una RTX 3060, a 60–63 token/s. Il caso mostra come un LLM di fascia media con quantization Q6 possa sostenere carichi prolungati on-prem su ha...

#Hardware #LLM On-Premise #DevOps
2026-08-21 LocalLLaMA

Qwen 3.8 27B: il Q3_xxs smette di essere un tabù su una 4060 Ti

Un test su RTX 4060 Ti da 16 GB mostra Qwen 3.8 27B a 30-35 token/s con quantization Q3_xxs, buona tenuta su coding e logica, ma fragilità conversazionali. Emerge un cambio di prospettiva per chi self-hosta LLM su GPU consumer.

#Hardware #LLM On-Premise #DevOps
2026-08-21 LocalLLaMA

NVFP4 per Qwen3.8 27B: 6.250 token/s su RTX 5090

Su una RTX 5090 da 32 GB, un nuovo GGUF NVFP4 per Qwen3.8 27B raggiunge 6.250 token/s nel prefill con prompt da 2048 token, il 50% in più di un Q4_0 con uguale ingombro di memoria e il 4-7% in più di altri NVFP4. Include una testa MTP quantizzata e i...

#Hardware #LLM On-Premise #DevOps
2026-08-21 LocalLLaMA

Sette ore senza Claude Code: Qwen3.8-27b su GPU locale da 24GB

La scadenza dell'abbonamento Pro a Claude Code ha spinto un utente a passare a un LLM locale Qwen3.8-27b su GPU 5090M con 24GB di VRAM e a Pi. Il test su un'app per previsioni aurorali ha mostrato tempi simili, UI migliore per Pi ma scienza migliore ...

#Hardware #LLM On-Premise #DevOps
2026-08-20 LocalLLaMA

DeepSeek V4 Flash con 16 RTX 5060 Ti: la via noiosa a 140 token/s

Un costruttore ha validato una configurazione self-hosted con 16 RTX 5060 Ti da 16 GB, due switch Broadcom/PLX PEX88096 e una Xeon Gold 6330. Il sistema serve DeepSeek V4 Flash-0731 con contesto fino a 1 milione di token e, in una configurazione, gen...

#Hardware #LLM On-Premise #DevOps
2026-08-19 LocalLLaMA

Qwen3.8-27B locale: 218 token/s su due RTX 3090 con vLLM e DFlash2

Un test bare-metal con due RTX 3090, vLLM e decodifica speculativa DFlash2 porta Qwen3.8-27B a 218 token/s su singola richiesta, con prefill fino a 1342 token/s e contesto massimo di 131k. Il setup usa quantization INT4 AutoRound, 22,3 GB di VRAM per...

#Hardware #LLM On-Premise #DevOps
2026-08-18 LocalLLaMA

Qwen3.8-27B su RTX PRO 6000: 8 ore e 650 dollari di API evitati

Un carico agentico di oltre otto ore su una singola RTX PRO 6000, con DeepSeek Harness e NInfer, ha gestito 966 chiamate modello, 131,2 milioni di token in input e 853,3 mila in output con zero errori di generazione. Il confronto con i listini API st...

#Hardware #LLM On-Premise #DevOps
2026-08-17 LocalLLaMA

llama.cpp v0.1.0 segna il passaggio al versioning semantico

Il progetto abbandona i numeri di build sequenziali e adotta il versioning semantico. Un cambiamento che pesa soprattutto nei contesti self-hosted e on-premise, dove la prevedibilità delle API e la stabilità delle pipeline di inference contano più de...

#Hardware #LLM On-Premise #DevOps
2026-08-17 Phoronix

KTransformers 0.7 espande AVX-512 e premia i server AMD EPYC

Il framework per LLM eterogenei KTransformers pubblica la versione 0.7 con supporto AVX-512 esteso, un intervento mirato sui server AMD EPYC. Per chi opera in self-hosted, il messaggio è strutturale: la CPU non è più un ripiego, ma una componente att...

#Hardware #LLM On-Premise #Fine-Tuning
← Torna ai Topic