Topic / Trend Rising

Inference locale di LLM open-weight su hardware consumer

Modelli Qwen3.8 e DeepSeek quantizzati girano su singole GPU e configurazioni Mac/EpYC a velocità utilizzabili, rendendo l'inference locale più pratica.

Detected: 2026-08-30 · Updated: 2026-08-30

Articoli Correlati

2026-08-30 LocalLLaMA

La leva runtime che porta un LLM da 27B a 100k token su 16 GB

Un setup su Reddit mostra un modello dense da 27 miliardi di parametri a 47-50 token/s con contesto da 100.000 token su una RTX 4070 Ti SUPER da 16 GB. Il segnale non è il modello, ma il controllo fine del runtime: cache KV asimmetrica kvarn5/kvarn4,...

2026-08-30 LocalLLaMA

Qwen3.8-Flash-Next su M5 Max: 350K token e i limiti del 2 bit

Un test di tre ore e mezzo su MacBook Pro M5 Max con 128 GB di memoria unificata esegue un modello Qwen3.8-Flash-Next da 78,9 GB in quantization 2 bit con slot da 358.400 token. Il prefill scende da 1.561 a 318 token/s; la generazione da 30–35 a 11,5...

#Hardware #LLM On-Premise #DevOps
2026-08-29 LocalLLaMA

Un LLM da 27B su GPU consumer: 50 token/s e contesto da 100k token

Un setup documentato su Reddit porta un Qwen3.8-27B su una RTX 4070 Ti SUPER a 47-50 token/s con 100.000 token di contesto. Il merito è del runtime beellama.cpp e della cache KV asimmetrica kvarn5/kvarn4, che ha liberato circa il 6% di VRAM. La coda ...

#Hardware #LLM On-Premise #DevOps
2026-08-29 Phoronix

HP Z4 G6i: il prezzo è solo la superficie del segnale Linux-ready

La workstation HP Z4 G6i unisce Xeon serie 600, grafica RTX e supporto Linux dichiarato, ma la configurazione top supera i 41mila dollari. Il segnale per AI-Radar non è la potenza assoluta: è la legittimazione delle macchine da lavoro come nodi on-pr...

2026-08-28 Phoronix

HP Z4 G6i: Xeon 600, RTX e Linux-ready, ma il prezzo supera 41mila dollari

Provata per un mese con carichi intensi, la workstation HP Z4 G6i combina processore Intel Xeon 600 "Granite Rapids WS" e grafica NVIDIA RTX. Il prezzo della configurazione top supera i 41.000 dollari. Il supporto a Ubuntu LTS e l'etichetta Linux-rea...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-28 LocalLLaMA

llama.cpp accelera su Qwen3.8-Flash-Next: 55 token/s con quattro RTX 3090

llama.cpp ha integrato il supporto per Qwen3.8-Flash-Next e una segnalazione comunitaria mostra 55 token/s con GGUF Q4 su quattro RTX 3090. Un test informale che sposta l’attenzione dal software all’hardware: per l’inference locale il costo e la comp...

#Hardware #LLM On-Premise #DevOps
2026-08-27 LocalLLaMA

Qwen3.8-Flash-Next alza il livello per i benchmark locali

Un Mac Studio M4 Max con 128 GB di memoria unificata ha ospitato il test di Qwen3.8-Flash-Next, il primo modello dell'anno a superare il 94% sul benchmark personale di tolitius. Il modello da 27B eccelle nel coding ma perde in conoscenza generale con...

#Hardware #LLM On-Premise #DevOps
2026-08-26 LocalLLaMA

Qwen3.8-Flash-Next: un 125B open-weight per acceleratori con poca memoria

Il team Qwen ha pubblicato Qwen3.8-Flash-Next, modello open-weight da 125B con 6B attivi e contesto nativo da 262.144 token. L’architettura unisce Qwen Sparse Attention, Gated Residual e n-gram embedding per ridurre la latenza sui contesti lunghi e r...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-26 LocalLLaMA

Qwen3.8-27B scende a 19,7 GB: cosa cambia per l'on-premise

Un checkpoint Qwen3.8-27B in NVFP4 mostra che la quantization W4A4 guidata da distillation può portare un LLM da 27 miliardi di parametri sotto i 20 GB senza perdite rilevanti. L'analisi AI-Radar legge il risultato come un cambio di soglia per VRAM e...

2026-08-26 LocalLLaMA

Qwen3.8-27B in NVFP4: 19,7 GB e qualità vicina al BF16

Un checkpoint Qwen3.8-27B completamente quantizzato in NVFP4 scende a 19,7 GB, contro i 55,6 GB del BF16, mantenendo punteggi vicini nei benchmark GPQA-Diamond e AIME26. Il team ha usato distillation consapevole della quantization con l’algoritmo QUA...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-24 LocalLLaMA

Qwen3.8-27B surclassa QwQ-32B: la community premia i modelli locali

In meno di un mese Qwen3.8-27B ha raccolto più like dei quattro modelli successivi insieme, superando QwQ-32B. La community HuggingFace premia LLM general-purpose intorno ai 27 e 9 miliardi di parametri, dimensioni compatibili con self-hosting e GPU ...

#Hardware #LLM On-Premise #DevOps
2026-08-24 LocalLLaMA

DeepSeek V4 Flash in cantina: Epyc, RTX 5090 e 24 token/s

Un utente ha testato DeepSeek V4 Flash in self-hosted con un Epyc 7663, 256 GB di RAM ECC e una RTX 5090 da 32 GB. Con quantization Q8_K_XL e contesti da 100-128k token, ottiene 23,8-24,6 token/s. Il dato mostra come un LLM da circa 151 GB di pesi po...

#Hardware #LLM On-Premise #DevOps
2026-08-24 LocalLLaMA

Qwen 3.8 27B, Docker e Home Assistant: un'ora per l'agente locale

Un utente di Reddit racconta come i suggerimenti della community abbiano trasformato un setup frustrante in un LLM locale funzionante con Home Assistant e input visivi. La barriera del self-hosted non è l'hardware ma la configurazione, e la community...

#Hardware #LLM On-Premise #DevOps
2026-08-23 LocalLLaMA

Qwen 3.8 27B quantizzato: il divario tra Q4 e Q8 su RTX PRO 6000

Un team ha creato quantizzazioni GGUF di Qwen 3.8 27B e le ha confrontate su una RTX PRO 6000 con un compito di costruzione di isole voxel. Il Q4_K_M occupa 17,1 GB e decodifica a 67 token/s, con un accordo top-1 del 95,6% rispetto a BF16. Le differe...

#Hardware #LLM On-Premise #DevOps
2026-08-23 Tom's Hardware

RTX 5080 a 702 dollari da Walmart: il segnale per chi fa inference LLM locale

Un acquirente ha trovato una RTX 5080 a 702 dollari in un Walmart, risparmiando quasi 800 dollari sui prezzi al dettaglio correnti. Più che un colpo di fortuna, l'episodio mostra il divario tra prezzo ufficiale e costo reale delle GPU consumer, con e...

#Hardware #LLM On-Premise #DevOps
2026-08-23 LocalLLaMA

Qwen 3.8 35B A3B: la richiesta dal basso che ridisegna l'inference locale

Un utente con M1 Max non ne può più: Qwen 3.8 27B in modalità xhigh impiega una notte per un singolo task. Chiede una variante 35B A3B, meno brillante ma più veloce. La richiesta mette a nudo il conflitto tra long-thinking e hardware consumer nel sel...

#Hardware #LLM On-Premise #DevOps
← Torna ai Topic