Topic / Trend Rising

Inference locale efficiente dei LLM

Quantization NVFP4 e GGUF, riuso della cache KV, conversione MoE e ottimizzazioni lato CPU stanno portando modelli fino a 125B alla portata di GPU consumer e di vecchia generazione. I test della community mostrano contesti estesi e configurazioni multi-GPU come frontiera pratica on-premise.

Detected: 2026-08-31 · Updated: 2026-08-31

Articoli Correlati

2026-08-31 ArXiv cs.CL

Inference CPU, l'indice vettoriale riduce il peso dell'output embedding

Sostituire la proiezione densa sul vocabolario con una ricerca approssimata su indice HNSW accelera la decodifica autoregressiva su CPU. Nei test con Gemma 3, Llama 3.2 e Qwen 3, il throughput batch-one di Gemma 3 270M migliora fino all'82%, senza pe...

#Hardware #LLM On-Premise #DevOps
2026-08-30 LocalLLaMA

Quattro V100 32GB servono un LLM a 256k token: cosa dice il test SGLang-V100

Il supporto a RadixArk/Qwen3.8-Flash-Next-NVFP4 in SGLang-V100 mostra quattro V100 32GB con contesto completo da 256k token e oltre 50GB di offload sulla RAM di sistema. Prefill intorno a 4.000 token/s, decoding intorno a 60 token/s. I dati MTP segna...

#Hardware #LLM On-Premise #DevOps
2026-08-30 LocalLLaMA

La leva runtime che porta un LLM da 27B a 100k token su 16 GB

Un setup su Reddit mostra un modello dense da 27 miliardi di parametri a 47-50 token/s con contesto da 100.000 token su una RTX 4070 Ti SUPER da 16 GB. Il segnale non è il modello, ma il controllo fine del runtime: cache KV asimmetrica kvarn5/kvarn4,...

2026-08-30 LocalLLaMA

Qwen3.8-Flash-Next su M5 Max: 350K token e i limiti del 2 bit

Un test di tre ore e mezzo su MacBook Pro M5 Max con 128 GB di memoria unificata esegue un modello Qwen3.8-Flash-Next da 78,9 GB in quantization 2 bit con slot da 358.400 token. Il prefill scende da 1.561 a 318 token/s; la generazione da 30–35 a 11,5...

#Hardware #LLM On-Premise #DevOps
2026-08-29 LocalLLaMA

Un LLM da 27B su GPU consumer: 50 token/s e contesto da 100k token

Un setup documentato su Reddit porta un Qwen3.8-27B su una RTX 4070 Ti SUPER a 47-50 token/s con 100.000 token di contesto. Il merito è del runtime beellama.cpp e della cache KV asimmetrica kvarn5/kvarn4, che ha liberato circa il 6% di VRAM. La coda ...

#Hardware #LLM On-Premise #DevOps
2026-08-28 LocalLLaMA

llama.cpp accelera su Qwen3.8-Flash-Next: 55 token/s con quattro RTX 3090

llama.cpp ha integrato il supporto per Qwen3.8-Flash-Next e una segnalazione comunitaria mostra 55 token/s con GGUF Q4 su quattro RTX 3090. Un test informale che sposta l’attenzione dal software all’hardware: per l’inference locale il costo e la comp...

#Hardware #LLM On-Premise #DevOps
2026-08-26 LocalLLaMA

Qwen3.8-27B scende a 19,7 GB: cosa cambia per l'on-premise

Un checkpoint Qwen3.8-27B in NVFP4 mostra che la quantization W4A4 guidata da distillation può portare un LLM da 27 miliardi di parametri sotto i 20 GB senza perdite rilevanti. L'analisi AI-Radar legge il risultato come un cambio di soglia per VRAM e...

2026-08-26 LocalLLaMA

Qwen3.8-27B in NVFP4: 19,7 GB e qualità vicina al BF16

Un checkpoint Qwen3.8-27B completamente quantizzato in NVFP4 scende a 19,7 GB, contro i 55,6 GB del BF16, mantenendo punteggi vicini nei benchmark GPQA-Diamond e AIME26. Il team ha usato distillation consapevole della quantization con l’algoritmo QUA...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-25 LocalLLaMA

ToMoE e la sparsità dinamica: meno calcolo per gli LLM locali

ToMoE converte checkpoint densi in MoE senza fine-tuning, riducendo i parametri attivi per token ma non il footprint in memoria. Un cambio di logica per l'on-premise: meno calcolo, stesso modello. Restano aperti i nodi runtime, latenza e VRAM. Il seg...

2026-08-24 LocalLLaMA

ToMoE trasforma LLM densi in Mixture of Experts senza fine-tuning

Un nuovo metodo converte LLM densi in architetture Mixture of Experts tramite pruning dinamico differenziabile, riducendo i parametri attivi per token senza eliminarli. Non richiede fine-tuning e supera le tecniche precedenti di pruning strutturale s...

#Hardware #LLM On-Premise #Fine-Tuning
← Torna ai Topic