Topic / Trend Rising

Modelli open-weight e inference locale efficiente

Nuovi modelli aperti compatti, sparsi o quantizzati e ottimizzazioni di runtime e ragionamento rendono praticabile l'esecuzione di LLM ad alto contesto su GPU consumer, CPU e sistemi self-hosted.

Detected: 2026-09-02 · Updated: 2026-09-02

Articoli Correlati

2026-09-02 ArXiv cs.LG

REAL-Q porta la discesa del gradiente nella quantization dei LLM

Un nuovo metodo di post-training quantization, REAL-Q, usa la discesa del gradiente a blocchi per ridurre fino a circa il 49% la divergenza KL end-to-end rispetto ai metodi di secondo ordine su LLaMA-3.1 e Qwen3 a W4A16. Un risultato che tocca i depl...

#Hardware #LLM On-Premise #Fine-Tuning
2026-09-01 LocalLLaMA

Spark-X2.5-4B e -1.7B: contesto 1M, architettura propria e un fork obbligato

Due nuovi LLM compatti, Spark-X2.5-4B e Spark-X2.5-1.7B, si presentano con architettura non derivata da fine-tuning e un contesto nativo dichiarato di 1 milione di token. I benchmark citati sulla pagina Hugging Face indicano la versione da 4B vicina ...

#LLM On-Premise #Fine-Tuning #DevOps
2026-08-31 LocalLLaMA

DeepSeek-V4-Flash-Vision-Exp: il segnale oltre il nome su Hugging Face

Un repository su Hugging Face con nome DeepSeek-V4-Flash-Vision-Exp circola su Reddit senza dettagli tecnici. Il nome suggerisce un modello visione-linguaggio efficiente e sperimentale, ma senza VRAM, quantization o licenza. Per chi valuta self-hoste...

#Hardware #LLM On-Premise #DevOps
2026-08-31 ArXiv cs.CL

Inference CPU, l'indice vettoriale riduce il peso dell'output embedding

Sostituire la proiezione densa sul vocabolario con una ricerca approssimata su indice HNSW accelera la decodifica autoregressiva su CPU. Nei test con Gemma 3, Llama 3.2 e Qwen 3, il throughput batch-one di Gemma 3 270M migliora fino all'82%, senza pe...

#Hardware #LLM On-Premise #DevOps
2026-08-30 LocalLLaMA

Quattro V100 32GB servono un LLM a 256k token: cosa dice il test SGLang-V100

Il supporto a RadixArk/Qwen3.8-Flash-Next-NVFP4 in SGLang-V100 mostra quattro V100 32GB con contesto completo da 256k token e oltre 50GB di offload sulla RAM di sistema. Prefill intorno a 4.000 token/s, decoding intorno a 60 token/s. I dati MTP segna...

#Hardware #LLM On-Premise #DevOps
2026-08-30 LocalLLaMA

La leva runtime che porta un LLM da 27B a 100k token su 16 GB

Un setup su Reddit mostra un modello dense da 27 miliardi di parametri a 47-50 token/s con contesto da 100.000 token su una RTX 4070 Ti SUPER da 16 GB. Il segnale non è il modello, ma il controllo fine del runtime: cache KV asimmetrica kvarn5/kvarn4,...

2026-08-30 LocalLLaMA

Qwen3.8-Flash-Next su M5 Max: 350K token e i limiti del 2 bit

Un test di tre ore e mezzo su MacBook Pro M5 Max con 128 GB di memoria unificata esegue un modello Qwen3.8-Flash-Next da 78,9 GB in quantization 2 bit con slot da 358.400 token. Il prefill scende da 1.561 a 318 token/s; la generazione da 30–35 a 11,5...

#Hardware #LLM On-Premise #DevOps
2026-08-29 LocalLLaMA

Un LLM da 27B su GPU consumer: 50 token/s e contesto da 100k token

Un setup documentato su Reddit porta un Qwen3.8-27B su una RTX 4070 Ti SUPER a 47-50 token/s con 100.000 token di contesto. Il merito è del runtime beellama.cpp e della cache KV asimmetrica kvarn5/kvarn4, che ha liberato circa il 6% di VRAM. La coda ...

#Hardware #LLM On-Premise #DevOps
2026-08-28 LocalLLaMA

llama.cpp accelera su Qwen3.8-Flash-Next: 55 token/s con quattro RTX 3090

llama.cpp ha integrato il supporto per Qwen3.8-Flash-Next e una segnalazione comunitaria mostra 55 token/s con GGUF Q4 su quattro RTX 3090. Un test informale che sposta l’attenzione dal software all’hardware: per l’inference locale il costo e la comp...

#Hardware #LLM On-Premise #DevOps
2026-08-27 LocalLLaMA

Apodex 1.1: i modelli agentici aperti arrivano in più formati quantizzati

Il team di Apodex presenta un AMA su Apodex 1.1, famiglia di modelli aperti per lavoro agente complesso. Oltre ai checkpoint, rilascia un harness open source e due paper. I formati includono FP8, GPTQ-Int4 e NVFP4, segnale che l'inference locale entr...

#LLM On-Premise #DevOps
2026-08-27 LocalLLaMA

Apodex 1.1: modelli agentici aperti e quantization come segnale strategico

Il team di Apodex ha presentato Apodex 1.1, famiglia di modelli aperti pensata per lavoro complesso con ragionamento, ricerca, esecuzione di codice e coordinamento di più agenti. Accanto ai modelli, rilascia FrontierAgent e due paper. Le varianti NVF...

#Hardware #LLM On-Premise #DevOps
2026-08-27 LocalLLaMA

Qwen3.8-Flash-Next alza il livello per i benchmark locali

Un Mac Studio M4 Max con 128 GB di memoria unificata ha ospitato il test di Qwen3.8-Flash-Next, il primo modello dell'anno a superare il 94% sul benchmark personale di tolitius. Il modello da 27B eccelle nel coding ma perde in conoscenza generale con...

#Hardware #LLM On-Premise #DevOps
2026-08-26 LocalLLaMA

GLM-5.3-Flash su Hugging Face: il modello c'è, i dettagli no

La pagina Hugging Face di zai-org/GLM-5.3-Flash segnala la disponibilità di un nuovo modello, ma nessuna specifica tecnica. Per chi valuta un deployment self-hosted, il nome Flash promette efficienza nell'inference, mentre l'assenza di dettagli su VR...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-26 LocalLLaMA

Qwen3.8-Flash-Next: un 125B open-weight per acceleratori con poca memoria

Il team Qwen ha pubblicato Qwen3.8-Flash-Next, modello open-weight da 125B con 6B attivi e contesto nativo da 262.144 token. L’architettura unisce Qwen Sparse Attention, Gated Residual e n-gram embedding per ridurre la latenza sui contesti lunghi e r...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-26 Ars Technica AI

IBM Granite 4.2: tre LLM self-hosted e una soglia agentica

IBM ha rilasciato Granite 4.2, tre LLM open-weight da 3, 8 e 30 miliardi di parametri pensati per il download e il self-hosted. Tutti offrono una finestra di contesto nativa di 128.000 token. Le varianti 8B e 30B aggiungono un blocco di reinforcement...

#Hardware #LLM On-Premise #DevOps
← Torna ai Topic