Topic / Trend Rising

Ottimizzazione dell'Inference LLM Locale

Strumenti comunitari e tecniche di runtime stanno rendendo pratici gli LLM a contesto lungo e MoE su GPU consumer, grazie a cache KV ed expert ottimizzate, quantization, offload su CPU e configurazioni multi-GPU.

Detected: 2026-09-03 · Updated: 2026-09-03

Articoli Correlati

2026-09-03 LocalLLaMA

Il calcolo lento come scelta: un Qwen 27B e la produttività asincrona

Un intervento su Reddit riporta un passaggio da 15 ore di programmazione attiva a 4 ore per debuggare o implementare una feature con Qwen 27B, anche a 0,5 token al secondo. Il dato ridisegna le aspettative per l'inference asincrona e il calcolo del v...

#Hardware #LLM On-Premise #DevOps
2026-09-03 LocalLLaMA

La KV cache pesa più dei parametri sui modelli locali a contesto lungo

Per gli LLM locali, il numero di parametri non è l'unico vincolo: la KV cache cresce con ogni token e può diventare il vero collo di bottiglia a contesti da 100k o 200k token. GQA, MQA e quantization riducono l'ingombro, ma il problema resta lineare....

#Hardware #LLM On-Premise #DevOps
2026-09-03 LocalLLaMA

Perplexity apre il server di inference per Mac ottimizzato per Qwen 3.6

Perplexity ha reso open source il repository lily in pplx-garden, un inference server per Mac costruito attorno a un solo modello, Qwen 3.6, per ottenere il massimo su Apple Silicon. Non è serving generico: la verticalizzazione su un singolo modello ...

#Hardware #LLM On-Premise #DevOps
2026-09-01 LocalLLaMA

Spark-X2.5-4B e -1.7B: contesto 1M, architettura propria e un fork obbligato

Due nuovi LLM compatti, Spark-X2.5-4B e Spark-X2.5-1.7B, si presentano con architettura non derivata da fine-tuning e un contesto nativo dichiarato di 1 milione di token. I benchmark citati sulla pagina Hugging Face indicano la versione da 4B vicina ...

#LLM On-Premise #Fine-Tuning #DevOps
2026-08-31 ArXiv cs.CL

Inference CPU, l'indice vettoriale riduce il peso dell'output embedding

Sostituire la proiezione densa sul vocabolario con una ricerca approssimata su indice HNSW accelera la decodifica autoregressiva su CPU. Nei test con Gemma 3, Llama 3.2 e Qwen 3, il throughput batch-one di Gemma 3 270M migliora fino all'82%, senza pe...

#Hardware #LLM On-Premise #DevOps
2026-08-30 LocalLLaMA

Quattro V100 32GB servono un LLM a 256k token: cosa dice il test SGLang-V100

Il supporto a RadixArk/Qwen3.8-Flash-Next-NVFP4 in SGLang-V100 mostra quattro V100 32GB con contesto completo da 256k token e oltre 50GB di offload sulla RAM di sistema. Prefill intorno a 4.000 token/s, decoding intorno a 60 token/s. I dati MTP segna...

#Hardware #LLM On-Premise #DevOps
2026-08-30 LocalLLaMA

La leva runtime che porta un LLM da 27B a 100k token su 16 GB

Un setup su Reddit mostra un modello dense da 27 miliardi di parametri a 47-50 token/s con contesto da 100.000 token su una RTX 4070 Ti SUPER da 16 GB. Il segnale non è il modello, ma il controllo fine del runtime: cache KV asimmetrica kvarn5/kvarn4,...

2026-08-30 LocalLLaMA

Qwen3.8-Flash-Next su M5 Max: 350K token e i limiti del 2 bit

Un test di tre ore e mezzo su MacBook Pro M5 Max con 128 GB di memoria unificata esegue un modello Qwen3.8-Flash-Next da 78,9 GB in quantization 2 bit con slot da 358.400 token. Il prefill scende da 1.561 a 318 token/s; la generazione da 30–35 a 11,5...

#Hardware #LLM On-Premise #DevOps
2026-08-29 LocalLLaMA

Un LLM da 27B su GPU consumer: 50 token/s e contesto da 100k token

Un setup documentato su Reddit porta un Qwen3.8-27B su una RTX 4070 Ti SUPER a 47-50 token/s con 100.000 token di contesto. Il merito è del runtime beellama.cpp e della cache KV asimmetrica kvarn5/kvarn4, che ha liberato circa il 6% di VRAM. La coda ...

#Hardware #LLM On-Premise #DevOps
2026-08-28 LocalLLaMA

llama.cpp accelera su Qwen3.8-Flash-Next: 55 token/s con quattro RTX 3090

llama.cpp ha integrato il supporto per Qwen3.8-Flash-Next e una segnalazione comunitaria mostra 55 token/s con GGUF Q4 su quattro RTX 3090. Un test informale che sposta l’attenzione dal software all’hardware: per l’inference locale il costo e la comp...

#Hardware #LLM On-Premise #DevOps
2026-08-27 LocalLLaMA

Qwen3.8-Flash-Next alza il livello per i benchmark locali

Un Mac Studio M4 Max con 128 GB di memoria unificata ha ospitato il test di Qwen3.8-Flash-Next, il primo modello dell'anno a superare il 94% sul benchmark personale di tolitius. Il modello da 27B eccelle nel coding ma perde in conoscenza generale con...

#Hardware #LLM On-Premise #DevOps
← Torna ai Topic