Topic / Trend Rising

Ottimizzazione dell'inference LLM on-premise

Esperimenti con modelli Qwen, MoE, gestione della cache KV, expert caching, MTP e indici vettoriali stanno rendendo possibile l'inference di modelli di grandi dimensioni su GPU consumer, Mac e hardware datacenter datato. L'attenzione si sposta dalla dimensione grezza dei parametri alla gerarchia di memoria e al controllo runtime.

Detected: 2026-09-04 · Updated: 2026-09-04

Articoli Correlati

2026-09-03 LocalLLaMA

Qwen-3.8-Next-Flash: iniezione di conoscenza a caldo in llama.cpp

Una modifica sperimentale a llama.cpp aggiorna in-memory la tabella Ngram PLE dei modelli Qwen, inserendo conoscenza senza ricaricare il modello. Il progetto, testato soltanto con quantization q8, richiede memory mapping e soffre di scarso controllo ...

#LLM On-Premise #Fine-Tuning #DevOps
2026-09-03 LocalLLaMA

Arcon spinge Qwen3-4B: quanto conta l'architettura, non solo i parametri

Il progetto Arcon usa Qwen3-4B con LoRA per costruire un assistente locale con memoria persistente, stato interno e strumenti. Più che un chatbot, è un banco di prova per capire fino a che punto un modello compatto possa reggere un'interazione da ass...

#LLM On-Premise #Fine-Tuning #DevOps
2026-09-03 LocalLLaMA

Il calcolo lento come scelta: un Qwen 27B e la produttività asincrona

Un intervento su Reddit riporta un passaggio da 15 ore di programmazione attiva a 4 ore per debuggare o implementare una feature con Qwen 27B, anche a 0,5 token al secondo. Il dato ridisegna le aspettative per l'inference asincrona e il calcolo del v...

#Hardware #LLM On-Premise #DevOps
2026-09-03 LocalLLaMA

La KV cache pesa più dei parametri sui modelli locali a contesto lungo

Per gli LLM locali, il numero di parametri non è l'unico vincolo: la KV cache cresce con ogni token e può diventare il vero collo di bottiglia a contesti da 100k o 200k token. GQA, MQA e quantization riducono l'ingombro, ma il problema resta lineare....

#Hardware #LLM On-Premise #DevOps
2026-09-03 LocalLLaMA

Perplexity apre il server di inference per Mac ottimizzato per Qwen 3.6

Perplexity ha reso open source il repository lily in pplx-garden, un inference server per Mac costruito attorno a un solo modello, Qwen 3.6, per ottenere il massimo su Apple Silicon. Non è serving generico: la verticalizzazione su un singolo modello ...

#Hardware #LLM On-Premise #DevOps
2026-09-03 Phoronix

Lemonade 11.9 porta il backend sperimentale AMD ROCm HRX in Llama.cpp

Lemonade 11.9, server AI locale open source sostenuto da AMD, debutta su Linux, Windows e macOS con un backend sperimentale ROCm HRX per Llama.cpp. Il progetto conferma la linea «100% gratuito e privato» su GPU, CPU e NPU. Il dettaglio tecnico più ri...

#Hardware #LLM On-Premise #DevOps
2026-09-02 Phoronix

Intel aggiorna LLM-Scaler-vLLM: vLLM 0.26 su GPU Arc con Docker

Il progetto LLM-Scaler-vLLM di Intel rilascia una nuova beta basata su vLLM 0.26, pensata per avviare vLLM su GPU Arc e Arc Pro tramite container Docker. L'aggiornamento riduce l'attrito di configurazione per chi vuole servire LLM in locale su hardwa...

#Hardware #LLM On-Premise #DevOps
2026-08-31 ArXiv cs.CL

Inference CPU, l'indice vettoriale riduce il peso dell'output embedding

Sostituire la proiezione densa sul vocabolario con una ricerca approssimata su indice HNSW accelera la decodifica autoregressiva su CPU. Nei test con Gemma 3, Llama 3.2 e Qwen 3, il throughput batch-one di Gemma 3 270M migliora fino all'82%, senza pe...

#Hardware #LLM On-Premise #DevOps
2026-08-30 LocalLLaMA

Quattro V100 32GB servono un LLM a 256k token: cosa dice il test SGLang-V100

Il supporto a RadixArk/Qwen3.8-Flash-Next-NVFP4 in SGLang-V100 mostra quattro V100 32GB con contesto completo da 256k token e oltre 50GB di offload sulla RAM di sistema. Prefill intorno a 4.000 token/s, decoding intorno a 60 token/s. I dati MTP segna...

#Hardware #LLM On-Premise #DevOps
2026-08-30 LocalLLaMA

La leva runtime che porta un LLM da 27B a 100k token su 16 GB

Un setup su Reddit mostra un modello dense da 27 miliardi di parametri a 47-50 token/s con contesto da 100.000 token su una RTX 4070 Ti SUPER da 16 GB. Il segnale non è il modello, ma il controllo fine del runtime: cache KV asimmetrica kvarn5/kvarn4,...

2026-08-30 LocalLLaMA

Qwen3.8-Flash-Next su M5 Max: 350K token e i limiti del 2 bit

Un test di tre ore e mezzo su MacBook Pro M5 Max con 128 GB di memoria unificata esegue un modello Qwen3.8-Flash-Next da 78,9 GB in quantization 2 bit con slot da 358.400 token. Il prefill scende da 1.561 a 318 token/s; la generazione da 30–35 a 11,5...

#Hardware #LLM On-Premise #DevOps
2026-08-29 LocalLLaMA

Un LLM da 27B su GPU consumer: 50 token/s e contesto da 100k token

Un setup documentato su Reddit porta un Qwen3.8-27B su una RTX 4070 Ti SUPER a 47-50 token/s con 100.000 token di contesto. Il merito è del runtime beellama.cpp e della cache KV asimmetrica kvarn5/kvarn4, che ha liberato circa il 6% di VRAM. La coda ...

#Hardware #LLM On-Premise #DevOps
← Torna ai Topic