Topic / Trend Rising

Ottimizzazione degli LLM locali e self-hosted

Miglioramenti runtime e guidati dalla comunità come gestione della KV cache, caching degli esperti, quantization GGUF e decoding speculativo stanno portando grandi LLM aperti su hardware consumer e datato. Contesti da oltre 100k token e configurazioni on-premise multi-GPU diventano più praticabili.

Detected: 2026-09-05 · Updated: 2026-09-05

Articoli Correlati

2026-09-04 LocalLLaMA

Qwen3.8 27B su RTX 5080: 21 quantizzazioni alla prova dei 16 GB

Un benchmark su 21 varianti quantizzate di Qwen3.8 27B con una RTX 5080 da 16 GB mostra quanto conti la scelta del formato GGUF. La variante IQ4_XS di bartowski ottiene la divergenza media più bassa e il miglior accordo sul token più probabile, mentr...

#Hardware #LLM On-Premise #DevOps
2026-09-04 LocalLLaMA

Un FPS multiplayer nato da un LLM locale: Qwen 3.8 Flash Next in azione

Un utente ha costruito un FPS multiplayer con Qwen 3.8 Flash Next in locale, usando opencode e GPU NVIDIA (RTX 5090 e RTX 4000 PRO). Demo giocabile in due ore, tre giorni di rifiniture, 20 token/s medi con MTP, contesto 256k e quantization Q4_K_XL. L...

#Hardware #LLM On-Premise #DevOps
2026-09-03 LocalLLaMA

Il calcolo lento come scelta: un Qwen 27B e la produttività asincrona

Un intervento su Reddit riporta un passaggio da 15 ore di programmazione attiva a 4 ore per debuggare o implementare una feature con Qwen 27B, anche a 0,5 token al secondo. Il dato ridisegna le aspettative per l'inference asincrona e il calcolo del v...

#Hardware #LLM On-Premise #DevOps
2026-09-03 LocalLLaMA

La KV cache pesa più dei parametri sui modelli locali a contesto lungo

Per gli LLM locali, il numero di parametri non è l'unico vincolo: la KV cache cresce con ogni token e può diventare il vero collo di bottiglia a contesti da 100k o 200k token. GQA, MQA e quantization riducono l'ingombro, ma il problema resta lineare....

#Hardware #LLM On-Premise #DevOps
2026-09-03 LocalLLaMA

Perplexity apre il server di inference per Mac ottimizzato per Qwen 3.6

Perplexity ha reso open source il repository lily in pplx-garden, un inference server per Mac costruito attorno a un solo modello, Qwen 3.6, per ottenere il massimo su Apple Silicon. Non è serving generico: la verticalizzazione su un singolo modello ...

#Hardware #LLM On-Premise #DevOps
2026-08-30 LocalLLaMA

Quattro V100 32GB servono un LLM a 256k token: cosa dice il test SGLang-V100

Il supporto a RadixArk/Qwen3.8-Flash-Next-NVFP4 in SGLang-V100 mostra quattro V100 32GB con contesto completo da 256k token e oltre 50GB di offload sulla RAM di sistema. Prefill intorno a 4.000 token/s, decoding intorno a 60 token/s. I dati MTP segna...

#Hardware #LLM On-Premise #DevOps
2026-08-30 LocalLLaMA

Qwen3.8-Flash-Next su M5 Max: 350K token e i limiti del 2 bit

Un test di tre ore e mezzo su MacBook Pro M5 Max con 128 GB di memoria unificata esegue un modello Qwen3.8-Flash-Next da 78,9 GB in quantization 2 bit con slot da 358.400 token. Il prefill scende da 1.561 a 318 token/s; la generazione da 30–35 a 11,5...

#Hardware #LLM On-Premise #DevOps
2026-08-29 LocalLLaMA

Un LLM da 27B su GPU consumer: 50 token/s e contesto da 100k token

Un setup documentato su Reddit porta un Qwen3.8-27B su una RTX 4070 Ti SUPER a 47-50 token/s con 100.000 token di contesto. Il merito è del runtime beellama.cpp e della cache KV asimmetrica kvarn5/kvarn4, che ha liberato circa il 6% di VRAM. La coda ...

#Hardware #LLM On-Premise #DevOps
← Torna ai Topic