Topic / Trend Rising

Inference locale dei LLM e ottimizzazione dei MoE

Benchmark e report ingegneristici si concentrano su Qwen3.8-Flash-Next e modelli MoE, usando cache degli esperti, quantizzazioni e tuning della KV cache su Apple Silicon e GPU RTX per migliorare la velocità di decode e ridurre il TCO. L'enfasi si sta spostando dai parametri grezzi alla gerarchia di memoria, alla bandwidth per dollaro e alle ottimizzazioni del runtime.

Detected: 2026-09-09 · Updated: 2026-09-09

Articoli Correlati

2026-09-08 LocalLLaMA

GB per dollaro e bandwidth: la bussola per le GPU LLM locali

Una comparazione condivisa su Reddit usa VRAM per dollaro e bandwidth dichiarata per orientarsi tra le GPU più discusse nei canali LocalLLaMA. Prezzi raccolti con ChatGPT, nuovi o di seconda mano, senza garanzie. Un metodo grezzo ma utile per chi val...

#Hardware #LLM On-Premise #DevOps
2026-09-06 LocalLLaMA

llama.cpp, una fork testa l'expert expansion sui modelli MoE su Apple Metal

Una branch custom di llama.cpp porta l'expert expansion ai modelli MoE e la testa su Apple Metal. Il risultato supera la versione DS4 dell'autore, ma manca validazione su altre piattaforme. Il caso mostra quanto l'inference locale sui modelli sparse ...

#Hardware #LLM On-Premise #DevOps
2026-09-06 LocalLLaMA

DeepSeek-V4-Flash-Vision vs Qwen3.8-Flash-Next: token lenti, task più rapidi

Una comparativa locale con quantization Q8_K_XL su due StrixHalo 128GB mostra che DeepSeek-V4-Flash-Vision genera token più lentamente di Qwen3.8-Flash-Next, ma chiude i compiti in circa metà tempo. L'autore osserva meno allucinazioni e una minore te...

#Hardware #LLM On-Premise #DevOps
2026-09-06 LocalLLaMA

Qwen3.8-Flash-Next: 45 tok/s su M4 Max, 25 su M2 Ultra in locale

La variante Qwen3.8-Flash-Next-oQ4e-mtp mostra velocità di inference locale su Apple Silicon: 45 token al secondo su M4 Max e 25 su M2 Ultra. Il dato arriva da llm-bench.io e mette a confronto una variante ottimizzata con Qwen3.8 27B, con prestazioni...

#Hardware #LLM On-Premise #DevOps
2026-09-04 LocalLLaMA

Qwen3.8 27B su RTX 5080: 21 quantizzazioni alla prova dei 16 GB

Un benchmark su 21 varianti quantizzate di Qwen3.8 27B con una RTX 5080 da 16 GB mostra quanto conti la scelta del formato GGUF. La variante IQ4_XS di bartowski ottiene la divergenza media più bassa e il miglior accordo sul token più probabile, mentr...

#Hardware #LLM On-Premise #DevOps
2026-09-03 LocalLLaMA

Qwen-3.8-Next-Flash: iniezione di conoscenza a caldo in llama.cpp

Una modifica sperimentale a llama.cpp aggiorna in-memory la tabella Ngram PLE dei modelli Qwen, inserendo conoscenza senza ricaricare il modello. Il progetto, testato soltanto con quantization q8, richiede memory mapping e soffre di scarso controllo ...

#LLM On-Premise #Fine-Tuning #DevOps
2026-09-03 LocalLLaMA

La KV cache pesa più dei parametri sui modelli locali a contesto lungo

Per gli LLM locali, il numero di parametri non è l'unico vincolo: la KV cache cresce con ogni token e può diventare il vero collo di bottiglia a contesti da 100k o 200k token. GQA, MQA e quantization riducono l'ingombro, ma il problema resta lineare....

#Hardware #LLM On-Premise #DevOps
← Torna ai Topic