Topic / Trend Rising

Inference Efficiente e Compressione dei Modelli

Nuove tecniche come il riuso della cache KV, la conversione dinamica in MoE, la quantization stocastica, la decodifica speculativa MTP e il pruning di profondità riducono i requisiti di calcolo e memoria per l'inference locale degli LLM.

Detected: 2026-08-25 · Updated: 2026-08-25

Articoli Correlati

2026-08-25 LocalLLaMA

ToMoE e la sparsità dinamica: meno calcolo per gli LLM locali

ToMoE converte checkpoint densi in MoE senza fine-tuning, riducendo i parametri attivi per token ma non il footprint in memoria. Un cambio di logica per l'on-premise: meno calcolo, stesso modello. Restano aperti i nodi runtime, latenza e VRAM. Il seg...

2026-08-24 LocalLLaMA

ToMoE trasforma LLM densi in Mixture of Experts senza fine-tuning

Un nuovo metodo converte LLM densi in architetture Mixture of Experts tramite pruning dinamico differenziabile, riducendo i parametri attivi per token senza eliminarli. Non richiede fine-tuning e supera le tecniche precedenti di pruning strutturale s...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-24 LocalLLaMA

MTP sbarca in GLM-Air: il MoE da 106B accelera sulle GPU locali

llama.cpp abilita MTP per GLM-4.5-Air, un MoE da 106 miliardi di parametri con soli 12 miliardi attivi. La novità accelera l'inference su macchine con molta memoria ma calcolo limitato, come Strix Halo, DGX Spark e RTX 3090, e rafforza l'ecosistema d...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-20 LocalLLaMA

Depth pruning su Qwen3.8-27B: la leggerezza non è gratuita

Uno sviluppatore ha ridotto Qwen3.8-27B a 22,7 miliardi di parametri con pruning di profondità, senza fine-tuning. Distribuito solo in MLX per Apple Silicon, mostra trade-off: meno pressione su memoria e calcolo, ma perdite nei casi limite. Per l'on-...

2026-08-20 ArXiv cs.LG

ECASQ: quantization adattiva stocastica sotto vincolo di entropia

Il nuovo metodo ECASQ unisce quantization e compressione lossless per minimizzare l'MSE rispettando un budget di entropia e il vincolo di unbiasedness. La soluzione ottimale usa programmazione dinamica con tempo O(sd^2) e spazio O(d^2). Una variante ...

#Hardware #LLM On-Premise #DevOps
2026-08-20 LocalLLaMA

Qwen3.8-27B ridotto a 22,7 miliardi con pruning di profondità

Uno sviluppatore ha applicato un pruning di profondità a Qwen3.8-27B, portandolo a circa 22,7 miliardi di parametri senza fine-tuning. Il modello, disponibile in versioni bf16, q8 e q4 su MLX, gestisce coding, uso agentico e conversazioni multi-turno...

#Hardware #LLM On-Premise #Fine-Tuning
← Torna ai Topic