Topic / Trend Rising

Inference LLM efficiente con sparsità e riuso della cache KV

Metodi come ToMoE, KVBoost e MTP riducono i parametri attivi o riusano blocchi di cache key-value, tagliando il calcolo per token senza riaddestramento completo.

Detected: 2026-08-30 · Updated: 2026-08-30

Articoli Correlati

2026-08-25 LocalLLaMA

ToMoE e la sparsità dinamica: meno calcolo per gli LLM locali

ToMoE converte checkpoint densi in MoE senza fine-tuning, riducendo i parametri attivi per token ma non il footprint in memoria. Un cambio di logica per l'on-premise: meno calcolo, stesso modello. Restano aperti i nodi runtime, latenza e VRAM. Il seg...

2026-08-24 LocalLLaMA

ToMoE trasforma LLM densi in Mixture of Experts senza fine-tuning

Un nuovo metodo converte LLM densi in architetture Mixture of Experts tramite pruning dinamico differenziabile, riducendo i parametri attivi per token senza eliminarli. Non richiede fine-tuning e supera le tecniche precedenti di pruning strutturale s...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-24 LocalLLaMA

MTP sbarca in GLM-Air: il MoE da 106B accelera sulle GPU locali

llama.cpp abilita MTP per GLM-4.5-Air, un MoE da 106 miliardi di parametri con soli 12 miliardi attivi. La novità accelera l'inference su macchine con molta memoria ma calcolo limitato, come Strix Halo, DGX Spark e RTX 3090, e rafforza l'ecosistema d...

#Hardware #LLM On-Premise #Fine-Tuning
← Torna ai Topic