Topic / Trend Rising

Tecniche efficienti per inference e memoria degli LLM

Nuovi metodi come il riuso della cache KV a chunk, la conversione da modelli densi a MoE e la quantization sotto vincolo di entropia riducono il tempo di prefill e il calcolo attivo senza fine-tuning. Queste tecniche puntano a un serving LLM locale e on-premise più economico.

Detected: 2026-08-26 · Updated: 2026-08-26

Articoli Correlati

2026-08-25 LocalLLaMA

ToMoE e la sparsità dinamica: meno calcolo per gli LLM locali

ToMoE converte checkpoint densi in MoE senza fine-tuning, riducendo i parametri attivi per token ma non il footprint in memoria. Un cambio di logica per l'on-premise: meno calcolo, stesso modello. Restano aperti i nodi runtime, latenza e VRAM. Il seg...

2026-08-24 LocalLLaMA

ToMoE trasforma LLM densi in Mixture of Experts senza fine-tuning

Un nuovo metodo converte LLM densi in architetture Mixture of Experts tramite pruning dinamico differenziabile, riducendo i parametri attivi per token senza eliminarli. Non richiede fine-tuning e supera le tecniche precedenti di pruning strutturale s...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-20 ArXiv cs.LG

ECASQ: quantization adattiva stocastica sotto vincolo di entropia

Il nuovo metodo ECASQ unisce quantization e compressione lossless per minimizzare l'MSE rispettando un budget di entropia e il vincolo di unbiasedness. La soluzione ottimale usa programmazione dinamica con tempo O(sd^2) e spazio O(d^2). Una variante ...

#Hardware #LLM On-Premise #DevOps
← Torna ai Topic