Topic / Trend Rising

Adattamento Efficiente e Compressione degli LLM

La ricerca su adattamento efficiente e compressione degli LLM accelera oltre la quantization classica. Metodi come FPO, ECASQ e il depth pruning riducono memoria e costi di addestramento, spesso con compromessi su accuratezza o robustezza.

Detected: 2026-08-24 · Updated: 2026-08-24

Articoli Correlati

2026-08-20 LocalLLaMA

Depth pruning su Qwen3.8-27B: la leggerezza non è gratuita

Uno sviluppatore ha ridotto Qwen3.8-27B a 22,7 miliardi di parametri con pruning di profondità, senza fine-tuning. Distribuito solo in MLX per Apple Silicon, mostra trade-off: meno pressione su memoria e calcolo, ma perdite nei casi limite. Per l'on-...

2026-08-20 ArXiv cs.LG

ECASQ: quantization adattiva stocastica sotto vincolo di entropia

Il nuovo metodo ECASQ unisce quantization e compressione lossless per minimizzare l'MSE rispettando un budget di entropia e il vincolo di unbiasedness. La soluzione ottimale usa programmazione dinamica con tempo O(sd^2) e spazio O(d^2). Una variante ...

#Hardware #LLM On-Premise #DevOps
2026-08-20 LocalLLaMA

Qwen3.8-27B ridotto a 22,7 miliardi con pruning di profondità

Uno sviluppatore ha applicato un pruning di profondità a Qwen3.8-27B, portandolo a circa 22,7 miliardi di parametri senza fine-tuning. Il modello, disponibile in versioni bf16, q8 e q4 su MLX, gestisce coding, uso agentico e conversazioni multi-turno...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-18 ArXiv cs.LG

FPO accelera il fine-tuning dei LLM senza backpropagation tra i layer

FPO adatta i LLM senza un backward pass attraverso il corpo del modello, raggiungendo un throughput da 2,7 a 3,2 volte superiore al fine-tuning standard e circa il 40% in meno di memoria di picco. Nei test su OLMo-2-7B, Qwen3-8B e Falcon3-7B migliora...

#Hardware #LLM On-Premise #Fine-Tuning
← Torna ai Topic