Topic / Trend Rising

Fine-tuning e compressione efficienti degli LLM

Nuove tecniche come FPO, BCMT, ECASQ e il masking MoE sensibile alla profondità puntano a ridurre memoria, calcolo e overhead di addestramento preservando la qualità. Questi metodi favoriscono un adattamento locale e un'inference on-premise più pratici.

Detected: 2026-08-20 · Updated: 2026-08-20

Articoli Correlati

2026-08-20 ArXiv cs.LG

ECASQ: quantization adattiva stocastica sotto vincolo di entropia

Il nuovo metodo ECASQ unisce quantization e compressione lossless per minimizzare l'MSE rispettando un budget di entropia e il vincolo di unbiasedness. La soluzione ottimale usa programmazione dinamica con tempo O(sd^2) e spazio O(d^2). Una variante ...

#Hardware #LLM On-Premise #DevOps
2026-08-18 ArXiv cs.LG

FPO accelera il fine-tuning dei LLM senza backpropagation tra i layer

FPO adatta i LLM senza un backward pass attraverso il corpo del modello, raggiungendo un throughput da 2,7 a 3,2 volte superiore al fine-tuning standard e circa il 40% in meno di memoria di picco. Nei test su OLMo-2-7B, Qwen3-8B e Falcon3-7B migliora...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-17 ArXiv cs.CL

BCMT: la memoria causale a blocchi riduce il peso dell'attenzione globale

BCMT separa l'interazione locale tra token dalla propagazione globale del contesto. Nei test fino a 1024 token, offre prestazioni di validazione paragonabili ai Dense Transformer, con throughput di training più alto e minor consumo di memoria. Il mec...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-17 ArXiv cs.AI

MoE: la tolleranza al mascheramento dipende dalla profondità

Uno studio su Qwen3.6-35B-A3B mostra che nei modelli MoE la tolleranza al mascheramento degli esperti non è uniforme: i layer iniziali e intermedi sono fragili, quelli finali reggono tagli aggressivi. Su tre server H100, politiche mirate agli ultimi ...

#Hardware #LLM On-Premise #Fine-Tuning
← Torna ai Topic