Topic / Trend Rising

Addestramento efficiente e architetture compatte

Metodi come FPO riducono la memoria del fine-tuning e saltano la retropropagazione tra i layer, mentre memoria causale a blocchi, ragionamento latente auto-spiegabile e retrofit ricorrenti migliorano l'efficienza degli LLM. Modelli compatti come Luth-2 e Nemotron MoE mostrano ottime prestazioni locali.

Detected: 2026-08-18 · Updated: 2026-08-18

Articoli Correlati

2026-08-18 ArXiv cs.LG

FPO accelera il fine-tuning dei LLM senza backpropagation tra i layer

FPO adatta i LLM senza un backward pass attraverso il corpo del modello, raggiungendo un throughput da 2,7 a 3,2 volte superiore al fine-tuning standard e circa il 40% in meno di memoria di picco. Nei test su OLMo-2-7B, Qwen3-8B e Falcon3-7B migliora...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-17 ArXiv cs.CL

BCMT: la memoria causale a blocchi riduce il peso dell'attenzione globale

BCMT separa l'interazione locale tra token dalla propagazione globale del contesto. Nei test fino a 1024 token, offre prestazioni di validazione paragonabili ai Dense Transformer, con throughput di training più alto e minor consumo di memoria. Il mec...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-17 ArXiv cs.AI

MoE: la tolleranza al mascheramento dipende dalla profondità

Uno studio su Qwen3.6-35B-A3B mostra che nei modelli MoE la tolleranza al mascheramento degli esperti non è uniforme: i layer iniziali e intermedi sono fragili, quelli finali reggono tagli aggressivi. Su tre server H100, politiche mirate agli ultimi ...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-11 LocalLLaMA

Luth-2, i piccoli LLM francesi che surclassano modelli tre volte più grandi

I nuovi Luth-2-0.8B e 2B fissano lo stato dell’arte per il francese, battendo modelli fino a tre volte più grandi in benchmark linguistici e matematici. Leggeri al punto da girare in locale, aprono scenari concreti per il deployment on-premise e la s...

#Hardware #LLM On-Premise #Fine-Tuning
← Torna ai Topic