BCMT: la memoria causale a blocchi riduce il peso dell'attenzione globale
BCMT separa l'interazione locale tra token dalla propagazione globale del contesto. Nei test fino a 1024 token, offre prestazioni di validazione paragonabili ai Dense Transformer, con throughput di training più alto e minor consumo di memoria. Il mec...