NVIDIA sfida i canoni con un LLM diffusivo a due torri che genera i token in parallelo
Nemotron-TwoTower-30B-A3B-Base-BF16 abbandona la decodifica sequenziale per un’architettura che riempie blocchi di token simultaneamente. La qualità resta al 98,7% del modello autoregressivo di partenza, mentre il throughput di generazione balza a 2,42 volte. Un segnale per chi progetta stack di inference on-premise: la via diffusiva potrebbe ridefinire l’equazione tra potenza hardware e velocità.