Maple-Preview e l’inference ternaria: la soglia on-premise si abbassa
Maple-Preview porta i pesi ternari su 20 miliardi di parametri, occupando solo 5 GB e attivando 1 miliardo di parametri per token con un design MoE-like. La preview apre a inference locale su GPU consumer, ma il supporto dei framework è ancora acerbo...