Gemma 4 QAT su Strix Halo: performance on-premise per LLM quantizzati
I modelli Gemma 4 QAT (Quantization-Aware Training) di Google, eseguiti localmente su una APU AMD Strix Halo, dimostrano un notevole incremento delle performance per l'inference on-premise. I test hanno evidenziato come l'utilizzo di assistant heads specifici per QAT migliori significativamente l'efficienza e l'accuratezza, raggiungendo fino a 71 token/secondo per il modello 26B-A4B QAT Q4_0. Questi risultati sono cruciali per chi valuta deployment di Large Language Models su hardware edge.