Qwen3.6 a 8 bit su CPU: quando la qualità dell’output ridisegna gli investimenti on-premise
Un test con un Qwen3.6 35B-A3B mostra che la quantization a 8 bit su CPU produce codice HTML complesso migliore della versione a 4 bit su GPU, nonostante la lentezza. L’esperimento accende un riflettore sul trade-off qualità-velocità, sul ruolo delle architetture MoE e sulla possibilità di usare server CPU ad alta densità di RAM per inference on-premise di LLM. Un segnale per chi cerca sovranità dei dati senza rinunciare alla fedeltà dell’output.