Quantization statisticamente lossless: il paper che cambia il trade-off per i modelli on-premise
Un nuovo studio propone una via di mezzo tra compressione lossy e lossless: una quantization che preserva la qualità statistica dell’output, accelera l’inference e riduce i bit per parametro fino a 3,3. Implicazioni dirette per chi gestisce LLM su ha...