REAL-Q porta la discesa del gradiente nella quantization dei LLM
Un nuovo metodo di post-training quantization, REAL-Q, usa la discesa del gradiente a blocchi per ridurre fino a circa il 49% la divergenza KL end-to-end rispetto ai metodi di secondo ordine su LLaMA-3.1 e Qwen3 a W4A16. Un risultato che tocca i depl...