FP8 su GPU AMD: i guadagni di TorchTitan e TorchAO ora sono nel mainline PyTorch
AMD e Meta hanno portato nel mainline PyTorch le ottimizzazioni FP8 per GPU Instinct: +13,4% su Llama3-8B, recupero dell'89% dell'overhead su DeepSeek-V3 671B e kernel 6,2× più rapidi. L'integrazione elimina la necessità di stack proprietari e rende ...