La cache degli esperti riscrive il TCO: MoE fluido su hardware on-premise datato
Il caso Qwen3.8-Flash-Next su due RTX 3090 mostra che nei modelli MoE la VRAM non è più l'unica variabile: la gerarchia di memoria e la cache degli esperti spostano il decode da 17 a 29 token/s. Un segnale concreto per chi valuta deployment on-premis...