MTP su Qwen3.8-Flash-Next-GGUF: la spinta al throughput nei modelli GGUF locali
La segnalazione su Reddit è scarna, ma il messaggio è chiaro: il supporto MTP per Qwen3.8-Flash-Next in formato GGUF promette di aumentare i token al secondo nelle esecuzioni con llama.cpp. Più che una singola ottimizzazione, è un segnale sulla direz...