Llama.cpp guadagna fino all’8% spostando il sampling sulla GPU
Una pull request elimina il round-trip CPU-GPU per il sampling MTP in llama.cpp. Su una RTX 5090 il guadagno sfiora l’8%, su una Tesla P40 è del 4% a causa della banda memoria ridotta. Un miglioramento netto senza costi aggiuntivi per chi fa inferenc...