dSpark e MTP: lo spillover su disco diventa accettabile per l’inference?
Nuovi booster per l’inference come dSpark, dflash, MTP e QAT promettono accelerazioni, ma storicamente lo spillover su disco faceva precipitare le prestazioni da 4-5 token/s a 0,5 token/s. La domanda: questi miglioramenti rendono il calo sopportabile?