Intel Battlemage e llama.cpp: una patch riscrive il TCO dell'inference on-premise
Una manciata di righe di codice in llama.cpp moltiplica fino a 2,7 volte le prestazioni delle GPU Intel Battlemage su contesti di 118.000 token quando la cache KV è quantizzata. Il guadagno è talmente netto da trasformare una scheda da gaming in un’a...