LLM on-device: LFM2.5-2.6B a 17 tok/s su OnePlus 13, inference solo CPU
Un developer ha eseguito LFM2.5-2.6B, un LLM da 2,69 miliardi di parametri con finestra di contesto di 128K, su uno smartphone OnePlus 13 usando solo CPU e quantization Q4_K_M. L'inference engine custom, di appena 450 KB, raggiunge 17 tok/s e support...