LFM2.5-8B-A1B: L'LLM da 8B gira su CPU con Rust, efficienza on-premise
Un nuovo progetto open source dimostra la fattibilità di eseguire LLM da 8 miliardi di parametri interamente su CPU. L'implementazione Rust-native di LFM2.5-8B-A1B, testata su un Ryzen 7950x, raggiunge circa 37 token/s in fase di decodifica, con un consumo di memoria di circa 7GB. Questo approccio sottolinea il potenziale per deployment on-premise, offrendo controllo sui dati e riducendo la dipendenza da infrastrutture GPU costose, pur richiedendo ottimizzazioni per la fase di prefill.