Topic / Trend Rising

LLM Open-Weight Compatti ed Efficienti

Una nuova generazione di modelli open-weight – come Ling-3.0-flash, Maple-Preview e LLM on-device – utilizza Mixture of Experts con pochissimi parametri attivi o quantization ternaria. Ciò consente inference di alta qualità su GPU consumer e persino smartphone, abbassando la barriera per il deployment locale dell'IA.

Detected: 2026-08-07 · Updated: 2026-08-07

Articoli Correlati

2026-08-05 LocalLLaMA

LLM on-device: LFM2.5-2.6B a 17 tok/s su OnePlus 13, inference solo CPU

Un developer ha eseguito LFM2.5-2.6B, un LLM da 2,69 miliardi di parametri con finestra di contesto di 128K, su uno smartphone OnePlus 13 usando solo CPU e quantization Q4_K_M. L'inference engine custom, di appena 450 KB, raggiunge 17 tok/s e support...

#Hardware #LLM On-Premise #DevOps
2026-08-05 LocalLLaMA

Maple-Preview: LLM da 20B con pesi ternari e ragionamento open-weight

Maple-Preview è un nuovo modello open-weight da 20 miliardi di parametri, con soli 1 miliardo di attivi per token e pesi in quantization ternaria. La combinazione riduce drasticamente la VRAM necessaria per l’inference, avvicinando scenari on-premise...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-04 LocalLLaMA

Ling-3.0-flash: 124 miliardi di parametri, 5 attivi, e un futuro on-premise

InclusionAI ha rilasciato Ling-3.0-flash, un modello MoE open-weight da 124 miliardi di parametri con appena 5 miliardi attivi per token. Annunciato prima dell’ondata Kimi K3 e DeepSeek-V4-Flash, il suo dimensionamento potrebbe ritagliargli una nicch...

#Hardware #LLM On-Premise #DevOps
← Torna ai Topic