Topic / Trend Rising

Modelli aperti compatti e sparsi espandono l'inference locale

Rilasci come Spark-X2.5, MiniCPM5-2B, K2-Horizon-MoVA e Qwen-Drive portano modelli aperti compatti o sparsi con meno parametri attivi e capacità specializzate. llama.cpp sta aggiungendo supporto per nuove architetture come Tencent Hy4, rafforzando i percorsi di inference locale, edge e on-premise.

Detected: 2026-09-09 · Updated: 2026-09-09

Articoli Correlati

2026-09-08 LocalLLaMA

Qwen porta i pesi aperti alla guida autonoma con Qwen-Drive-1.0-4B

Il team Qwen pubblica un modello open weight derivato da un checkpoint da 4B e ottimizzato per la guida. Il checkpoint BF16 completo pesa 9B. Un segnale concreto della spinta dei laboratori cinesi verso la guida autonoma con modelli aperti, con impli...

#Hardware #LLM On-Premise #Fine-Tuning
2026-09-07 LocalLLaMA

MiniCPM5-2B: OpenBMB guida i modelli open weights sotto i 4B

OpenBMB ha pubblicato MiniCPM5-2B, un modello open weights da 2 miliardi di parametri che ottiene 15 sull'Artificial Analysis Intelligence Index v4.2, il punteggio più alto tra i modelli aperti fino a 4B. Il risultato interessa chi valuta deployment ...

#LLM On-Premise #Fine-Tuning #DevOps
2026-09-06 LocalLLaMA

Spark-X2.5 in GGUF: llama.cpp apre la strada ai modelli compatti da 1M token

Una pull request su llama.cpp introduce il supporto per Spark-X2.5, due LLM compatti da 4B e 1.7B parametri, con contesto nativo fino a 1M token e architettura ibrida a finestra scorrevole. La mossa abbassa la soglia per l'inference locale e self-hos...

#Hardware #LLM On-Premise #Fine-Tuning
2026-09-05 LocalLLaMA

Tencent Hy4 su llama.cpp: il segnale per l'inference locale

La pull request #28127 per integrare Hy4-preview in llama.cpp non porta benchmark, ma segnala la convergenza dell'ecosistema self-hosted. Anche i vendor cloud mostrano attenzione alle pipeline on-premise. Restano da verificare stabilità, licenze e do...

2026-09-03 LocalLLaMA

IFM rilascia K2-Horizon-MoVA-36B-A4B in GGUF: frontiera a 4B attivi

IFM ha pubblicato il checkpoint finale del modello sparse Mixture-of-Experts K2-Horizon-MoVA-36B-A4B, con 36 miliardi di parametri totali e 4 miliardi attivi per token. Distribuito in GGUF, compete su task agentici e di reasoning con modelli chiusi d...

#Hardware #LLM On-Premise #Fine-Tuning
← Torna ai Topic