📁 LLM

Questa sezione LLM monitora release di modelli, quantizzazione, capacita di ragionamento e impatti pratici su deployment locale o ibrido. L'obiettivo e focalizzarsi su cio che cambia davvero le decisioni tecniche: finestra di contesto, latenza, footprint memoria, licenze e evidenza valutativa su famiglie open e commerciali. E una raccolta pensata per team che cercano segnali affidabili, non rumore. Integra la lettura con la pillar LLM, i vincoli hardware e l'integrazione framework.

Tencent ha reso open source il modello Hy3: 295 miliardi di parametri totali, 21 miliardi attivi, architettura mixture-of-experts e, soprattutto, licenza Apache 2.0. Sostituisce la vecchia licenza comunitaria che proibiva l’uso in Corea del Sud, Regno Unito e Unione Europea. Per le aziende che valutano deployment on-premise in Europa, il cambio di licenza elimina la barriera legale principale.

2026-07-06 Fonte

Un ricercatore indipendente ha costruito un modello linguistico custom con architettura Transformer ottimizzata per l'esecuzione in locale. Rotary Positional Embeddings, RMSNorm, SwiGLU e grouped query attention compongono un decoder autoregressivo che segnala una direzione chiara: portare l'intelligenza artificiale direttamente sui dispositivi.

2026-07-05 Fonte

Un thread su Reddit invita a condividere i migliori Vision-Language Model eseguiti in locale. Emergono dettagli su hardware, engine di inference e casi d’uso, rivelando come la comunità aggiri l’inaffidabilità dei benchmark con resoconti pratici. Uno spaccato prezioso per chi valuta stack on-premise.

2026-07-05 Fonte

La decisione del team Qwen di posticipare il rilascio di modelli più grandi solleva dubbi sulla sostenibilità a lungo termine degli LLM open weight. Con un divario prestazionale già di 2-4 mesi rispetto ai sistemi state-of-the-art, ulteriori ritardi potrebbero allontanare la comunità che fa affidamento su GPU consumer per l'inference locale.

2026-07-05 Fonte

Un benchmark su 13 modelli a contesto 65K-128K su GPU consumer mostra che il prefill assorbe il 94-99% del tempo per output brevi, diventando la metrica chiave. Il numero di KV head, non i parametri, determina la scalabilità. Sorprendenti i risultati sulla quantization del KV cache e sull’architettura Mamba2, mentre MLA soffre su Vulkan. L’analisi ridefinisce i criteri per deployment agentici on-premise.

2026-07-05 Fonte

La startup francese ha raccolto finanziamenti significativi dal 2023 per portare modelli di frontiera al pubblico. Ma dietro la retorica, il vero differenziale sta nei modelli aperti: una scelta che ridefinisce il controllo sui dati e le strategie di deployment per le imprese.

2026-07-04 Fonte

Google Research ha rilasciato TabFM, un foundation model zero-shot per dati tabulari. Il modello gestisce classificazione e regressione su colonne miste numeriche e categoriche, senza fine-tuning o ricerca di iperparametri: gli esempi di training vengono passati come contesto, e le previsioni sono prodotte in un singolo passaggio. Per chi opera con dati strutturati in ambiti regolamentati, l'approccio promette di semplificare il deployment on-premise, mantenendo i dati locali e riducendo la dipendenza da pipeline di addestramento cloud.

2026-07-04 Fonte

Meituan ha rilasciato i pesi di Longcat 2 nelle varianti INT8 e FP8. Per chi gestisce LLM in locale, la disponibilità di modelli già quantizzati riduce la barriera hardware e i costi di inference, mantenendo un buon equilibrio fra prestazioni e consumo di VRAM.

2026-07-03 Fonte

Mistral ha rilasciato Leanstral 1.5, un LLM con licenza Apache 2.0 focalizzato sulla verifica formale. Attiva solo 6 miliardi di parametri su 119 totali, raggiunge risultati all’avanguardia su miniF2F, PutnamBench e FATE, e ha scovato 5 bug in 57 repository reali. Il footprint ridotto apre scenari di deployment on-premise per chi non può esporre codice a servizi cloud.

2026-07-03 Fonte

Mark Zuckerberg ha comunicato ai dipendenti che lo sviluppo degli agenti AI di Meta sta procedendo più lentamente del previsto, nonostante la riorganizzazione di quattro mesi fa. La notizia solleva interrogativi sulle sfide tecniche dell'AI agentica e sulle implicazioni per chi gestisce carichi di lavoro LLM on-premise.

2026-07-03 Fonte