📁 LLM

Questa sezione LLM monitora release di modelli, quantizzazione, capacita di ragionamento e impatti pratici su deployment locale o ibrido. L'obiettivo e focalizzarsi su cio che cambia davvero le decisioni tecniche: finestra di contesto, latenza, footprint memoria, licenze e evidenza valutativa su famiglie open e commerciali. E una raccolta pensata per team che cercano segnali affidabili, non rumore. Integra la lettura con la pillar LLM, i vincoli hardware e l'integrazione framework.

KPMG ha ritirato un rapporto sull'uso dell'intelligenza artificiale a causa di apparenti 'allucinazioni' generate dai sistemi stessi. L'episodio sottolinea le sfide legate all'affidabilità degli LLM, in particolare quando utilizzati per produrre contenuti informativi critici. Per le aziende che considerano deployment on-premise, la gestione della qualità e della veridicità degli output AI diventa un fattore determinante per la sovranità dei dati e la compliance.

2026-06-13 Fonte

Il panorama degli LLM Open Source è in rapida evoluzione, con l'emergere di nuovi attori e strategie, in particolare dalla Cina. Questo sviluppo richiede alle aziende una preparazione proattiva per valutare le implicazioni su deployment on-premise, sovranità dei dati e TCO. La dinamica evidenzia una strategia più ampia che va oltre i singoli modelli, influenzando le decisioni infrastrutturali e di compliance.

2026-06-13 Fonte

Il modello Qwen 3.7 67B, disponibile su Hugging Face in formato GGUF con livelli di Quantization q6/q7, rappresenta una soluzione interessante per le aziende che cercano LLM personalizzati e controllati. Questa opzione favorisce deployment on-premise, offrendo sovranità dei dati, flessibilità e un potenziale controllo sui costi operativi per carichi di lavoro AI.

2026-06-13 Fonte

Il governo della città di Rio de Janeiro ha rilasciato Rio-3.5-Open-397B, un Large Language Model basato su fine-tuning di Qwen. Disponibile su Hugging Face, il modello si distingue per la sua natura open source, offrendo un'alternativa con prestazioni comparabili a Qwen 3.7 Plus e ponendo l'accento sulla sovranità dei dati e il controllo per le pubbliche amministrazioni.

2026-06-13 Fonte

Anthropic ha annunciato il ritiro del suo modello Claude Fable 5 per conformarsi a un'ingiunzione del governo statunitense. La decisione è legata alla scoperta di un metodo per "jailbreakare" il modello, sollevando questioni critiche sulla sicurezza e il controllo dei Large Language Models, particolarmente rilevanti per i deployment on-premise e la sovranità dei dati.

2026-06-13 Fonte

Un benchmark su GPU H100 (FP8) rivela che DiffusionGemma, pur essendo quattro volte più veloce del suo gemello autoregressivo Gemma4, commette sei volte più errori fattuali. L'analisi evidenzia un trade-off significativo tra velocità di generazione e accuratezza, con implicazioni dirette per i deployment on-premise dove la fedeltà dei dati è cruciale.

2026-06-13 Fonte

Una nuova metodologia di 'scaffold' ha permesso a modelli come Qwen-3.6-27B e Gemma-4-31B di superare Claude Mythos nell'ottimizzazione del codice e nella velocità di esecuzione. L'approccio, che richiede un aumento significativo della potenza di calcolo, affronta le limitazioni di ragionamento dei Large Language Models su contesti estesi attraverso un sistema di esplorazione ramificata e un 'solution pool' per evitare minimi locali.

2026-06-12 Fonte

Unsloth ha reso disponibile su Hugging Face il modello MiniMax M3 nel formato GGUF. Questa mossa sottolinea l'importanza crescente delle soluzioni ottimizzate per l'inference locale di Large Language Models, fornendo agli architetti di infrastrutture e ai responsabili DevOps uno strumento per deployment on-premise che privilegiano il controllo sui dati e l'efficienza delle risorse hardware.

2026-06-12 Fonte

OpenAI lancia tre nuovi corsi nell'ambito della sua Academy, pensati per sviluppare competenze pratiche nell'intelligenza artificiale. L'iniziativa mira a supportare professionisti e aziende nella creazione di workflow efficienti e nell'applicazione di agenti AI nelle operazioni quotidiane, un aspetto cruciale per chi gestisce carichi di lavoro AI, anche in contesti on-premise.

2026-06-12 Fonte

Sono stati rilasciati i pesi del modello MiniMax-M3 su Hugging Face, un Large Language Model che vanta circa 428 miliardi di parametri totali, di cui 23 miliardi attivati. Questa disponibilità offre nuove opportunità e sfide per le aziende che considerano deployment on-premise, richiedendo un'attenta valutazione dell'infrastruttura hardware necessaria per gestire carichi di lavoro di tale portata, bilanciando performance e TCO.

2026-06-12 Fonte

Anthropic ha rilasciato Claude Fable 5, una versione pubblica e controllata del suo modello Mythos, con l'obiettivo di impedire l'accesso ai laboratori AI cinesi. Questa decisione ha però generato critiche significative all'interno della stessa comunità o tra i partner dell'azienda, evidenziando le complessità delle politiche di accesso ai modelli avanzati. Il modello Mythos era stato precedentemente ritirato ad aprile.

2026-06-12 Fonte

Moonshot AI ha rilasciato Kimi K2.7 Code, un LLM agentico focalizzato sulla programmazione, evoluzione del precedente Kimi K2.6. Il modello introduce miglioramenti significativi nelle attività di coding complesse e a lungo termine, potenziando il completamento end-to-end dei workflow di ingegneria del software. Un aspetto chiave è l'ottimizzazione dell'efficienza dei token, con una riduzione di circa il 30% nell'uso dei “thinking-token”, un fattore cruciale per i deployment on-premise.

2026-06-12 Fonte

Huawei ha presentato openPangu 2.0, un Large Language Model open source profondamente ottimizzato per la propria architettura Ascend. Il modello, disponibile in due versioni con capacità di contesto di 512K token e un'elevata sparsità, promette miglioramenti significativi in throughput e latenza. L'iniziativa, che include il rilascio progressivo del codice di training e inference, riflette la strategia di Huawei di massimizzare l'efficienza computazionale e ridurre i costi per i deployment on-premise.

2026-06-12 Fonte

Preply, piattaforma di apprendimento linguistico, ha adottato le capacità di Large Language Models di OpenAI per arricchire la sua offerta. L'integrazione mira a personalizzare l'esperienza degli utenti, generando riassunti delle lezioni, fornendo feedback mirato e creando esercizi pratici. Questa strategia combina l'efficienza dell'intelligenza artificiale con l'interazione umana, offrendo un approccio ibrido all'istruzione.

2026-06-12 Fonte

Una nuova tecnica di compressione del contesto per i Large Language Models (LLM) promette di superare l'efficienza del tradizionale KV cache con un fattore di 16x. Questo progresso potrebbe ridurre significativamente i requisiti di VRAM, rendendo i deployment on-premise di LLM più accessibili ed economici, pur mantenendo la capacità di gestire finestre di contesto estese.

2026-06-12 Fonte

La selezione di Large Language Models (LLM) per la generazione di contenuti altamente specifici presenta notevoli sfide tecniche, in particolare per i deployment on-premise. Un utente ha evidenziato la difficoltà nel trovare modelli ottimizzati per 16GB di VRAM tramite Quantization, pur utilizzando con successo Cydonia 24B v4.3. La carenza di benchmark dedicati complica ulteriormente la scelta, sottolineando l'importanza di valutare attentamente i vincoli hardware e le tecniche di ottimizzazione per carichi di lavoro specializzati.

2026-06-12 Fonte

EDEN (Emergency Department Electronic Notes) è un nuovo corpus su larga scala di circa 4 milioni di note cliniche anonimizzate, provenienti dai pronto soccorso italiani. Include un sottoinsieme di 6.000 note annotate manualmente da esperti. Questo dataset, il più grande liberamente disponibile per l'italiano, mira a colmare il divario di dati per lo sviluppo e l'uso di Large Language Models in ambito medico, con un focus implicito sulla sovranità dei dati grazie all'anonimizzazione on-site.

2026-06-12 Fonte

OpenAI ha annunciato l'acquisizione di Ona, una mossa strategica volta a rafforzare e ampliare le capacità del suo modello Codex. L'obiettivo principale è lo sviluppo di "agenti persistenti", entità AI in grado di mantenere stato e memoria nel tempo, aprendo nuove frontiere per l'automazione e l'interazione complessa. Questa operazione sottolinea l'evoluzione verso sistemi AI più autonomi e capaci di gestire compiti di lunga durata.

2026-06-12 Fonte

Un recente intervento di Brendan O’Donoghue di Google DeepMind offre approfondimenti cruciali sui modelli di Text Diffusion. Pubblicato poco prima del rilascio di DiffusionGemma, il talk è ora considerato ancora più pertinente, fornendo risposte a interrogativi e chiarimenti sulle nuove capacità di generazione testuale. Un'analisi essenziale per chi segue gli sviluppi nel campo degli LLM e dell'AI generativa.

2026-06-12 Fonte

La community ha rilasciato nuove versioni dei modelli Gemma 4, spaziando da 12B a 31B parametri. Queste release includono varianti con Quantization Aware Training (QAT) a 4-bit e sono disponibili in formati ottimizzati come GGUF, Safetensors, NVFP4 e GPTQ-Int4. L'iniziativa, frutto di un notevole impegno, mira a offrire maggiore flessibilità per il deployment on-premise, consentendo agli sviluppatori di scegliere la configurazione più adatta alle proprie esigenze hardware e di performance, con un focus su modelli meno restrittivi.

2026-06-12 Fonte