Digest Settimanale Questa settimana

📖 AI-Radar · 2026-W30

20 July – 26 July 2026  ·  60 articoli pubblicati

📁 OnPremise 1

L’on-premise accelera mentre i modelli USA si blindano: sovranità e TCO ridisegnano la corsa AI

L’on-premise accelera mentre i modelli USA si blindano: sovranità e TCO ridisegnano la corsa AI

La chiusura dei modelli di frontiera americani non frena l’adozione dell’AI, ma la sposta su stack self-hosted. Aziende e istituzioni scelgono controllo, costi prevedibili e indipendenza dalle API. L’analisi AI-RADAR esplora come questo riequilibrio infrastrutturale stia ridefinendo hardware, framework e competenze, trasformando l’on-premise da eccezione a standard per chi tratta dati sensibili o opera a volumi elevati.

21 Jul

📁 LLM 9

RIMS: aggregazione morbida per piccoli LLM più precisi nel RAG rumoroso

RIMS: aggregazione morbida per piccoli LLM più precisi nel RAG rumoroso

Un nuovo framework chiamato RIMS migliora la robustezza dei piccoli LLM nel question answering con RAG. Invece di scartare le coppie di preferenze meno difficili, RIMS le aggrega con un operatore morbido, sfruttando tutti i segnali di addestramento. I dati sintetici vengono generati localmente senza modelli proprietari, e il metodo si applica a diversi algoritmi di allineamento. Su quattro benchmark multi-hop, RIMS supera le soluzioni esistenti con guadagni costanti in Exact Match e F1 in presenza di recupero rumoroso. Codice open source.

21 Jul #Hardware #LLM On-Premise #Fine-Tuning
Gli LLM non ereditano solo i nostri pregiudizi: ora li inventano da soli

Gli LLM non ereditano solo i nostri pregiudizi: ora li inventano da soli

Nuovi esperimenti mostrano che modelli come o3 e R1 sviluppano stereotipi occupazionali più forti degli umani già dopo poche assunzioni simulate. Il paradosso è che i modelli più potenti sono anche i più faziosi, e insegnargli a essere “giusti” non basta: serve un bonus per la diversità. Un campanello d’allarme per chi usa LLM nei processi decisionali, anche in house.

20 Jul #LLM On-Premise #Fine-Tuning #DevOps

📁 Altro 37

Il protocollo più importante per l'AI diventa più facile da usare

Il protocollo più importante per l'AI diventa più facile da usare

Il Model Context Protocol (MCP), lo standard che permette agli LLM di accedere a dati e servizi esterni in modo sicuro, sta per ricevere aggiornamenti che ne semplificano l’uso. Per chi gestisce deployment on-premise, la facilità di connessione apre scenari di integrazione rapida, ma impone nuove domande su sicurezza, controllo dei flussi di dati e sovranità. La sfida si sposta dal protocollo al sistema che lo governa.

20 Jul #Hardware #LLM On-Premise
Dimissioni al vertice dell’AI Safety Institute: nuova incertezza per chi sceglie il self-hosting

Dimissioni al vertice dell’AI Safety Institute: nuova incertezza per chi sceglie il self-hosting

La notizia delle dimissioni del direttore dell'agenzia federale per la sicurezza dell'AI apre scenari di instabilità normativa che toccano direttamente le aziende impegnate nel deployment on-premise. Fra sovranità dei dati, valutazione dei rischi e costi di compliance, il vuoto di leadership potrebbe rallentare gli standard, costringendo i decisori a rivedere le architetture locali in un framework regolatorio in evoluzione.

20 Jul #Hardware #LLM On-Premise #Fine-Tuning
Il drone militare ibrido-elettrico di Anduril e Archer segnala il futuro dell’AI on-premise in campo di battaglia

Il drone militare ibrido-elettrico di Anduril e Archer segnala il futuro dell’AI on-premise in campo di battaglia

Il velivolo autonomo Thunder, presentato al Farnborough Airshow, opera senza pilota e con un powertrain ibrido-elettrico. Oltre allo scossone nel settore della difesa, la piattaforma indica un’accelerazione verso sistemi di intelligenza artificiale completamente locali, progettati per decisioni critiche in assenza di connettività cloud, con vincoli severi di latenza, sicurezza e controllo dei dati.

20 Jul #Hardware #LLM On-Premise #Fine-Tuning
Adobe porta la critica AI sulla fotocamera: una scelta che riscrive il rapporto con la privacy

Adobe porta la critica AI sulla fotocamera: una scelta che riscrive il rapporto con la privacy

Il progetto Indigo di Adobe non si limita a rimuovere sfondi: ora valuta gli scatti con l’AI. Una mossa che sposta l’intelligenza artificiale dalla post-produzione al momento stesso della cattura, puntando sull’elaborazione locale per tutelare la riservatezza. L’analisi esplora le implicazioni per la privacy, il deployment on-device e il futuro degli strumenti creativi.

20 Jul #Hardware #LLM On-Premise #DevOps
Netflix: l’AI già in 300 show. Il regista di punta: «È un cavallo di Troia»

Netflix: l’AI già in 300 show. Il regista di punta: «È un cavallo di Troia»

Mentre Netflix sfrutta l’AI in 300 produzioni, il suo regista più celebre la definisce un cavallo di Troia. Lo scontro tra studio, regista e sindacato sull’uso dell’AI nella produzione mostra un’industria che l’ha già adottata. L’analisi: perché la metafora del Trojan rivela rischi strutturali per il controllo dei dati e spinge verso deployment self-hosted.

20 Jul #Hardware #LLM On-Premise #Fine-Tuning
Microsoft: screenshot bloccati per i PDF riservati, ma solo in Edge

Microsoft: screenshot bloccati per i PDF riservati, ma solo in Edge

Da aprile OneDrive e SharePoint impediranno le catture schermo sui PDF aziendali con etichetta Purview di protezione senza permesso Copy (EXTRACT). La restrizione scatterà solo in Microsoft Edge, lasciando fuori altri browser e i documenti non etichettati. Un tassello nella strategia di controllo dei dati, che solleva interrogativi sulla reale efficacia e sulla sovranità delle informazioni.

20 Jul #LLM On-Premise #DevOps #RAG
Agenti AI violati quattro volte in dieci giorni: dietro ogni attacco c’è la stessa fiducia malriposta

Agenti AI violati quattro volte in dieci giorni: dietro ogni attacco c’è la stessa fiducia malriposta

In meno di due settimane, quattro team hanno dimostrato attacchi riproducibili contro agenti LLM connessi a Gmail, calendari e strumenti aziendali. Il difetto comune non è tecnico ma architetturale: la cieca esecuzione di istruzioni in linguaggio naturale ricevute da fonti non attendibili. La corsa agli agenti autonomi urta contro un problema di sicurezza strutturale, con implicazioni profonde per chi valuta il deployment on‑premise e il controllo dei dati.

20 Jul #DevOps
Stop al copia-incolla su ChatGPT: il Parlamento europeo si costruisce la propria AI

Stop al copia-incolla su ChatGPT: il Parlamento europeo si costruisce la propria AI

I legislatori dell'UE continuano a usare chatbot pubblici per redigere leggi, con rischi per la privacy. Così l’istituzione lancia EPGenAI Hub, piattaforma interna con modelli approvati di Meta, OpenAI e Anthropic. Non una sostituzione umana, ma un controllo su un’abitudine ormai diffusa. L’obiettivo: mantenere sovranità sui dati, conformità GDPR e proteggere documenti sensibili senza rinunciare agli LLM. Una mossa che ridisegna il rapporto tra pubbliche amministrazioni e intelligenza artificiale.

20 Jul #LLM On-Premise #Fine-Tuning
Kimi K3 corregge 15 bug che Codex e Fable bloccano: il lato oscuro dei cyber guardrail

Kimi K3 corregge 15 bug che Codex e Fable bloccano: il lato oscuro dei cyber guardrail

Tre modelli, un paradosso: Kimi K3 ha risolto quindici vulnerabilità critiche che Codex e Fable hanno rifiutato adducendo guardrail di sicurezza. L’episodio, riecheggiato da Hugging Face, mostra come i vincoli imposti per proteggere i Large Language Models possano paralizzare i difensori mentre gli attaccanti restano liberi di agire. Una dinamica che ridefinisce le priorità per chi gestisce deployment self-hosted.

20 Jul #LLM On-Premise #DevOps
Il ritorno dei divieti sui modelli open-source stranieri: chi vince e chi perde

Il ritorno dei divieti sui modelli open-source stranieri: chi vince e chi perde

L'amministrazione Trump starebbe tentando di bandire di fatto i modelli open-source stranieri, mentre le LLM cinesi avanzano. Una scelta che rischia di frammentare l'ecosistema, spingere le aziende verso deployment on-premise air-gapped e ridefinire la domanda di hardware per inference locale. Il vero effetto strutturale: la sovranità tecnicica diventa un vantaggio competitivo.

20 Jul #Hardware #LLM On-Premise #Fine-Tuning
Firefox 153: decoding Vulkan e JPEG-XL sperimentale, novità per l'on-premise

Firefox 153: decoding Vulkan e JPEG-XL sperimentale, novità per l'on-premise

Mozilla ha pubblicato Firefox 153, nuova versione ESR. La release porta il supporto alla decodifica video Vulkan e il supporto sperimentale per il formato immagine JPEG-XL. Dietro la notizia, si nasconde un segnale importante per chi gestisce carichi di lavoro AI in locale: codec aperti e processing GPU senza vincoli di vendor facilitano pipeline di inference on-premise e archiviazione dati a basso costo.

20 Jul #Hardware #LLM On-Premise #Fine-Tuning
Perché Netflix condiziona la libertà nell'AI alla proprietà ferrea

Perché Netflix condiziona la libertà nell'AI alla proprietà ferrea

Elizabeth Stone, CPO di Netflix, afferma che densità di talento, titolarità chiara e feedback sincero contano più della rapidità nell'adozione dell'AI. Una scelta che riflette una tendenza strutturale nel mondo enterprise: la proprietà intellettuale e il controllo dei modelli diventano centrali, con effetti diretti sulle strategie di deployment on-premise e sulla sovranità dei dati.

20 Jul #Hardware #LLM On-Premise #Fine-Tuning

📁 Market 5

ASML verso il trilione? La vera scommessa è la fragilità della filiera on-premise

ASML verso il trilione? La vera scommessa è la fragilità della filiera on-premise

La capitalizzazione record di ASML non è solo un traguardo finanziario: è il riflesso di un collo di bottiglia hardware che condiziona ogni strategia di deployment locale degli LLM. Mentre l’intelligenza artificiale spinge la domanda di chip all’estremo, la dipendenza da pochi macchinari litografici solleva interrogativi strutturali per chi punta sulla sovranità dei dati.

20 Jul #Hardware #LLM On-Premise #DevOps

📁 Hardware 7

543 tok/s: un motore custom fa volare Qwen 35B su una sola RTX 5090

543 tok/s: un motore custom fa volare Qwen 35B su una sola RTX 5090

NInfer, un inference engine open source scritto da zero in C++/CUDA, raggiunge 543 token al secondo su Qwen3.6-35B-A3B con un prompt da 65mila token, tutto su una singola RTX 5090. Quantization su misura e ottimizzazioni hardware spingono le prestazioni molto oltre i motori generici, segnando un punto a favore del self-hosting su GPU consumer per carichi di lavoro che richiedono bassa latenza e sovranità sui dati.

20 Jul #Hardware #LLM On-Premise #DevOps

📁 Frameworks 1

← 2026-W29 Tutte le notizie