Topic / Trend Rising

AI On-Premise e Sovranità Digitale

Crescente spostamento verso il deployment locale dei modelli di AI per motivi di costi, controllo dei dati e affidabilità. Aziende dalla sanità all'aerospazio portano i carichi di lavoro on-premise per evitare il lock-in dei fornitori cloud e garantire conformità.

Detected: 2026-07-23 · Updated: 2026-07-23

Articoli Correlati

2026-07-22 LocalLLaMA

Solar-Open2: l'LLM MoE a 15B attivi che punta ai carichi agentivi on-premise

Upstage rilascia Solar-Open2-250B, un modello open-weight pensato per flussi agentivi con architettura MoE ibrida: 250 miliardi di parametri totali, ma solo 15 miliardi attivi per token. Attenzione lineare e rimozione del positional encoding permetto...

#Hardware #LLM On-Premise #Fine-Tuning
2026-07-22 LocalLLaMA

Unsloth quantizza Laguna S 2.1: un altro passo verso l’AI on-premise

Il team Unsloth annuncia su Reddit la disponibilità di varie quantization per Laguna S 2.1. Il processo di compressione riduce il fabbisogno di VRAM e facilita l’esecuzione in locale, accelerando l’adozione di LLM self-hosted per esigenze di sovranit...

#Hardware #LLM On-Premise #Fine-Tuning
2026-07-21 LocalLLaMA

Laguna-S-2.1: il 120B di Poolside e il fork su misura per llama.cpp

Poolside rilascia Laguna-S-2.1, un LLM da 120 miliardi di parametri, accompagnato da file GGUF e da un fork personalizzato di llama.cpp. Scelta inedita che accelera il deployment on-premise e abbassa la barriera per l’esecuzione locale di modelli di ...

#Hardware #LLM On-Premise #DevOps
2026-07-20 LocalLLaMA

543 tok/s: un motore custom fa volare Qwen 35B su una sola RTX 5090

NInfer, un inference engine open source scritto da zero in C++/CUDA, raggiunge 543 token al secondo su Qwen3.6-35B-A3B con un prompt da 65mila token, tutto su una singola RTX 5090. Quantization su misura e ottimizzazioni hardware spingono le prestazi...

#Hardware #LLM On-Premise #DevOps
2026-07-20 Phoronix

Linux ora scarica la rete direttamente su GPU AMD: arriva KNOD

Le patch spedite domenica abilitano lo scarico di rete nel kernel Linux con un driver diretto per GPU AMD, saltando le librerie utente come ROCm. Nessuna dipendenza esterna, tutto gestito in-kernel: un cambio di paradigma con implicazioni forti per c...

#Hardware #LLM On-Premise #DevOps
2026-07-20 Phoronix

Firefox 153: decoding Vulkan e JPEG-XL sperimentale, novità per l'on-premise

Mozilla ha pubblicato Firefox 153, nuova versione ESR. La release porta il supporto alla decodifica video Vulkan e il supporto sperimentale per il formato immagine JPEG-XL. Dietro la notizia, si nasconde un segnale importante per chi gestisce carichi...

#Hardware #LLM On-Premise #Fine-Tuning
2026-07-20 Tech in Asia

Perché Netflix condiziona la libertà nell'AI alla proprietà ferrea

Elizabeth Stone, CPO di Netflix, afferma che densità di talento, titolarità chiara e feedback sincero contano più della rapidità nell'adozione dell'AI. Una scelta che riflette una tendenza strutturale nel mondo enterprise: la proprietà intellettuale ...

#Hardware #LLM On-Premise #Fine-Tuning
2026-07-20 Phoronix

AMD spinge AVX10_V2_AUX per GCC: l'AI on-premise passa dalla CPU

AMD segue Intel nell'integrare in GCC le estensioni AVX10_V2_AUX, progettate per accelerare carichi AI su CPU x86. Un passo che avvicina l'inference on-premise senza GPU, con vantaggi per sovranità dei dati e TCO.

#Hardware #LLM On-Premise
2026-07-20 The Next Web

CFO britannici fiduciosi nell'AI: la prudenza spinge verso l’on-premise

Il 73% dei direttori finanziari delle grandi aziende UK ora crede che l’AI migliorerà le performance, contro il 59% di fine 2025. Un’ondata di ottimismo che, filtrata dalla storica prudenza della categoria, disegna scenari concreti per il deployment ...

#Hardware #LLM On-Premise #Fine-Tuning
2026-07-20 DigiTimes

Apple contro OpenAI: la privacy come arma, ma l’arbitro è Trump

Una causa legale tra Apple e OpenAI riaccende lo scontro tra cloud e on-device. Mentre Cupertino rivendica la sovranità sul dato, l’ombra di un possibile ritorno di Trump impone alle aziende di ripensare i confini dell’inference. Per chi gestisce LLM...

#Hardware #LLM On-Premise #Fine-Tuning
2026-07-19 LocalLLaMA

Moonshot AI finisce le GPU: il segnale che il cloud non basta più

La cinese Moonshot AI blocca nuovi abbonamenti e cancella l’accesso gratuito per saturazione di GPU. Un caso che mostra i limiti dell’on-demand e riaccende il dibattito su infrastrutture dedicate, vincoli geopolitici e strategie di deployment.

#Hardware #LLM On-Premise #Fine-Tuning
2026-07-19 LocalLLaMA

Qwen, la comunità vuole un MoE da 100B per l’inference on-prem

Un post su Reddit chiede al team Qwen di rilasciare un modello Mixture of Experts da 100 miliardi di parametri eseguibile su “Spark”. Dietro la richiesta c’è la spinta verso LLM sempre più capaci su hardware consumer, un trend che rimodella l’equilib...

#Hardware #LLM On-Premise #DevOps
2026-07-19 LocalLLaMA

Qwen, la community vuole più 35B-a3B: il segnale per il self-hosting

Un post su Reddit chiede al team Qwen nuove versioni del modello 35B-A3B. Dietro l'appello c'è una fame di architetture MoE con pochi parametri attivi, ideali per l'inference on-premise. Il caso segnala uno spostamento strutturale verso modelli capac...

#Hardware #LLM On-Premise #DevOps
2026-07-19 LocalLLaMA

Qwen3.8 all'orizzonte: preparate la VRAM, l'inference locale si scalda

L'annuncio del nuovo modello Qwen3.8, ancora senza dettagli ufficiali, mette in guardia gli appassionati di LLM on-premise: la richiesta di memoria video potrebbe essere significativa. La scelta di Alibaba di spingere su una taglia intermedia riapre ...

#Hardware #LLM On-Premise
2026-07-19 LocalLLaMA

Qwen accelera ancora: cosa significa per chi distribuisce LLM on-premise

Alibaba Qwen torna a far parlare di sé con un nuovo teaser. Il timing non è casuale: la sequenza di rilasci open-weight del team cinese sta ridisegnando gli equilibri dell'inference self-hosted, aprendo spazi per chi cerca sovranità dei dati al di fu...

#Hardware #LLM On-Premise #Fine-Tuning
2026-07-19 LocalLLaMA

La corsa agli hard disk per mettere in salvo i modelli aperti

Una domanda su Reddit rivela un fenomeno sommerso: professionisti e aziende accumulano copie locali dei migliori LLM aperti su capienti HDD. Non è nostalgia del vintage, ma un calcolo di sovranità digitale e resilienza operativa, di fronte all'incert...

#Hardware #LLM On-Premise #Fine-Tuning
2026-07-18 LocalLLaMA

openPangu-2.0-Flash sbarca su ik_llama.cpp: 92B e contesto di 512K su CPU

Un modello a mistura di esperti da 92 miliardi di parametri con finestra contestuale di 512.000 token diventa eseguibile su CPU grazie all'integrazione nel runtime ik_llama.cpp. Una combinazione di tecniche come MLA-latent cache e attivazione seletti...

#Hardware #LLM On-Premise #DevOps
2026-07-18 The Next Web

Raidium: l'AI-native che ridisegna la radiologia e punta sull'on-premise

La startup franco-siliconvalleyana Raidium ha portato la sua piattaforma di imaging AI-native al Moffitt Cancer Center, sostituendo le applicazioni radiomiche legacy. Un segnale forte sul futuro del deployment dell'AI in ambito clinico.

#Hardware #LLM On-Premise #DevOps
2026-07-18 LocalLLaMA

Qwen3.5 MoE vola su AMD grazie a FP4: 28 token/s e solo 60 GB di VRAM

Una build custom di llama.cpp con kernel ROCmFPX porta il modello Qwen3.5 da 122 miliardi di parametri su GPU AMD a 28.50 token al secondo, riducendo l’occupazione di memoria del 18% e accelerando l’inference del 37%. Un banco di prova per la fattibi...

#Hardware #LLM On-Premise #DevOps
2026-07-17 LocalLLaMA

Bonsai 27B su iPhone: LLM da 27B in 3,9GB con quantization a 1 bit

PrismML ha quantizzato il modello Qwen3.6-27B fino a 1 bit, portandolo da 54 GB a 3,9 GB. Bonsai 27B gira su un iPhone 15 Pro Max con 8 GB di RAM, mantenendo il ~90% delle prestazioni benchmark. La matematica regge, ma conoscenza e ragionamento calan...

#Hardware #LLM On-Premise #DevOps
2026-07-17 LocalLLaMA

Soofi S 30B-A3B, l’LLM europeo che punta sull’inference locale

Spunta nei forum un nuovo modello linguistico europeo e open source: Soofi S 30B-A3B. Con 3 miliardi di parametri attivi su un totale di 30, promette esecuzione locale a basso consumo di VRAM, affiancato da anteprime con capacità di ragionamento. Il ...

#Hardware #LLM On-Premise #Fine-Tuning
2026-07-17 Tom's Hardware

Intel Nova Lake: 52 core su desktop nel 2027, cosa cambia per l’AI on-premise

Un leak anticipa la strategia Intel per Nova Lake: Core Ultra Series 400 e un chip desktop da 52 core solo nel tardo 2027. Per chi punta sull’inference locale, l’aumento dei core sfida il monopolio GPU e rilancia il calcolo CPU per LLM, con vantaggi ...

#Hardware #LLM On-Premise #Fine-Tuning
2026-07-16 TechCrunch AI

Google Vids: l’AI ti dà un avatar, ma il prezzo è la sovranità dei dati

Google integra avatar AI personalizzati in Vids grazie a Gemini Omni. Gli utenti possono creare video interpretati da una versione digitale di sé, usando prompt e immagini. La novità alza il livello per il settore, ma rafforza la dipendenza dal cloud...

#Hardware #LLM On-Premise #DevOps
2026-07-16 The Next Web

WAICO: la governance globale dell’IA spinge verso il controllo on-premise

29 paesi hanno firmato il trattato per istituire la World AI Cooperation Organization. L’accordo prevede cooperazione e governance globale sull’intelligenza artificiale. Dietro l’annuncio diplomatico si cela una partita cruciale per la sovranità dei ...

#Hardware #LLM On-Premise #Fine-Tuning
← Torna ai Topic