Topic / Trend Rising

Maturità dell'infrastruttura AI on-premise

L'ecosistema per l'inference locale sta maturando rapidamente tra hardware, software e ottimizzazione dei modelli, rendendo gli LLM self-hosted un'alternativa concreta alle API cloud.

Detected: 2026-07-24 · Updated: 2026-07-24

Articoli Correlati

2026-07-24 DigiTimes

AMD lancia ROCm.ai: l’inference per l’AI agentica accelera fino a 3.3x

AMD ha annunciato ROCm.ai, una piattaforma dedicata all’intelligenza artificiale agentica, promettendo guadagni in inference fino a 3.3x. L’iniziativa rafforza la strategia software dell’azienda in un settore sempre più orientato a deployment on‑prem...

#Hardware #LLM On-Premise #DevOps
2026-07-22 LocalLLaMA

Solar-Open2: l'LLM MoE a 15B attivi che punta ai carichi agentivi on-premise

Upstage rilascia Solar-Open2-250B, un modello open-weight pensato per flussi agentivi con architettura MoE ibrida: 250 miliardi di parametri totali, ma solo 15 miliardi attivi per token. Attenzione lineare e rimozione del positional encoding permetto...

#Hardware #LLM On-Premise #Fine-Tuning
2026-07-21 LocalLLaMA

Laguna-S-2.1: il 120B di Poolside e il fork su misura per llama.cpp

Poolside rilascia Laguna-S-2.1, un LLM da 120 miliardi di parametri, accompagnato da file GGUF e da un fork personalizzato di llama.cpp. Scelta inedita che accelera il deployment on-premise e abbassa la barriera per l’esecuzione locale di modelli di ...

#Hardware #LLM On-Premise #DevOps
2026-07-20 LocalLLaMA

543 tok/s: un motore custom fa volare Qwen 35B su una sola RTX 5090

NInfer, un inference engine open source scritto da zero in C++/CUDA, raggiunge 543 token al secondo su Qwen3.6-35B-A3B con un prompt da 65mila token, tutto su una singola RTX 5090. Quantization su misura e ottimizzazioni hardware spingono le prestazi...

#Hardware #LLM On-Premise #DevOps
2026-07-20 Phoronix

Linux ora scarica la rete direttamente su GPU AMD: arriva KNOD

Le patch spedite domenica abilitano lo scarico di rete nel kernel Linux con un driver diretto per GPU AMD, saltando le librerie utente come ROCm. Nessuna dipendenza esterna, tutto gestito in-kernel: un cambio di paradigma con implicazioni forti per c...

#Hardware #LLM On-Premise #DevOps
2026-07-20 Phoronix

AMD spinge AVX10_V2_AUX per GCC: l'AI on-premise passa dalla CPU

AMD segue Intel nell'integrare in GCC le estensioni AVX10_V2_AUX, progettate per accelerare carichi AI su CPU x86. Un passo che avvicina l'inference on-premise senza GPU, con vantaggi per sovranità dei dati e TCO.

#Hardware #LLM On-Premise
2026-07-18 LocalLLaMA

openPangu-2.0-Flash sbarca su ik_llama.cpp: 92B e contesto di 512K su CPU

Un modello a mistura di esperti da 92 miliardi di parametri con finestra contestuale di 512.000 token diventa eseguibile su CPU grazie all'integrazione nel runtime ik_llama.cpp. Una combinazione di tecniche come MLA-latent cache e attivazione seletti...

#Hardware #LLM On-Premise #DevOps
2026-07-18 LocalLLaMA

Qwen3.5 MoE vola su AMD grazie a FP4: 28 token/s e solo 60 GB di VRAM

Una build custom di llama.cpp con kernel ROCmFPX porta il modello Qwen3.5 da 122 miliardi di parametri su GPU AMD a 28.50 token al secondo, riducendo l’occupazione di memoria del 18% e accelerando l’inference del 37%. Un banco di prova per la fattibi...

#Hardware #LLM On-Premise #DevOps
2026-07-17 LocalLLaMA

Bonsai 27B su iPhone: LLM da 27B in 3,9GB con quantization a 1 bit

PrismML ha quantizzato il modello Qwen3.6-27B fino a 1 bit, portandolo da 54 GB a 3,9 GB. Bonsai 27B gira su un iPhone 15 Pro Max con 8 GB di RAM, mantenendo il ~90% delle prestazioni benchmark. La matematica regge, ma conoscenza e ragionamento calan...

#Hardware #LLM On-Premise #DevOps
← Torna ai Topic