📁 Hardware

Questa sezione Hardware segue il lato pratico dell'infrastruttura AI locale: GPU, NPU, mini PC, acceleratori edge, banda memoria e compromessi energetici che incidono direttamente sulle prestazioni in inferenza. Privilegiamo aggiornamenti con benchmark e note operative utili a decisioni reali, dal laboratorio domestico ai cluster pilota in azienda. Qui puoi confrontare costo totale, vincoli termici e scenari modello-hardware, poi approfondire con la guida pillar hardware e la copertura LLM collegata.

Alphabet starebbe lavorando a un chip personalizzato per migliorare l’efficienza di Gemini. La mossa segnala un’accelerazione verso hardware dedicato, con potenziali ripercussioni su consumi, costi operativi e strategie di deployment on-premise. L’analisi di AI-RADAR sulle implicazioni strutturali.

2026-07-20 Fonte

NInfer, un inference engine open source scritto da zero in C++/CUDA, raggiunge 543 token al secondo su Qwen3.6-35B-A3B con un prompt da 65mila token, tutto su una singola RTX 5090. Quantization su misura e ottimizzazioni hardware spingono le prestazioni molto oltre i motori generici, segnando un punto a favore del self-hosting su GPU consumer per carichi di lavoro che richiedono bassa latenza e sovranità sui dati.

2026-07-20 Fonte

AMD svela Helios, un rack con 72 acceleratori Instinct MI455X e 31 terabyte di memoria HBM4, capace di 2,9 exaflops in FP4. È il primo sistema AI su scala rack di AMD, diretto concorrente del Nvidia Vera Rubin NVL72. Un segnale di come il mercato si orienti verso super-computer on-premise con enormi dotazioni di memoria, cruciali per LLM self-hosted e sovranità dei dati.

2026-07-20 Fonte

Secondo diverse fonti, Google sta sviluppando un chip dove il modello Gemini è impresso direttamente nell'hardware, senza bisogno di essere caricato. Il nome informale "Frozen v2" suggerisce un design congelato e immutabile. L'approccio ASIC model-specific potrebbe abbattere i costi di inference, ma sacrifica ogni flessibilità. Quali scenari di deployment si aprono?

2026-07-20 Fonte

L’annuncio di Huahsu segnala una risposta concreta alle strozzature nella filiera dei chip AI. Mentre le GPU restano difficili da reperire, l’espansione del packaging avanzato rivela dinamiche strutturali: chi controlla l’assemblaggio 3D e l’integrazione HBM tiene in mano il rubinetto dell’inference on-premise e del training distribuito.

2026-07-20 Fonte

L'annuncio del nuovo modello Qwen3.8, ancora senza dettagli ufficiali, mette in guardia gli appassionati di LLM on-premise: la richiesta di memoria video potrebbe essere significativa. La scelta di Alibaba di spingere su una taglia intermedia riapre il dibattito su hardware e quantization per chi vuole mantenere il controllo totale dei dati senza passare per il cloud.

2026-07-19 Fonte

Uno studioso coreano indica nel modello foundry la via per superare i limiti della memoria nell’inference AI. La separazione tra progettazione e produzione consentirebbe chip di memoria specializzati, riducendo latenze e costi. Un cambio strutturale che avvantaggerebbe i deployment on-premise, dove il controllo sullo stack hardware è totale.

2026-07-19 Fonte