Topic / Trend Rising

Costi hardware AI e strategie sugli acceleratori

L'aumento dei prezzi delle GPU e la scarsità di schede economiche spingono i builder AI locali a ottimizzare l'hardware esistente, dal tuning RTX alla virtualizzazione ROCm di AMD e AVX-512 su EPYC. Anche i grandi cloud diversificano la fornitura di acceleratori con mosse su AMD e Marvell.

Detected: 2026-08-21 · Updated: 2026-08-21

Articoli Correlati

2026-08-20 LocalLLaMA

DeepSeek V4 Flash con 16 RTX 5060 Ti: la via noiosa a 140 token/s

Un costruttore ha validato una configurazione self-hosted con 16 RTX 5060 Ti da 16 GB, due switch Broadcom/PLX PEX88096 e una Xeon Gold 6330. Il sistema serve DeepSeek V4 Flash-0731 con contesto fino a 1 milione di token e, in una configurazione, gen...

#Hardware #LLM On-Premise #DevOps
2026-08-20 DigiTimes

Google allarga la filiera dei TPU: warrant Marvell fino al 2033

Il gigante di Mountain View ha legato a Marvell un warrant che matura fino all'anno fiscale 2033 e copre cinque categorie di chip. Il sourcing dei TPU si allarga oltre un singolo fornitore, segnale di una strategia multi-fornitore per gli accelerator...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-19 LocalLLaMA

Qwen3.8-27B locale: 218 token/s su due RTX 3090 con vLLM e DFlash2

Un test bare-metal con due RTX 3090, vLLM e decodifica speculativa DFlash2 porta Qwen3.8-27B a 218 token/s su singola richiesta, con prefill fino a 1342 token/s e contesto massimo di 131k. Il setup usa quantization INT4 AutoRound, 22,3 GB di VRAM per...

#Hardware #LLM On-Premise #DevOps
2026-08-18 Tom's Hardware

RTX 50, Hydra ora controlla VRAM e limiti di potenza fino a +3000 MHz

L’aggiornamento di Hydra introduce controlli su VRAM e limiti di potenza per le GPU RTX 50, con offset di memoria fino a +3000 MHz. Per chi esegue LLM in locale, la banda di memoria è spesso il collo di bottiglia: un controllo più fine promette margi...

#Hardware #LLM On-Premise #DevOps
2026-08-17 Phoronix

AMD lavora a un backend ROCm per il calcolo GPU virtualizzato in QEMU

Gli ingegneri AMD stanno sviluppando un backend per migliorare il supporto del calcolo GPU virtualizzato con ROCm sotto QEMU. La mossa punta a rendere più stabile l'uso di GPU AMD in macchine virtuali, un tema cruciale per infrastrutture on-premise e...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-17 Phoronix

KTransformers 0.7 espande AVX-512 e premia i server AMD EPYC

Il framework per LLM eterogenei KTransformers pubblica la versione 0.7 con supporto AVX-512 esteso, un intervento mirato sui server AMD EPYC. Per chi opera in self-hosted, il messaggio è strutturale: la CPU non è più un ripiego, ma una componente att...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-17 Tom's Hardware

GPU in salita: PC Partner avverte su prezzi e scarsità di schede economiche

PC Partner avverte che i prezzi delle GPU continueranno a salire e che le schede economiche scarseggeranno. Un analista suggerisce che i produttori stiano alzando i listini oltre l'aumento dei costi della memoria. Per chi valuta deployment on-premise...

#Hardware #LLM On-Premise #DevOps
2026-08-16 Tom's Hardware

Google potrebbe affidare ad AMD il design del prossimo TPU ibrido

Indiscrezioni indicano che Google starebbe collaborando con AMD per il design della prossima generazione di TPU, un ASIC ibrido che potrebbe integrare core CPU on-package per il reinforcement learning. Una mossa che ridisegna i rapporti nel silicio c...

#Hardware #LLM On-Premise #Fine-Tuning
← Torna ai Topic