Hardware per LLM Locali

Benchmark, guide alle GPU e build workstation per la sovranità dei dati.

> HARDWARE_PRIMER

Due numeri decidono quasi tutto nell'hardware per LLM locali: la VRAM (se il modello entra) e la banda di memoria (i tuoi token/sec — la generazione single-user fa scorrere l'intero modello nella GPU a ogni token, quindi i GB/s contano più dei TFLOPS). La regola pratica: VRAM ≈ parametri(B) × 0,55 × 1,15 a 4-bit — un 34B entra in una scheda da 24GB, un 70B vuole 48GB. I contesti lunghi aggiungono la KV-cache, che a 100k+ token può rivaleggiare coi pesi.

Le fasce pratiche: 24GB (RTX 3090 usata / 4090 — il punto di valore, esegue 7–34B), 32GB (RTX 5090 — l'inferenza consumer più veloce), 48GB (classe RTX A6000 o doppia 24GB — la fascia dei 70B), 80GB+ (schede datacenter — contesto lungo, 8-bit, training). Apple Silicon gioca un'altra partita: un'enorme memoria unificata contiene modelli che nessuna GPU consumer regge, a velocità inferiori.

Riferimenti approfonditi: guida all'acquisto GPU · matematica del sizing VRAM · Hardware Matrix · quantizzazione. Qui sotto: l'ultima intelligence hardware dal radar.

Frameworks
FastFlowLM 1.0: AMD unifica l’AI su NPU sotto l’ombrello ROCm

FastFlowLM 1.0: AMD unifica l’AI su NPU sotto l’ombrello ROCm

FastFlowLM 1.0, il software open-source per eseguire modelli linguistici e multimodali sulle NPU dei processori Ryzen AI, entra ufficialmente...

2026-08-11 READ_MORE >
LLM
Luth-2, i piccoli LLM francesi che surclassano modelli tre volte più grandi

Luth-2, i piccoli LLM francesi che surclassano modelli tre volte più grandi

I nuovi Luth-2-0.8B e 2B fissano lo stato dell’arte per il francese, battendo modelli fino a tre volte più grandi in benchmark linguistici e...

2026-08-11 READ_MORE >
Frameworks
Fuzzing adattivo svela le crepe delle MLLM: perché l’allucinazione resiste ai benchmark statici

Fuzzing adattivo svela le crepe delle MLLM: perché l’allucinazione resiste ai benchmark statici

Un nuovo framework di valutazione combina un benchmark a tassonomia unificata con un fuzzing multi-modale auto-adattivo (SAMF) e mostra che i...

2026-08-11 READ_MORE >
LLM
Addestrare un LLM da 1B con 200$: la frontiera del self-hosted accessibile

Addestrare un LLM da 1B con 200$: la frontiera del self-hosted accessibile

Un progetto personale mostra come addestrare da zero un modello linguistico da 1,1 miliardi di parametri su 20 miliardi di token con una spesa...

2026-08-11 READ_MORE >
Hardware
Linux: il driver open-source NVIDIA ‘Nova’ guadagna funzionalità con Rust

Linux: il driver open-source NVIDIA ‘Nova’ guadagna funzionalità con Rust

Il driver DRM Nova, successore di Nouveau, riceve nuove funzionalità per il kernel Linux 7.3. Scritto in Rust, punta a offrire un supporto...

2026-08-11 READ_MORE >
Altro
Fedora CoreOS attiva systemd-oomd e swap su zRAM: un segnale per chi fa inference on-premise

Fedora CoreOS attiva systemd-oomd e swap su zRAM: un segnale per chi fa inference on-premise

A partire dalla release 45, il sistema container-optimized di Fedora gestirà in automatico la pressione di memoria con systemd-oomd e swap...

2026-08-10 READ_MORE >
Altro
Ling-3.0-tiny: 8B parametri, 1.3B attivi e inference a 100 token/s sul MacBook

Ling-3.0-tiny: 8B parametri, 1.3B attivi e inference a 100 token/s sul MacBook

InclusionAI rilascia Ling-3.0-tiny, un MoE da 8 miliardi di parametri (soli 1,3 attivi) che raggiunge 100-105 token/s su DGX Spark e 86-90 su...

2026-08-10 READ_MORE >
Altro
Agenti AI on-device: Meta porta Muse Glimmer su ExecuTorch con decoding speculativo e 128K contesto

Agenti AI on-device: Meta porta Muse Glimmer su ExecuTorch con decoding speculativo e 128K contesto

Meta rilascia Muse Glimmer, modello da 30 miliardi di parametri ottimizzato per flussi agentici on-device. ExecuTorch ora supporta l'inference su...

2026-08-10 READ_MORE >
LLM
Muse-Glimmer-30B in GGUF: l'ultimo tassello di un ecosistema locale sempre più maturo

Muse-Glimmer-30B in GGUF: l'ultimo tassello di un ecosistema locale sempre più maturo

L'arrivo di Muse-Glimmer-30B nel formato GGUF non è solo il rilascio di un modello. È il segnale di un'infrastruttura di inference locale che si...

2026-08-10 READ_MORE >
LLM
Meta Muse Glimmer: agenti AI locali su GPU consumer, il nuovo modello da 30 miliardi di parametri

Meta Muse Glimmer: agenti AI locali su GPU consumer, il nuovo modello da 30 miliardi di parametri

Meta rilascia Muse Glimmer, LLM da 30 miliardi di parametri con licenza Apache 2.0, ottimizzato per agenti AI su GPU consumer. Con quantization a...

2026-08-10 READ_MORE >
LLM
Muse Glimmer di Meta: l'agente locale open-weight da 30B che sfida il cloud

Muse Glimmer di Meta: l'agente locale open-weight da 30B che sfida il cloud

Meta rilascia Muse Glimmer, un modello da 30 miliardi di parametri con licenza Apache 2.0, ottimizzato per flussi di lavoro agentici sempre attivi...

2026-08-10 READ_MORE >
Altro
Linux 7.3 elimina i driver SGI: sicurezza e rumore degli agenti AI spingono la potatura del kernel

Linux 7.3 elimina i driver SGI: sicurezza e rumore degli agenti AI spingono la potatura del kernel

L'ultima release del kernel non è solo una pulizia: la rimozione dei driver per vecchie schede Silicon Graphics, accompagnata dall'ondata di patch...

2026-08-10 READ_MORE >
Altro
Niente cloud, solo edge: Edgify alza 9 milioni per l’AI che impara sui dispositivi

Niente cloud, solo edge: Edgify alza 9 milioni per l’AI che impara sui dispositivi

La startup israeliana chiude un round Serie A+ per espandere la sua piattaforma di AI edge dalla grande distribuzione a ristorazione rapida e...

2026-08-10 READ_MORE >
LLM
TEXAS usa il routing nativo dei MoE per un fine-tuning più chirurgico

TEXAS usa il routing nativo dei MoE per un fine-tuning più chirurgico

Un nuovo approccio chiamato TEXAS sfrutta il modo in cui i modelli a mistura di esperti attivano i sotto-modelli per guidare l'addestramento,...

2026-08-10 READ_MORE >
LLM
La verità è un vettore: individuare fake news senza uscire dal modello

La verità è un vettore: individuare fake news senza uscire dal modello

Un team di ricerca sfrutta l’activation engineering per estrarre una direzione della menzogna nello spazio latente dei transformer. Senza...

2026-08-10 READ_MORE >
Hardware
WeatherNext 2: DeepMind porta le previsioni dei cicloni su una singola GPU H100

WeatherNext 2: DeepMind porta le previsioni dei cicloni su una singola GPU H100

Un modello aperto di DeepMind, pubblicato su Nature, migliora le previsioni dei cicloni con un giorno di anticipo, ma la vera sorpresa è che gira...

2026-08-09 READ_MORE >
LLM
BDH: scalabilità GPT-2 su GPU normali, la sfida post-transformer di Pathway

BDH: scalabilità GPT-2 su GPU normali, la sfida post-transformer di Pathway

Pathway presenta BDH, un'architettura post-transformer che eguaglia le prestazioni di GPT-2 da 10 milioni a 1 miliardo di parametri, addestrandosi...

2026-08-09 READ_MORE >
Frameworks
DGX Spark: due flag portano Ling-3.0-flash da 20.8 a 38.7 tok/s

DGX Spark: due flag portano Ling-3.0-flash da 20.8 a 38.7 tok/s

L'INT4 ufficiale di Ling-3.0-flash gira su una DGX Spark, ma con configurazione predefinita eroga 20.8 tok/s. Due interventi — disabilitare...

2026-08-09 READ_MORE >
Frameworks
Lophius: il workbench per l’esplorazione dei trasformer che viene dal creatore di Heretic

Lophius: il workbench per l’esplorazione dei trasformer che viene dal creatore di Heretic

Rilasciato dopo due anni di sviluppo, un ambiente ibrido codice/GUI dentro i notebook per ispezionare modelli, gestire prompt, analizzare logit,...

2026-08-09 READ_MORE >
Hardware
Die nudo e blocco 3D: RTX 2060 Super a 28°C sotto carico

Die nudo e blocco 3D: RTX 2060 Super a 28°C sotto carico

Un modder ha portato il raffreddamento a liquido direttamente sul silicio di una RTX 2060 Super con un blocco stampato in 3D. Nonostante perdite...

2026-08-09 READ_MORE >
Altro
Meetily trascrive e riassume riunioni senza abbonamento, open source. Ecco come

Meetily trascrive e riassume riunioni senza abbonamento, open source. Ecco come

Un’alternativa gratuita e open source ai servizi di trascrizione a pagamento: Meetily registra e trascrive le riunioni in locale, senza mandare...

2026-08-09 READ_MORE >
Altro
Quando l’AI scrive i driver: DeepSeek genera il kernel Metal per Kimi K2 su Mac

Quando l’AI scrive i driver: DeepSeek genera il kernel Metal per Kimi K2 su Mac

In 50 minuti un LLM ha scritto il codice per eseguire un modello quantizzato da 90 GB su un Mac Studio, senza kernel preesistenti. Prestazioni...

2026-08-09 READ_MORE >
LLM
Kimi K3 scende a 478 GB: la sforbiciata multilingua che cambia i conti dell’on-premise

Kimi K3 scende a 478 GB: la sforbiciata multilingua che cambia i conti dell’on-premise

Un utente Hugging Face ha pubblicato una versione quantizzata di Kimi K3 che elimina il multilingua e applica IQ2-XXS via Unsloth, riducendo lo...

2026-08-09 READ_MORE >
Frameworks
BitNet a 36 tok/s su Xeon: zero dipendenze, tutto C, e il soffitto della DRAM

BitNet a 36 tok/s su Xeon: zero dipendenze, tutto C, e il soffitto della DRAM

Un motore di inference in C99 senza dipendenze esterne spinge il modello ternario BitNet da 2 miliardi di parametri a 36,25 token al secondo su...

2026-08-08 READ_MORE >
Altro
Kimi K3 in locale: cluster, quantization spinta e la fede nei modelli piccoli

Kimi K3 in locale: cluster, quantization spinta e la fede nei modelli piccoli

Un utente esegue Kimi K3 su due cluster con llama.cpp e RPC, ricorrendo a offloading parziale e quantization IQ1_M. L’obiettivo? Accelerare del...

2026-08-08 READ_MORE >
Frameworks
Minimalismo radicale: un agente di coding in 9 righe Python e zero dipendenze

Minimalismo radicale: un agente di coding in 9 righe Python e zero dipendenze

Un esperimento open source mostra un agente di coding essenziale: 9 righe di Python, solo standard library, nessuna dipendenza esterna. Funziona...

2026-08-08 READ_MORE >
Altro
Qwen3.6 27B e 35B su singola Radeon R9700: l'inference locale si fa estrema

Qwen3.6 27B e 35B su singola Radeon R9700: l'inference locale si fa estrema

Un utente spinge al limite una Radeon AI Pro R9700 da 32 GB con i modelli Qwen3.6 ridotti a INT4. Il 35B MoE tocca 262mila token di contesto e 52...

2026-08-08 READ_MORE >
Altro
HWMON: i bug critici in Linux 7.2-rc7 trovati da un agente LLM

HWMON: i bug critici in Linux 7.2-rc7 trovati da un agente LLM

La release 7.2-rc7 del kernel Linux porta con sé decine di correzioni al sottosistema di monitoraggio hardware, per lo più bug critici o ad alta...

2026-08-08 READ_MORE >
LLM
L’eccitazione per Qwen 3.8: il futuro degli LLM domestici accelera

L’eccitazione per Qwen 3.8: il futuro degli LLM domestici accelera

Un utente racconta l’esperienza con Qwen 3.6 27B in Q4 su un Apple M5, immaginando un futuro in cui ogni query passa prima dal proprio LLM locale....

2026-08-08 READ_MORE >
Altro
MoE vs denso: Qwen 35B-A3B vola a 116 tok/s su GPU AMD, il gap qualitativo sorprende

MoE vs denso: Qwen 35B-A3B vola a 116 tok/s su GPU AMD, il gap qualitativo sorprende

Un test locale su hardware AMD mette a confronto Qwen 35B-A3B (MoE, 3B parametri attivi) e Qwen 27B denso. Il modello MoE genera ~116 token/s...

2026-08-08 READ_MORE >

Cerchi notizie generali sull'AI?

< AI-RADAR MAIN