Hardware per LLM Locali
Benchmark, guide alle GPU e build workstation per la sovranità dei dati.
Due numeri decidono quasi tutto nell'hardware per LLM locali: la VRAM (se il modello entra)
e la banda di memoria (i tuoi token/sec — la generazione single-user fa scorrere l'intero modello nella GPU
a ogni token, quindi i GB/s contano più dei TFLOPS). La regola pratica:
VRAM ≈ parametri(B) × 0,55 × 1,15 a 4-bit — un 34B entra in una scheda da 24GB, un 70B vuole 48GB.
I contesti lunghi aggiungono la KV-cache, che a 100k+ token può rivaleggiare coi pesi.
Le fasce pratiche: 24GB (RTX 3090 usata / 4090 — il punto di valore, esegue 7–34B), 32GB (RTX 5090 — l'inferenza consumer più veloce), 48GB (classe RTX A6000 o doppia 24GB — la fascia dei 70B), 80GB+ (schede datacenter — contesto lungo, 8-bit, training). Apple Silicon gioca un'altra partita: un'enorme memoria unificata contiene modelli che nessuna GPU consumer regge, a velocità inferiori.
Riferimenti approfonditi: guida all'acquisto GPU · matematica del sizing VRAM · Hardware Matrix · quantizzazione. Qui sotto: l'ultima intelligence hardware dal radar.
FastFlowLM 1.0: AMD unifica l’AI su NPU sotto l’ombrello ROCm
FastFlowLM 1.0, il software open-source per eseguire modelli linguistici e multimodali sulle NPU dei processori Ryzen AI, entra ufficialmente...
Luth-2, i piccoli LLM francesi che surclassano modelli tre volte più grandi
I nuovi Luth-2-0.8B e 2B fissano lo stato dell’arte per il francese, battendo modelli fino a tre volte più grandi in benchmark linguistici e...
Fuzzing adattivo svela le crepe delle MLLM: perché l’allucinazione resiste ai benchmark statici
Un nuovo framework di valutazione combina un benchmark a tassonomia unificata con un fuzzing multi-modale auto-adattivo (SAMF) e mostra che i...
Addestrare un LLM da 1B con 200$: la frontiera del self-hosted accessibile
Un progetto personale mostra come addestrare da zero un modello linguistico da 1,1 miliardi di parametri su 20 miliardi di token con una spesa...
Linux: il driver open-source NVIDIA ‘Nova’ guadagna funzionalità con Rust
Il driver DRM Nova, successore di Nouveau, riceve nuove funzionalità per il kernel Linux 7.3. Scritto in Rust, punta a offrire un supporto...
Fedora CoreOS attiva systemd-oomd e swap su zRAM: un segnale per chi fa inference on-premise
A partire dalla release 45, il sistema container-optimized di Fedora gestirà in automatico la pressione di memoria con systemd-oomd e swap...
Ling-3.0-tiny: 8B parametri, 1.3B attivi e inference a 100 token/s sul MacBook
InclusionAI rilascia Ling-3.0-tiny, un MoE da 8 miliardi di parametri (soli 1,3 attivi) che raggiunge 100-105 token/s su DGX Spark e 86-90 su...
Agenti AI on-device: Meta porta Muse Glimmer su ExecuTorch con decoding speculativo e 128K contesto
Meta rilascia Muse Glimmer, modello da 30 miliardi di parametri ottimizzato per flussi agentici on-device. ExecuTorch ora supporta l'inference su...
Muse-Glimmer-30B in GGUF: l'ultimo tassello di un ecosistema locale sempre più maturo
L'arrivo di Muse-Glimmer-30B nel formato GGUF non è solo il rilascio di un modello. È il segnale di un'infrastruttura di inference locale che si...
Meta Muse Glimmer: agenti AI locali su GPU consumer, il nuovo modello da 30 miliardi di parametri
Meta rilascia Muse Glimmer, LLM da 30 miliardi di parametri con licenza Apache 2.0, ottimizzato per agenti AI su GPU consumer. Con quantization a...
Muse Glimmer di Meta: l'agente locale open-weight da 30B che sfida il cloud
Meta rilascia Muse Glimmer, un modello da 30 miliardi di parametri con licenza Apache 2.0, ottimizzato per flussi di lavoro agentici sempre attivi...
Linux 7.3 elimina i driver SGI: sicurezza e rumore degli agenti AI spingono la potatura del kernel
L'ultima release del kernel non è solo una pulizia: la rimozione dei driver per vecchie schede Silicon Graphics, accompagnata dall'ondata di patch...
Niente cloud, solo edge: Edgify alza 9 milioni per l’AI che impara sui dispositivi
La startup israeliana chiude un round Serie A+ per espandere la sua piattaforma di AI edge dalla grande distribuzione a ristorazione rapida e...
TEXAS usa il routing nativo dei MoE per un fine-tuning più chirurgico
Un nuovo approccio chiamato TEXAS sfrutta il modo in cui i modelli a mistura di esperti attivano i sotto-modelli per guidare l'addestramento,...
La verità è un vettore: individuare fake news senza uscire dal modello
Un team di ricerca sfrutta l’activation engineering per estrarre una direzione della menzogna nello spazio latente dei transformer. Senza...
WeatherNext 2: DeepMind porta le previsioni dei cicloni su una singola GPU H100
Un modello aperto di DeepMind, pubblicato su Nature, migliora le previsioni dei cicloni con un giorno di anticipo, ma la vera sorpresa è che gira...
BDH: scalabilità GPT-2 su GPU normali, la sfida post-transformer di Pathway
Pathway presenta BDH, un'architettura post-transformer che eguaglia le prestazioni di GPT-2 da 10 milioni a 1 miliardo di parametri, addestrandosi...
DGX Spark: due flag portano Ling-3.0-flash da 20.8 a 38.7 tok/s
L'INT4 ufficiale di Ling-3.0-flash gira su una DGX Spark, ma con configurazione predefinita eroga 20.8 tok/s. Due interventi — disabilitare...
Lophius: il workbench per l’esplorazione dei trasformer che viene dal creatore di Heretic
Rilasciato dopo due anni di sviluppo, un ambiente ibrido codice/GUI dentro i notebook per ispezionare modelli, gestire prompt, analizzare logit,...
Die nudo e blocco 3D: RTX 2060 Super a 28°C sotto carico
Un modder ha portato il raffreddamento a liquido direttamente sul silicio di una RTX 2060 Super con un blocco stampato in 3D. Nonostante perdite...
Meetily trascrive e riassume riunioni senza abbonamento, open source. Ecco come
Un’alternativa gratuita e open source ai servizi di trascrizione a pagamento: Meetily registra e trascrive le riunioni in locale, senza mandare...
Quando l’AI scrive i driver: DeepSeek genera il kernel Metal per Kimi K2 su Mac
In 50 minuti un LLM ha scritto il codice per eseguire un modello quantizzato da 90 GB su un Mac Studio, senza kernel preesistenti. Prestazioni...
Kimi K3 scende a 478 GB: la sforbiciata multilingua che cambia i conti dell’on-premise
Un utente Hugging Face ha pubblicato una versione quantizzata di Kimi K3 che elimina il multilingua e applica IQ2-XXS via Unsloth, riducendo lo...
BitNet a 36 tok/s su Xeon: zero dipendenze, tutto C, e il soffitto della DRAM
Un motore di inference in C99 senza dipendenze esterne spinge il modello ternario BitNet da 2 miliardi di parametri a 36,25 token al secondo su...
Kimi K3 in locale: cluster, quantization spinta e la fede nei modelli piccoli
Un utente esegue Kimi K3 su due cluster con llama.cpp e RPC, ricorrendo a offloading parziale e quantization IQ1_M. L’obiettivo? Accelerare del...
Minimalismo radicale: un agente di coding in 9 righe Python e zero dipendenze
Un esperimento open source mostra un agente di coding essenziale: 9 righe di Python, solo standard library, nessuna dipendenza esterna. Funziona...
Qwen3.6 27B e 35B su singola Radeon R9700: l'inference locale si fa estrema
Un utente spinge al limite una Radeon AI Pro R9700 da 32 GB con i modelli Qwen3.6 ridotti a INT4. Il 35B MoE tocca 262mila token di contesto e 52...
HWMON: i bug critici in Linux 7.2-rc7 trovati da un agente LLM
La release 7.2-rc7 del kernel Linux porta con sé decine di correzioni al sottosistema di monitoraggio hardware, per lo più bug critici o ad alta...
L’eccitazione per Qwen 3.8: il futuro degli LLM domestici accelera
Un utente racconta l’esperienza con Qwen 3.6 27B in Q4 su un Apple M5, immaginando un futuro in cui ogni query passa prima dal proprio LLM locale....
MoE vs denso: Qwen 35B-A3B vola a 116 tok/s su GPU AMD, il gap qualitativo sorprende
Un test locale su hardware AMD mette a confronto Qwen 35B-A3B (MoE, 3B parametri attivi) e Qwen 27B denso. Il modello MoE genera ~116 token/s...
Cerchi notizie generali sull'AI?
< AI-RADAR MAIN