Topic / Trend Rising

Esplosione dell'inference AI efficiente in locale e su dispositivo

Un'ondata di tecniche di quantization, architetture MoE e ottimizzazioni hardware sta permettendo di eseguire potenti LLM direttamente su GPU consumer, smartphone e single-board computer, tagliando i costi infrastrutturali e portando la sovranità dei dati a portata di mano.

Detected: 2026-08-12 · Updated: 2026-08-12

Articoli Correlati

2026-08-11 LocalLLaMA

Unsloth Desktop porta il training in locale: 2× più veloce, 70% VRAM in meno

Unsloth Desktop è la prima applicazione open source per eseguire e addestrare LLM in locale. Supporta Windows, macOS e Linux, con accelerazione su NVIDIA, AMD, Intel e Mac. Promette training 2× più veloce e riduce la VRAM del 70%. Integra ricerca pri...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-11 LocalLLaMA

Luth-2, i piccoli LLM francesi che surclassano modelli tre volte più grandi

I nuovi Luth-2-0.8B e 2B fissano lo stato dell’arte per il francese, battendo modelli fino a tre volte più grandi in benchmark linguistici e matematici. Leggeri al punto da girare in locale, aprono scenari concreti per il deployment on-premise e la s...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-11 LocalLLaMA

Addestrare un LLM da 1B con 200$: la frontiera del self-hosted accessibile

Un progetto personale mostra come addestrare da zero un modello linguistico da 1,1 miliardi di parametri su 20 miliardi di token con una spesa totale di circa 200 dollari. Il modello, poi ottimizzato con LoRA e quantizzato, gira su CPU e persino su u...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-10 LocalLLaMA

Ling-3.0-tiny: 8B parametri, 1.3B attivi e inference a 100 token/s sul MacBook

InclusionAI rilascia Ling-3.0-tiny, un MoE da 8 miliardi di parametri (soli 1,3 attivi) che raggiunge 100-105 token/s su DGX Spark e 86-90 su MacBook M4 Pro, con 8,34 GiB di picco a contesto 8K in FP8. Prestazioni da fascia media, ma l’efficienza har...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-09 LocalLLaMA

BDH: scalabilità GPT-2 su GPU normali, la sfida post-transformer di Pathway

Pathway presenta BDH, un'architettura post-transformer che eguaglia le prestazioni di GPT-2 da 10 milioni a 1 miliardo di parametri, addestrandosi su hardware comune. Un promettente segnale per chi punta a self-hosted LLM senza vincoli hardware estre...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-09 LocalLLaMA

DGX Spark: due flag portano Ling-3.0-flash da 20.8 a 38.7 tok/s

L'INT4 ufficiale di Ling-3.0-flash gira su una DGX Spark, ma con configurazione predefinita eroga 20.8 tok/s. Due interventi — disabilitare `--enforce-eager` per abilitare i cudagraph e attivare la decodifica speculativa MTP con un token — fanno balz...

#Hardware #LLM On-Premise #DevOps
2026-08-08 LocalLLaMA

Kimi K3 in locale: cluster, quantization spinta e la fede nei modelli piccoli

Un utente esegue Kimi K3 su due cluster con llama.cpp e RPC, ricorrendo a offloading parziale e quantization IQ1_M. L’obiettivo? Accelerare del 2-3x unificando le GPU in un solo sistema e passare a Q2_K_XL, sperando che modelli come Qwen3.8 rendano s...

#Hardware #LLM On-Premise #DevOps
2026-08-08 LocalLLaMA

Qwen3.6 27B e 35B su singola Radeon R9700: l'inference locale si fa estrema

Un utente spinge al limite una Radeon AI Pro R9700 da 32 GB con i modelli Qwen3.6 ridotti a INT4. Il 35B MoE tocca 262mila token di contesto e 52 tok/s a 100k, mentre il 27B sfrutta il speculative decoding per mantenere 59 tok/s oltre i 50k di contes...

#Hardware #LLM On-Premise #DevOps
2026-08-08 LocalLLaMA

L’eccitazione per Qwen 3.8: il futuro degli LLM domestici accelera

Un utente racconta l’esperienza con Qwen 3.6 27B in Q4 su un Apple M5, immaginando un futuro in cui ogni query passa prima dal proprio LLM locale. Tra costi cloud in crescita e modelli frontier insostenibili, l’attesa per un ipotetico Qwen 3.8 denso ...

#Hardware #LLM On-Premise #DevOps
2026-08-07 AI News

Modelli aperti e prezzi stracciati: la strategia cinese per l'AI on-premise

Alibaba ha lanciato Qwen3.8-Max, un modello da 2.4 trilioni di parametri con architettura MoE, mentre DeepSeek propone V4-Flash a $0,14 per milione di token in input. Entrambi distribuiscono i pesi in modalità open-weight, abilitando deployment on-pr...

#Hardware #LLM On-Premise #DevOps
2026-08-05 LocalLLaMA

LLM on-device: LFM2.5-2.6B a 17 tok/s su OnePlus 13, inference solo CPU

Un developer ha eseguito LFM2.5-2.6B, un LLM da 2,69 miliardi di parametri con finestra di contesto di 128K, su uno smartphone OnePlus 13 usando solo CPU e quantization Q4_K_M. L'inference engine custom, di appena 450 KB, raggiunge 17 tok/s e support...

#Hardware #LLM On-Premise #DevOps
2026-08-05 LocalLLaMA

DeepSeek V4 Flash con MXFP4: il benchmark locale segna il nuovo vertice

I benchmark locali di un utente mostrano DeepSeek V4 Flash 0731 in formato MXFP4 al top per efficienza e qualità, raggiungendo 1.000 token/s in prefill e 90 token/s in generazione. Un risultato che accende i riflettori sulla quantization a bassa prec...

#Hardware #LLM On-Premise #DevOps
← Torna ai Topic