Topic / Trend Rising

L'inference AI locale efficiente si diffonde su hardware consumer e edge

Innovazioni nella quantization, ottimizzazioni specifiche per hardware (Intel Battlemage, GPU AMD, CPU) e motori on-device permettono agli LLM di funzionare senza problemi su smartphone, Raspberry Pi e desktop, espandendo l'AI self-hosted.

Detected: 2026-08-10 · Updated: 2026-08-10

Articoli Correlati

2026-08-09 LocalLLaMA

DGX Spark: due flag portano Ling-3.0-flash da 20.8 a 38.7 tok/s

L'INT4 ufficiale di Ling-3.0-flash gira su una DGX Spark, ma con configurazione predefinita eroga 20.8 tok/s. Due interventi — disabilitare `--enforce-eager` per abilitare i cudagraph e attivare la decodifica speculativa MTP con un token — fanno balz...

#Hardware #LLM On-Premise #DevOps
2026-08-08 LocalLLaMA

Qwen3.6 27B e 35B su singola Radeon R9700: l'inference locale si fa estrema

Un utente spinge al limite una Radeon AI Pro R9700 da 32 GB con i modelli Qwen3.6 ridotti a INT4. Il 35B MoE tocca 262mila token di contesto e 52 tok/s a 100k, mentre il 27B sfrutta il speculative decoding per mantenere 59 tok/s oltre i 50k di contes...

#Hardware #LLM On-Premise #DevOps
2026-08-05 LocalLLaMA

LLM on-device: LFM2.5-2.6B a 17 tok/s su OnePlus 13, inference solo CPU

Un developer ha eseguito LFM2.5-2.6B, un LLM da 2,69 miliardi di parametri con finestra di contesto di 128K, su uno smartphone OnePlus 13 usando solo CPU e quantization Q4_K_M. L'inference engine custom, di appena 450 KB, raggiunge 17 tok/s e support...

#Hardware #LLM On-Premise #DevOps
← Torna ai Topic