Topic / Trend Rising

L'inference locale e on-device dei LLM si espande

Una serie di guide, benchmark e lanci hardware mostra LLM eseguiti localmente su Apple Silicon, GPU RTX, SoC edge e desktop dedicati. Modifiche grigie e nuovi core on-device spingono VRAM, banda e limiti di potenza per l'inference self-hosted.

Detected: 2026-09-12 · Updated: 2026-09-12

Articoli Correlati

2026-09-09 Phoronix

System76 lancia Thelio Mira AI, desktop multi-GPU per training e inference

System76 ha presentato il Thelio Mira AI, un desktop pensato per carichi multi-GPU: training di modelli, fine-tuning, inference, computer vision e generazione di immagini. La macchina combina CPU AMD Ryzen 9000 con opzioni GPU NVIDIA o AMD e si prest...

#Hardware #LLM On-Premise #Fine-Tuning
2026-09-08 LocalLLaMA

GB per dollaro e bandwidth: la bussola per le GPU LLM locali

Una comparazione condivisa su Reddit usa VRAM per dollaro e bandwidth dichiarata per orientarsi tra le GPU più discusse nei canali LocalLLaMA. Prezzi raccolti con ChatGPT, nuovi o di seconda mano, senza garanzie. Un metodo grezzo ma utile per chi val...

#Hardware #LLM On-Premise #DevOps
2026-09-07 LocalLLaMA

Jenny, l'app desktop MIT per LLM locali nata da notti e weekend

Un developer rilascia Jenny, app Electron open source per eseguire LLM in locale con tool calling, rollback e IDE. Nessuna chiamata di rete oltre al runtime locale; sicurezza su comandi distruttivi e modifiche ai file. Windows first, con segnalazioni...

#Hardware #LLM On-Premise #DevOps
2026-09-07 LocalLLaMA

llama.cpp, MCP e FreeCAD: un LLM locale che progetta geometrie

Una guida mostra come collegare llama.cpp, il protocollo MCP e FreeCAD per generare solidi con un modello locale. Il flusso usa Qwen3.8-27B quantizzato Q4_K_M e un proiettore visivo mmproj-F16: il modello può avviare tool, leggere screenshot e verifi...

#Hardware #LLM On-Premise
2026-09-06 LocalLLaMA

llama.cpp, una fork testa l'expert expansion sui modelli MoE su Apple Metal

Una branch custom di llama.cpp porta l'expert expansion ai modelli MoE e la testa su Apple Metal. Il risultato supera la versione DS4 dell'autore, ma manca validazione su altre piattaforme. Il caso mostra quanto l'inference locale sui modelli sparse ...

#Hardware #LLM On-Premise #DevOps
2026-09-06 LocalLLaMA

DeepSeek-V4-Flash-Vision vs Qwen3.8-Flash-Next: token lenti, task più rapidi

Una comparativa locale con quantization Q8_K_XL su due StrixHalo 128GB mostra che DeepSeek-V4-Flash-Vision genera token più lentamente di Qwen3.8-Flash-Next, ma chiude i compiti in circa metà tempo. L'autore osserva meno allucinazioni e una minore te...

#Hardware #LLM On-Premise #DevOps
2026-09-06 LocalLLaMA

Qwen3.8-Flash-Next: 45 tok/s su M4 Max, 25 su M2 Ultra in locale

La variante Qwen3.8-Flash-Next-oQ4e-mtp mostra velocità di inference locale su Apple Silicon: 45 token al secondo su M4 Max e 25 su M2 Ultra. Il dato arriva da llm-bench.io e mette a confronto una variante ottimizzata con Qwen3.8 27B, con prestazioni...

#Hardware #LLM On-Premise #DevOps
← Torna ai Topic