Topic / Trend Rising

Ottimizzazione dell'Inference LLM Self-Hosted

Le implementazioni LLM locali avanzano grazie a quantization, cache degli esperti MoE, ottimizzazione della KV cache e tuning specifico per Apple Silicon, RTX, AMD e Intel Arc. Nuovi modelli compatti open-weight e integrazioni con llama.cpp rendono l'inference on-premise più veloce, economica e capace.

Detected: 2026-09-08 · Updated: 2026-09-08

Articoli Correlati

2026-09-07 LocalLLaMA

Jenny, l'app desktop MIT per LLM locali nata da notti e weekend

Un developer rilascia Jenny, app Electron open source per eseguire LLM in locale con tool calling, rollback e IDE. Nessuna chiamata di rete oltre al runtime locale; sicurezza su comandi distruttivi e modifiche ai file. Windows first, con segnalazioni...

#Hardware #LLM On-Premise #DevOps
2026-09-07 LocalLLaMA

llama.cpp, MCP e FreeCAD: un LLM locale che progetta geometrie

Una guida mostra come collegare llama.cpp, il protocollo MCP e FreeCAD per generare solidi con un modello locale. Il flusso usa Qwen3.8-27B quantizzato Q4_K_M e un proiettore visivo mmproj-F16: il modello può avviare tool, leggere screenshot e verifi...

#Hardware #LLM On-Premise
2026-09-06 LocalLLaMA

llama.cpp, una fork testa l'expert expansion sui modelli MoE su Apple Metal

Una branch custom di llama.cpp porta l'expert expansion ai modelli MoE e la testa su Apple Metal. Il risultato supera la versione DS4 dell'autore, ma manca validazione su altre piattaforme. Il caso mostra quanto l'inference locale sui modelli sparse ...

#Hardware #LLM On-Premise #DevOps
2026-09-06 LocalLLaMA

DeepSeek-V4-Flash-Vision vs Qwen3.8-Flash-Next: token lenti, task più rapidi

Una comparativa locale con quantization Q8_K_XL su due StrixHalo 128GB mostra che DeepSeek-V4-Flash-Vision genera token più lentamente di Qwen3.8-Flash-Next, ma chiude i compiti in circa metà tempo. L'autore osserva meno allucinazioni e una minore te...

#Hardware #LLM On-Premise #DevOps
2026-09-06 LocalLLaMA

Spark-X2.5 in GGUF: llama.cpp apre la strada ai modelli compatti da 1M token

Una pull request su llama.cpp introduce il supporto per Spark-X2.5, due LLM compatti da 4B e 1.7B parametri, con contesto nativo fino a 1M token e architettura ibrida a finestra scorrevole. La mossa abbassa la soglia per l'inference locale e self-hos...

#Hardware #LLM On-Premise #Fine-Tuning
2026-09-06 LocalLLaMA

Qwen 3.8 27B senza censura: i tagli mirati battono le modifiche pesanti

Undici giorni e circa 167 ore di GPU per confrontare otto varianti abliterated di Qwen 3.8 27B con il modello base. I dati mostrano che le modifiche chirurgiche superano quelle aggressive: i modelli più editati entrano in loop di pensiero e perdono u...

#Hardware #LLM On-Premise #DevOps
2026-09-06 LocalLLaMA

Qwen3.8-Flash-Next: 45 tok/s su M4 Max, 25 su M2 Ultra in locale

La variante Qwen3.8-Flash-Next-oQ4e-mtp mostra velocità di inference locale su Apple Silicon: 45 token al secondo su M4 Max e 25 su M2 Ultra. Il dato arriva da llm-bench.io e mette a confronto una variante ottimizzata con Qwen3.8 27B, con prestazioni...

#Hardware #LLM On-Premise #DevOps
2026-09-05 LocalLLaMA

Tencent Hy4 su llama.cpp: il segnale per l'inference locale

La pull request #28127 per integrare Hy4-preview in llama.cpp non porta benchmark, ma segnala la convergenza dell'ecosistema self-hosted. Anche i vendor cloud mostrano attenzione alle pipeline on-premise. Restano da verificare stabilità, licenze e do...

2026-09-04 LocalLLaMA

Qwen3.8 27B su RTX 5080: 21 quantizzazioni alla prova dei 16 GB

Un benchmark su 21 varianti quantizzate di Qwen3.8 27B con una RTX 5080 da 16 GB mostra quanto conti la scelta del formato GGUF. La variante IQ4_XS di bartowski ottiene la divergenza media più bassa e il miglior accordo sul token più probabile, mentr...

#Hardware #LLM On-Premise #DevOps
2026-09-04 LocalLLaMA

Un FPS multiplayer nato da un LLM locale: Qwen 3.8 Flash Next in azione

Un utente ha costruito un FPS multiplayer con Qwen 3.8 Flash Next in locale, usando opencode e GPU NVIDIA (RTX 5090 e RTX 4000 PRO). Demo giocabile in due ore, tre giorni di rifiniture, 20 token/s medi con MTP, contesto 256k e quantization Q4_K_XL. L...

#Hardware #LLM On-Premise #DevOps
2026-09-03 LocalLLaMA

IFM rilascia K2-Horizon-MoVA-36B-A4B in GGUF: frontiera a 4B attivi

IFM ha pubblicato il checkpoint finale del modello sparse Mixture-of-Experts K2-Horizon-MoVA-36B-A4B, con 36 miliardi di parametri totali e 4 miliardi attivi per token. Distribuito in GGUF, compete su task agentici e di reasoning con modelli chiusi d...

#Hardware #LLM On-Premise #Fine-Tuning
2026-09-03 LocalLLaMA

Qwen-3.8-Next-Flash: iniezione di conoscenza a caldo in llama.cpp

Una modifica sperimentale a llama.cpp aggiorna in-memory la tabella Ngram PLE dei modelli Qwen, inserendo conoscenza senza ricaricare il modello. Il progetto, testato soltanto con quantization q8, richiede memory mapping e soffre di scarso controllo ...

#LLM On-Premise #Fine-Tuning #DevOps
2026-09-03 LocalLLaMA

Arcon spinge Qwen3-4B: quanto conta l'architettura, non solo i parametri

Il progetto Arcon usa Qwen3-4B con LoRA per costruire un assistente locale con memoria persistente, stato interno e strumenti. Più che un chatbot, è un banco di prova per capire fino a che punto un modello compatto possa reggere un'interazione da ass...

#LLM On-Premise #Fine-Tuning #DevOps
2026-09-03 LocalLLaMA

La KV cache pesa più dei parametri sui modelli locali a contesto lungo

Per gli LLM locali, il numero di parametri non è l'unico vincolo: la KV cache cresce con ogni token e può diventare il vero collo di bottiglia a contesti da 100k o 200k token. GQA, MQA e quantization riducono l'ingombro, ma il problema resta lineare....

#Hardware #LLM On-Premise #DevOps
2026-09-03 LocalLLaMA

Perplexity apre il server di inference per Mac ottimizzato per Qwen 3.6

Perplexity ha reso open source il repository lily in pplx-garden, un inference server per Mac costruito attorno a un solo modello, Qwen 3.6, per ottenere il massimo su Apple Silicon. Non è serving generico: la verticalizzazione su un singolo modello ...

#Hardware #LLM On-Premise #DevOps
2026-09-03 Phoronix

Lemonade 11.9 porta il backend sperimentale AMD ROCm HRX in Llama.cpp

Lemonade 11.9, server AI locale open source sostenuto da AMD, debutta su Linux, Windows e macOS con un backend sperimentale ROCm HRX per Llama.cpp. Il progetto conferma la linea «100% gratuito e privato» su GPU, CPU e NPU. Il dettaglio tecnico più ri...

#Hardware #LLM On-Premise #DevOps
2026-09-02 Phoronix

Intel aggiorna LLM-Scaler-vLLM: vLLM 0.26 su GPU Arc con Docker

Il progetto LLM-Scaler-vLLM di Intel rilascia una nuova beta basata su vLLM 0.26, pensata per avviare vLLM su GPU Arc e Arc Pro tramite container Docker. L'aggiornamento riduce l'attrito di configurazione per chi vuole servire LLM in locale su hardwa...

#Hardware #LLM On-Premise #DevOps
2026-09-01 LocalLLaMA

Spark-X2.5-4B e -1.7B: contesto 1M, architettura propria e un fork obbligato

Due nuovi LLM compatti, Spark-X2.5-4B e Spark-X2.5-1.7B, si presentano con architettura non derivata da fine-tuning e un contesto nativo dichiarato di 1 milione di token. I benchmark citati sulla pagina Hugging Face indicano la versione da 4B vicina ...

#LLM On-Premise #Fine-Tuning #DevOps
← Torna ai Topic