Topic / Trend Rising

Inference LLM locale e self-hosted su llama.cpp

Gli sviluppatori eseguono modelli aperti quantizzati in locale tramite llama.cpp e strumenti correlati su GPU consumer, Apple Silicon e dispositivi limitati, ottimizzando velocità, VRAM, lunghezza del contesto e flussi di sviluppo agentico.

Detected: 2026-09-10 · Updated: 2026-09-10

Articoli Correlati

2026-09-07 LocalLLaMA

Jenny, l'app desktop MIT per LLM locali nata da notti e weekend

Un developer rilascia Jenny, app Electron open source per eseguire LLM in locale con tool calling, rollback e IDE. Nessuna chiamata di rete oltre al runtime locale; sicurezza su comandi distruttivi e modifiche ai file. Windows first, con segnalazioni...

#Hardware #LLM On-Premise #DevOps
2026-09-07 LocalLLaMA

MiniCPM5-2B: OpenBMB guida i modelli open weights sotto i 4B

OpenBMB ha pubblicato MiniCPM5-2B, un modello open weights da 2 miliardi di parametri che ottiene 15 sull'Artificial Analysis Intelligence Index v4.2, il punteggio più alto tra i modelli aperti fino a 4B. Il risultato interessa chi valuta deployment ...

#LLM On-Premise #Fine-Tuning #DevOps
2026-09-07 LocalLLaMA

llama.cpp, MCP e FreeCAD: un LLM locale che progetta geometrie

Una guida mostra come collegare llama.cpp, il protocollo MCP e FreeCAD per generare solidi con un modello locale. Il flusso usa Qwen3.8-27B quantizzato Q4_K_M e un proiettore visivo mmproj-F16: il modello può avviare tool, leggere screenshot e verifi...

#Hardware #LLM On-Premise
2026-09-06 LocalLLaMA

llama.cpp, una fork testa l'expert expansion sui modelli MoE su Apple Metal

Una branch custom di llama.cpp porta l'expert expansion ai modelli MoE e la testa su Apple Metal. Il risultato supera la versione DS4 dell'autore, ma manca validazione su altre piattaforme. Il caso mostra quanto l'inference locale sui modelli sparse ...

#Hardware #LLM On-Premise #DevOps
2026-09-06 LocalLLaMA

DeepSeek-V4-Flash-Vision vs Qwen3.8-Flash-Next: token lenti, task più rapidi

Una comparativa locale con quantization Q8_K_XL su due StrixHalo 128GB mostra che DeepSeek-V4-Flash-Vision genera token più lentamente di Qwen3.8-Flash-Next, ma chiude i compiti in circa metà tempo. L'autore osserva meno allucinazioni e una minore te...

#Hardware #LLM On-Premise #DevOps
2026-09-06 LocalLLaMA

Spark-X2.5 in GGUF: llama.cpp apre la strada ai modelli compatti da 1M token

Una pull request su llama.cpp introduce il supporto per Spark-X2.5, due LLM compatti da 4B e 1.7B parametri, con contesto nativo fino a 1M token e architettura ibrida a finestra scorrevole. La mossa abbassa la soglia per l'inference locale e self-hos...

#Hardware #LLM On-Premise #Fine-Tuning
2026-09-06 LocalLLaMA

Qwen 3.8 27B senza censura: i tagli mirati battono le modifiche pesanti

Undici giorni e circa 167 ore di GPU per confrontare otto varianti abliterated di Qwen 3.8 27B con il modello base. I dati mostrano che le modifiche chirurgiche superano quelle aggressive: i modelli più editati entrano in loop di pensiero e perdono u...

#Hardware #LLM On-Premise #DevOps
2026-09-06 LocalLLaMA

Qwen3.8-Flash-Next: 45 tok/s su M4 Max, 25 su M2 Ultra in locale

La variante Qwen3.8-Flash-Next-oQ4e-mtp mostra velocità di inference locale su Apple Silicon: 45 token al secondo su M4 Max e 25 su M2 Ultra. Il dato arriva da llm-bench.io e mette a confronto una variante ottimizzata con Qwen3.8 27B, con prestazioni...

#Hardware #LLM On-Premise #DevOps
2026-09-05 LocalLLaMA

Tencent Hy4 su llama.cpp: il segnale per l'inference locale

La pull request #28127 per integrare Hy4-preview in llama.cpp non porta benchmark, ma segnala la convergenza dell'ecosistema self-hosted. Anche i vendor cloud mostrano attenzione alle pipeline on-premise. Restano da verificare stabilità, licenze e do...

2026-09-04 LocalLLaMA

Qwen3.8 27B su RTX 5080: 21 quantizzazioni alla prova dei 16 GB

Un benchmark su 21 varianti quantizzate di Qwen3.8 27B con una RTX 5080 da 16 GB mostra quanto conti la scelta del formato GGUF. La variante IQ4_XS di bartowski ottiene la divergenza media più bassa e il miglior accordo sul token più probabile, mentr...

#Hardware #LLM On-Premise #DevOps
2026-09-04 LocalLLaMA

Un LLM da 90 milioni di parametri gira su PSP: il local al limite del 2004

Un esperimento porta un modello conversazionale da 90M su una console Sony del 2004. L'inference viaggia a circa 0,5-0,6 token al secondo, con risposte in 1-3 minuti. Più una provocazione tecnica che uno strumento utile, ma dice molto sui vincoli rea...

#Hardware #LLM On-Premise #DevOps
2026-09-04 LocalLLaMA

Un FPS multiplayer nato da un LLM locale: Qwen 3.8 Flash Next in azione

Un utente ha costruito un FPS multiplayer con Qwen 3.8 Flash Next in locale, usando opencode e GPU NVIDIA (RTX 5090 e RTX 4000 PRO). Demo giocabile in due ore, tre giorni di rifiniture, 20 token/s medi con MTP, contesto 256k e quantization Q4_K_XL. L...

#Hardware #LLM On-Premise #DevOps
2026-09-03 LocalLLaMA

IFM rilascia K2-Horizon-MoVA-36B-A4B in GGUF: frontiera a 4B attivi

IFM ha pubblicato il checkpoint finale del modello sparse Mixture-of-Experts K2-Horizon-MoVA-36B-A4B, con 36 miliardi di parametri totali e 4 miliardi attivi per token. Distribuito in GGUF, compete su task agentici e di reasoning con modelli chiusi d...

#Hardware #LLM On-Premise #Fine-Tuning
2026-09-03 LocalLLaMA

Qwen-3.8-Next-Flash: iniezione di conoscenza a caldo in llama.cpp

Una modifica sperimentale a llama.cpp aggiorna in-memory la tabella Ngram PLE dei modelli Qwen, inserendo conoscenza senza ricaricare il modello. Il progetto, testato soltanto con quantization q8, richiede memory mapping e soffre di scarso controllo ...

#LLM On-Premise #Fine-Tuning #DevOps
2026-09-03 LocalLLaMA

Arcon spinge Qwen3-4B: quanto conta l'architettura, non solo i parametri

Il progetto Arcon usa Qwen3-4B con LoRA per costruire un assistente locale con memoria persistente, stato interno e strumenti. Più che un chatbot, è un banco di prova per capire fino a che punto un modello compatto possa reggere un'interazione da ass...

#LLM On-Premise #Fine-Tuning #DevOps
← Torna ai Topic