Topic / Trend Rising

Tooling per LLM Locali e Quantization

llama.cpp adotta il versioning semantico, nuovi percorsi di quantization GGUF migliorano accuratezza e velocità, e tecniche come FPO riducono la memoria per il fine-tuning locale. Il numero crescente di modelli su Hugging Face rende inoltre la curation un problema di primo piano.

Detected: 2026-08-23 · Updated: 2026-08-23

Articoli Correlati

2026-08-22 LocalLLaMA

Llama.cpp 0.2.0: il runtime locale per LLM cambia passo

La nuova release di llama.cpp, con sorgenti e build precompilate, segna una tappa per l'inference self-hosted. Meno attrito per sviluppatori e aziende che vogliono eseguire LLM in locale, più pressione sui servizi cloud-only.

#Hardware #LLM On-Premise #DevOps
2026-08-21 LocalLLaMA

DeepSeek Harness 0.1.1: le immagini diventano stato persistente

DeepSeek ha aggiornato il proprio harness alla versione 0.1.1, integrando il modello multimodale DeepSeek-V4-Flash-Vision-Exp e il supporto a richieste native di immagini. Comandi come /goal e /plan accettano testo e immagini; MCP/ACP conservano alle...

#LLM On-Premise #DevOps
2026-08-20 ArXiv cs.LG

ECASQ: quantization adattiva stocastica sotto vincolo di entropia

Il nuovo metodo ECASQ unisce quantization e compressione lossless per minimizzare l'MSE rispettando un budget di entropia e il vincolo di unbiasedness. La soluzione ottimale usa programmazione dinamica con tempo O(sd^2) e spazio O(d^2). Una variante ...

#Hardware #LLM On-Premise #DevOps
2026-08-19 LocalLLaMA

Ornith 1.5: tre modelli dal 9B al 397B con versioni GGUF per l'on-premise

Sono comparsi su Hugging Face tre nuovi modelli Ornith 1.5: 9B, 35B-A3B e 397B, tutti con versioni GGUF. La disponibilità immediata del formato quantizzato segnala un'attenzione diretta al deployment locale e self-hosted, spingendo a riflettere sui t...

#Hardware #LLM On-Premise #DevOps
2026-08-18 LocalLLaMA

DFlash 2 disponibile per Qwen 3.8 27B e Muse Glimmer via llama.cpp

Gli autori originali dei quantizzati GGUF di DFlash hanno pubblicato una seconda versione insieme a una pull request per llama.cpp. Il pacchetto copre Qwen 3.8 27B e Muse Glimmer, segnalando un'integrazione stretta tra ottimizzazioni di modello e run...

#Hardware #LLM On-Premise #DevOps
2026-08-18 ArXiv cs.LG

FPO accelera il fine-tuning dei LLM senza backpropagation tra i layer

FPO adatta i LLM senza un backward pass attraverso il corpo del modello, raggiungendo un throughput da 2,7 a 3,2 volte superiore al fine-tuning standard e circa il 40% in meno di memoria di picco. Nei test su OLMo-2-7B, Qwen3-8B e Falcon3-7B migliora...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-17 Phoronix

Rust sulle GPU: memoria sicura oltre CUDA e HIP

Un nuovo paper sull'offloading LLVM verso GPU con Rust discute le prospettive di sfruttare la sicurezza della memoria nei kernel GPU. Rispetto a C++/CUDA/HIP, il modello di Rust può ridurre intere classi di bug critici. Per deploy self-hosted questo ...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-17 LocalLLaMA

llama.cpp v0.1.0 segna il passaggio al versioning semantico

Il progetto abbandona i numeri di build sequenziali e adotta il versioning semantico. Un cambiamento che pesa soprattutto nei contesti self-hosted e on-premise, dove la prevedibilità delle API e la stabilità delle pipeline di inference contano più de...

#Hardware #LLM On-Premise #DevOps
2026-08-17 Phoronix

KTransformers 0.7 espande AVX-512 e premia i server AMD EPYC

Il framework per LLM eterogenei KTransformers pubblica la versione 0.7 con supporto AVX-512 esteso, un intervento mirato sui server AMD EPYC. Per chi opera in self-hosted, il messaggio è strutturale: la CPU non è più un ripiego, ma una componente att...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-16 LocalLLaMA

Il debito dell'AI locale verso Georgi Gerganov e llama.cpp

Un breve post di ringraziamento riporta l'attenzione su Georgi Gerganov, creatore di llama.cpp. Il progetto open source ha trasformato l'approccio all'esecuzione di Large Language Models su hardware comune, abbattendo barriere per deployment self-hos...

#Hardware #LLM On-Premise #Fine-Tuning
← Torna ai Topic