Topic / Trend Rising

Ecosistema di LLM aperti self-hosted

Modelli open-weight come Qwen 3.8, Ornith e Ling vengono distribuiti con varianti quantizzate GGUF/MLX immediate, mentre llama.cpp, DFlash e Unsloth trainano il deployment locale. Merge, pruning di profondità e versioning semantico mostrano una toolchain local-first in maturazione.

Detected: 2026-08-21 · Updated: 2026-08-21

Articoli Correlati

2026-08-20 LocalLLaMA

Ling-3.0: sei checkpoint base, due taglie e tre stadi

AntLing ha pubblicato sei checkpoint per Ling-3.0: due taglie e tre stadi ciascuna, tutti con licenza MIT e senza post-training. Materiale per continued pretraining, fine-tuning e ricerca, non un modello chat pronto. La mappa degli stadi è contesto, ...

#LLM On-Premise #Fine-Tuning #DevOps
2026-08-20 LocalLLaMA

QwenMix-3.7: quando unire Qwen 3.8 e 3.6 è questione di sette token

Un esperimento di merge tra Qwen3.8-27B e Qwen3.6-27B, condotto partendo da un file GGUF con quantization Q6_K_XL, ha prodotto QwenMix-3.7. L'autore segnala la compatibilità strutturale tra i due modelli, differenziati nell'addestramento da soli sett...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-20 LocalLLaMA

Depth pruning su Qwen3.8-27B: la leggerezza non è gratuita

Uno sviluppatore ha ridotto Qwen3.8-27B a 22,7 miliardi di parametri con pruning di profondità, senza fine-tuning. Distribuito solo in MLX per Apple Silicon, mostra trade-off: meno pressione su memoria e calcolo, ma perdite nei casi limite. Per l'on-...

2026-08-20 LocalLLaMA

Qwen3.8-27B ridotto a 22,7 miliardi con pruning di profondità

Uno sviluppatore ha applicato un pruning di profondità a Qwen3.8-27B, portandolo a circa 22,7 miliardi di parametri senza fine-tuning. Il modello, disponibile in versioni bf16, q8 e q4 su MLX, gestisce coding, uso agentico e conversazioni multi-turno...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-19 LocalLLaMA

Qwen3.8-27B: Unsloth alza l'accuratezza del 10% con nuovi GGUF

Unsloth ha pubblicato nuovi file GGUF per Qwen3.8-27B basati su Dynamic v3.0. La promessa è un miglioramento dell'accuratezza di oltre il 10% a parità di dimensione, con quantizzazioni a 1 bit che mantengono il 77% di accuratezza e girano in 8GB di R...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-19 LocalLLaMA

Ornith 1.5: tre modelli dal 9B al 397B con versioni GGUF per l'on-premise

Sono comparsi su Hugging Face tre nuovi modelli Ornith 1.5: 9B, 35B-A3B e 397B, tutti con versioni GGUF. La disponibilità immediata del formato quantizzato segnala un'attenzione diretta al deployment locale e self-hosted, spingendo a riflettere sui t...

#Hardware #LLM On-Premise #DevOps
2026-08-18 LocalLLaMA

DFlash 2 disponibile per Qwen 3.8 27B e Muse Glimmer via llama.cpp

Gli autori originali dei quantizzati GGUF di DFlash hanno pubblicato una seconda versione insieme a una pull request per llama.cpp. Il pacchetto copre Qwen 3.8 27B e Muse Glimmer, segnalando un'integrazione stretta tra ottimizzazioni di modello e run...

#Hardware #LLM On-Premise #DevOps
2026-08-17 LocalLLaMA

llama.cpp v0.1.0 segna il passaggio al versioning semantico

Il progetto abbandona i numeri di build sequenziali e adotta il versioning semantico. Un cambiamento che pesa soprattutto nei contesti self-hosted e on-premise, dove la prevedibilità delle API e la stabilità delle pipeline di inference contano più de...

#Hardware #LLM On-Premise #DevOps
2026-08-16 LocalLLaMA

Il debito dell'AI locale verso Georgi Gerganov e llama.cpp

Un breve post di ringraziamento riporta l'attenzione su Georgi Gerganov, creatore di llama.cpp. Il progetto open source ha trasformato l'approccio all'esecuzione di Large Language Models su hardware comune, abbattendo barriere per deployment self-hos...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-15 LocalLLaMA

Qwen 3.8 35BA3B spunta in un commit: il segnale prima del lancio

Un commit nel framework ms-swift espone la stringa Qwen 3.8 35BA3B, senza annunci né specifiche. Il nome suggerisce un modello da 35 miliardi di parametri con architettura a esperti, ma la fonte non conferma nulla. Analizziamo cosa significa per chi ...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-15 Phoronix

Lemonade 11.6: il segnale è nel runtime, non nel modello

AMD aggiorna Lemonade SDK con Muse-Glimmer 30B e modulo sperimentale ROCm per generazione immagini. Più che una novità di benchmark, è un segnale per chi valuta LLM locali: il valore si sposta su ottimizzazione di CPU, GPU e NPU, prevedibilità dei co...

← Torna ai Topic