Topic / Trend Rising

L'ecosistema self-hosted dei modelli aperti si espande

Oltre a Qwen3.8, modelli aperti e runtime come Ling-3.0, Ornith 1.5, GLM-Air, DeepSeek V4 Flash e llama.cpp stanno ampliando le opzioni di serving locale. Le esperienze della community testano configurazioni multi-GPU, CPU/GPU ed edge per il self-hosting.

Detected: 2026-08-26 · Updated: 2026-08-26

Articoli Correlati

2026-08-24 LocalLLaMA

DeepSeek V4 Flash in cantina: Epyc, RTX 5090 e 24 token/s

Un utente ha testato DeepSeek V4 Flash in self-hosted con un Epyc 7663, 256 GB di RAM ECC e una RTX 5090 da 32 GB. Con quantization Q8_K_XL e contesti da 100-128k token, ottiene 23,8-24,6 token/s. Il dato mostra come un LLM da circa 151 GB di pesi po...

#Hardware #LLM On-Premise #DevOps
2026-08-24 LocalLLaMA

MTP sbarca in GLM-Air: il MoE da 106B accelera sulle GPU locali

llama.cpp abilita MTP per GLM-4.5-Air, un MoE da 106 miliardi di parametri con soli 12 miliardi attivi. La novità accelera l'inference su macchine con molta memoria ma calcolo limitato, come Strix Halo, DGX Spark e RTX 3090, e rafforza l'ecosistema d...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-23 Tom's Hardware

RTX 5080 a 702 dollari da Walmart: il segnale per chi fa inference LLM locale

Un acquirente ha trovato una RTX 5080 a 702 dollari in un Walmart, risparmiando quasi 800 dollari sui prezzi al dettaglio correnti. Più che un colpo di fortuna, l'episodio mostra il divario tra prezzo ufficiale e costo reale delle GPU consumer, con e...

#Hardware #LLM On-Premise #DevOps
2026-08-23 LocalLLaMA

Kimi K3 su 8 B300: 92 token/s e 190 dollari per milione di token

Un test di hosting su Modal con 8 B300 mostra 92 token/s in decode e 190 dollari per milione di token di output. La variante 1-bit su 8 A100 costa meno all'ora ma triplica il costo per token. L'analisi della prova rivela perché il prezzo orario è una...

#Hardware #LLM On-Premise #DevOps
2026-08-22 Phoronix

Etnaviv open source ora esegue YOLOX: cosa cambia per l'edge

Il driver open source Etnaviv, nato per le GPU Vivante ed esteso alle NPU, ora supporta YOLOX. La notizia segnala un'alternativa concreta agli SDK proprietari per l'inference edge locale.

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-22 LocalLLaMA

Llama.cpp 0.2.0: il runtime locale per LLM cambia passo

La nuova release di llama.cpp, con sorgenti e build precompilate, segna una tappa per l'inference self-hosted. Meno attrito per sviluppatori e aziende che vogliono eseguire LLM in locale, più pressione sui servizi cloud-only.

#Hardware #LLM On-Premise #DevOps
2026-08-20 LocalLLaMA

Ling-3.0: sei checkpoint base, due taglie e tre stadi

AntLing ha pubblicato sei checkpoint per Ling-3.0: due taglie e tre stadi ciascuna, tutti con licenza MIT e senza post-training. Materiale per continued pretraining, fine-tuning e ricerca, non un modello chat pronto. La mappa degli stadi è contesto, ...

#LLM On-Premise #Fine-Tuning #DevOps
2026-08-20 LocalLLaMA

DeepSeek V4 Flash con 16 RTX 5060 Ti: la via noiosa a 140 token/s

Un costruttore ha validato una configurazione self-hosted con 16 RTX 5060 Ti da 16 GB, due switch Broadcom/PLX PEX88096 e una Xeon Gold 6330. Il sistema serve DeepSeek V4 Flash-0731 con contesto fino a 1 milione di token e, in una configurazione, gen...

#Hardware #LLM On-Premise #DevOps
2026-08-19 LocalLLaMA

Ornith 1.5: tre modelli dal 9B al 397B con versioni GGUF per l'on-premise

Sono comparsi su Hugging Face tre nuovi modelli Ornith 1.5: 9B, 35B-A3B e 397B, tutti con versioni GGUF. La disponibilità immediata del formato quantizzato segnala un'attenzione diretta al deployment locale e self-hosted, spingendo a riflettere sui t...

#Hardware #LLM On-Premise #DevOps
← Torna ai Topic