Topic / Trend Rising

Rilasci di LLM open-weight per l'inference locale

Nuovi modelli open-weight come Qwen 3.8, Meta Muse Glimmer, Nemotron-3.5 Lightning, Ling-3.0 e Luth-2 vengono rilasciati o preparati per l'inference locale, con formati GGUF, MLX e FP8 disponibili rapidamente. L'ecosistema si sta spostando verso il self-hosting su hardware consumer ed edge.

Detected: 2026-08-16 · Updated: 2026-08-16

Articoli Correlati

2026-08-15 LocalLLaMA

Qwen 3.8 35BA3B spunta in un commit: il segnale prima del lancio

Un commit nel framework ms-swift espone la stringa Qwen 3.8 35BA3B, senza annunci né specifiche. Il nome suggerisce un modello da 35 miliardi di parametri con architettura a esperti, ma la fonte non conferma nulla. Analizziamo cosa significa per chi ...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-13 LocalLLaMA

Qwen apre il countdown ufficiale per Qwen3.8-27B su Hugging Face

La pagina di Hugging Face mostra un conto alla rovescia per Qwen/Qwen3.8-27B, suggerendo una fase di pre-rilascio. Il gesto segnala una strategia di distribuzione comunitaria e offre ai team on-premise una finestra per valutare vincoli di VRAM, quant...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-11 LocalLLaMA

Luth-2, i piccoli LLM francesi che surclassano modelli tre volte più grandi

I nuovi Luth-2-0.8B e 2B fissano lo stato dell’arte per il francese, battendo modelli fino a tre volte più grandi in benchmark linguistici e matematici. Leggeri al punto da girare in locale, aprono scenari concreti per il deployment on-premise e la s...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-10 LocalLLaMA

Ling-3.0-tiny: 8B parametri, 1.3B attivi e inference a 100 token/s sul MacBook

InclusionAI rilascia Ling-3.0-tiny, un MoE da 8 miliardi di parametri (soli 1,3 attivi) che raggiunge 100-105 token/s su DGX Spark e 86-90 su MacBook M4 Pro, con 8,34 GiB di picco a contesto 8K in FP8. Prestazioni da fascia media, ma l’efficienza har...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-10 LocalLLaMA

Muse Glimmer di Meta: l'agente locale open-weight da 30B che sfida il cloud

Meta rilascia Muse Glimmer, un modello da 30 miliardi di parametri con licenza Apache 2.0, ottimizzato per flussi di lavoro agentici sempre attivi su hardware consumer. La quantization a 4 bit e la decodifica speculativa lo rendono eseguibile su GPU ...

#Hardware #LLM On-Premise #Fine-Tuning
← Torna ai Topic