Topic / Trend Rising

Rilasci di modelli open-weight locali e quantization

Un'ondata di LLM open-weight, da Muse Glimmer di Meta e Qwen 3.8 alle varianti quantizzate di Kimi K3, Ling e Nemotron, sta rendendo praticabile l'IA self-hosted. Formati comunitari come GGUF e MLX e runtime on-device sono al centro di questo cambiamento.

Detected: 2026-08-15 · Updated: 2026-08-15

Articoli Correlati

2026-08-13 LocalLLaMA

DeepSeek V4 Pro 0813 su Hugging Face: un nome non basta

La comparsa del repository deepseek-ai/DeepSeek-V4-Pro-0813 su Hugging Face riporta l'attenzione sulla distribuzione dei LLM. Senza schede tecniche, però, un identificativo non orienta le decisioni on-premise: servono VRAM, quantization, pipeline di ...

#Hardware #LLM On-Premise #DevOps
2026-08-13 LocalLLaMA

Qwen apre il countdown ufficiale per Qwen3.8-27B su Hugging Face

La pagina di Hugging Face mostra un conto alla rovescia per Qwen/Qwen3.8-27B, suggerendo una fase di pre-rilascio. Il gesto segnala una strategia di distribuzione comunitaria e offre ai team on-premise una finestra per valutare vincoli di VRAM, quant...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-10 LocalLLaMA

Ling-3.0-tiny: 8B parametri, 1.3B attivi e inference a 100 token/s sul MacBook

InclusionAI rilascia Ling-3.0-tiny, un MoE da 8 miliardi di parametri (soli 1,3 attivi) che raggiunge 100-105 token/s su DGX Spark e 86-90 su MacBook M4 Pro, con 8,34 GiB di picco a contesto 8K in FP8. Prestazioni da fascia media, ma l’efficienza har...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-10 LocalLLaMA

Muse Glimmer di Meta: l'agente locale open-weight da 30B che sfida il cloud

Meta rilascia Muse Glimmer, un modello da 30 miliardi di parametri con licenza Apache 2.0, ottimizzato per flussi di lavoro agentici sempre attivi su hardware consumer. La quantization a 4 bit e la decodifica speculativa lo rendono eseguibile su GPU ...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-09 LocalLLaMA

DGX Spark: due flag portano Ling-3.0-flash da 20.8 a 38.7 tok/s

L'INT4 ufficiale di Ling-3.0-flash gira su una DGX Spark, ma con configurazione predefinita eroga 20.8 tok/s. Due interventi — disabilitare `--enforce-eager` per abilitare i cudagraph e attivare la decodifica speculativa MTP con un token — fanno balz...

#Hardware #LLM On-Premise #DevOps
2026-08-08 LocalLLaMA

Kimi K3 in locale: cluster, quantization spinta e la fede nei modelli piccoli

Un utente esegue Kimi K3 su due cluster con llama.cpp e RPC, ricorrendo a offloading parziale e quantization IQ1_M. L’obiettivo? Accelerare del 2-3x unificando le GPU in un solo sistema e passare a Q2_K_XL, sperando che modelli come Qwen3.8 rendano s...

#Hardware #LLM On-Premise #DevOps
2026-08-08 LocalLLaMA

Qwen3.6 27B e 35B su singola Radeon R9700: l'inference locale si fa estrema

Un utente spinge al limite una Radeon AI Pro R9700 da 32 GB con i modelli Qwen3.6 ridotti a INT4. Il 35B MoE tocca 262mila token di contesto e 52 tok/s a 100k, mentre il 27B sfrutta il speculative decoding per mantenere 59 tok/s oltre i 50k di contes...

#Hardware #LLM On-Premise #DevOps
← Torna ai Topic