Topic / Trend Rising

Modelli MoE open-weight e compatti portano l'AI di frontiera sull'hardware personale

Un'ondata di modelli MoE open-weight come Ling-3.0-flash, DeepSeek V4 e varianti Qwen, combinati con quantization estrema e pesi ternari, raggiungono performance quasi-frontiera su GPU consumer e sistemi CPU.

Detected: 2026-08-10 · Updated: 2026-08-10

Articoli Correlati

2026-08-08 LocalLLaMA

Kimi K3 in locale: cluster, quantization spinta e la fede nei modelli piccoli

Un utente esegue Kimi K3 su due cluster con llama.cpp e RPC, ricorrendo a offloading parziale e quantization IQ1_M. L’obiettivo? Accelerare del 2-3x unificando le GPU in un solo sistema e passare a Q2_K_XL, sperando che modelli come Qwen3.8 rendano s...

#Hardware #LLM On-Premise #DevOps
2026-08-07 AI News

Modelli aperti e prezzi stracciati: la strategia cinese per l'AI on-premise

Alibaba ha lanciato Qwen3.8-Max, un modello da 2.4 trilioni di parametri con architettura MoE, mentre DeepSeek propone V4-Flash a $0,14 per milione di token in input. Entrambi distribuiscono i pesi in modalità open-weight, abilitando deployment on-pr...

#Hardware #LLM On-Premise #DevOps
2026-08-05 LocalLLaMA

DeepSeek V4 Flash con MXFP4: il benchmark locale segna il nuovo vertice

I benchmark locali di un utente mostrano DeepSeek V4 Flash 0731 in formato MXFP4 al top per efficienza e qualità, raggiungendo 1.000 token/s in prefill e 90 token/s in generazione. Un risultato che accende i riflettori sulla quantization a bassa prec...

#Hardware #LLM On-Premise #DevOps
2026-08-05 LocalLLaMA

Maple-Preview: LLM da 20B con pesi ternari e ragionamento open-weight

Maple-Preview è un nuovo modello open-weight da 20 miliardi di parametri, con soli 1 miliardo di attivi per token e pesi in quantization ternaria. La combinazione riduce drasticamente la VRAM necessaria per l’inference, avvicinando scenari on-premise...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-04 LocalLLaMA

Ling-3.0-flash: il MoE da 127B scende a 128GB con l'FP8 ufficiale

InclusionAI ha rilasciato i pesi di Ling-3.0-flash su Hugging Face. Il modello conta 127,5 miliardi di parametri con un'architettura a 512 esperti, di cui solo 8 attivi per token. La vera notizia è la versione FP8 ufficiale: 128GB, sufficienti per un...

#Hardware #LLM On-Premise #DevOps
2026-08-04 LocalLLaMA

Ling-3.0-flash: 124 miliardi di parametri, 5 attivi, e un futuro on-premise

InclusionAI ha rilasciato Ling-3.0-flash, un modello MoE open-weight da 124 miliardi di parametri con appena 5 miliardi attivi per token. Annunciato prima dell’ondata Kimi K3 e DeepSeek-V4-Flash, il suo dimensionamento potrebbe ritagliargli una nicch...

#Hardware #LLM On-Premise #DevOps
← Torna ai Topic