Topic / Trend Rising

Proliferano i Modelli MoE Open-Weight per l'AI Locale

Una nuova ondata di modelli Mixture-of-Experts open-weight come Ling, Qwen MoE e Kimi K3 combina un gran numero di parametri totali con un basso numero di parametri attivi, consentendo una qualità da frontier su hardware consumer a costi ridotti.

Detected: 2026-08-09 · Updated: 2026-08-09

Articoli Correlati

2026-08-08 LocalLLaMA

Qwen3.6 27B e 35B su singola Radeon R9700: l'inference locale si fa estrema

Un utente spinge al limite una Radeon AI Pro R9700 da 32 GB con i modelli Qwen3.6 ridotti a INT4. Il 35B MoE tocca 262mila token di contesto e 52 tok/s a 100k, mentre il 27B sfrutta il speculative decoding per mantenere 59 tok/s oltre i 50k di contes...

#Hardware #LLM On-Premise #DevOps
2026-08-07 AI News

Modelli aperti e prezzi stracciati: la strategia cinese per l'AI on-premise

Alibaba ha lanciato Qwen3.8-Max, un modello da 2.4 trilioni di parametri con architettura MoE, mentre DeepSeek propone V4-Flash a $0,14 per milione di token in input. Entrambi distribuiscono i pesi in modalità open-weight, abilitando deployment on-pr...

#Hardware #LLM On-Premise #DevOps
2026-08-04 LocalLLaMA

Ling-3.0-flash: 124 miliardi di parametri, 5 attivi, e un futuro on-premise

InclusionAI ha rilasciato Ling-3.0-flash, un modello MoE open-weight da 124 miliardi di parametri con appena 5 miliardi attivi per token. Annunciato prima dell’ondata Kimi K3 e DeepSeek-V4-Flash, il suo dimensionamento potrebbe ritagliargli una nicch...

#Hardware #LLM On-Premise #DevOps
← Torna ai Topic