Topic / Trend Rising

Modelli sparsi e quantization sbloccano l'IA di frontiera in locale

Un'ondata di modelli MoE open-weight con enormi parametri totali ma pochi attivi, combinati con quantization aggressiva, sta rendendo eseguibili LLM ad alte prestazioni su hardware consumer.

Detected: 2026-08-05 · Updated: 2026-08-05

Articoli Correlati

2026-08-05 LocalLLaMA

Maple-Preview: LLM da 20B con pesi ternari e ragionamento open-weight

Maple-Preview è un nuovo modello open-weight da 20 miliardi di parametri, con soli 1 miliardo di attivi per token e pesi in quantization ternaria. La combinazione riduce drasticamente la VRAM necessaria per l’inference, avvicinando scenari on-premise...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-04 LocalLLaMA

Ling-3.0-flash: il MoE da 127B scende a 128GB con l'FP8 ufficiale

InclusionAI ha rilasciato i pesi di Ling-3.0-flash su Hugging Face. Il modello conta 127,5 miliardi di parametri con un'architettura a 512 esperti, di cui solo 8 attivi per token. La vera notizia è la versione FP8 ufficiale: 128GB, sufficienti per un...

#Hardware #LLM On-Premise #DevOps
2026-08-04 LocalLLaMA

Ling-3.0-flash: 124 miliardi di parametri, 5 attivi, e un futuro on-premise

InclusionAI ha rilasciato Ling-3.0-flash, un modello MoE open-weight da 124 miliardi di parametri con appena 5 miliardi attivi per token. Annunciato prima dell’ondata Kimi K3 e DeepSeek-V4-Flash, il suo dimensionamento potrebbe ritagliargli una nicch...

#Hardware #LLM On-Premise #DevOps
2026-07-30 LocalLLaMA

Inkling-Small: 1M token locali con 276B parametri, solo 12B attivi

Thinkingmachines ha rilasciato Inkling-Small, un LLM con 276 miliardi di parametri totali ma appena 12 miliardi attivi e una finestra di contesto di 1 milione di token. Grazie alla quantization NVFP4 e ai file GGUF di Unsloth, il modello si presta al...

#Hardware #LLM On-Premise #DevOps
2026-07-30 LocalLLaMA

GLM 5.2 ora vede: Baseten aggiunge la visione con quantization NVFP4

Il provider di inference Baseten ha rilasciato pubblicamente GLM-5.2-Vision, una versione del modello GLM 5.2 arricchita con un encoder visivo tratto da Kimi k2.6 e quantizzata in formato NVFP4. La mossa colma una lacuna segnalata dalla community e a...

#Hardware #LLM On-Premise #DevOps
← Torna ai Topic