Topic / Trend Rising

La rivoluzione degli LLM self-hosted: progressi di llama.cpp e modelli aperti

I recenti progressi di llama.cpp, inclusi accelerazioni significative su GPU Intel e supporto per predizione multi-token, insieme a una nuova ondata di modelli MoE e ternari open-weight, stanno rendendo l'inference LLM locale di alta qualità più accessibile ed efficiente.

Detected: 2026-08-08 · Updated: 2026-08-08

Articoli Correlati

2026-08-07 AI News

Modelli aperti e prezzi stracciati: la strategia cinese per l'AI on-premise

Alibaba ha lanciato Qwen3.8-Max, un modello da 2.4 trilioni di parametri con architettura MoE, mentre DeepSeek propone V4-Flash a $0,14 per milione di token in input. Entrambi distribuiscono i pesi in modalità open-weight, abilitando deployment on-pr...

#Hardware #LLM On-Premise #DevOps
2026-08-05 LocalLLaMA

DeepSeek V4 Flash con MXFP4: il benchmark locale segna il nuovo vertice

I benchmark locali di un utente mostrano DeepSeek V4 Flash 0731 in formato MXFP4 al top per efficienza e qualità, raggiungendo 1.000 token/s in prefill e 90 token/s in generazione. Un risultato che accende i riflettori sulla quantization a bassa prec...

#Hardware #LLM On-Premise #DevOps
2026-08-05 LocalLLaMA

Maple-Preview: LLM da 20B con pesi ternari e ragionamento open-weight

Maple-Preview è un nuovo modello open-weight da 20 miliardi di parametri, con soli 1 miliardo di attivi per token e pesi in quantization ternaria. La combinazione riduce drasticamente la VRAM necessaria per l’inference, avvicinando scenari on-premise...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-04 LocalLLaMA

Ling-3.0-flash: il MoE da 127B scende a 128GB con l'FP8 ufficiale

InclusionAI ha rilasciato i pesi di Ling-3.0-flash su Hugging Face. Il modello conta 127,5 miliardi di parametri con un'architettura a 512 esperti, di cui solo 8 attivi per token. La vera notizia è la versione FP8 ufficiale: 128GB, sufficienti per un...

#Hardware #LLM On-Premise #DevOps
2026-08-04 LocalLLaMA

Ling-3.0-flash: 124 miliardi di parametri, 5 attivi, e un futuro on-premise

InclusionAI ha rilasciato Ling-3.0-flash, un modello MoE open-weight da 124 miliardi di parametri con appena 5 miliardi attivi per token. Annunciato prima dell’ondata Kimi K3 e DeepSeek-V4-Flash, il suo dimensionamento potrebbe ritagliargli una nicch...

#Hardware #LLM On-Premise #DevOps
2026-08-04 LocalLLaMA

Llama.cpp guadagna fino all’8% spostando il sampling sulla GPU

Una pull request elimina il round-trip CPU-GPU per il sampling MTP in llama.cpp. Su una RTX 5090 il guadagno sfiora l’8%, su una Tesla P40 è del 4% a causa della banda memoria ridotta. Un miglioramento netto senza costi aggiuntivi per chi fa inferenc...

#Hardware #LLM On-Premise #DevOps
2026-08-04 LocalLLaMA

Addio LM Studio, benvenuto llama.cpp: il bivio della maturità on-premise

Una domanda su Reddit sul passaggio a llama.cpp rivela molto più di un cambio di interfaccia: è il momento in cui l’inference locale passa dall’esplorazione individuale a stack pronti per l’azienda, con controllo, riproducibilità e automazione.

#Hardware #LLM On-Premise #DevOps
← Torna ai Topic