Topic / Trend Rising

Rilascio di modelli open-weight agentici

Nuovi modelli open-weight come Qwen3.8-Flash-Next, IBM Granite 4.2, Apodex 1.1 e GLM-5.3-Flash portano contesto lungo, efficienza mixture-of-experts e uso agentico degli strumenti nei deployment self-hosted. Queste release abbassano la barriera per le organizzazioni che vogliono eseguire o adattare localmente modelli vicini alla frontiera.

Detected: 2026-08-28 · Updated: 2026-08-28

Articoli Correlati

2026-08-27 LocalLLaMA

Apodex 1.1: i modelli agentici aperti arrivano in più formati quantizzati

Il team di Apodex presenta un AMA su Apodex 1.1, famiglia di modelli aperti per lavoro agente complesso. Oltre ai checkpoint, rilascia un harness open source e due paper. I formati includono FP8, GPTQ-Int4 e NVFP4, segnale che l'inference locale entr...

#LLM On-Premise #DevOps
2026-08-27 LocalLLaMA

Apodex 1.1: modelli agentici aperti e quantization come segnale strategico

Il team di Apodex ha presentato Apodex 1.1, famiglia di modelli aperti pensata per lavoro complesso con ragionamento, ricerca, esecuzione di codice e coordinamento di più agenti. Accanto ai modelli, rilascia FrontierAgent e due paper. Le varianti NVF...

#Hardware #LLM On-Premise #DevOps
2026-08-27 LocalLLaMA

Qwen3.8-Flash-Next alza il livello per i benchmark locali

Un Mac Studio M4 Max con 128 GB di memoria unificata ha ospitato il test di Qwen3.8-Flash-Next, il primo modello dell'anno a superare il 94% sul benchmark personale di tolitius. Il modello da 27B eccelle nel coding ma perde in conoscenza generale con...

#Hardware #LLM On-Premise #DevOps
2026-08-26 LocalLLaMA

GLM-5.3-Flash su Hugging Face: il modello c'è, i dettagli no

La pagina Hugging Face di zai-org/GLM-5.3-Flash segnala la disponibilità di un nuovo modello, ma nessuna specifica tecnica. Per chi valuta un deployment self-hosted, il nome Flash promette efficienza nell'inference, mentre l'assenza di dettagli su VR...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-26 LocalLLaMA

Qwen3.8-Flash-Next: un 125B open-weight per acceleratori con poca memoria

Il team Qwen ha pubblicato Qwen3.8-Flash-Next, modello open-weight da 125B con 6B attivi e contesto nativo da 262.144 token. L’architettura unisce Qwen Sparse Attention, Gated Residual e n-gram embedding per ridurre la latenza sui contesti lunghi e r...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-26 Ars Technica AI

IBM Granite 4.2: tre LLM self-hosted e una soglia agentica

IBM ha rilasciato Granite 4.2, tre LLM open-weight da 3, 8 e 30 miliardi di parametri pensati per il download e il self-hosted. Tutti offrono una finestra di contesto nativa di 128.000 token. Le varianti 8B e 30B aggiungono un blocco di reinforcement...

#Hardware #LLM On-Premise #DevOps
← Torna ai Topic