Topic / Trend Rising

Efficienza degli LLM open-weight e deployment locale

Un'ondata di modelli open-weight, guidata da Qwen3.8-Flash-Next e dai rilasci da 27B, viene compressa ed eseguita su GPU consumer e workstation locali. Il focus è su contesti lunghi, alte velocità di token e footprint di VRAM ridotti.

Detected: 2026-09-01 · Updated: 2026-09-01

Articoli Correlati

2026-08-31 LocalLLaMA

DeepSeek-V4-Flash-Vision-Exp: il segnale oltre il nome su Hugging Face

Un repository su Hugging Face con nome DeepSeek-V4-Flash-Vision-Exp circola su Reddit senza dettagli tecnici. Il nome suggerisce un modello visione-linguaggio efficiente e sperimentale, ma senza VRAM, quantization o licenza. Per chi valuta self-hoste...

#Hardware #LLM On-Premise #DevOps
2026-08-30 LocalLLaMA

Quattro V100 32GB servono un LLM a 256k token: cosa dice il test SGLang-V100

Il supporto a RadixArk/Qwen3.8-Flash-Next-NVFP4 in SGLang-V100 mostra quattro V100 32GB con contesto completo da 256k token e oltre 50GB di offload sulla RAM di sistema. Prefill intorno a 4.000 token/s, decoding intorno a 60 token/s. I dati MTP segna...

#Hardware #LLM On-Premise #DevOps
2026-08-30 LocalLLaMA

La leva runtime che porta un LLM da 27B a 100k token su 16 GB

Un setup su Reddit mostra un modello dense da 27 miliardi di parametri a 47-50 token/s con contesto da 100.000 token su una RTX 4070 Ti SUPER da 16 GB. Il segnale non è il modello, ma il controllo fine del runtime: cache KV asimmetrica kvarn5/kvarn4,...

2026-08-30 LocalLLaMA

Qwen3.8-Flash-Next su M5 Max: 350K token e i limiti del 2 bit

Un test di tre ore e mezzo su MacBook Pro M5 Max con 128 GB di memoria unificata esegue un modello Qwen3.8-Flash-Next da 78,9 GB in quantization 2 bit con slot da 358.400 token. Il prefill scende da 1.561 a 318 token/s; la generazione da 30–35 a 11,5...

#Hardware #LLM On-Premise #DevOps
2026-08-29 LocalLLaMA

Un LLM da 27B su GPU consumer: 50 token/s e contesto da 100k token

Un setup documentato su Reddit porta un Qwen3.8-27B su una RTX 4070 Ti SUPER a 47-50 token/s con 100.000 token di contesto. Il merito è del runtime beellama.cpp e della cache KV asimmetrica kvarn5/kvarn4, che ha liberato circa il 6% di VRAM. La coda ...

#Hardware #LLM On-Premise #DevOps
2026-08-28 LocalLLaMA

llama.cpp accelera su Qwen3.8-Flash-Next: 55 token/s con quattro RTX 3090

llama.cpp ha integrato il supporto per Qwen3.8-Flash-Next e una segnalazione comunitaria mostra 55 token/s con GGUF Q4 su quattro RTX 3090. Un test informale che sposta l’attenzione dal software all’hardware: per l’inference locale il costo e la comp...

#Hardware #LLM On-Premise #DevOps
2026-08-27 LocalLLaMA

Apodex 1.1: i modelli agentici aperti arrivano in più formati quantizzati

Il team di Apodex presenta un AMA su Apodex 1.1, famiglia di modelli aperti per lavoro agente complesso. Oltre ai checkpoint, rilascia un harness open source e due paper. I formati includono FP8, GPTQ-Int4 e NVFP4, segnale che l'inference locale entr...

#LLM On-Premise #DevOps
2026-08-27 LocalLLaMA

Apodex 1.1: modelli agentici aperti e quantization come segnale strategico

Il team di Apodex ha presentato Apodex 1.1, famiglia di modelli aperti pensata per lavoro complesso con ragionamento, ricerca, esecuzione di codice e coordinamento di più agenti. Accanto ai modelli, rilascia FrontierAgent e due paper. Le varianti NVF...

#Hardware #LLM On-Premise #DevOps
2026-08-27 LocalLLaMA

Qwen3.8-Flash-Next alza il livello per i benchmark locali

Un Mac Studio M4 Max con 128 GB di memoria unificata ha ospitato il test di Qwen3.8-Flash-Next, il primo modello dell'anno a superare il 94% sul benchmark personale di tolitius. Il modello da 27B eccelle nel coding ma perde in conoscenza generale con...

#Hardware #LLM On-Premise #DevOps
2026-08-26 LocalLLaMA

GLM-5.3-Flash su Hugging Face: il modello c'è, i dettagli no

La pagina Hugging Face di zai-org/GLM-5.3-Flash segnala la disponibilità di un nuovo modello, ma nessuna specifica tecnica. Per chi valuta un deployment self-hosted, il nome Flash promette efficienza nell'inference, mentre l'assenza di dettagli su VR...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-26 LocalLLaMA

Qwen3.8-Flash-Next: un 125B open-weight per acceleratori con poca memoria

Il team Qwen ha pubblicato Qwen3.8-Flash-Next, modello open-weight da 125B con 6B attivi e contesto nativo da 262.144 token. L’architettura unisce Qwen Sparse Attention, Gated Residual e n-gram embedding per ridurre la latenza sui contesti lunghi e r...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-26 Ars Technica AI

IBM Granite 4.2: tre LLM self-hosted e una soglia agentica

IBM ha rilasciato Granite 4.2, tre LLM open-weight da 3, 8 e 30 miliardi di parametri pensati per il download e il self-hosted. Tutti offrono una finestra di contesto nativa di 128.000 token. Le varianti 8B e 30B aggiungono un blocco di reinforcement...

#Hardware #LLM On-Premise #DevOps
2026-08-26 LocalLLaMA

Qwen3.8-27B scende a 19,7 GB: cosa cambia per l'on-premise

Un checkpoint Qwen3.8-27B in NVFP4 mostra che la quantization W4A4 guidata da distillation può portare un LLM da 27 miliardi di parametri sotto i 20 GB senza perdite rilevanti. L'analisi AI-Radar legge il risultato come un cambio di soglia per VRAM e...

2026-08-26 LocalLLaMA

Qwen3.8-27B in NVFP4: 19,7 GB e qualità vicina al BF16

Un checkpoint Qwen3.8-27B completamente quantizzato in NVFP4 scende a 19,7 GB, contro i 55,6 GB del BF16, mantenendo punteggi vicini nei benchmark GPQA-Diamond e AIME26. Il team ha usato distillation consapevole della quantization con l’algoritmo QUA...

#Hardware #LLM On-Premise #Fine-Tuning
← Torna ai Topic