Topic / Trend Rising

Ondata di deployment locale dei modelli open-weight Qwen

Il rilascio di Qwen3.8-27B scatena un'ondata immediata di formati locali, quantizzazioni, test agentici ed esperimenti di depth pruning. I benchmark della community lo confrontano con Qwen3.6 evidenziando progressi nei loop agentici visivi ma regressioni nel richiamo fattuale offline.

Detected: 2026-08-20 · Updated: 2026-08-20

Articoli Correlati

2026-08-20 LocalLLaMA

Depth pruning su Qwen3.8-27B: la leggerezza non è gratuita

Uno sviluppatore ha ridotto Qwen3.8-27B a 22,7 miliardi di parametri con pruning di profondità, senza fine-tuning. Distribuito solo in MLX per Apple Silicon, mostra trade-off: meno pressione su memoria e calcolo, ma perdite nei casi limite. Per l'on-...

2026-08-20 LocalLLaMA

Qwen3.8-27B ridotto a 22,7 miliardi con pruning di profondità

Uno sviluppatore ha applicato un pruning di profondità a Qwen3.8-27B, portandolo a circa 22,7 miliardi di parametri senza fine-tuning. Il modello, disponibile in versioni bf16, q8 e q4 su MLX, gestisce coding, uso agentico e conversazioni multi-turno...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-19 LocalLLaMA

Qwen3.8-27B: Unsloth alza l'accuratezza del 10% con nuovi GGUF

Unsloth ha pubblicato nuovi file GGUF per Qwen3.8-27B basati su Dynamic v3.0. La promessa è un miglioramento dell'accuratezza di oltre il 10% a parità di dimensione, con quantizzazioni a 1 bit che mantengono il 77% di accuratezza e girano in 8GB di R...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-19 LocalLLaMA

Qwen3.8-27B locale: 218 token/s su due RTX 3090 con vLLM e DFlash2

Un test bare-metal con due RTX 3090, vLLM e decodifica speculativa DFlash2 porta Qwen3.8-27B a 218 token/s su singola richiesta, con prefill fino a 1342 token/s e contesto massimo di 131k. Il setup usa quantization INT4 AutoRound, 22,3 GB di VRAM per...

#Hardware #LLM On-Premise #DevOps
2026-08-18 LocalLLaMA

DFlash 2 disponibile per Qwen 3.8 27B e Muse Glimmer via llama.cpp

Gli autori originali dei quantizzati GGUF di DFlash hanno pubblicato una seconda versione insieme a una pull request per llama.cpp. Il pacchetto copre Qwen 3.8 27B e Muse Glimmer, segnalando un'integrazione stretta tra ottimizzazioni di modello e run...

#Hardware #LLM On-Premise #DevOps
2026-08-18 LocalLLaMA

Qwen3.8-27B su RTX PRO 6000: 8 ore e 650 dollari di API evitati

Un carico agentico di oltre otto ore su una singola RTX PRO 6000, con DeepSeek Harness e NInfer, ha gestito 966 chiamate modello, 131,2 milioni di token in input e 853,3 mila in output con zero errori di generazione. Il confronto con i listini API st...

#Hardware #LLM On-Premise #DevOps
2026-08-16 LocalLLaMA

Qwen3.8-27B: la chiusura del loop visivo sposta il valore on-premise

Un confronto amatoriale tra Qwen3.6-27B e Qwen3.8-27B su un ray tracer in BASIC mostra una differenza decisiva: la capacità di osservare il rendering e correggere il codice in autonomia. Con quantization spinta e hardware locale, il ciclo chiuso ridu...

2026-08-16 LocalLLaMA

Qwen3.8-27B batte Qwen3.6-27B nell'iterazione autonoma su ray tracer BASIC

Un appassionato ha confrontato due LLM da 27 miliardi di parametri con quantization unsloth UD-Q8_K_XL in un harness agentico: scrivere un ray tracer ricorsivo in BASIC, eseguirlo, guardare l'immagine e iterare. Qwen3.6 richiedeva interventi umani qu...

#Hardware #LLM On-Premise #DevOps
2026-08-15 LocalLLaMA

Qwen3.8-27B in ufficio genera un clone di Super Mario in un colpo solo

Un modello locale su Framework Desktop con quantization Q8 GGUF genera al primo tentativo un clone di Super Mario. Non è veloce, ma abbastanza intelligente per batch notturni e lavori in background. Il caso solleva questioni concrete su velocità, acc...

#Hardware #LLM On-Premise #DevOps
2026-08-15 LocalLLaMA

Qwen 3.8 35BA3B spunta in un commit: il segnale prima del lancio

Un commit nel framework ms-swift espone la stringa Qwen 3.8 35BA3B, senza annunci né specifiche. Il nome suggerisce un modello da 35 miliardi di parametri con architettura a esperti, ma la fonte non conferma nulla. Analizziamo cosa significa per chi ...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-13 LocalLLaMA

Qwen apre il countdown ufficiale per Qwen3.8-27B su Hugging Face

La pagina di Hugging Face mostra un conto alla rovescia per Qwen/Qwen3.8-27B, suggerendo una fase di pre-rilascio. Il gesto segnala una strategia di distribuzione comunitaria e offre ai team on-premise una finestra per valutare vincoli di VRAM, quant...

#Hardware #LLM On-Premise #Fine-Tuning
← Torna ai Topic