Topic / Trend Rising

Rilasci di modelli open-weight e deployment locale

I rilasci di Qwen3.8 27B e Qwen 2.4T Max stanno accelerando l'adozione locale e self-hosted, con formati quantizzati e decodifica speculativa disponibili immediatamente. L'abbondanza di modelli su Hugging Face sposta inoltre l'attenzione su curation e prontezza al deployment.

Detected: 2026-08-19 · Updated: 2026-08-19

Articoli Correlati

2026-08-19 LocalLLaMA

Qwen3.8-27B locale: 218 token/s su due RTX 3090 con vLLM e DFlash2

Un test bare-metal con due RTX 3090, vLLM e decodifica speculativa DFlash2 porta Qwen3.8-27B a 218 token/s su singola richiesta, con prefill fino a 1342 token/s e contesto massimo di 131k. Il setup usa quantization INT4 AutoRound, 22,3 GB di VRAM per...

#Hardware #LLM On-Premise #DevOps
2026-08-18 LocalLLaMA

Qwen3.8-27B su RTX PRO 6000: 8 ore e 650 dollari di API evitati

Un carico agentico di oltre otto ore su una singola RTX PRO 6000, con DeepSeek Harness e NInfer, ha gestito 966 chiamate modello, 131,2 milioni di token in input e 853,3 mila in output con zero errori di generazione. Il confronto con i listini API st...

#Hardware #LLM On-Premise #DevOps
2026-08-16 LocalLLaMA

Qwen3.8-27B: la chiusura del loop visivo sposta il valore on-premise

Un confronto amatoriale tra Qwen3.6-27B e Qwen3.8-27B su un ray tracer in BASIC mostra una differenza decisiva: la capacità di osservare il rendering e correggere il codice in autonomia. Con quantization spinta e hardware locale, il ciclo chiuso ridu...

2026-08-16 LocalLLaMA

Qwen3.8-27B batte Qwen3.6-27B nell'iterazione autonoma su ray tracer BASIC

Un appassionato ha confrontato due LLM da 27 miliardi di parametri con quantization unsloth UD-Q8_K_XL in un harness agentico: scrivere un ray tracer ricorsivo in BASIC, eseguirlo, guardare l'immagine e iterare. Qwen3.6 richiedeva interventi umani qu...

#Hardware #LLM On-Premise #DevOps
2026-08-15 LocalLLaMA

Qwen3.8-27B in ufficio genera un clone di Super Mario in un colpo solo

Un modello locale su Framework Desktop con quantization Q8 GGUF genera al primo tentativo un clone di Super Mario. Non è veloce, ma abbastanza intelligente per batch notturni e lavori in background. Il caso solleva questioni concrete su velocità, acc...

#Hardware #LLM On-Premise #DevOps
2026-08-15 LocalLLaMA

Qwen 3.8 35BA3B spunta in un commit: il segnale prima del lancio

Un commit nel framework ms-swift espone la stringa Qwen 3.8 35BA3B, senza annunci né specifiche. Il nome suggerisce un modello da 35 miliardi di parametri con architettura a esperti, ma la fonte non conferma nulla. Analizziamo cosa significa per chi ...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-13 LocalLLaMA

DeepSeek V4 Pro 0813 su Hugging Face: un nome non basta

La comparsa del repository deepseek-ai/DeepSeek-V4-Pro-0813 su Hugging Face riporta l'attenzione sulla distribuzione dei LLM. Senza schede tecniche, però, un identificativo non orienta le decisioni on-premise: servono VRAM, quantization, pipeline di ...

#Hardware #LLM On-Premise #DevOps
2026-08-13 LocalLLaMA

Qwen apre il countdown ufficiale per Qwen3.8-27B su Hugging Face

La pagina di Hugging Face mostra un conto alla rovescia per Qwen/Qwen3.8-27B, suggerendo una fase di pre-rilascio. Il gesto segnala una strategia di distribuzione comunitaria e offre ai team on-premise una finestra per valutare vincoli di VRAM, quant...

#Hardware #LLM On-Premise #Fine-Tuning
← Torna ai Topic