Topic / Trend Rising

Inference AI locale e modelli open-weight

Il baricentro si sposta dall'inference solo cloud a quella locale e open-weight, spinta da quantization, ottimizzazione per GPU/CPU consumer e addestramento a basso costo. Rilasci come Meta Muse Glimmer e lo stack vocale on-device di NVIDIA stanno rafforzando l'ecosistema self-hosted.

Detected: 2026-08-13 · Updated: 2026-08-13

Articoli Correlati

2026-08-13 LocalLLaMA

Nvidia raddoppia la RTX PRO 6000 Blackwell: on-premise più caro

La scheda professionale da 96 GB passa da un preordine sotto gli 8.000 dollari a un MSRP di 16.000. Un segnale sui costi dell'inference self-hosted e sulla pressione che spinge le aziende private a spendere il doppio per GPU. Per chi valuta server lo...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-11 LocalLLaMA

Unsloth Desktop porta il training in locale: 2× più veloce, 70% VRAM in meno

Unsloth Desktop è la prima applicazione open source per eseguire e addestrare LLM in locale. Supporta Windows, macOS e Linux, con accelerazione su NVIDIA, AMD, Intel e Mac. Promette training 2× più veloce e riduce la VRAM del 70%. Integra ricerca pri...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-11 LocalLLaMA

Luth-2, i piccoli LLM francesi che surclassano modelli tre volte più grandi

I nuovi Luth-2-0.8B e 2B fissano lo stato dell’arte per il francese, battendo modelli fino a tre volte più grandi in benchmark linguistici e matematici. Leggeri al punto da girare in locale, aprono scenari concreti per il deployment on-premise e la s...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-11 LocalLLaMA

Addestrare un LLM da 1B con 200$: la frontiera del self-hosted accessibile

Un progetto personale mostra come addestrare da zero un modello linguistico da 1,1 miliardi di parametri su 20 miliardi di token con una spesa totale di circa 200 dollari. Il modello, poi ottimizzato con LoRA e quantizzato, gira su CPU e persino su u...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-10 LocalLLaMA

Ling-3.0-tiny: 8B parametri, 1.3B attivi e inference a 100 token/s sul MacBook

InclusionAI rilascia Ling-3.0-tiny, un MoE da 8 miliardi di parametri (soli 1,3 attivi) che raggiunge 100-105 token/s su DGX Spark e 86-90 su MacBook M4 Pro, con 8,34 GiB di picco a contesto 8K in FP8. Prestazioni da fascia media, ma l’efficienza har...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-10 LocalLLaMA

Muse Glimmer di Meta: l'agente locale open-weight da 30B che sfida il cloud

Meta rilascia Muse Glimmer, un modello da 30 miliardi di parametri con licenza Apache 2.0, ottimizzato per flussi di lavoro agentici sempre attivi su hardware consumer. La quantization a 4 bit e la decodifica speculativa lo rendono eseguibile su GPU ...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-09 LocalLLaMA

DGX Spark: due flag portano Ling-3.0-flash da 20.8 a 38.7 tok/s

L'INT4 ufficiale di Ling-3.0-flash gira su una DGX Spark, ma con configurazione predefinita eroga 20.8 tok/s. Due interventi — disabilitare `--enforce-eager` per abilitare i cudagraph e attivare la decodifica speculativa MTP con un token — fanno balz...

#Hardware #LLM On-Premise #DevOps
2026-08-08 LocalLLaMA

Kimi K3 in locale: cluster, quantization spinta e la fede nei modelli piccoli

Un utente esegue Kimi K3 su due cluster con llama.cpp e RPC, ricorrendo a offloading parziale e quantization IQ1_M. L’obiettivo? Accelerare del 2-3x unificando le GPU in un solo sistema e passare a Q2_K_XL, sperando che modelli come Qwen3.8 rendano s...

#Hardware #LLM On-Premise #DevOps
2026-08-08 LocalLLaMA

Qwen3.6 27B e 35B su singola Radeon R9700: l'inference locale si fa estrema

Un utente spinge al limite una Radeon AI Pro R9700 da 32 GB con i modelli Qwen3.6 ridotti a INT4. Il 35B MoE tocca 262mila token di contesto e 52 tok/s a 100k, mentre il 27B sfrutta il speculative decoding per mantenere 59 tok/s oltre i 50k di contes...

#Hardware #LLM On-Premise #DevOps
2026-08-08 LocalLLaMA

L’eccitazione per Qwen 3.8: il futuro degli LLM domestici accelera

Un utente racconta l’esperienza con Qwen 3.6 27B in Q4 su un Apple M5, immaginando un futuro in cui ogni query passa prima dal proprio LLM locale. Tra costi cloud in crescita e modelli frontier insostenibili, l’attesa per un ipotetico Qwen 3.8 denso ...

#Hardware #LLM On-Premise #DevOps
2026-08-07 AI News

Modelli aperti e prezzi stracciati: la strategia cinese per l'AI on-premise

Alibaba ha lanciato Qwen3.8-Max, un modello da 2.4 trilioni di parametri con architettura MoE, mentre DeepSeek propone V4-Flash a $0,14 per milione di token in input. Entrambi distribuiscono i pesi in modalità open-weight, abilitando deployment on-pr...

#Hardware #LLM On-Premise #DevOps
2026-08-07 LocalLLaMA

Stack vocale NVIDIA in locale: implicazioni per l'AI on-premise

L'analisi esamina come il rilascio dello stack vocale NVIDIA (ASR, TTS, codec) ottimizzato per esecuzione locale tramite GGUF e NeMo-Speech.cpp ridefinisca il calcolo del TCO, la sovranità dei dati e le architetture on-premise. Il passaggio dal cloud...

2026-08-06 LocalLLaMA

NVIDIA porta lo stack vocale in locale: ASR, TTS e codec ora girano on-device

NVIDIA ha rilasciato modelli di sintesi, riconoscimento e compressione vocale ottimizzati in GGUF, eseguibili localmente con NeMo-Speech.cpp. Una mossa che abilita pipeline vocali on-premise, riduce la dipendenza dal cloud e rafforza il controllo sui...

#Hardware #LLM On-Premise #Fine-Tuning
← Torna ai Topic