Topic / Trend Rising

La Rivoluzione dell'AI On-Premise: Modelli Aperti e Hardware Consumer

I modelli open-weight come Muse Glimmer di Meta e i giganti MoE cinesi si fondono con i progressi nella quantization e nei framework locali, permettendo a potenti AI di funzionare su GPU consumer, telefoni e piccoli server.

Detected: 2026-07-28 · Updated: 2026-08-11

Articoli Correlati

2026-08-10 LocalLLaMA

Ling-3.0-tiny: 8B parametri, 1.3B attivi e inference a 100 token/s sul MacBook

InclusionAI rilascia Ling-3.0-tiny, un MoE da 8 miliardi di parametri (soli 1,3 attivi) che raggiunge 100-105 token/s su DGX Spark e 86-90 su MacBook M4 Pro, con 8,34 GiB di picco a contesto 8K in FP8. Prestazioni da fascia media, ma l’efficienza har...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-10 LocalLLaMA

Muse Glimmer di Meta: l'agente locale open-weight da 30B che sfida il cloud

Meta rilascia Muse Glimmer, un modello da 30 miliardi di parametri con licenza Apache 2.0, ottimizzato per flussi di lavoro agentici sempre attivi su hardware consumer. La quantization a 4 bit e la decodifica speculativa lo rendono eseguibile su GPU ...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-09 LocalLLaMA

DGX Spark: due flag portano Ling-3.0-flash da 20.8 a 38.7 tok/s

L'INT4 ufficiale di Ling-3.0-flash gira su una DGX Spark, ma con configurazione predefinita eroga 20.8 tok/s. Due interventi — disabilitare `--enforce-eager` per abilitare i cudagraph e attivare la decodifica speculativa MTP con un token — fanno balz...

#Hardware #LLM On-Premise #DevOps
2026-08-09 Tom's Hardware

Die nudo e blocco 3D: RTX 2060 Super a 28°C sotto carico

Un modder ha portato il raffreddamento a liquido direttamente sul silicio di una RTX 2060 Super con un blocco stampato in 3D. Nonostante perdite iniziali, la temperatura in pieno carico è scesa a 28°C. L’esperimento accende i riflettori su un aspetto...

#Hardware #LLM On-Premise #DevOps
2026-08-08 LocalLLaMA

Kimi K3 in locale: cluster, quantization spinta e la fede nei modelli piccoli

Un utente esegue Kimi K3 su due cluster con llama.cpp e RPC, ricorrendo a offloading parziale e quantization IQ1_M. L’obiettivo? Accelerare del 2-3x unificando le GPU in un solo sistema e passare a Q2_K_XL, sperando che modelli come Qwen3.8 rendano s...

#Hardware #LLM On-Premise #DevOps
2026-08-08 LocalLLaMA

Qwen3.6 27B e 35B su singola Radeon R9700: l'inference locale si fa estrema

Un utente spinge al limite una Radeon AI Pro R9700 da 32 GB con i modelli Qwen3.6 ridotti a INT4. Il 35B MoE tocca 262mila token di contesto e 52 tok/s a 100k, mentre il 27B sfrutta il speculative decoding per mantenere 59 tok/s oltre i 50k di contes...

#Hardware #LLM On-Premise #DevOps
2026-08-08 LocalLLaMA

L’eccitazione per Qwen 3.8: il futuro degli LLM domestici accelera

Un utente racconta l’esperienza con Qwen 3.6 27B in Q4 su un Apple M5, immaginando un futuro in cui ogni query passa prima dal proprio LLM locale. Tra costi cloud in crescita e modelli frontier insostenibili, l’attesa per un ipotetico Qwen 3.8 denso ...

#Hardware #LLM On-Premise #DevOps
2026-08-07 LocalLLaMA

Stack vocale NVIDIA in locale: implicazioni per l'AI on-premise

L'analisi esamina come il rilascio dello stack vocale NVIDIA (ASR, TTS, codec) ottimizzato per esecuzione locale tramite GGUF e NeMo-Speech.cpp ridefinisca il calcolo del TCO, la sovranità dei dati e le architetture on-premise. Il passaggio dal cloud...

2026-08-06 LocalLLaMA

NVIDIA porta lo stack vocale in locale: ASR, TTS e codec ora girano on-device

NVIDIA ha rilasciato modelli di sintesi, riconoscimento e compressione vocale ottimizzati in GGUF, eseguibili localmente con NeMo-Speech.cpp. Una mossa che abilita pipeline vocali on-premise, riduce la dipendenza dal cloud e rafforza il controllo sui...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-05 LocalLLaMA

LLM on-device: LFM2.5-2.6B a 17 tok/s su OnePlus 13, inference solo CPU

Un developer ha eseguito LFM2.5-2.6B, un LLM da 2,69 miliardi di parametri con finestra di contesto di 128K, su uno smartphone OnePlus 13 usando solo CPU e quantization Q4_K_M. L'inference engine custom, di appena 450 KB, raggiunge 17 tok/s e support...

#Hardware #LLM On-Premise #DevOps
2026-08-05 LocalLLaMA

DeepSeek V4 Flash con MXFP4: il benchmark locale segna il nuovo vertice

I benchmark locali di un utente mostrano DeepSeek V4 Flash 0731 in formato MXFP4 al top per efficienza e qualità, raggiungendo 1.000 token/s in prefill e 90 token/s in generazione. Un risultato che accende i riflettori sulla quantization a bassa prec...

#Hardware #LLM On-Premise #DevOps
2026-08-05 Tom's Hardware

Frore: il LiquidJet raffredda del 10% le GPU Nvidia Rubin, prestazioni +15%

La tecnicia di raffreddamento a getto liquido promette di abbassare le temperature delle GPU di nuova generazione e di aumentare le prestazioni. I grandi fornitori cloud valutano l’uso di GPU ‘delidded’ nei data center, segnando un punto di svolta pe...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-05 LocalLLaMA

Maple-Preview: LLM da 20B con pesi ternari e ragionamento open-weight

Maple-Preview è un nuovo modello open-weight da 20 miliardi di parametri, con soli 1 miliardo di attivi per token e pesi in quantization ternaria. La combinazione riduce drasticamente la VRAM necessaria per l’inference, avvicinando scenari on-premise...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-04 LocalLLaMA

Ling-3.0-flash: il MoE da 127B scende a 128GB con l'FP8 ufficiale

InclusionAI ha rilasciato i pesi di Ling-3.0-flash su Hugging Face. Il modello conta 127,5 miliardi di parametri con un'architettura a 512 esperti, di cui solo 8 attivi per token. La vera notizia è la versione FP8 ufficiale: 128GB, sufficienti per un...

#Hardware #LLM On-Premise #DevOps
2026-08-04 LocalLLaMA

Ling-3.0-flash: 124 miliardi di parametri, 5 attivi, e un futuro on-premise

InclusionAI ha rilasciato Ling-3.0-flash, un modello MoE open-weight da 124 miliardi di parametri con appena 5 miliardi attivi per token. Annunciato prima dell’ondata Kimi K3 e DeepSeek-V4-Flash, il suo dimensionamento potrebbe ritagliargli una nicch...

#Hardware #LLM On-Premise #DevOps
2026-08-04 LocalLLaMA

Llama.cpp guadagna fino all’8% spostando il sampling sulla GPU

Una pull request elimina il round-trip CPU-GPU per il sampling MTP in llama.cpp. Su una RTX 5090 il guadagno sfiora l’8%, su una Tesla P40 è del 4% a causa della banda memoria ridotta. Un miglioramento netto senza costi aggiuntivi per chi fa inferenc...

#Hardware #LLM On-Premise #DevOps
2026-08-04 LocalLLaMA

Addio LM Studio, benvenuto llama.cpp: il bivio della maturità on-premise

Una domanda su Reddit sul passaggio a llama.cpp rivela molto più di un cambio di interfaccia: è il momento in cui l’inference locale passa dall’esplorazione individuale a stack pronti per l’azienda, con controllo, riproducibilità e automazione.

#Hardware #LLM On-Premise #DevOps
2026-07-27 Tech.eu

Multiverse Computing cerca 570M per portare gli LLM sui dispositivi edge

La scaleup spagnola alza 570 milioni con una valutazione di 1,7 miliardi, puntando sulla tecnicia CompactifAI che riduce le dimensioni degli LLM fino al 95% senza perdita di accuratezza. La posta in gioco: spostare l'inference dai data center ai disp...

#Hardware #LLM On-Premise #DevOps
2026-07-26 LocalLLaMA

Cosa ci fate davvero con i piccoli LLM? Il segnale per l’on-premise

La domanda comparsa su Reddit – «Cosa ci fate con i modelli piccoli?» – svela un riassetto dell’infrastruttura AI lontano dai data center. AI-Radar analizza i quattro scenari d’uso reali, il ruolo decisivo della VRAM, del TCO e dei framework locali, ...

2026-07-25 LocalLLaMA

Inflect v2: la sintesi vocale neurale da 4M di parametri gira tutta in locale

Il diciassettenne Owen Song rilascia Inflect v2: due modelli TTS completi da 4 e 9 milioni di parametri, sotto 38 MB, che operano su CPU senza API cloud. Micro e Nano offrono voce maschile fissa in inglese, niente clonazione. La vera notizia è la cor...

#Hardware #LLM On-Premise #Fine-Tuning
2026-07-24 DigiTimes

AMD lancia ROCm.ai: l’inference per l’AI agentica accelera fino a 3.3x

AMD ha annunciato ROCm.ai, una piattaforma dedicata all’intelligenza artificiale agentica, promettendo guadagni in inference fino a 3.3x. L’iniziativa rafforza la strategia software dell’azienda in un settore sempre più orientato a deployment on‑prem...

#Hardware #LLM On-Premise #DevOps
2026-07-22 LocalLLaMA

Solar-Open2: l'LLM MoE a 15B attivi che punta ai carichi agentivi on-premise

Upstage rilascia Solar-Open2-250B, un modello open-weight pensato per flussi agentivi con architettura MoE ibrida: 250 miliardi di parametri totali, ma solo 15 miliardi attivi per token. Attenzione lineare e rimozione del positional encoding permetto...

#Hardware #LLM On-Premise #Fine-Tuning
2026-07-22 LocalLLaMA

Unsloth quantizza Laguna S 2.1: un altro passo verso l’AI on-premise

Il team Unsloth annuncia su Reddit la disponibilità di varie quantization per Laguna S 2.1. Il processo di compressione riduce il fabbisogno di VRAM e facilita l’esecuzione in locale, accelerando l’adozione di LLM self-hosted per esigenze di sovranit...

#Hardware #LLM On-Premise #Fine-Tuning
2026-07-22 ArXiv cs.CL

SIFT, il classificatore che impara da sé: fine dei progetti di etichettatura

Un sistema di classificazione documentale che si auto-addestra usando una pipeline CPU economica e un giudice LLM. Il gate di promozione bloccato previene regressioni silenziose e l’onboarding richiede solo dichiarazioni, non lunghi progetti di annot...

#Hardware #LLM On-Premise #Fine-Tuning
2026-07-21 LocalLLaMA

Laguna-S-2.1: il 120B di Poolside e il fork su misura per llama.cpp

Poolside rilascia Laguna-S-2.1, un LLM da 120 miliardi di parametri, accompagnato da file GGUF e da un fork personalizzato di llama.cpp. Scelta inedita che accelera il deployment on-premise e abbassa la barriera per l’esecuzione locale di modelli di ...

#Hardware #LLM On-Premise #DevOps
← Torna ai Topic