Topic / Trend Rising

La rivoluzione dell'AI on-premise: modelli piccoli, quantization e inference locale

Un'ondata di modelli linguistici piccoli, tecniche di quantization avanzate e hardware dedicato sta consentendo un'inference locale affidabile, allontanandosi dalla dipendenza cloud e promuovendo la sovranità dei dati.

Detected: 2026-07-28 · Updated: 2026-07-28

Articoli Correlati

2026-07-27 Tech.eu

Multiverse Computing cerca 570M per portare gli LLM sui dispositivi edge

La scaleup spagnola alza 570 milioni con una valutazione di 1,7 miliardi, puntando sulla tecnicia CompactifAI che riduce le dimensioni degli LLM fino al 95% senza perdita di accuratezza. La posta in gioco: spostare l'inference dai data center ai disp...

#Hardware #LLM On-Premise #DevOps
2026-07-26 LocalLLaMA

Cosa ci fate davvero con i piccoli LLM? Il segnale per l’on-premise

La domanda comparsa su Reddit – «Cosa ci fate con i modelli piccoli?» – svela un riassetto dell’infrastruttura AI lontano dai data center. AI-Radar analizza i quattro scenari d’uso reali, il ruolo decisivo della VRAM, del TCO e dei framework locali, ...

2026-07-25 LocalLLaMA

Inflect v2: la sintesi vocale neurale da 4M di parametri gira tutta in locale

Il diciassettenne Owen Song rilascia Inflect v2: due modelli TTS completi da 4 e 9 milioni di parametri, sotto 38 MB, che operano su CPU senza API cloud. Micro e Nano offrono voce maschile fissa in inglese, niente clonazione. La vera notizia è la cor...

#Hardware #LLM On-Premise #Fine-Tuning
2026-07-24 DigiTimes

AMD lancia ROCm.ai: l’inference per l’AI agentica accelera fino a 3.3x

AMD ha annunciato ROCm.ai, una piattaforma dedicata all’intelligenza artificiale agentica, promettendo guadagni in inference fino a 3.3x. L’iniziativa rafforza la strategia software dell’azienda in un settore sempre più orientato a deployment on‑prem...

#Hardware #LLM On-Premise #DevOps
2026-07-22 LocalLLaMA

Solar-Open2: l'LLM MoE a 15B attivi che punta ai carichi agentivi on-premise

Upstage rilascia Solar-Open2-250B, un modello open-weight pensato per flussi agentivi con architettura MoE ibrida: 250 miliardi di parametri totali, ma solo 15 miliardi attivi per token. Attenzione lineare e rimozione del positional encoding permetto...

#Hardware #LLM On-Premise #Fine-Tuning
2026-07-22 LocalLLaMA

Unsloth quantizza Laguna S 2.1: un altro passo verso l’AI on-premise

Il team Unsloth annuncia su Reddit la disponibilità di varie quantization per Laguna S 2.1. Il processo di compressione riduce il fabbisogno di VRAM e facilita l’esecuzione in locale, accelerando l’adozione di LLM self-hosted per esigenze di sovranit...

#Hardware #LLM On-Premise #Fine-Tuning
2026-07-22 ArXiv cs.CL

SIFT, il classificatore che impara da sé: fine dei progetti di etichettatura

Un sistema di classificazione documentale che si auto-addestra usando una pipeline CPU economica e un giudice LLM. Il gate di promozione bloccato previene regressioni silenziose e l’onboarding richiede solo dichiarazioni, non lunghi progetti di annot...

#Hardware #LLM On-Premise #Fine-Tuning
2026-07-21 LocalLLaMA

Laguna-S-2.1: il 120B di Poolside e il fork su misura per llama.cpp

Poolside rilascia Laguna-S-2.1, un LLM da 120 miliardi di parametri, accompagnato da file GGUF e da un fork personalizzato di llama.cpp. Scelta inedita che accelera il deployment on-premise e abbassa la barriera per l’esecuzione locale di modelli di ...

#Hardware #LLM On-Premise #DevOps
← Torna ai Topic