Topic / Trend Rising

L’ecosistema dell’inference AI on-premise matura grazie a innovazioni hardware e software

I progressi nei driver GPU, nei metodi di quantization e nei motori di inference rendono il deployment locale dell’IA economico e sovrano. Progetti come llama.cpp, Unsloth e ROCm di AMD stanno riducendo le barriere per le imprese che cercano il controllo dei dati.

Detected: 2026-07-25 · Updated: 2026-07-25

Articoli Correlati

2026-07-22 LocalLLaMA

Unsloth quantizza Laguna S 2.1: un altro passo verso l’AI on-premise

Il team Unsloth annuncia su Reddit la disponibilità di varie quantization per Laguna S 2.1. Il processo di compressione riduce il fabbisogno di VRAM e facilita l’esecuzione in locale, accelerando l’adozione di LLM self-hosted per esigenze di sovranit...

#Hardware #LLM On-Premise #Fine-Tuning
2026-07-20 LocalLLaMA

543 tok/s: un motore custom fa volare Qwen 35B su una sola RTX 5090

NInfer, un inference engine open source scritto da zero in C++/CUDA, raggiunge 543 token al secondo su Qwen3.6-35B-A3B con un prompt da 65mila token, tutto su una singola RTX 5090. Quantization su misura e ottimizzazioni hardware spingono le prestazi...

#Hardware #LLM On-Premise #DevOps
← Torna ai Topic