Topic / Trend Rising

Ascesa dell'AI On-Premise e del Deployment Locale di LLM

Un movimento crescente sta permettendo ai modelli linguistici di grandi dimensioni di funzionare efficientemente su hardware consumer e dispositivi edge, spinto da strumenti open-source, quantization e esigenze di privacy.

Detected: 2026-06-26 · Updated: 2026-07-07

Articoli Correlati

2026-07-05 LocalLLaMA

RTX 3090 e LLM: eseguire Qwen 27B con 200K token in locale è realtà

La community dei maker AI celebra la potenza della NVIDIA RTX 3090: un utente condivide la sua esperienza nell’eseguire il modello Qwen 27B con una finestra di contesto di 200.000 token, utilizzando la configurazione ‘club 3090’ disponibile su GitHub...

#Hardware #LLM On-Premise #DevOps
2026-07-03 LocalLLaMA

DeepSeek V4 Flash con 1M token in locale: la patch open-source per RTX 5090

Uno sviluppatore ha creato una patch CUDA per llama.cpp che permette a DeepSeek V4 Flash di operare con un contesto di un milione di token su una singola RTX 5090, riducendo la VRAM necessaria da circa 256 GB a soli 31 GB e raggiungendo velocità di p...

#Hardware #LLM On-Premise #DevOps
2026-07-02 LocalLLaMA

vLLM, un fix silenzioso raddoppia la finestra di contesto su una GPU consumer

Un post di gratitudine su Reddit svela un progresso tecnico: le ultime release di vLLM eliminano i bug di allocazione memoria, permettendo a Qwen2.5 7B di operare con 240.000 token su una RTX 5090, contro i 120.000 precedenti. Un esempio di come l’op...

#Hardware #LLM On-Premise #DevOps
2026-06-30 LocalLLaMA

64 GB di VRAM e LLM per coding: l’esperimento on-premise con Qwen 3.5 122b

Un utente Reddit con 64 GB di VRAM condivide la sua esperienza di inference locale con una versione Unsloth di Qwen 3.5 122b-a10b, quantizzato UD-IQ4_NL, finestra di contesto 100.000 token e velocità di circa 30 tok/sec. L’architettura MoE consente d...

#Hardware #LLM On-Premise #DevOps
2026-06-30 LocalLLaMA

NVIDIA rilascia Qwen3.6-27B-NVFP4: ottimizzazione per l'inference locale

NVIDIA ha reso disponibile su Hugging Face il modello Qwen3.6-27B ottimizzato con Quantization NVFP4. Questa mossa sottolinea l'impegno verso l'efficienza nell'inference di Large Language Models, riducendo i requisiti di VRAM e migliorando il through...

#Hardware #LLM On-Premise #DevOps
2026-06-24 Phoronix

Linux 7.2: la miglioria MGLRU spinge MongoDB fino al +100% di throughput

La gestione della memoria nel kernel Linux 7.2 porta un guadagno tra il 30 e il 100% per MongoDB. Il merito è dell’algoritmo MGLRU, più intelligente nel recuperare pagine sotto pressione. Un vantaggio concreto anche per l’infrastruttura di chi esegue...

#Hardware #LLM On-Premise #DevOps
2026-06-21 LocalLLaMA

Due Radeon R9700 spingono un LLM da 27B: i numeri di una build on-premise

Un server con due GPU Radeon AI PRO R9700 e 64 GB di VRAM totale mette alla prova Qwen 3.6 27B in quantization Q8 con Multi-Token Prediction. Decode fino a 67 token/s su contesti pieni, prefill oltre 1.500 t/s e prompt caching efficiente: uno spaccat...

#Hardware #LLM On-Premise #DevOps
2026-06-19 LocalLLaMA

Agenti AI locali nel 2026: cosa funziona davvero, oltre i buzzword

Un megathread su Reddit accende il confronto sugli agenti AI eseguibili in locale con modelli open-weight. Tra definizioni traballanti e l’hype del termine ‘Harness’, emerge un cantiere in cui autonomia, controllo hardware e maturità del software def...

#Hardware #LLM On-Premise #DevOps
← Torna ai Topic