Nota: questa è una guida pratica, non consulenza legale. Per una decisione di compliance specifica, coinvolgi il tuo DPO o un avvocato qualificato in protezione dei dati.
Passo 1 — Il test decisionale: ti serve davvero?
L'on-premise merita una valutazione se rispondi sì ad almeno una di queste. Se sono tutti no, confronta un'opzione cloud in base a contratto, ubicazione, garanzie e prezzo corrente.
- Tratti dati personali, sanitari, legali, finanziari o segreti industriali che legalmente o contrattualmente non possono lasciare il tuo controllo?
- Inviare i tuoi documenti a un provider AI statunitense creerebbe un problema di trasferimento internazionale che i tuoi clienti o le regole di settore non accettano?
- Il tuo volume di query è alto e costante (migliaia al giorno) — il regime in cui le bollette API per-token superano l'hardware?
- Ti serve disponibilità garantita, funzionamento offline, o piena verificabilità del modello e dei suoi dati?
Il trade-off più profondo cloud-vs-locale — incluso lo schema ibrido su cui la maggior parte delle aziende atterra davvero — è nella nostra guida on-premise vs cloud.
Passo 2 — Il quadro di compliance: GDPR + EU AI Act
A un'azienda italiana che usa l'AI si applicano due normative. Il GDPR regola i dati personali che passano nel modello: l'on-premise non ti rende automaticamente conforme, ma può ridurre il numero di responsabili esterni e di trasferimenti da documentare. Servono comunque base giuridica, controlli di sicurezza, regole di conservazione e una valutazione per il trattamento concreto. Vedi il testo ufficiale del GDPR.
L'EU AI Act aggiunge un livello basato sul rischio, con obblighi che entrano in vigore alle date previste dal Regolamento. Un uso comune per redazione o ricerca interna può non rientrare nelle categorie ad alto rischio, ma la classificazione dipende da finalità e contesto di deployment. L'esecuzione locale non cambia la classificazione: può facilitare la raccolta delle evidenze, ma non sostituisce la governance richiesta. Leggi il testo ufficiale dell'AI Act e il quadro completo nella nostra guida all'EU AI Act.
Passo 3 — Le tre fasce di budget realistiche
| Fascia | Hardware | Serve | Adatta a |
|---|---|---|---|
| ~€3k — Pilota | Una workstation, GPU 24GB (RTX 4090/3090 usata) | 1–5 utenti, un modello 27–32B | Dimostrare il valore su un caso d'uso reale |
| ~€8–12k — Team | Server dedicato, GPU 48GB o 2×24GB | 10–30 utenti concorrenti via vLLM | Un assistente per tutto un reparto + RAG |
| ~€25–30k+ — Produzione | Multi-GPU (classe 80GB), ridondanza, UPS | Intera azienda, modelli 70B+, SLA | L'AI come infrastruttura centrale |
Queste sono stime indicative dell'hardware, non preventivi o misurazioni. Aggiungi installazione e gestione — un pilota può stare nelle ore dell'IT interno; un sistema di produzione richiede qualche giorno di configurazione specialistica più la manutenzione nel tempo. Le scelte dietro ogni fascia sono nella nostra guida alle GPU, e il costo di possesso completo nella guida ai costi.
Passo 4 — Build vs API: dove si incrociano
Lasciando da parte per un attimo la conformità e guardando solo al costo: una API cloud può costare meno finché l'uso non sale al punto da far ripagare l'hardware. Il punto di pareggio dipende da prezzi API e hardware, utilizzo, elettricità, supporto e qualità del modello. Consideralo un calcolo di scenario con questi input, non una soglia misurata: questa guida non dichiara un ritorno universale in un anno.
La regola onesta per decidere: lascia che sia la conformità a dire se andare on-premise, e che sia il volume a dire quando tornano anche i conti. Quando puntano entrambi nella stessa direzione — dati sensibili e volumi costanti — la scelta si fa da sola.
Passo 5 — Dove le PMI italiane trovano valore reale per prime
- Ricerca interna nella documentazione aziendale — contratti, manuali, procedure (RAG sui tuoi documenti): alto valore, basso rischio.
- Stesura e riscrittura di preventivi, email e report in italiano — un buon 27B se la cava in locale senza far uscire un solo dato.
- Un assistente di supporto ancorato alla documentazione di prodotto — smaltisce le domande ripetitive senza esporre i dati dei clienti.
- Estrazione di dati strutturati da fatture, PDF e moduli — un lavoro di routine in cui un piccolo modello locale dà il meglio.
Lo schema di costruzione per i primi due è il nostro tutorial sul chatbot RAG; l'architettura enterprise è in ChatGPT privato per l'azienda.