Stack Infrastrutturale
Pattern di orchestrazione production-grade per LLM locali.
La GPU è solo il motore — l'AI locale in produzione è uno stack infrastrutturale: un motore di inferenza esegue il modello (llama.cpp, MLX), un runtime lo rende usabile (Ollama), un livello di serving lo fa scalare (vLLM/TGI, la cui paged attention + continuous batching moltiplicano il throughput di una GPU 10–20× sotto concorrenza), e intorno stanno la UI di chat (Open WebUI), il DB vettoriale per il RAG (Chroma, Qdrant, pgvector) e il livello ops — Docker con passthrough GPU, versioni bloccate, metriche Prometheus.
Le tre forme di riferimento: box singolo (Ollama + una GPU, zero cerimonie), server di team (vLLM + Open WebUI + SSO su una scheda 48–80GB dietro Docker Compose), flotta di produzione (istanze vLLM dietro load balancer, k8s, autoscaling, routing su modelli piccoli). Il fallimento classico è servire un team su un runtime single-user: si accoda, e gli utenti incolpano il modello.
Riferimenti approfonditi: lo stack software completo · architetture di riferimento · costruire un ChatGPT privato. Qui sotto: l'ultima intelligence infrastrutturale dal radar.
> SYSTEM_OFFLINE
Nessun articolo infrastruttura trovato.