Il problema, per chi gestisce H100 in produzione e non può usare modelli cinesi, non è la mancanza di LLM aperti: è la mancanza di LLM aperti nella fascia 120B+ con capacità visive. La discussione parte da un tecnico che lo spiega senza giri di parole: nei suoi progetti personali usa GLM, Qwen e DeepSeek, ma l'organizzazione vieta qualsiasi laboratorio cinese sui cluster locali. Se potesse scegliere, metterebbe subito GLM 5.3 Flash. Non può, e questo cambia tutti i calcoli.

Il divario non è una percezione. Tra i candidati occidentali, Thinking Machines Inkling Small viene indicato come il front runner, ma secondo il confronto riportato resta indietro di 16 punti nel benchmark AA rispetto a GLM 5.3 Flash. Cohere Command A+ soddisfa quasi tutti i requisiti, ma la finestra di contesto si ferma a 128k token. Poi ci sono Poolside Laguna S 2.1 e Nvidia Nemotron 3 Super, che rientrano nella classe di parametri ma non hanno capacità visive. Non è una rosa ampia: è un mercato in cui il vincolo aziendale restringe le opzioni a pochi modelli.

Questo scenario ha implicazioni strutturali, non solo tecniche. I laboratori cinesi hanno alzato l'asticella dell'open source proprio nella fascia alta con visione, spingendo qualità e prezzo. Chi esclude quei modelli per policy rimuove pressione competitiva dal proprio parco fornitori occidentali e accetta un costo implicito: può servire più hardware, più fine-tuning o più tempo di sviluppo per ottenere lo stesso livello su carichi multimodali. Su un cluster di H100, il divario di 16 punti non resta sulla carta: si traduce in pipeline che richiedono modelli aggiuntivi, controlli manuali o riduzione dello scope, soprattutto quando la visione è un requisito e non un optional.

C'è anche un'asimmetria di conoscenza. Lo stesso tecnico conosce bene GLM, Qwen e DeepSeek dai progetti personali e sa cosa sta perdendo; il management impone un perimetro che i practitioner vedono come un freno. Questo non è un semplice conflitto culturale: è il segnale che le policy di sourcing non riescono ancora a distinguere tra valutazione tecnica, sovranità dei dati e disponibilità di alternative locali. Per chi valuta deployment on-premise, il trade-off è tra controllo e capacità effettiva del parco modelli. AI-RADAR esplora questi nodi nella sezione /llm-onpremise, ma la scelta resta appesa ai vincoli specifici di ogni organizzazione.

La domanda con cui si chiude il thread — c'è qualche altro contendente forte nella categoria 120B? — è più indicativa delle risposte che mancano. Se servisse una risposta ovvia, probabilmente non ci sarebbe questa discussione.