Immaginate di dover decidere se una sequenza di simboli segue una regola di involuzione (un'operazione che, applicata due volte, riporta all'elemento di partenza) oppure un ciclo di tre passi. Un transformer da 2.8 milioni di parametri non solo distingue le due ipotesi, ma lo fa con un'entropia che si discosta di appena 0.01 bit dal calcolo bayesiano ottimale — sia con token interi tradizionali, sia con simboli opachi il cui significato viene rimescolato a ogni episodio. È il risultato di un "tunnel del vento bayesiano", un ambiente controllato dove la distribuzione a posteriori sulle classi di ipotesi è nota in forma chiusa, descritto in un recente studio sul model selection nei transformer.

Il concetto di tunnel del vento bayesiano estende una linea di ricerca che aveva già dimostrato come i transformer possano eseguire un filtraggio bayesiano esatto all'interno di una classe di ipotesi fissata. Ora il passo successivo è chiedersi se siano capaci di model selection: identificare quale classe di ipotesi spiega meglio i dati, senza averla definita a priori. La metafora del tunnel del vento è calzante: invece di testare modelli nel mondo reale, si creano condizioni di laboratorio dove la "verità" è nota, permettendo di misurare con precisione quanto il comportamento del modello si avvicini all'ottimo teorico.

La scelta delle involuzioni a punto fisso — funzioni per cui f(f(x)) = x — non è casuale. Si tratta di una proprietà puramente relazionale, che non richiede aritmetica. In questo scenario, il transformer mostra un accordo quasi perfetto con il riferimento bayesiano. Ma la vera sorpresa arriva quando si introducono confronti non annidati: per esempio, discriminare tra involuzioni e cicli di ordine 3, dove nessuna classe è un sottoinsieme dell'altra. Qui l'errore medio assoluto sulla distribuzione a posteriori delle classi scende sotto 0.001, dimostrando che il modello non si limita a preferire l'ipotesi più semplice, ma compie autentica model selection.

Tuttavia, il framework cambia radicalmente quando la statistica discriminante diventa aritmetica. Se la distinzione tra classi si basa su addizione modulare (rotazioni) o moltiplicazione modulare (f(x) = cx mod p), il model selection funziona solo con token interi. Con simboli opachi — unità simboliche prive di identità stabile, il cui mapping cambia a ogni episodio — il modello fallisce completamente. E questo confine non è una questione di scala: portare il modello da 2.8 a 316 milioni di parametri (un fattore 112x) non cambia l'esito. La capacità di fare aritmetica scompare se i token non hanno una semantica fissa.

Un controllo di stazionarietà conferma la diagnosi: se i simboli opachi vengono rietichettati in modo fisso (cioè la stessa relazione mantiene lo stesso simbolo in tutti gli episodi), il modello riesce di nuovo, con un accordo di 0.009 bit. Non serve l'identità dei numeri, ma una semantica stabile che consenta al transformer di compilare circuiti aritmetici. Le diagnostiche sui subtask puntano inoltre il dito sulla composizione dell'inversione dell'header con l'operazione aritmetica, non sul parsing dell'header in sé: il guasto è a valle, nell'integrazione fra controllo e calcolo.

Lo studio non si ferma ai modelli da laboratorio. Le sonde — necessariamente "lossy", quindi direzionali ma non esatte — su modelli linguistici di frontiera mostrano un comportamento qualitativamente bayesiano, ma con un divario di calibrazione di circa 55 volte. In altre parole, questi modelli sembrano muoversi nella direzione giusta, ma le loro probabilità sono lontane dall'affidabilità di un agente bayesiano.

Per chi sviluppa o valuta sistemi basati su LLM, questi risultati offrono una lente preziosa. La distinzione fra pattern matching sintattico e capacità di compilare algoritmi partendo da simboli con identità stabile è centrale per decidere dove un modello può essere usato in modo affidabile. In contesti on-premise ad alta posta — come analisi finanziarie, diagnostica o controllo di processo — sapere che l'aritmetica richiede ancoraggio semantico pone domande precise sull'addestramento e sulla tokenizzazione. I tunnel del vento bayesiani, pur nella loro astrazione, forniscono un banco di prova rigoroso per separare l'apparenza dalla sostanza, molto oltre i benchmark convenzionali.