Topic / Trend Rising

Interpretabilità e Reverse Engineering degli LLM

I ricercatori estraggono direzioni latenti, tracce di ragionamento e strutture topologiche per comprendere e guidare il comportamento dei transformer. Nuovi strumenti rendono gli interni dei modelli più ispezionabili senza training o fine-tuning costosi.

Detected: 2026-08-14 · Updated: 2026-08-14

Articoli Correlati

2026-08-14 ArXiv cs.CL

Auto-riflessione LLM: contano le azioni, non le domande o le tassonomie

Uno studio controllato a sei condizioni smonta un'assunzione diffusa: il valore dell'auto-riflessione nei LLM non arriva da domande diagnostiche o vocabolari di incertezza, ma dal routing tipizzato delle azioni. I dati mostrano guadagni consistenti e...

#LLM On-Premise #DevOps
2026-08-12 LocalLLaMA

Decifrati i ragionamenti segreti di Claude e GPT: cosa cambia

Un paper svela come estrarre tutti i token di reasoning dai modelli Claude e GPT. Emergono overthinking diffuso, benchmark contaminati dalla memoria e l’uso del gap da parte della Cina per distillare modelli. La chiusura della falla ridefinisce il ve...

#LLM On-Premise #Fine-Tuning #DevOps
2026-08-12 ArXiv cs.LG

Come la topologia svela l'evoluzione interna dei Transformer

Un nuovo framework usa l'omologia persistente per tracciare la trasformazione delle rappresentazioni token da strato a strato. L'analisi topologica globale potrebbe indicare dove e come i modelli sviluppano feature rilevanti, con implicazioni per ott...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-10 ArXiv cs.LG

La verità è un vettore: individuare fake news senza uscire dal modello

Un team di ricerca sfrutta l’activation engineering per estrarre una direzione della menzogna nello spazio latente dei transformer. Senza fine-tuning né recupero di prove esterne, la proiezione dell’ultimo token alimenta un classificatore MLP. Il met...

#Hardware #LLM On-Premise #Fine-Tuning
← Torna ai Topic