Topic / Trend Rising

Affidabilità degli LLM agentici e valutazione per processi

La ricerca sta superando la valutazione basata solo sul risultato finale per adottare supervisione a livello di processo, ricompense basate sull'entropia e soglie di evidenza che individuano i guasti silenziosi. Questi metodi affrontano lacune di affidabilità in decisioni mediche, RAG multi-hop e traiettorie agentiche.

Detected: 2026-09-05 · Updated: 2026-09-05

Articoli Correlati

2026-09-03 ArXiv cs.CL

Quando tacere è la risposta giusta: addestrare il confine dell'evidenza

Un framework di training insegna ai modelli di QA grounded a rispondere solo quando l'evidenza diventa sufficiente, localizzando il punto esatto in cui l'astensione lascia spazio alla risposta. Su HotpotQA, 2WikiMultiHopQA e MuSiQue, con Qwen2.5-3B-I...

#LLM On-Premise #Fine-Tuning #DevOps
2026-09-03 ArXiv cs.CL

PRO-Step corregge il RAG multi-hop: premia ogni passo, non solo il risultato

PRO-Step introduce una supervisione a livello di passo per il Retrieval-Augmented Generation. Invece di valutare solo la risposta finale, un modello generativo di ricompensa controlla coerenza logica e aderenza alle evidenze in ogni fase del ragionam...

#Hardware #LLM On-Premise #Fine-Tuning
2026-09-02 ArXiv cs.CL

I giudici LLM a esito unico non vedono i guasti silenziosi degli agenti

Uno studio su 400 traiettorie mostra che i giudici LLM basati solo sull'esito rilevano l'84% dei guasti visibili ma solo il 45% di quelli silenziosi e segnalano come errate un terzo delle traiettorie corrette. Un giudice con rubrica per passi arriva ...

#LLM On-Premise #DevOps
← Torna ai Topic