Topic / Trend Stable

Valutazione e affidabilità degli LLM

La ricerca mostra che i giudici basati solo sull'esito non vedono i guasti silenziosi, mentre supervisione a livello di passo, confini di astensione e giudizio clinico rivelano i limiti di affidabilità dei modelli di frontiera.

Detected: 2026-09-06 · Updated: 2026-09-06

Articoli Correlati

2026-09-03 ArXiv cs.CL

Quando tacere è la risposta giusta: addestrare il confine dell'evidenza

Un framework di training insegna ai modelli di QA grounded a rispondere solo quando l'evidenza diventa sufficiente, localizzando il punto esatto in cui l'astensione lascia spazio alla risposta. Su HotpotQA, 2WikiMultiHopQA e MuSiQue, con Qwen2.5-3B-I...

#LLM On-Premise #Fine-Tuning #DevOps
2026-09-03 ArXiv cs.CL

PRO-Step corregge il RAG multi-hop: premia ogni passo, non solo il risultato

PRO-Step introduce una supervisione a livello di passo per il Retrieval-Augmented Generation. Invece di valutare solo la risposta finale, un modello generativo di ricompensa controlla coerenza logica e aderenza alle evidenze in ogni fase del ragionam...

#Hardware #LLM On-Premise #Fine-Tuning
2026-09-02 ArXiv cs.CL

I giudici LLM a esito unico non vedono i guasti silenziosi degli agenti

Uno studio su 400 traiettorie mostra che i giudici LLM basati solo sull'esito rilevano l'84% dei guasti visibili ma solo il 45% di quelli silenziosi e segnalano come errate un terzo delle traiettorie corrette. Un giudice con rubrica per passi arriva ...

#LLM On-Premise #DevOps
← Torna ai Topic