Topic / Trend Rising

Valutazione dell'AI agentica e supervisione a livello di processo

La ricerca sta superando la valutazione basata solo sul risultato finale per adottare ricompense a livello di passo, confini dell'evidenza e harness espliciti per intercettare i guasti silenziosi di agenti e sistemi RAG. Nuovi framework premiano la correttezza di ogni passo e la calibrazione dell'incertezza invece del solo esito.

Detected: 2026-09-04 · Updated: 2026-09-04

Articoli Correlati

2026-09-03 ArXiv cs.CL

Quando tacere è la risposta giusta: addestrare il confine dell'evidenza

Un framework di training insegna ai modelli di QA grounded a rispondere solo quando l'evidenza diventa sufficiente, localizzando il punto esatto in cui l'astensione lascia spazio alla risposta. Su HotpotQA, 2WikiMultiHopQA e MuSiQue, con Qwen2.5-3B-I...

#LLM On-Premise #Fine-Tuning #DevOps
2026-09-03 ArXiv cs.CL

PRO-Step corregge il RAG multi-hop: premia ogni passo, non solo il risultato

PRO-Step introduce una supervisione a livello di passo per il Retrieval-Augmented Generation. Invece di valutare solo la risposta finale, un modello generativo di ricompensa controlla coerenza logica e aderenza alle evidenze in ogni fase del ragionam...

#Hardware #LLM On-Premise #Fine-Tuning
2026-09-02 ArXiv cs.CL

I giudici LLM a esito unico non vedono i guasti silenziosi degli agenti

Uno studio su 400 traiettorie mostra che i giudici LLM basati solo sull'esito rilevano l'84% dei guasti visibili ma solo il 45% di quelli silenziosi e segnalano come errate un terzo delle traiettorie corrette. Un giudice con rubrica per passi arriva ...

#LLM On-Premise #DevOps
2026-09-01 ArXiv cs.AI

DS-Lighting: un harness esplicito per gli agenti data science

DS-Lighting è un toolkit open-source che rende esplicito il harness nell'automazione della data science. Scompone il harness in quattro strati: dati, workflow, esecuzione e valutazione, e rappresenta gli agenti come programmi operatori eseguibili. In...

#Hardware #LLM On-Premise #DevOps
← Torna ai Topic