Topic / Trend Rising

Validità dei benchmark e limiti della valutazione

Il fine-tuning sui benchmark di coding più diffusi non si trasferisce a suite di sviluppo più ampie, e il fuzzing avversariale o i domini specialistici rivelano una generalizzazione fragile nei LLM e nei MLLM. La community si sta orientando verso valutazioni esecutive e basate sulle azioni per evitare l'overfitting sui benchmark.

Detected: 2026-08-17 · Updated: 2026-08-17

Articoli Correlati

2026-08-14 ArXiv cs.CL

Auto-riflessione LLM: contano le azioni, non le domande o le tassonomie

Uno studio controllato a sei condizioni smonta un'assunzione diffusa: il valore dell'auto-riflessione nei LLM non arriva da domande diagnostiche o vocabolari di incertezza, ma dal routing tipizzato delle azioni. I dati mostrano guadagni consistenti e...

#LLM On-Premise #DevOps
2026-08-13 ArXiv cs.CL

Backtrader-Bench: il benchmark che costringe gli LLM a eseguire codice

Backtrader-Bench introduce due pipeline per valutare agenti LLM nel trading algoritmico: una genera quesiti a risposta multipla da configurazioni di backtest con verifica indipendente, l'altra estrae domande più difficili che richiedono esecuzione di...

#LLM On-Premise #Fine-Tuning
2026-08-11 ArXiv cs.CL

LLM e gestione rifiuti: WuYuEval svela i limiti dell'AI generalista

Un benchmark dedicato mette alla prova 33 Large Language Model su compiti di gestione dei rifiuti solidi. Il migliore sfiora il 95% di accuratezza nelle domande semplici, ma in quelle complesse la media crolla al 42,5%. Calcolo, progettazione sperime...

#LLM On-Premise #Fine-Tuning #DevOps
← Torna ai Topic