Topic / Trend Rising

Validità dei benchmark e lacune nella valutazione

La ricerca mostra che ottimizzare gli LLM sui benchmark di coding non trasferisce capacità generali di programmazione e l'estrazione del ragionamento nascosto rivela contaminazione e overthinking. Nuovi approcci di valutazione puntano sull'esecuzione reale del codice e sulla calibrazione più che sui ranking.

Detected: 2026-08-19 · Updated: 2026-08-19

Articoli Correlati

2026-08-18 ArXiv cs.AI

LLM medici: la fiducia è parziale, e gli errori si annidano nei casi ambigui

Un benchmark clinico controllato su gpt-4.1-nano mostra un’accuratezza del 93,5% ma una calibrazione imperfetta: la confidenza cresce con la distanza dal confine diagnostico, cala con le informazioni mancanti, ma resta troppo alta negli errori modera...

#LLM On-Premise #Fine-Tuning #DevOps
2026-08-13 ArXiv cs.CL

Backtrader-Bench: il benchmark che costringe gli LLM a eseguire codice

Backtrader-Bench introduce due pipeline per valutare agenti LLM nel trading algoritmico: una genera quesiti a risposta multipla da configurazioni di backtest con verifica indipendente, l'altra estrae domande più difficili che richiedono esecuzione di...

#LLM On-Premise #Fine-Tuning
2026-08-12 LocalLLaMA

Decifrati i ragionamenti segreti di Claude e GPT: cosa cambia

Un paper svela come estrarre tutti i token di reasoning dai modelli Claude e GPT. Emergono overthinking diffuso, benchmark contaminati dalla memoria e l’uso del gap da parte della Cina per distillare modelli. La chiusura della falla ridefinisce il ve...

#LLM On-Premise #Fine-Tuning #DevOps
← Torna ai Topic