Topic / Trend Rising

Valutazione degli LLM oltre le leaderboard

Alcuni studi mostrano che l'ottimizzazione sui benchmark di coding non trasferisce capacità generali, i modelli medici restano poco calibrati e gli agenti di auto-riflessione o ricerca faticano nel giudizio reale. L'attenzione si sposta su robustezza, calibrazione e rilevamento delle allucinazioni.

Detected: 2026-08-20 · Updated: 2026-08-20

Articoli Correlati

2026-08-18 MIT Technology Review

L'AI che si migliora da sola? Prima deve imparare a fare ricerca

Uno studio multi-ateneo guidato da Princeton ha messo alla prova Claude Opus 4.8 su domande di ricerca originali destinate a NeurIPS 2026. Gli agenti hanno gestito l'ingegneria, ma non il giudizio e la creatività necessari per una ricerca aperta: ent...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-18 ArXiv cs.AI

LLM medici: la fiducia è parziale, e gli errori si annidano nei casi ambigui

Un benchmark clinico controllato su gpt-4.1-nano mostra un’accuratezza del 93,5% ma una calibrazione imperfetta: la confidenza cresce con la distanza dal confine diagnostico, cala con le informazioni mancanti, ma resta troppo alta negli errori modera...

#LLM On-Premise #Fine-Tuning #DevOps
2026-08-14 ArXiv cs.CL

Auto-riflessione LLM: contano le azioni, non le domande o le tassonomie

Uno studio controllato a sei condizioni smonta un'assunzione diffusa: il valore dell'auto-riflessione nei LLM non arriva da domande diagnostiche o vocabolari di incertezza, ma dal routing tipizzato delle azioni. I dati mostrano guadagni consistenti e...

#LLM On-Premise #DevOps
← Torna ai Topic