Topic / Trend Declining

Valutazione degli LLM sotto esame

Gli studi mostrano che le ottimizzazioni sui benchmark di coding non si trasferiscono alla programmazione generale e che il fine-tuning mirato ai benchmark distorce le classifiche. Anche le valutazioni mediche, di auto-riflessione, di framing e dei rilevatori di testo IA rivelano lacune di calibrazione, giudizi morali disomogenei e limiti dei rilevatori.

Detected: 2026-08-18 · Updated: 2026-08-18

Articoli Correlati

2026-08-18 ArXiv cs.AI

LLM medici: la fiducia è parziale, e gli errori si annidano nei casi ambigui

Un benchmark clinico controllato su gpt-4.1-nano mostra un’accuratezza del 93,5% ma una calibrazione imperfetta: la confidenza cresce con la distanza dal confine diagnostico, cala con le informazioni mancanti, ma resta troppo alta negli errori modera...

#LLM On-Premise #Fine-Tuning #DevOps
2026-08-14 ArXiv cs.CL

Auto-riflessione LLM: contano le azioni, non le domande o le tassonomie

Uno studio controllato a sei condizioni smonta un'assunzione diffusa: il valore dell'auto-riflessione nei LLM non arriva da domande diagnostiche o vocabolari di incertezza, ma dal routing tipizzato delle azioni. I dati mostrano guadagni consistenti e...

#LLM On-Premise #DevOps
← Torna ai Topic