LLM medici: la fiducia è parziale, e gli errori si annidano nei casi ambigui
Un benchmark clinico controllato su gpt-4.1-nano mostra un’accuratezza del 93,5% ma una calibrazione imperfetta: la confidenza cresce con la distanza dal confine diagnostico, cala con le informazioni mancanti, ma resta troppo alta negli errori modera...