Medical LLMs: Partial Confidence Calibration and Errors in Ambiguous Cases
A controlled clinical benchmark on gpt-4.1-nano shows 93.5% accuracy but imperfect calibration: confidence rises with evidence distance from the diagnostic boundary and falls with missing information, yet remains too high in moderate, conflicting err...