Topic / Trend Rising

Credibilità dei Benchmark LLM e Lacune Valutative

Nuovi studi mostrano che il fine-tuning sui benchmark di coding non si generalizza e che i benchmark diventano spesso obiettivi di addestramento. Suite dedicate per accuratezza clinica, riassunti di romanzi lunghi e compiti di ricerca rivelano lacune di calibrazione e allucinazione.

Detected: 2026-08-23 · Updated: 2026-08-23

Articoli Correlati

2026-08-18 MIT Technology Review

L'AI che si migliora da sola? Prima deve imparare a fare ricerca

Uno studio multi-ateneo guidato da Princeton ha messo alla prova Claude Opus 4.8 su domande di ricerca originali destinate a NeurIPS 2026. Gli agenti hanno gestito l'ingegneria, ma non il giudizio e la creatività necessari per una ricerca aperta: ent...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-18 ArXiv cs.AI

LLM medici: la fiducia è parziale, e gli errori si annidano nei casi ambigui

Un benchmark clinico controllato su gpt-4.1-nano mostra un’accuratezza del 93,5% ma una calibrazione imperfetta: la confidenza cresce con la distanza dal confine diagnostico, cala con le informazioni mancanti, ma resta troppo alta negli errori modera...

#LLM On-Premise #Fine-Tuning #DevOps
← Torna ai Topic