Fuzzing adattivo svela le crepe delle MLLM: perché l’allucinazione resiste ai benchmark statici
Un nuovo framework di valutazione combina un benchmark a tassonomia unificata con un fuzzing multi-modale auto-adattivo (SAMF) e mostra che i migliori MLLM degradano sotto stress, rivelando uno scollamento tra ragionamento e ancoraggio ai fatti. L’al...