Il benchmark come obiettivo: distorsione dei ranking e rischi per l'on-premise
Il fine-tuning su SWE-bench non trasferisce capacità a suite come Django o LiveCodeBench. Il benchmark diventa obiettivo di addestramento e smette di misurare capacità generale. Per chi gestisce LLM self-hosted, un punteggio gonfiato falsa il calcolo...