Valutazione degli LLM e critica dei benchmark
StableOttimizzare gli LLM sui benchmark di coding più diffusi non trasferisce capacità generali di programmazione, e i test sulle allucinazioni a contesto lungo espongono nuovi modi di errore. Lacune nel richiamo di conoscenza offline e la curation di milioni di modelli Hugging Face rendono la valutazione una sfida centrale on-premise.