Topic / Trend Rising

Agenti AI e valutazione orientata al processo

Nuovi framework e benchmark per agenti spostano la valutazione dagli output finali alle traiettorie complete, alle chiamate a strumenti, agli errori e alla confidenza. I progetti spaziano dal fact-checking modulare agli agenti scientifici autonomi, all'ottimizzazione della supply chain e alla formulazione auto-riparante.

Detected: 2026-09-15 · Updated: 2026-09-15

Articoli Correlati

2026-09-15 ArXiv cs.CL

PhysMent: il benchmark che trasforma gli LLM in sperimentatori attivi

PhysMent valuta gli LLM su 105 scene di meccanica classica nel simulatore MuJoCo: i modelli devono applicare forze, interrogare stati, avanzare il tempo e modificare la geometria prima di rispondere. Nei compiti quantitativi multi-step la maggior par...

#LLM On-Premise #Fine-Tuning #DevOps
2026-09-14 ArXiv cs.CL

R2VC: il fact-checking modulare separa recupero, verifica e fiducia

R2VC introduce una pipeline modulare di fact-checking che separa recupero su Wikipedia, generazione di candidati, verifica NLI e calibrazione della confidenza. Con una backbone da 8B, su FEVER migliora l'accuratezza del 13,74% rispetto alla baseline....

#Hardware #LLM On-Premise #Fine-Tuning
2026-09-12 ArXiv cs.AI

QUBO dal linguaggio naturale: il self-repair multi-agente fa la differenza

Un framework multi-agente genera formulazioni QUBO da descrizioni in linguaggio naturale, usando test case per correggersi. Su QUBOBench, 100 problemi in 12 domini, raggiunge il 68% di accuratezza e supera del 22% una baseline a chiamata singola. Il ...

#Hardware #LLM On-Premise #DevOps
2026-09-11 AI News

NVIDIA automatizza la supply chain con Palantir, cuOpt e un LLM da 30B

NVIDIA ha costruito un centro di comando per l’allocazione delle forniture basato su Palantir Foundry e cuOpt. Il sistema combina ottimizzazione MILP e un LLM Nemotron 3.5 Lightning da 30 miliardi di parametri, tre attivi, affinato su due B200 in poc...

#Hardware #LLM On-Premise #Fine-Tuning
2026-09-11 ArXiv cs.AI

OpenDiscoveryTrace: le tracce che mancavano agli AI scientist

Un dataset pubblico registra 558 traiettorie complete di agenti scientifici, con pensieri, chiamate a strumenti, errori e confidenza. I benchmark tradizionali guardano solo gli output finali; qui emergono differenze tra modelli con success rate simil...

#LLM On-Premise #Fine-Tuning #DevOps
2026-09-10 LocalLLaMA

Nvidia rilascia SoL-Pi: agenti Pi più efficienti senza patch al framework

Nvidia ha rilasciato SoL-Pi, estensione standalone per il framework Pi. Introduce quattro meccanismi opt-in, disabilitati per default, nati da cicli di auto-research: riducono turni ripetuti, replay del contesto, osservazioni sovradimensionate e lett...

#Hardware #LLM On-Premise
← Torna ai Topic