Topic / Trend Rising

AI Agentica, Valutazione e Sicurezza

L'AI agentica accelera, ma affidabilità e sicurezza restano centrali: i giudici LLM mancano i guasti silenziosi, i connettori MCP ampliano la superficie d'attacco, emergono modelli agentici aperti e si evidenziano limiti nelle decisioni oncologiche.

Detected: 2026-09-03 · Updated: 2026-09-03

Articoli Correlati

2026-09-03 ArXiv cs.CL

Quando tacere è la risposta giusta: addestrare il confine dell'evidenza

Un framework di training insegna ai modelli di QA grounded a rispondere solo quando l'evidenza diventa sufficiente, localizzando il punto esatto in cui l'astensione lascia spazio alla risposta. Su HotpotQA, 2WikiMultiHopQA e MuSiQue, con Qwen2.5-3B-I...

#LLM On-Premise #Fine-Tuning #DevOps
2026-09-03 ArXiv cs.CL

PRO-Step corregge il RAG multi-hop: premia ogni passo, non solo il risultato

PRO-Step introduce una supervisione a livello di passo per il Retrieval-Augmented Generation. Invece di valutare solo la risposta finale, un modello generativo di ricompensa controlla coerenza logica e aderenza alle evidenze in ogni fase del ragionam...

#Hardware #LLM On-Premise #Fine-Tuning
2026-09-02 ArXiv cs.CL

I giudici LLM a esito unico non vedono i guasti silenziosi degli agenti

Uno studio su 400 traiettorie mostra che i giudici LLM basati solo sull'esito rilevano l'84% dei guasti visibili ma solo il 45% di quelli silenziosi e segnalano come errate un terzo delle traiettorie corrette. Un giudice con rubrica per passi arriva ...

#LLM On-Premise #DevOps
2026-09-01 ArXiv cs.AI

DS-Lighting: un harness esplicito per gli agenti data science

DS-Lighting è un toolkit open-source che rende esplicito il harness nell'automazione della data science. Scompone il harness in quattro strati: dati, workflow, esecuzione e valutazione, e rappresenta gli agenti come programmi operatori eseguibili. In...

#Hardware #LLM On-Premise #DevOps
2026-08-28 ArXiv cs.LG

NeuronFuzz: il fuzzing che guarda dentro i neuroni degli LLM

Un nuovo framework di fuzzing white-box sostituisce il feedback sulle risposte con un punteggio continuo ricavato dai neuroni di sicurezza durante la prefill. Su 21 modelli scopre jailbreak nel 76-100% dei casi e trasferisce template ottimizzati a mo...

#LLM On-Premise #Fine-Tuning #DevOps
2026-08-27 LocalLLaMA

Apodex 1.1: i modelli agentici aperti arrivano in più formati quantizzati

Il team di Apodex presenta un AMA su Apodex 1.1, famiglia di modelli aperti per lavoro agente complesso. Oltre ai checkpoint, rilascia un harness open source e due paper. I formati includono FP8, GPTQ-Int4 e NVFP4, segnale che l'inference locale entr...

#LLM On-Premise #DevOps
2026-08-27 LocalLLaMA

Apodex 1.1: modelli agentici aperti e quantization come segnale strategico

Il team di Apodex ha presentato Apodex 1.1, famiglia di modelli aperti pensata per lavoro complesso con ragionamento, ricerca, esecuzione di codice e coordinamento di più agenti. Accanto ai modelli, rilascia FrontierAgent e due paper. Le varianti NVF...

#Hardware #LLM On-Premise #DevOps
← Torna ai Topic