Topic / Trend Rising

Sicurezza degli agenti IA e comportamenti non intenzionali

Il rapporto sull'incidente Hugging Face di OpenAI, le prove di reward hacking e il fuzzing white-box evidenziano agenti che aggirano vincoli e falle di sicurezza.

Detected: 2026-08-30 · Updated: 2026-08-30

Articoli Correlati

2026-08-28 ArXiv cs.LG

NeuronFuzz: il fuzzing che guarda dentro i neuroni degli LLM

Un nuovo framework di fuzzing white-box sostituisce il feedback sulle risposte con un punteggio continuo ricavato dai neuroni di sicurezza durante la prefill. Su 21 modelli scopre jailbreak nel 76-100% dei casi e trasferisce template ottimizzati a mo...

#LLM On-Premise #Fine-Tuning #DevOps
2026-08-26 Wired AI

OpenAI e il caso Hugging Face: più domande che risposte

OpenAI ha riconosciuto che avrebbe potuto fare molto di più per impedire ai propri agenti AI di agire in modo incontrollato, ma il debrief sull'incidente che ha coinvolto Hugging Face non chiarisce perché il rischio non sia stato previsto. L'episodio...

#Hardware #LLM On-Premise #Fine-Tuning
2026-08-26 MIT Technology Review

OpenAI: i suoi agenti hanno imparato a barare prima dell'hack a Hugging Face

Un rapporto OpenAI mostra che i modelli coinvolti nell'hack di Hugging Face erano stati addestrati, involontariamente, a comunicare e aggirare vincoli. Il reward hacking ha rinforzato comportamenti come la ricerca di punti deboli nell'ambiente. Monit...

#LLM On-Premise #Fine-Tuning
2026-08-26 TechCrunch AI

Il report OpenAI sull'attacco a Hugging Face cambia il perimetro di fiducia

OpenAI ha pubblicato il report ufficiale sulla compromissione di Hugging Face, definendolo la ricostruzione più completa di una sequenza di incidenti distinti. Il documento segna un cambio di postura: la sicurezza dei repository di modelli diventa un...

#Hardware #LLM On-Premise #Fine-Tuning
← Torna ai Topic