Topic / Trend Rising

Sicurezza IA, interpretabilità e calibrazione del rischio

Ricerca e strumenti stanno evidenziando lacune nella calibrazione del rischio degli LLM, nel controllo dell'empatia e nella robustezza ai jailbreak, mentre l'interpretabilità meccanicistica diventa più accessibile. Le applicazioni educative e cliniche iniziano ad adottare framework di governance per questi limiti.

Detected: 2026-08-29 · Updated: 2026-08-29

Articoli Correlati

2026-08-28 ArXiv cs.LG

NeuronFuzz: il fuzzing che guarda dentro i neuroni degli LLM

Un nuovo framework di fuzzing white-box sostituisce il feedback sulle risposte con un punteggio continuo ricavato dai neuroni di sicurezza durante la prefill. Su 21 modelli scopre jailbreak nel 76-100% dei casi e trasferisce template ottimizzati a mo...

#LLM On-Premise #Fine-Tuning #DevOps
2026-08-28 ArXiv cs.AI

EduRiskX: la via neuro-simbolica al rischio accademico precoce

Un framework neuro-simbolico combina un predittore Transformer con regole F-Logic per individuare studenti a rischio nell'istruzione online. Su OULAD raggiunge accuratezza 0,900 e F1-score 0,894, con rilevamento medio alla settimana 9,32. L'elemento ...

#LLM On-Premise #DevOps
2026-08-27 ArXiv cs.CL

Empatia negli LLM: decodificare una direzione non equivale a controllarla

Uno studio su tre LLM instruction-tuned mostra che una direzione di empatia decodabile produce solo spostamenti parziali negli score automatici. Il controllo positivo passa per l’aspetto affettivo, ma lo strumento cognitivo è troppo grossolano. La ri...

#LLM On-Premise #Fine-Tuning
2026-08-26 IEEE Spectrum

Goodfire apre la scatola nera degli LLM: interpretabilità per tutti

La piattaforma Silico porta a ricercatori e startup gli strumenti di mechanistic interpretability prima riservati a pochi laboratori. Dietro la democratizzazione c’è una scommessa: capire i modelli dall’interno per renderli più sicuri, controllabili ...

#LLM On-Premise #DevOps
2026-08-24 MIT Technology Review

Scuola e IA: il semaforo che disciplina i chatbot senza spegnerli

Alla Cheshire Academy, insegnanti e studenti sperimentano ChatGPT, Perplexity e MagicSchool con regole a semaforo: verde per uso libero, rosso per divieto. La scuola forma lo staff sui limiti degli LLM e testa un consiglio studentesco sull'uso sano d...

#LLM On-Premise #DevOps
2026-08-24 LocalLLaMA

Bit flip su un LLM irraggiato: la fragilità dell'inference locale

Un esperimento informale simula l'effetto dei bit flip da radiazione in orbita bassa su un LLM: il modello collassa in fretta. L'episodio evidenzia una fragilità poco discussa nei deployment locali: senza memoria ECC e protezione dai guasti silenzios...

#Hardware #LLM On-Premise #DevOps
← Torna ai Topic