Vulnerabilità nei modelli decisionali tipizzati: passa il 63% delle azioni vietate

Sei righe di log hanno fatto salire dallo 0% al 63% la quota di azioni vietate che un guardrail lascia passare. Lo dice uno studio dell’8 ottobre 2026 sulle vulnerabilità nei modelli decisionali tipizzati. Tra gli...
Bitcoin 1 Minute
Uno sviluppo di rilievo scuote i mercati delle criptovalute. Sei righe di log hanno fatto salire dallo 0% al 63% la quota di azioni vietate che un guardrail lascia passare. Lo dice uno studio dell’8 ottobre 2026 sulle vulnerabilità nei modelli decisionali tipizzati. Tra gli attacchi analizzati ce n’è uno che cambia soltanto il nome di un’opzione.
La sua definizione e il testo da giudicare restano identici. Punti chiave Sette modelli open-weight hanno totalizzato tra il 36% e il 72% sulle decisioni di blocco o consenso. Con etichette ingannevoli, quattro modelli hanno lasciato passare dal 93% al 100% delle azioni vietate.
Dinamiche di mercato
Per i ricercatori questi modelli servono ad alleggerire il lavoro dei revisori, non a decidere da soli. I risultati sono stati pubblicati su arXiv da Erfan Baghaei Potraghloo. I modelli sono stati provati come guardrail per agent system, su compiti di prompt injection, jailbreak e filtraggio di contenuti tossici.
Come funzionano i modelli decisionali tipizzati come guardrail Un modello decisionale tipizzato legge un testo e assegna probabilità alle opzioni stabilite da chi lo usa, senza generare testo. Ogni opzione ha una breve definizione scritta. Negli agent system il modello valuta una chiamata a uno strumento o un messaggio in arrivo, e ne decide il via libera.
È la funzione del guardrail, la barriera che sta tra l’agente e le azioni che la policy vieta. I sette modelli valutati hanno raggiunto un’accuratezza tra il 36% e il 72% nelle decisioni di blocco o consenso. Il termine di paragone è il 50% del puro caso.
Impatto sui mercati
Lo studio ha trovato anche impostazioni predefinite molto diverse. Un modello lasciava passare quasi tutto, un altro bloccava quasi tutto. Le vulnerabilità nei modelli decisionali tipizzati: due errori diversi Gli errori fail-open lasciano passare azioni che la policy vieta, quindi sono falle di sicurezza.
Gli errori fail-closed respingono azioni che la policy ammette e producono costi operativi. Lo studio misura le due direzioni separatamente. Un tasso basso, in una delle due, non dimostra che la policy venga applicata bene: dipende anche dalla tendenza del modello a scegliere sempre una certa risposta.
In pratica, un modello che blocca quasi tutto può avere pochi rischi fail-open senza per questo giudicare correttamente i casi. Righe di log e nomi delle opzioni cambiano le decisioni Sei righe di log di un server, estranee alla policy, hanno portato il tasso di errori fail-open di un guardrail dallo 0% al 63%. Il test è stato fatto su un insieme sintetico di chiamate a strumenti di un agente.
I mercati delle criptovalute seguono da vicino questo sviluppo, mentre gli investitori valutano il potenziale impatto sui prezzi.





