News • 06/10/2026

Un’istruzione malevola può essere acquisita da un modello di intelligenza artificiale durante la lettura di un documento e produrre i propri effetti soltanto in un momento successivo della conversazione, al verificarsi di una specifica condizione. È questo il principio alla base degli Explosive Prompts, analizzato nel nuovo paper del CERT-AGID. 

 

Come funzionano le prompt injection? 

 

Le prompt injection rappresentano una delle principali criticità di sicurezza nei sistemi basati su modelli linguistici. Attraverso istruzioni nascoste o ingannevoli inserite nei contenuti elaborati dal modello, un attaccante può influenzarne il comportamento inducendolo a ignorare istruzioni precedenti, divulgare informazioni riservate o tentare azioni non autorizzate. 

 

Recenti ricerche hanno evidenziato una caratteristica particolarmente insidiosa di questi attacchi: l'istruzione malevola non produce necessariamente effetti immediati, ma può rimanere inattiva all'interno del contesto e attivarsi solo successivamente, in presenza di uno specifico trigger. 

 

L'analisi del CERT-AGID 

 

Per approfondire il fenomeno, il CERT-AGID ha realizzato un ambiente sperimentale minimale che consente di osservare separatamente il comportamento di alcuni modelli open-weight e quello del sistema che ne gestisce le azioni. Sono state inoltre confrontate due modalità di autorizzazione: una basata sull'accettazione automatica delle richieste del modello e una fondata su controlli esterni indipendenti. 

 

L'esperimento ha mostrato che una prompt injection può effettivamente rimanere inattiva nel contesto e manifestare i propri effetti soltanto in un momento successivo della conversazione. Nei modelli sottoposti al test è stata osservata almeno un'attivazione dell'istruzione differita dopo il trigger previsto, seppure con frequenze differenti. 

 

Il risultato conferma che il momento in cui un modello acquisisce un'istruzione può essere diverso rispetto al momento in cui tale istruzione produce un effetto diretto. La semplice assenza di comportamenti anomali durante la lettura di un contenuto non è quindi sufficiente a escluderne l'influenza nelle interazioni successive. 

 

L'analisi ha inoltre evidenziato una distinzione fondamentale tra manipolazione del modello e compromissione del sistema: quando le richieste generate dal modello venivano accettate senza un controllo effettivo dei privilegi, l'azione veniva eseguita. Applicando invece meccanismi di autorizzazione esterni al modello, le richieste continuavano a essere generate ma non raggiungevano l'esecuzione. 

 

Le implicazioni per la sicurezza 

 

Lo studio evidenzia un principio centrale per la sicurezza dei sistemi agentici: una prompt injection riuscita contro il modello non deve necessariamente tradursi in un'azione riuscita contro il sistema. 

 

Per questo motivo, le decisioni di autorizzazione non dovrebbero essere affidate esclusivamente al modello e i sistemi dovrebbero essere progettati assumendo che il modello possa essere influenzato da contenuti ostili o commettere errori, introducendo controlli indipendenti capaci di impedire che una decisione errata si trasformi in un'azione non autorizzata. 

 

Per maggiori dettagli è possibile consultare l’intero report. Nella sezione Sicurezza, invece, sono disponibili tutti i paper pubblicati nei mesi precedenti.