10m read

Che cos’รจ l’iniezione di prompt?

Cosa troverai qui?

Cato Networks nominata Leader nel Gartnerยฎ Magic Quadrantโ„ข 2024 per il SASE a fornitore unico

Scarica il report

Gli attacchi di iniezione di prompt utilizzano query maligne e progettate per ingannare un LLM a compiere azioni indesiderate. Ad esempio, un attaccante potrebbe convincere il sistema GenAI a ignorare le protezioni o le politiche aziendali e generare tipi di contenuti non approvati.

Con l’integrazione diffusa di GenAI e agenti AI nei flussi di lavoro aziendali, gli attacchi di iniezione di prompt rappresentano un rischio significativo per l’affidabilitร  e la sicurezza del servizio. Gli attaccanti possono ingannare gli agenti a compiere azioni che portano a violazioni dei dati, infezioni da malware o altri incidenti di sicurezza.

Punti chiave

  • L’iniezione di prompt manipola le istruzioni del modello per attivare output non sicuri, esposizione di dati o azioni non intenzionali.
  • L’iniezione di prompt indiretta puรฒ verificarsi attraverso contenuti non affidabili come pagine web, documenti, email, ticket o registri di chat.
  • Il rischio aumenta quando i modelli possono utilizzare strumenti, accedere a fonti di dati o compiere azioni.
  • Le mitigazioni sono stratificate. I controlli sugli input e sugli output aiutano, ma la “prevenzione perfetta” non รจ un’assunzione realistica.
  • L’obiettivo รจ ridurre il raggio d’azione utilizzando il minimo privilegio, forti confini sui dati e passaggi di verifica per azioni sensibili.

Come funziona l’iniezione di prompt nella pratica?

Gli LLM hanno comunemente istruzioni e protezioni in atto per controllare il loro funzionamento. I creatori di LLM integrano determinate misure di sicurezza, e le imprese aggiungono le proprie istruzioni mentre configurano gli strumenti per eseguire vari compiti all’interno dei loro ambienti.

Gli attacchi di iniezione di prompt utilizzano input accuratamente progettati per eludere queste protezioni e fare qualcosa che avvantaggi l’attaccante, come rubare dati sensibili, produrre output che violano le politiche o attivare azioni in strumenti connessi. Questi input potrebbero essere forniti direttamente allo strumento o incorporati in altri contenuti che consuma, come documenti recuperati tramite RAG o pagine web che un agente visita.

Iniezione di Prompt Diretta

L’iniezione di prompt diretta implica che l’attaccante interagisca direttamente con l’agente. Ad esempio, un attaccante potrebbe inserire prompt in un chatbot LLM. Questi prompt malevoli possono seguire vari schemi, come:

  • Ignora le istruzioni precedenti
  • Gioco di ruolo coercitivo
  • Modalitร  sviluppatore
  • Lingua di override della politica

L’obiettivo di queste istruzioni รจ far sรฌ che il prompt dell’attaccante venga prioritizzato rispetto alle protezioni del LLM, sfruttando una scappatoia o venendo percepito come piรน importante dal LLM. Se ha successo, il LLM puรฒ generare contenuti non consentiti, rivelare istruzioni nascoste, fornire raccomandazioni non sicure o deviare azioni verso lo strumento o l’utente sbagliato.

Iniezione di prompt indiretta

Gli attacchi di iniezione di prompt indiretta inseriscono istruzioni malevole nel contenuto che un modello consuma piuttosto che istruzioni dirette. Questi potrebbero includere:

  • Pagine web
  • Documenti
  • E-mail
  • Ticket IT
  • Trascrizioni di chat
  • Basi di conoscenza

Queste minacce sono piรน significative se un LLM accede a contenuti esterni, sia tramite un RAG che navigando in rete per potenziali risposte, poichรฉ i dati recuperati sono trattati come contesto dal LLM. Istruzioni malevole possono essere letteralmente nascoste nel contenuto, ad esempio utilizzando testo bianco per rendere le istruzioni invisibili ai lettori umani o utilizzando testo dall’aspetto benigno che un modello interpreta come istruzioni.

I principali tipi di attacchi di iniezione di prompt

Gli attacchi di iniezione di prompt possono essere eseguiti per raggiungere vari obiettivi. Due dei principali tipi di attacchi tentano di accedere a informazioni sensibili riguardanti il prompt di sistema o di manipolare l’uso degli strumenti di un’IA per raccogliere informazioni sensibili o compiere azioni dannose.

Fuga di prompt ed estrazione del prompt di sistema

Alcuni attacchi sono progettati per accedere al prompt di sistema, che puรฒ includere dati sensibili, come istruzioni di sistema nascoste, politiche o segreti. Queste informazioni possono essere utili per un attaccante poichรฉ consentono di elaborare attacchi successivi che eludono queste difese.

Il potenziale per la fuga di prompt significa che i segreti non dovrebbero mai essere incorporati nei prompt. Le barriere di sicurezza come le istruzioni “non rivelare” possono essere eluse o superate da un attaccante.

Dirottamento di strumenti e agenti

Gli strumenti di intelligenza artificiale possono essere in grado di chiamare funzioni o API, navigare in internet o attivare flussi di lavoro. Un prompt accuratamente elaborato puรฒ consentire a un attaccante di definire quali strumenti vengono selezionati, i parametri inviati a essi e la sequenza in cui vengono chiamate le azioni.

Ciรฒ comporta un rischio che un attaccante possa accedere a dati sensibili quando effettua chiamate a sistemi di ticketing, CRM, archivi di documenti, repository di codice o console cloud. Per gestire questo rischio, le organizzazioni dovrebbero implementare controlli di accesso con il principio del minimo privilegio e porte di approvazione con l’uomo nel ciclo per azioni ad alto impatto, specialmente per agenti di intelligenza artificiale che operano senza supervisione umana.

Dove si manifesta l’iniezione di prompt negli ambienti aziendali?

Gli attacchi di iniezione di prompt possono verificarsi ovunque un’organizzazione utilizzi GenAI. Esempi comuni includono:

  • Strumenti di chat pubblici
  • Assistenti incorporati
  • Bot di supporto clienti
  • Assistenti di conoscenza interni
  • Co-piloti per sviluppatori
  • Agenti autonomi

Anche se gli utenti non interagiscono direttamente con questi strumenti, l’iniezione di prompt rappresenta comunque un rischio. Gli strumenti possono accedere a contenuti web, allegati, registri incollati, commenti di SaaS di terze parti e altri input non affidabili che potrebbero includere istruzioni dannose.

Chatbot e assistenti rivolti ai clienti

I chatbot e gli agenti rivolti ai clienti accettano input di testo libero da utenti sconosciuti. Attacchi di iniezione di prompt riusciti potrebbero comportare la manipolazione delle uscite per fuorviare i clienti e una potenziale esposizione dei dati se il bot ha accesso al CRM o ai sistemi degli ordini.

Per gestire questi rischi, le organizzazioni dovrebbero implementare ambiti di dati rigorosi, redigere i dati sensibili quando possibile e specificare risposte predefinite per richieste sensibili. Inoltre, questi strumenti dovrebbero essere monitorati per segnali di potenziale abuso, inclusi tassi di richiesta, ripetizione e somiglianza dei payload.

Assistenti RAG e “Chiedi alla tua base di conoscenza”

Gli assistenti RAG e “chiedi alla tua base di conoscenza” hanno la capacitร  di accedere a documenti e altri contenuti che potrebbero essere elevati al di sopra della politica aziendale come parte del contesto del LLM. Di conseguenza, contenuti dannosi incorporati in pagine web e altre risorse possono consentire a un attaccante di eludere le protezioni.

Le organizzazioni possono mitigare questi rischi implementando etichettatura dei contenuti, liste di autorizzazione per il recupero e compartimentazione dei prompt. Inoltre, i controlli di accesso con il principio del minimo privilegio limitano i dati a cui questi strumenti possono accedere, riducendo i potenziali impatti di un attacco.

Impatto dell’iniezione di prompt sulla sicurezza aziendale

Gli attacchi di iniezione di prompt possono influenzare strumenti alimentati da AI a fare ciรฒ che desidera l’attaccante. Questo puรฒ introdurre minacce significative alla riservatezza, integritร  e disponibilitร  a causa del potenziale di violazioni dei dati, uscite manipolate e flussi di lavoro corrotti.

Un attacco di iniezione di prompt riuscito puรฒ essere difficile da investigare a causa dell’uso di strumenti legittimi e della visibilitร  limitata su questi strumenti. Questo rappresenta un rischio significativo per la conformitร  normativa se le organizzazioni mancano dei dati per dimostrare cosa รจ successo e l’ambito dell’incidente.

Impatto aziendale comune

Gli attacchi di iniezione di prompt possono avere una varietร  di impatti diversi sull’impresa, inclusi:

  • Fuga di dati dei clienti
  • Esposizione della proprietร  intellettuale (IP)
  • Interruzione del servizio
  • Risposte errate alle domande dei clienti
  • Decisioni basate su dati inaccurati
  • Danno reputazionale e finanziario
  • Sanzioni normative ed esposizione legale

Come puรฒ essere rilevata l’iniezione di prompt?

Rilevare l’iniezione di prompt richiede l’analisi degli input, output e comportamenti dei LLM per identificare anomalie o violazioni della politica aziendale. A tal fine, le organizzazioni dovrebbero registrare prompt, risposte e chiamate agli strumenti per il monitoraggio. L’analisi dovrebbe cercare anomalie, violazioni delle politiche e schemi di payload ripetuti.

Indicatori nei Prompt, nel Contesto e nelle Chiamate agli Strumenti

I prompt, il contesto e le chiamate agli strumenti possono includere indicatori di attacchi di iniezione di prompt. Cose da cercare includono:

  • Schemi di istruzioni sospette
  • Linguaggio coercitivo
  • Frequenza insolita delle chiamate agli strumenti
  • Destinazioni insolite delle chiamate agli strumenti
  • Dati di dimensioni eccessive restituiti dagli strumenti
  • Testo recuperato che tenta di agire come politica

Mitigazioni pratiche per l’iniezione di prompt

Gli attacchi di iniezione di prompt richiedono una difesa a piรน livelli poichรฉ gli aggressori possono creare prompt dannosi per eludere ricerche testuali semplici e corrispondenze di schemi. Un modello di mitigazione stratificato dovrebbe includere:

  • Accesso sicuro allโ€™applicazione e
  • Controlli di interazione del modello
  • Governance dei dati
  • Test operativi

L’obiettivo di queste mitigazioni รจ ridurre l’impatto e la frequenza degli attacchi. La natura dei LLM rende impossibile garantire completamente che gli attacchi non abbiano mai successo.

Modelli di design che riducono il raggio d’azione

Le azioni di mitigazione dell’iniezione di prompt dovrebbero concentrarsi sulla gestione del potenziale raggio d’azione di un’iniezione riuscita. Le migliori pratiche includono:

  • Controlli di accesso con il minimo privilegio per strumenti, connettori e fonti di dati: Ciรฒ include l’implementazione di permessi separati per l’accesso in lettura e scrittura.
  • Porte con l’uomo nel ciclo per azioni sensibili: Ad esempio, dovrebbe essere richiesta l’approvazione umana per pagamenti, modifiche dell’account, compiti amministrativi privilegiati e altre attivitร  ad alto rischio.
  • Confini forti per i segreti: I segreti non dovrebbero mai essere memorizzati nei prompt, utilizzando invece token a scopo limitato o schemi di vault.
  • Segmentazione per fonti di recupero: Idealmente, i LLM dovrebbero poter accedere solo a corpora fidati contenenti dati curati e etichettati.
  • Post-elaborazione deterministica per output rischiosi: Gli output dei LLM in flussi di lavoro ad alto rischio o con accesso a dati sensibili dovrebbero essere post-elaborati da software non AI per garantire che le politiche siano applicate e che i dati sensibili siano redatti.

Barriere di sicurezza in tempo di esecuzione

Oltre a limitare il raggio d’azione degli attacchi, le organizzazioni possono anche implementare barriere di sicurezza che gestiscono il rischio in tempo di esecuzione. Le migliori pratiche includono:

  • Richiesta di filtraggio e normalizzazione: Tutte le risposte dei LLM devono essere analizzate per filtrare contenuti potenzialmente sensibili o dannosi e per garantire l’aderenza alle politiche aziendali.
  • Controlli per la perdita di dati: Utilizzare DLP o un SWG per prevenire la fuoriuscita di dati sensibili attraverso prompt e risposte quando possibile.
  • Controlli per il rischio di contenuto: I LLM con accesso web dovrebbero essere limitati nei siti web e nei tipi di contenuto a cui possono accedere.
  • Governance degli accessi per app e assistenti AI: Le app e gli assistenti AI dovrebbero essere limitati con controlli di accesso a privilegi minimi che restringono i dati e gli strumenti che possono utilizzare.
  • Registrazione e allerta: La registrazione e l’allerta dovrebbero essere integrate negli strumenti alimentati da AI per garantire una corretta visibilitร  e tracciabilitร  degli audit.

Come vengono testate e validate le iniezioni di prompt?

Le vulnerabilitร  da iniezione di prompt dovrebbero essere testate regolarmente poichรฉ piccole modifiche a prompt, strumenti, modelli e fonti di dati possono reintrodurre rischi. Un team rosso AI utilizza prompt avversari per valutare i comportamenti di modelli e app in modo strutturato e ripetibile. Alcune delle cose chiave da testare includono:

  • Perdita di dati
  • Evasione delle politiche
  • Uso improprio degli strumenti
  • Manipolazione del recupero
  • Output dannoso

I test dovrebbero essere eseguiti regolarmente, specialmente dopo aver distribuito nuovi agenti, strumenti o connettori. Il successo di un programma di test puรฒ essere valutato in base al tasso di successo, alla gravitร , alla copertura di rilevamento, al tempo di rilevamento e al tempo di contenimento.

Costruire una suite di test per l’iniezione di prompt ripetibile.

Una suite di test per l’iniezione di prompt puรฒ garantire che un’organizzazione stia affrontando correttamente i principali rischi di iniezione di prompt nei suoi sistemi. Le migliori pratiche includono:

  • Mantenere una libreria di prompt avversariali mappati a categorie di rischio.
  • Includere elementi di iniezione indiretta (documenti, pagine web, ticket) che siano sicuri ma realistici.
  • Testare per flusso di lavoro e per set di permessi. Lo stesso modello puรฒ essere sicuro in un contesto e non sicuro in un altro.
  • Automatizzare i test di regressione quando i prompt, le fonti di recupero o gli schemi degli strumenti cambiano.
  • Documentare il comportamento atteso e i percorsi di escalation quando un test fallisce.

Riduzione del rischio di iniezione di prompt e guardrail operativi.

L’iniezione di prompt รจ un rischio crescente per la cybersecurity aziendale poichรฉ le aziende si affidano sempre piรน a strumenti di intelligenza artificiale che possono essere ingannati per eseguire azioni dannose. La sicurezza contro l’iniezione di prompt include la restrizione degli input, del contesto, delle azioni e delle uscite per ridurre la probabilitร  di un attacco e i suoi potenziali impatti sull’azienda. Le organizzazioni dovrebbero:

  • Limitare l’accesso degli strumenti di intelligenza artificiale a dati e strumenti.
  • Monitorare input e output per anomalie e violazioni delle politiche.
  • Utilizzare la sanificazione e il templating deterministici per risposte ad alto rischio.
  • Testare regolarmente gli strumenti con prompt avversariali.


Eliminare il rischio di iniezione di prompt รจ impossibile. Tuttavia, le organizzazioni possono ridurre la probabilitร  e il raggio d’azione di un attacco riuscito.

FAQ sull’iniezione di prompt.

L’iniezione di prompt รจ la stessa cosa del jailbreaking?

Il jailbreaking รจ un tipo particolare di attacco di iniezione di prompt progettato per ingannare un modello a generare output proibiti e dannosi. Gli attacchi di iniezione di prompt includono anche la possibilitร  che un modello prenda azioni non approvate e interagisca con strumenti di terze parti.

L’iniezione di prompt puรฒ essere completamente prevenuta?

No, l’iniezione di prompt non puรฒ essere completamente prevenuta a causa della difficoltร  di identificare tutti gli input malevoli e del fatto che i LLM non sono sistemi deterministici e prevedibili. Tuttavia, controlli di sicurezza a strati possono ridurre il rischio e il raggio d’azione di un attacco riuscito.

Perchรฉ l’iniezione di prompt indiretta รจ considerata piรน pericolosa?

L’iniezione di prompt indiretta comporta un attaccante che inietta istruzioni in contenuti consumati da un LLM, come le pagine web accessibili mentre si raccoglie contesto da Internet. Questo รจ piรน pericoloso perchรฉ un attaccante potrebbe essere in grado di influenzare un agente anche se non puรฒ accedere direttamente alla sua interfaccia utente.

Cosa dovrebbe essere registrato per indagare sui tentativi di iniezione di prompt?

I registri dovrebbero includere eventi, chiamate agli strumenti e violazioni delle politiche. Registrare i prompt grezzi puรฒ essere pericoloso a causa della possibilitร  che contengano dati sensibili, e tutte le registrazioni dovrebbero avere queste informazioni oscurate.

Qual รจ il primo controllo da implementare per un assistente AI?

L’accesso con il minimo privilegio รจ il controllo piรน importante da implementare per un assistente AI. Limitare il suo accesso ai dati e ad altri strumenti riduce il potenziale danno che puรฒ essere causato da un attacco riuscito.

Cato Networks nominata Leader nel Gartnerยฎ Magic Quadrantโ„ข 2024 per il SASE a fornitore unico

Scarica il report

This page was machine-translated. If you notice any inaccuracies or have feedback, please feel free to send it to us here.