12m read

Qu’est-ce que l’injection de prompt ?

Que trouverez-vous ici ?

Cato Networks reconnu comme Leader dans le Gartnerยฎ Magic Quadrantโ„ข 2024 pour le SASE ร  fournisseur unique

Tรฉlรฉcharger le rapport

Les attaques par injection de prompt utilisent des requรชtes malveillantes et รฉlaborรฉes pour tromper un LLM afin qu’il prenne une action indรฉsirable. Par exemple, un attaquant pourrait convaincre le systรจme GenAI d’ignorer les garde-fous ou les politiques d’entreprise et de gรฉnรฉrer des types de contenu non approuvรฉs.

Avec l’intรฉgration gรฉnรฉralisรฉe de GenAI et des agents IA dans les flux de travail des entreprises, les attaques par injection de prompt reprรฉsentent un risque significatif pour la fiabilitรฉ et la sรฉcuritรฉ des services. Les attaquants peuvent tromper les agents pour qu’ils prennent des actions menant ร  des violations de donnรฉes, des infections par des logiciels malveillants ou d’autres incidents de sรฉcuritรฉ.

Points clรฉs

  • L’injection de prompt manipule les instructions du modรจle pour dรฉclencher des sorties non sรฉcurisรฉes, une exposition de donnรฉes ou des actions non intentionnelles.
  • L’injection de prompt indirecte peut se produire par le biais de contenus non fiables tels que des pages web, des documents, des courriels, des tickets ou des journaux de discussion.
  • Le risque augmente lorsque les modรจles peuvent utiliser des outils, accรฉder ร  des sources de donnรฉes ou prendre des actions.
  • Les mesures d’attรฉnuation sont superposรฉes. Les contrรดles d’entrรฉe et de sortie aident, mais la ยซย prรฉvention parfaiteย ยป n’est pas une hypothรจse rรฉaliste.
  • L’objectif est de rรฉduire le rayon d’explosion en utilisant le principe du moindre privilรจge, des frontiรจres de donnรฉes solides et des รฉtapes de vรฉrification pour les actions sensibles.

Comment fonctionne l’injection de prompt en pratique ?

Les LLM ont gรฉnรฉralement des instructions et des garde-fous en place pour contrรดler leur fonctionnement. Les crรฉateurs de LLM intรจgrent certaines protections, et les entreprises ajoutent leurs propres instructions en configurant des outils pour effectuer diverses tรขches dans leurs environnements.

Les attaques par injection de prompt utilisent des entrรฉes soigneusement รฉlaborรฉes conรงues pour contourner ces garde-fous et rรฉaliser quelque chose qui bรฉnรฉficie ร  l’attaquant, comme voler des donnรฉes sensibles, produire des sorties violant les politiques ou dรฉclencher des actions dans des outils connectรฉs. Ces entrรฉes peuvent รชtre fournies directement ร  l’outil ou intรฉgrรฉes dans d’autres contenus qu’il consomme, tels que des documents rรฉcupรฉrรฉs par RAG ou des pages web que visite un agent.

Injection de prompt directe

L’injection de prompt directe implique que l’attaquant interagisse directement avec l’agent. Par exemple, un attaquant pourrait entrer des prompts dans un chatbot LLM. Ces invites malveillantes peuvent suivre divers schรฉmas, tels que :

  • Ignorer les instructions prรฉcรฉdentes
  • Jeux de rรดle coercitifs
  • Mode dรฉveloppeur
  • Langage de contournement de la politique

L’objectif de ces instructions est de faire en sorte que l’invite de l’attaquant soit priorisรฉe par rapport aux garde-fous du LLM, soit en exploitant une faille, soit en รฉtant perรงue comme plus importante par le LLM. Si cela rรฉussit, le LLM peut gรฉnรฉrer du contenu non autorisรฉ, divulguer des instructions cachรฉes, fournir des recommandations dangereuses ou rediriger des actions vers le mauvais outil ou utilisateur.

Injection de prompt indirecte

Les attaques par injection de prompt indirecte insรจrent des instructions malveillantes dans le contenu qu’un modรจle consomme plutรดt que des instructions directes. Ceci pourrait inclure :

  • Webpages
  • Documents
  • E-mails
  • Tickets informatiques
  • Transcriptions de chat
  • Bases de connaissances

Ces menaces sont plus significatives si un LLM accรจde ร  du contenu externe, soit via un RAG, soit en naviguant sur le web ร  la recherche de rรฉponses potentielles, puisque les donnรฉes rรฉcupรฉrรฉes sont traitรฉes comme un contexte par le LLM. Des instructions malveillantes peuvent littรฉralement รชtre cachรฉes dans le contenu, par exemple en utilisant du texte blanc pour rendre les instructions invisibles aux lecteurs humains ou en utilisant un texte ayant l’apparence inoffensive que le modรจle interprรจte comme des instructions.

Les principaux types d’attaques par injection de prompt

Les attaques par injection de prompt peuvent รชtre rรฉalisรฉes pour atteindre divers objectifs. Deux des principaux types d’attaques tentent d’accรฉder ร  des informations sensibles concernant l’invite systรจme ou de manipuler l’utilisation des outils d’une IA pour collecter des informations sensibles ou effectuer des actions nuisibles.

Fuite de prompt et extraction de l’invite systรจme

Certaines attaques sont conรงues pour accรฉder ร  l’invite systรจme, qui peut inclure des donnรฉes sensibles, telles que des instructions systรจme cachรฉes, des politiques ou des secrets. Cette information peut รชtre utile ร  un attaquant car elle lui permet de concevoir des attaques ultรฉrieures qui contournent ces dรฉfenses.

Le potentiel de fuite de prompts signifie que des secrets ne devraient jamais รชtre intรฉgrรฉs dans des prompts. Des garde-fous de sรฉcuritรฉ tels que des instructions de ยซย non-rรฉvรฉlationย ยป peuvent รชtre contournรฉs ou neutralisรฉs par un attaquant.

Dรฉtournement d’outils et d’agents

Les outils d’IA peuvent รชtre capables d’appeler des fonctions ou des API, de naviguer sur Internet ou de dรฉclencher des flux de travail. Un prompt soigneusement รฉlaborรฉ peut permettre ร  un attaquant de dรฉfinir quels outils sont sรฉlectionnรฉs, les paramรจtres qui leur sont envoyรฉs et la sรฉquence dans laquelle les actions sont appelรฉes.

Cela pose un risque qu’un attaquant puisse accรฉder ร  des donnรฉes sensibles lors d’appels ร  des systรจmes de billetterie, des CRM, des magasins de documents, des dรฉpรดts de code ou des consoles cloud. Pour gรฉrer ce risque, les organisations devraient mettre en ล“uvre des contrรดles d’accรจs au moindre privilรจge et des portes d’approbation avec intervention humaine pour les actions ร  fort impact, en particulier pour les agents d’IA qui opรจrent sans supervision humaine.

Oรน l’injection de prompts se manifeste-t-elle dans les environnements d’entreprise ?

Des attaques par injection de prompts peuvent se produire partout oรน une organisation utilise GenAI. Des exemples courants incluent :

  • Outils de chat publics
  • Assistants intรฉgrรฉs
  • Bots de support client
  • Assistants de connaissance internes
  • Copilotes de dรฉveloppeur
  • Agents autonomes

Mรชme si les utilisateurs n’interagissent pas directement avec ces outils, l’injection de prompts reste un risque. Les outils peuvent accรฉder ร  du contenu web, des piรจces jointes, des journaux collรฉs, des commentaires de SaaS tiers et d’autres entrรฉes non fiables qui pourraient inclure des instructions malveillantes.

Chatbots et assistants orientรฉs client

Les chatbots et les agents en contact avec les clients acceptent des entrรฉes de texte libre de la part d’utilisateurs inconnus. Des attaques rรฉussies d’injection de prompt pourraient impliquer la manipulation des rรฉsultats pour induire les clients en erreur et une exposition potentielle de donnรฉes si le bot a accรจs au CRM ou aux systรจmes de commande.

Pour gรฉrer ces risques, les organisations devraient mettre en ล“uvre des portรฉes de donnรฉes strictes, masquer les donnรฉes sensibles lorsque cela est possible, et spรฉcifier des rรฉponses types pour les demandes sensibles. De plus, ces outils devraient รชtre surveillรฉs pour dรฉtecter des signes d’abus potentiel, y compris les taux de demande, la rรฉpรฉtition et la similaritรฉ des charges utiles.

RAG et assistants ยซ Demandez ร  votre base de connaissances ยป

Les assistants RAG et ยซ demandez ร  votre base de connaissances ยป ont la capacitรฉ d’accรฉder ร  des documents et ร  d’autres contenus qui pourraient รชtre รฉlevรฉs au-dessus de la politique d’entreprise dans le cadre du contexte du LLM. En consรฉquence, un contenu malveillant intรฉgrรฉ dans des pages web et d’autres ressources peut permettre ร  un attaquant d’รฉchapper aux garde-fous.

Les organisations peuvent attรฉnuer ces risques en mettant en ล“uvre un รฉtiquetage de contenu, des listes blanches de rรฉcupรฉration et une compartimentation des prompts. De plus, des contrรดles d’accรจs basรฉs sur le principe du moindre privilรจge limitent les donnรฉes auxquelles ces outils peuvent accรฉder, rรฉduisant ainsi les impacts potentiels d’une attaque.

Impacts de l’injection de prompt sur la sรฉcuritรฉ des entreprises

Les attaques par injection de prompt peuvent influencer les outils alimentรฉs par l’IA ร  faire le souhait de l’attaquant. Cela peut introduire des menaces significatives pour la confidentialitรฉ, l’intรฉgritรฉ et la disponibilitรฉ en raison du potentiel de violations de donnรฉes, de rรฉsultats manipulรฉs et de flux de travail corrompus.

Une attaque rรฉussie par injection de prompt peut รชtre difficile ร  enquรชter en raison de l’utilisation d’outils lรฉgitimes et de la visibilitรฉ limitรฉe sur ces outils. Cela pose รฉgalement un risque significatif pour la conformitรฉ rรฉglementaire si les organisations manquent de donnรฉes pour prouver ce qui s’est passรฉ et l’รฉtendue de l’incident.

Impacts commerciaux courants

Les attaques par injection de prompt peuvent avoir une variรฉtรฉ d’impacts diffรฉrents sur l’entreprise, y compris :

  • Fuite de donnรฉes clients
  • Exposition de la propriรฉtรฉ intellectuelle (PI)
  • Temps d’arrรชt du service
  • Rรฉponses incorrectes aux demandes des clients
  • Prise de dรฉcision basรฉe sur des donnรฉes inexactes
  • Dommages rรฉputationnels et financiers
  • Pรฉnalitรฉs rรฉglementaires et exposition lรฉgale

Comment dรฉtecter l’injection de prompt ?

La dรฉtection de l’injection de prompt nรฉcessite d’analyser les entrรฉes, les sorties et le comportement des LLM pour identifier les anomalies ou les violations de la politique d’entreprise. Pour ce faire, les organisations doivent enregistrer les prompts, les rรฉponses et les appels d’outils pour le suivi. L’analyse doit rechercher des anomalies, des violations de politique et des motifs de charge utile rรฉpรฉtรฉs.

Indicateurs dans les Prompts, le Contexte et les Appels d’Outils

Les prompts, le contexte et les appels d’outils peuvent inclure des indicateurs d’attaques par injection de prompt. Les รฉlรฉments ร  surveiller incluent :

  • Modรจles d’instructions suspects
  • Langage coercitif
  • Frรฉquence inhabituelle des appels d’outils
  • Destinations d’appels d’outils inhabituelles
  • Donnรฉes de taille excessive retournรฉes par les outils
  • Texte rรฉcupรฉrรฉ tentant d’agir comme politique

Attรฉnuations pratiques pour l’injection de prompt

Les attaques par injection de prompt nรฉcessitent une dรฉfense en profondeur, car les attaquants peuvent concevoir des prompts malveillants pour รฉchapper ร  des recherches textuelles simples et ร  la correspondance de motifs. Un modรจle d’attรฉnuation en couches devrait inclure :

  • Accรจs sรฉcurisรฉ aux applications et
  • Contrรดles d’interaction du modรจle
  • Gouvernance des donnรฉes
  • Tests opรฉrationnels

L’objectif de ces mesures d’attรฉnuation est de rรฉduire l’impact et la frรฉquence des attaques. La nature des LLM rend impossible de garantir complรจtement que les attaques ne rรฉussiront jamais.

Modรจles de conception qui rรฉduisent le rayon d’explosion

Les actions d’attรฉnuation des injections de prompt doivent se concentrer sur la gestion du rayon d’explosion potentiel d’une injection rรฉussie. Les meilleures pratiques incluent :

  • Contrรดles d’accรจs au moindre privilรจge pour les outils, connecteurs et sources de donnรฉes : Cela inclut la mise en ล“uvre de permissions distinctes pour l’accรจs en lecture et en รฉcriture.
  • Portes humaines pour les actions sensibles : Par exemple, l’approbation humaine devrait รชtre requise pour les paiements, les changements de compte, les tรขches administratives privilรฉgiรฉes et d’autres activitรฉs ร  haut risque.
  • Frontiรจres solides pour les secrets : Les secrets ne devraient jamais รชtre stockรฉs dans des prompts, en utilisant plutรดt des jetons ร  portรฉe ou des modรจles de coffre-fort.
  • Segmentation pour les sources de rรฉcupรฉration : Idรฉalement, les LLM ne devraient avoir accรจs qu’ร  des corpus de confiance contenant des donnรฉes organisรฉes et รฉtiquetรฉes.
  • Post-traitement dรฉterministe pour les sorties risquรฉes : Les sorties des LLM dans des flux de travail ร  haut risque ou avec accรจs ร  des donnรฉes sensibles devraient รชtre post-traitรฉes par des logiciels non-AI pour garantir que les politiques sont appliquรฉes et que les donnรฉes sensibles sont masquรฉes.

Garde-fous en temps d’exรฉcution

En plus de limiter le rayon d’explosion des attaques, les organisations peuvent รฉgalement mettre en ล“uvre des garde-fous qui gรจrent le risque en temps d’exรฉcution. Les meilleures pratiques incluent :

  • Filtrage et normalisation des requรชtes : Toutes les rรฉponses des LLM devraient รชtre analysรฉes pour filtrer le contenu potentiellement sensible ou malveillant et pour garantir le respect des politiques d’entreprise.
  • Contrรดles de perte de donnรฉes: Utilisez DLP ou un SWG pour empรชcher les donnรฉes sensibles de quitter les systรจmes par le biais de requรชtes et de rรฉponses lorsque cela est possible.
  • Contrรดles de risque de contenu: Les LLMs avec accรจs web doivent รชtre restreints quant aux sites web et types de contenu auxquels ils peuvent accรฉder.
  • Gouvernance d’accรจs pour les applications et assistants IA: Les applications et assistants IA doivent รชtre limitรฉs par des contrรดles d’accรจs basรฉs sur le principe du moindre privilรจge qui restreignent les donnรฉes et outils qu’ils peuvent utiliser.
  • Journalisation et alertes: La journalisation et les alertes doivent รชtre intรฉgrรฉes dans les outils alimentรฉs par l’IA pour garantir une visibilitรฉ adรฉquate et des pistes de vรฉrification.

Comment les injections de requรชtes sont-elles testรฉes et validรฉes ?

Les vulnรฉrabilitรฉs d’injection de requรชtes doivent รชtre testรฉes rรฉguliรจrement, car de petits changements dans les requรชtes, les outils, les modรจles et les sources de donnรฉes peuvent rรฉintroduire des risques. Une รฉquipe rouge IA utilise des requรชtes adversariales pour รฉvaluer les comportements des modรจles et des applications de maniรจre structurรฉe et rรฉpรฉtable. Certaines des choses clรฉs ร  tester incluent :

  • Fuite de donnรฉes
  • Contournement de politique
  • Mauvaise utilisation des outils
  • Manipulation de rรฉcupรฉration
  • Sortie nuisible

Des tests doivent รชtre effectuรฉs rรฉguliรจrement, surtout aprรจs le dรฉploiement de nouveaux agents, outils ou connecteurs. Le succรจs d’un programme de test peut รชtre รฉvaluรฉ en fonction du taux de rรฉussite, de la gravitรฉ, de la couverture de dรฉtection, du temps de dรฉtection et du temps de confinement.

Construire une suite de tests d’injection de requรชtes rรฉpรฉtable

Une suite de tests d’injection de prompt peut garantir qu’une organisation traite correctement les principaux risques d’injection de prompt pour ses systรจmes. Les meilleures pratiques incluent :

  • Maintenez une bibliothรจque de prompts adversariaux classรฉs par catรฉgories de risque.
  • Incluez des รฉlรฉments d’injection indirecte (documents, pages web, tickets) qui sont sรปrs mais rรฉalistes.
  • Testez par flux de travail et par ensemble de permissions. Le mรชme modรจle peut รชtre sรปr dans un contexte et dangereux dans un autre.
  • Automatisez les tests de rรฉgression lorsque les prompts, les sources de rรฉcupรฉration ou les schรฉmas d’outils changent.
  • Documentez le comportement attendu et les voies d’escalade lorsqu’un test รฉchoue.

Rรฉduction des risques d’injection de prompt et garde-fous opรฉrationnels.

L’injection de prompt est un risque croissant pour la cybersรฉcuritรฉ des entreprises alors que celles-ci s’appuient de plus en plus sur des outils d’IA qui peuvent รชtre trompรฉs pour effectuer des actions malveillantes. La sรฉcuritรฉ contre l’injection de prompt inclut la contrainte des entrรฉes, du contexte, des actions et des sorties pour rรฉduire la probabilitรฉ d’une attaque et ses impacts potentiels sur l’entreprise. Les organisations devraient :

  • Restreindre l’accรจs des outils d’IA aux donnรฉes et aux outils.
  • Surveillez les entrรฉes et les sorties pour dรฉtecter des anomalies et des violations de politique.
  • Utilisez une dรฉsinfection dรฉterministe et un modรจle pour les rรฉponses ร  haut risque.
  • Testez rรฉguliรจrement les outils avec des prompts adversariaux.


ร‰liminer le risque d’injection de prompt est impossible. Cependant, les organisations peuvent rรฉduire la probabilitรฉ et l’ampleur d’une attaque rรฉussie.

FAQ sur l’injection de prompt.

L’injection de prompt est-elle la mรชme chose que le jailbreak ?

Le jailbreak est un type particulier d’attaque par injection de prompt conรงu pour tromper un modรจle afin de gรฉnรฉrer des sorties interdites et nuisibles. Les attaques par injection de prompt incluent รฉgalement le risque qu’un modรจle prenne des actions non approuvรฉes et interagisse avec des outils tiers.

L’injection de prompt peut-elle รชtre complรจtement empรชchรฉe ?

Non, l’injection de prompt ne peut pas รชtre complรจtement empรชchรฉe en raison de la difficultรฉ ร  identifier toutes les entrรฉes malveillantes et du fait que les LLM ne sont pas des systรจmes dรฉterministes et prรฉvisibles. Cependant, des contrรดles de sรฉcuritรฉ en couches peuvent rรฉduire le risque et l’ampleur d’une attaque rรฉussie.

Pourquoi l’injection de prompt indirecte est-elle considรฉrรฉe comme plus dangereuse ?

L’injection de prompt indirecte implique qu’un attaquant injecte des instructions dans un contenu consommรฉ par un LLM, comme des pages web consultรฉes lors de la collecte de contexte sur Internet. C’est plus dangereux car un attaquant pourrait รชtre en mesure d’influencer un agent mรชme s’il ne peut pas accรฉder directement ร  son interface utilisateur.

Que doit-on enregistrer pour enquรชter sur les tentatives d’injection de prompt ?

Les journaux doivent inclure des รฉvรฉnements, des appels d’outils et des violations de politique. Enregistrer des prompts bruts peut รชtre dangereux en raison du risque qu’ils contiennent des donnรฉes sensibles, et toutes les journaux doivent avoir ces informations expurgรฉes.

Quel est le premier contrรดle ร  mettre en ล“uvre pour un assistant IA ?

L’accรจs au moindre privilรจge est le contrรดle le plus important ร  mettre en ล“uvre pour un assistant IA. Limiter son accรจs aux donnรฉes et ร  d’autres outils rรฉduit les dommages potentiels qu’une attaque rรฉussie peut causer.

Cato Networks reconnu comme Leader dans le Gartnerยฎ Magic Quadrantโ„ข 2024 pour le SASE ร  fournisseur unique

Tรฉlรฉcharger le rapport

This page was machine-translated. If you notice any inaccuracies or have feedback, please feel free to send it to us here.