10m read

Was ist Prompt-Injection?

Was Sie erwartet

Cato Networks wurde im Gartner® Magic Quadrant™ 2024 für Single-Vendor SASE als Leader ausgezeichnet

Bericht lesen

Prompt-Injection-Angriffe verwenden bösartige, gestaltete Anfragen, um ein LLM dazu zu bringen, eine unerwünschte Aktion auszuführen. Ein Angreifer könnte beispielsweise das GenAI-System überzeugen, Sicherheitsvorkehrungen oder Unternehmensrichtlinien zu ignorieren und nicht genehmigte Arten von Inhalten zu generieren.

Mit der weit verbreiteten Integration von GenAI und KI-Agenten in Unternehmensabläufe stellen Prompt-Injection-Angriffe ein erhebliches Risiko für die Zuverlässigkeit und Sicherheit von Dienstleistungen dar. Angreifer können Agenten dazu bringen, Aktionen auszuführen, die zu Datenverletzungen, Malware-Infektionen oder anderen Sicherheitsvorfällen führen.

Wichtige Highlights

  • Prompt-Injection manipuliert Modellanweisungen, um unsichere Ausgaben, Datenexposition oder unbeabsichtigte Aktionen auszulösen.
  • Indirekte Prompt-Injection kann durch nicht vertrauenswürdige Inhalte wie Webseiten, Dokumente, E-Mails, Tickets oder Chatprotokolle erfolgen.
  • Das Risiko steigt, wenn Modelle Werkzeuge verwenden, auf Datenquellen zugreifen oder Aktionen ausführen können.
  • Die Minderung erfolgt in Schichten. Eingabe- und Ausgabe-Kontrollen helfen, aber „perfekte Prävention“ ist keine realistische Annahme.
  • Das Ziel ist es, den Explosionsradius zu verringern, indem das Prinzip der geringsten Privilegien, starke Datengrenzen und Verifizierungsschritte für sensible Aktionen verwendet werden.

Wie funktioniert Prompt-Injection in der Praxis?

LLMs haben in der Regel Anweisungen und Sicherheitsvorkehrungen, um zu steuern, wie sie arbeiten. LLM-Ersteller integrieren bestimmte Sicherheitsmaßnahmen, und Unternehmen fügen ihre eigenen Anweisungen hinzu, während sie Werkzeuge konfigurieren, um verschiedene Aufgaben in ihren Umgebungen auszuführen.

Prompt-Injection-Angriffe verwenden sorgfältig gestaltete Eingaben, die darauf ausgelegt sind, diese Sicherheitsvorkehrungen zu umgehen und etwas zu tun, das dem Angreifer zugutekommt, wie das Stehlen sensibler Daten, das Produzieren von gegen Richtlinien verstoßenden Ausgaben oder das Auslösen von Aktionen in verbundenen Werkzeugen. Diese Eingaben könnten direkt an das Werkzeug übergeben oder in andere Inhalte eingebettet werden, die es konsumiert, wie RAG-abgerufene Dokumente oder Webseiten, die ein Agent besucht.

Direkte Prompt Injection:

Direkte Prompt-Injection beinhaltet, dass der Angreifer direkt mit dem Agenten interagiert. Ein Angreifer könnte beispielsweise Eingabeaufforderungen in einen LLM-Chatbot eingeben. Diese bösartigen Eingabeaufforderungen können verschiedenen Mustern folgen, wie:

  • Ignoriere vorherige Anweisungen
  • Zwangsrollenspiel
  • Entwicklermodus
  • Sprache zur Überschreibung von Richtlinien

Das Ziel dieser Anweisungen besteht darin, dass die Eingabeaufforderung des Angreifers Vorrang vor den LLM-Schutzmaßnahmen erhält, entweder durch Ausnutzung einer Schwachstelle oder durch die Wahrnehmung als wichtiger durch das LLM. Wenn dies erfolgreich ist, kann das LLM unerlaubte Inhalte generieren, versteckte Anweisungen preisgeben, unsichere Empfehlungen geben oder Aktionen an das falsche Werkzeug oder den falschen Benutzer umleiten.

Indirekte Prompt Injection:

Indirekte Eingabeaufforderungsinjektionsangriffe fügen bösartige Anweisungen in den Inhalt ein, den ein Modell konsumiert, anstatt direkte Anweisungen zu geben. Diese könnten Folgendes umfassen:

  • Webseiten
  • Dokumente
  • E-Mails
  • IT-Tickets
  • Chat-Protokolle
  • Wissensdatenbanken

Diese Bedrohungen sind bedeutender, wenn ein LLM auf externe Inhalte zugreift, entweder über ein RAG oder durch das Durchsuchen des Internets nach potenziellen Antworten, da die abgerufenen Daten vom LLM als Kontext behandelt werden. Bösartige Anweisungen können buchstäblich im Inhalt verborgen sein, zum Beispiel durch die Verwendung von weißem Text, um Anweisungen für menschliche Leser unsichtbar zu machen, oder durch die Verwendung von harmlos aussehendem Text, den ein Modell als Anweisungen interpretiert.

Die Haupttypen von Eingabeaufforderungsinjektionsangriffen

Eingabeaufforderungsinjektionsangriffe können durchgeführt werden, um verschiedene Ziele zu erreichen. Zwei der Haupttypen von Angriffen versuchen, auf sensible Informationen über die Systemaufforderung zuzugreifen oder die Nutzung von Werkzeugen durch eine KI zu manipulieren, um sensible Informationen zu sammeln oder schädliche Aktionen durchzuführen.

Eingabeaufforderungsleckage und Extraktion der Systemaufforderung

Einige Angriffe sind darauf ausgelegt, auf die Systemaufforderung zuzugreifen, die sensible Daten enthalten kann, wie versteckte Systemanweisungen, Richtlinien oder Geheimnisse. Diese Informationen können für einen Angreifer nützlich sein, da sie es ihm ermöglichen, nachfolgende Angriffe zu gestalten, die diese Abwehrmaßnahmen umgehen.

Das Potenzial für die Offenlegung von Eingabeaufforderungen bedeutet, dass Geheimnisse niemals in Eingabeaufforderungen eingebettet werden sollten. Sicherheitsleitlinien wie „Keine Offenlegung“-Anweisungen können von einem Angreifer umgangen oder überwunden werden.

Werkzeug- und Agentenübernahme

KI-Tools können möglicherweise Funktionen oder APIs aufrufen, im Internet surfen oder Arbeitsabläufe auslösen. Eine sorgfältig gestaltete Eingabeaufforderung kann es einem Angreifer ermöglichen, festzulegen, welche Werkzeuge ausgewählt werden, die gesendeten Parameter und die Reihenfolge, in der Aktionen aufgerufen werden.

Dies birgt das Risiko, dass ein Angreifer auf sensible Daten zugreifen kann, wenn er Anfragen an Ticketing-Systeme, CRM, Dokumentenspeicher, Code-Repositories oder Cloud-Konsolen stellt. Um dieses Risiko zu managen, sollten Organisationen Zugriffssteuerungen mit minimalen Rechten und Genehmigungsschritte mit menschlicher Beteiligung für hochwirksame Aktionen implementieren, insbesondere für KI-Agenten, die ohne menschliche Aufsicht arbeiten.

Wo tritt die Eingabeaufforderungsinjektion in Unternehmensumgebungen auf?

Eingabeaufforderungsinjektionsangriffe können überall dort auftreten, wo eine Organisation GenAI verwendet. Häufige Beispiele sind:

  • Öffentliche Chat-Tools
  • Eingebettete Assistenten
  • Kundenservice-Bots
  • Interne Wissensassistenten
  • Entwickler-Co-Piloten
  • Autonome Agenten

Selbst wenn Benutzer nicht direkt mit diesen Tools interagieren, bleibt die Eingabeaufforderungsinjektion ein Risiko. Tools können auf Webinhalte, Anhänge, eingefügte Protokolle, Kommentare von Drittanbietern zu SaaS und andere nicht vertrauenswürdige Eingaben zugreifen, die bösartige Anweisungen enthalten könnten.

Chatbots und kundenorientierte Assistenten

Chatbots und kundenorientierte Agenten akzeptieren Freitext von unbekannten Nutzern. Erfolgreiche Angriffe durch Eingabeinjektion könnten das Manipulieren von Ausgaben beinhalten, um Kunden irrezuführen, sowie potenzielle Datenexposition, wenn der Bot Zugriff auf das CRM oder die Bestellsysteme hat.

Um diese Risiken zu managen, sollten Organisationen strenge Datenrichtlinien implementieren, sensible Daten, wenn möglich, schwärzen und vorgefertigte Antworten für sensible Anfragen festlegen. Zusätzlich sollten diese Werkzeuge auf Anzeichen potenziellen Missbrauchs überwacht werden, einschließlich Anforderungsraten, Wiederholungen und Ähnlichkeiten bei den Payloads.

RAG und „Fragen Sie Ihre Wissensdatenbank“-Assistenten

RAG und „Fragen Sie Ihre Wissensdatenbank“-Assistenten haben die Fähigkeit, auf Dokumente und andere Inhalte zuzugreifen, die möglicherweise über die Unternehmensrichtlinien hinausgehen, als Teil des Kontexts des LLM. Infolgedessen kann bösartiger Inhalt, der in Webseiten und anderen Ressourcen eingebettet ist, einem Angreifer ermöglichen, die Sicherheitsvorkehrungen zu umgehen.

Organisationen können diese Risiken mindern, indem sie Inhaltskennzeichnungen, Abruf-Whitelist und die Aufteilung von Eingaben implementieren. Zusätzlich begrenzen Zugriffsrechte nach dem Prinzip der geringsten Privilegien die Daten, auf die diese Werkzeuge zugreifen können, und reduzieren die potenziellen Auswirkungen eines Angriffs.

Auswirkungen von Eingabeinjektionen auf die Unternehmenssicherheit

Angriffe durch Eingabeinjektion können KI-gestützte Werkzeuge dazu bringen, den Wünschen des Angreifers nachzukommen. Dies kann erhebliche Bedrohungen für Vertraulichkeit, Integrität und Verfügbarkeit einführen, aufgrund des Potenzials für Datenverletzungen, manipulierte Ausgaben und korrupte Arbeitsabläufe.

Ein erfolgreicher Angriff durch Eingabeinjektion kann schwer zu untersuchen sein, da legitime Werkzeuge verwendet werden und die Sichtbarkeit in diese Werkzeuge begrenzt ist. Dies stellt auch ein erhebliches Risiko für die Einhaltung von Vorschriften dar, wenn Organisationen nicht über die Daten verfügen, um nachzuweisen, was passiert ist und den Umfang des Vorfalls zu bestimmen.

Häufige geschäftliche Auswirkungen

Angriffe durch Eingabeinjektion können eine Vielzahl unterschiedlicher Auswirkungen auf das Unternehmen haben, einschließlich:

  • Datenlecks von Kundeninformationen
  • Offenlegung von geistigem Eigentum (IP)
  • Ausfallzeiten von Diensten
  • Falsche Antworten auf Kundenanfragen
  • Entscheidungsfindung basierend auf ungenauen Daten
  • Ruf- und finanzielle Schäden
  • Regulatorische Strafen und rechtliche Risiken

Wie kann Prompt-Injection erkannt werden?

Die Erkennung von Prompt-Injection erfordert die Analyse von LLM-Eingaben, -Ausgaben und -Verhalten, um Anomalien oder Verstöße gegen Unternehmensrichtlinien zu identifizieren. Dazu sollten Organisationen Eingaben, Antworten und Toolaufrufe zur Überwachung protokollieren. Die Analyse sollte nach Anomalien, Richtlinienverstößen und wiederholten Payload-Mustern suchen.

Indikatoren in Eingaben, Kontext und Toolaufrufen

Eingaben, Kontext und Toolaufrufe können Indikatoren für Prompt-Injection-Angriffe enthalten. Worauf man achten sollte, sind:

  • Verdächtige Anweisungspatterns
  • Zwangssprache
  • Ungewöhnliche Häufigkeit von Toolaufrufen
  • Ungewöhnliche Zielorte von Toolaufrufen
  • Übermäßige Daten, die von Tools zurückgegeben werden
  • Abgerufener Text, der versucht, als Richtlinie zu agieren

Praktische Maßnahmen gegen Prompt-Injection

Prompt-Injection-Angriffe erfordern eine tiefgehende Verteidigung, da Angreifer bösartige Eingaben erstellen können, um einfache Textsuchen und Mustererkennung zu umgehen. Ein mehrschichtiges Minderungskonzept sollte Folgendes umfassen:

  • Sicherer Anwendungs- und
  • Modellinteraktionskontrollen
  • Datenverwaltung
  • Betriebliche Tests

Das Ziel dieser Maßnahmen ist es, die Auswirkungen und die Häufigkeit von Angriffen zu verringern. Die Natur von LLMs bedeutet, dass es unmöglich ist, vollständig zu garantieren, dass Angriffe niemals erfolgreich sein werden.

Entwurfsmuster zur Verringerung des Explosionsradius

Maßnahmen zur Minderung von Eingabeaufforderungsinjektionen sollten sich darauf konzentrieren, den potenziellen Explosionsradius einer erfolgreichen Injektion zu verwalten. Best Practices umfassen:

  • Weniger Privilegien für den Zugriff auf Werkzeuge, Verbindungen und Datenquellen: Dies umfasst die Implementierung separater Berechtigungen für Lese- und Schreibzugriff.
  • Mensch-in-der-Schleife-Gates für sensible Aktionen: Zum Beispiel sollte eine menschliche Genehmigung für Zahlungen, Kontowechsel, privilegierte Administrationsaufgaben und andere risikobehaftete Aktivitäten erforderlich sein.
  • Starke Grenzen für Geheimnisse: Geheimnisse sollten niemals in Eingabeaufforderungen gespeichert werden, stattdessen sollten eingeschränkte Tokens oder Tresormuster verwendet werden.
  • Segmentierung für Abrufquellen: Idealerweise sollten LLMs nur auf vertrauenswürdige Korpora zugreifen können, die kuratierte und gekennzeichnete Daten enthalten.
  • Deterministische Nachbearbeitung für risikobehaftete Ausgaben: LLM-Ausgaben in risikobehafteten Arbeitsabläufen oder mit Zugang zu sensiblen Daten sollten von nicht-AI-Software nachbearbeitet werden, um sicherzustellen, dass Richtlinien durchgesetzt und sensible Daten geschwärzt werden.

Sicherheitsvorkehrungen zur Laufzeit

Zusätzlich zur Begrenzung des Explosionsradius von Angriffen können Organisationen auch Sicherheitsvorkehrungen implementieren, die das Risiko zur Laufzeit verwalten. Best Practices umfassen:

  • Anforderungsfilterung und Normalisierung: Alle LLM-Antworten sollten analysiert werden, um potenziell sensible oder bösartige Inhalte herauszufiltern und die Einhaltung der Unternehmensrichtlinien sicherzustellen.
  • Datenverlustkontrollen: Verwenden Sie DLP oder ein SWG, um zu verhindern, dass sensible Daten über Eingabeaufforderungen und Antworten hinausgehen, wenn möglich.
  • Inhaltsrisikokontrollen: LLMs mit Internetzugang sollten in den Websites und Inhaltstypen, auf die sie zugreifen können, eingeschränkt werden.
  • Zugriffsverwaltung für KI-Anwendungen und -Assistenten: KI-Anwendungen und -Assistenten sollten mit Zugriffskontrollen mit minimalen Rechten ausgestattet werden, die die Daten und Werkzeuge, die sie verwenden können, einschränken.
  • Protokollierung und Alarmierung: Protokollierung und Alarmierung sollten in KI-gestützte Werkzeuge integriert werden, um eine ordnungsgemäße Sichtbarkeit und Prüfpfade zu gewährleisten.

Wie wird die Eingabeaufforderungsinjektion getestet und validiert?

Die Schwachstellen der Eingabeaufforderungsinjektion sollten regelmäßig getestet werden, da kleine Änderungen an Eingabeaufforderungen, Werkzeugen, Modellen und Datenquellen Risiken wieder einführen können. Ein KI-Rotteam verwendet gegnerische Eingabeaufforderungen, um das Verhalten von Modellen und Anwendungen auf strukturierte und wiederholbare Weise zu bewerten. Einige der wichtigsten Punkte, die getestet werden sollten, sind:

  • Datenleckage
  • Richtlinienumgehung
  • Werkzeugmissbrauch
  • Abrufmanipulation
  • Schädliche Ausgaben

Tests sollten regelmäßig durchgeführt werden, insbesondere nach der Bereitstellung neuer Agenten, Werkzeuge oder Verbindungen. Der Erfolg eines Testprogramms kann anhand der Erfolgsquote, Schwere, Erkennungsabdeckung, Zeit bis zur Erkennung und Zeit bis zur Eindämmung bewertet werden.

Aufbau einer wiederholbaren Testreihe zur Eingabeaufforderungsinjektion

Eine Testreihe für Prompt-Injection kann sicherstellen, dass eine Organisation die wichtigsten Risiken der Prompt-Injection für ihre Systeme angemessen adressiert. Best Practices umfassen:

  • Führen Sie eine Bibliothek von adversarialen Prompts, die den Risikokategorien zugeordnet sind,.
  • Schließen Sie indirekte Injektionsvorrichtungen (Dokumente, Webseiten, Tickets) ein, die sicher, aber realistisch sind.
  • Testen Sie pro Workflow und pro Berechtigungssatz. Dasselbe Modell kann in einem Kontext sicher und in einem anderen unsicher sein.
  • Automatisieren Sie Regressionstests, wenn sich Prompts, Abrufquellen oder Tool-Schemata ändern.
  • Dokumentieren Sie das erwartete Verhalten und die Eskalationswege, wenn ein Test fehlschlägt.

Risikoreduzierung bei Prompt-Injection und operationale Leitplanken.

Prompt-Injection ist ein wachsendes Risiko für die Cybersicherheit von Unternehmen, da Firmen zunehmend auf KI-Tools angewiesen sind, die möglicherweise dazu verleitet werden können, böswillige Aktionen auszuführen. Die Sicherheit bei der Prompt-Injection umfasst die Einschränkung von Eingaben, Kontext, Aktionen und Ausgaben, um die Wahrscheinlichkeit eines Angriffs und dessen potenzielle Auswirkungen auf das Unternehmen zu verringern. Organisationen sollten:

  • Den Zugang von KI-Tools zu Daten und Werkzeugen einschränken.
  • Eingaben und Ausgaben auf Anomalien und Verstöße gegen Richtlinien überwachen.
  • Verwenden Sie deterministische Sanitärmaßnahmen und Vorlagen für hochriskante Antworten.
  • Testen Sie regelmäßig Tools mit adversarialen Prompts.


Das Risiko der Prompt-Injection vollständig zu beseitigen, ist unmöglich. Organisationen können jedoch die Wahrscheinlichkeit und den Wirkungsbereich eines erfolgreichen Angriffs verringern.

FAQ zur Prompt-Injection.

Ist Prompt-Injection dasselbe wie Jailbreaking?

Jailbreaking ist eine besondere Art von Prompt-Injection-Angriff, der darauf abzielt, ein Modell dazu zu bringen, verbotene und schädliche Ausgaben zu erzeugen. Prompt-Injection-Angriffe beinhalten auch das Potenzial, dass ein Modell unautorisierte Aktionen ausführt und mit Drittanbieter-Tools interagiert.

Kann Prompt-Injection vollständig verhindert werden?

Nein, Prompt-Injection kann nicht vollständig verhindert werden, da es schwierig ist, alle bösartigen Eingaben zu identifizieren und da LLMs keine deterministischen, vorhersehbaren Systeme sind. Allerdings können mehrschichtige Sicherheitskontrollen das Risiko und den Schadensradius eines erfolgreichen Angriffs verringern.

Warum wird indirekte Prompt-Injection als gefährlicher angesehen?

Indirekte Prompt-Injection beinhaltet, dass ein Angreifer Anweisungen in Inhalte injiziert, die von einem LLM konsumiert werden, wie beispielsweise Webseiten, die beim Sammeln von Kontext aus dem Internet aufgerufen werden. Dies ist gefährlicher, da ein Angreifer möglicherweise einen Agenten beeinflussen kann, selbst wenn er nicht direkt auf dessen Benutzeroberfläche zugreifen kann.

Was sollte protokolliert werden, um Prompt-Injection-Versuche zu untersuchen?

Protokolle sollten Ereignisse, Toolaufrufe und Verstöße gegen Richtlinien enthalten. Das Protokollieren von Roh-Prompts kann gefährlich sein, da sie möglicherweise sensible Daten enthalten, und alle Protokolle sollten diese Informationen geschwärzt haben.

Was ist die erste Kontrolle, die für einen KI-Assistenten implementiert werden sollte?

Der Zugriff mit minimalen Rechten ist die wichtigste Kontrolle, die für einen KI-Assistenten implementiert werden sollte. Die Einschränkung des Zugriffs auf Daten und andere Tools begrenzt den potenziellen Schaden, der durch einen erfolgreichen Angriff angerichtet werden kann.

Cato Networks wurde im Gartner® Magic Quadrant™ 2024 für Single-Vendor SASE als Leader ausgezeichnet

Bericht lesen

This page was machine-translated. If you notice any inaccuracies or have feedback, please feel free to send it to us here.