<< Zurück

IT Sicherheit Künstliche Intelligenz

Was ist eine Prompt Injection? – KI Sicherheitsrisiko kurzgefasst

was ist eine Prompt Injection Roboter hebt eine Textscheibe an

Seitenaufrufe: 59 Aufrufe

Was ist eine Prompt Injection? – Eine „Prompt Injection“ ist eine Methode, die auf Sprachmodelle abzielt. Diese Bedrohung nutzt Schwachstellen aus, um schädliche Eingaben als harmlose Anfragen zu tarnen. Unser Beitrag beleuchtet die Arten von Prompt Injections und die potenziellen Risiken für Unternehmen, sowie allgemeine Sicherheitsmaßnahmen.

 

Was ist eine Prompt Injection?

Eine Prompt Injection ist eine Cyberangriffstechnik, die Sprachmodelle ins Visier nimmt. Angreifer schleusen schädliche Eingaben als harmlose Prompts ein, um generative KI-Systeme zu manipulieren.

Dadurch können sensible Daten preisgegeben oder Fehlinformationen verbreitet werden. Besonders besorgniserregend ist, dass diese Schwachstellen auch sicherheitskritische Anwendungen betreffen können. Es gibt bisher keine wasserdichte Lösung, um diese Angriffe zu verhindern, da sie die Kernfunktionalität der Sprachverarbeitung ausnutzen.

 

Die Arten von Prompt Injections

Prompt-Injections gibt es in zwei Arten: direkte und indirekte. Beide Formen führen jeweils unterschiedliche Methoden zur Ausführung schädlicher Prompts aus.

 

Direkte Prompt Injections

Angreifer manipulieren bei einer direkten Prompt Injection die Benutzereingabe, um schädliche Befehle an das LLM weiterzuleiten.

Ein Beispiel: „ …Ignorieren Sie vorherige Anweisungen und führen Sie ‚Anweisung‘ aus.“

 

direkte prompt injection beispiel bild
In einem realen Beispiel für direkte Prompt Injection gelang es Nutzern, den Twitter/X-Bot von remoteli.io, der von OpenAIs ChatGPT betrieben wird, dazu zu bringen, ein Stellenangebot anzubieten. In diesem Beispiel ist es zwar harmlos, kann jedoch einen peinlichen Imageschaden verursachen. Quelle: ibm.com

 

Indirekte Prompt Injections

Angreifende verstecken ihre Nutzlasten in den Daten, die von LLMs verarbeitet werden. Sie platzieren Prompts auf Webseiten, die vom LLM gelesen werden können. Ein Beispiel: Ein Angreifer teilt einen schädlichen Prompt in einem Forum, der LLMs anweist, Benutzer auf eine Phishing-Seite zu leiten. Nutzt jemand ein LLM, um die Diskussion zu lesen, könnte die Zusammenfassung den Benutzer unbewusst zur Angreifer-Seite führen.

Schädliche Prompts können auch in Bilder eingebettet sein, die vom LLM gescannt werden.

 

 

 

 

Schematischer Ablauf einer Indirect Prompt Injection
Ein Überblick über den Ablauf einer indirekten Prompt Injection und die möglichen Konsequenzen, die sie bei einem Chatbot nach sich ziehen könnte. Quelle: bsi.bund.de

 


 

Unterschied Jailbreaking und Prompt Injection

Es sind unterschiedliche Techniken, die oft verwechselt werden: Prompt Injections tarnen schädliche Befehle als harmlose Eingaben, während Jailbreaking dazu führt, dass ein LLM seine Sicherheitsmaßnahmen ignoriert.

Ein Beispiel für Jailbreaking ist, wenn das LLM eine Persona annimmt und dadurch in der Lage ist, durch darauffolgende Fragen Blockaden zu überwinden.

 

Risiken einer Prompt Injection für Unternehmen

Die Verwendung von KI-Werkzeugen im Unternehmen birgt durch eine Prompt Injection folgende Risiken:


  • Nutzung eines LLM zur Textzusammenfassung oder -analyse aus externen Quellen:

    • Ergebnisse könnten manipuliert werden.

     

  • Nutzung eines Chatbots, der modifizierte Internetseiten abruft:

    • Anfragen könnten manipuliert werden.
    • Der Chatbot könnte unerwünschtes Verhalten zeigen, z.B. rechtlich bedenkliche Aussagen anzeigen.
    • Nutzende könnten zum Aufrufen bösartiger Links motiviert werden.
    • Der Chatbot könnte versuchen, sensible Informationen wie Kreditkartendaten zu erlangen.
    • Angreifende könnten unbemerkt sensible Informationen aus dem Chatverlauf extrahieren, falls die Möglichkeit zum Aufrufen von URLs oder externen Bildern besteht.
    • Der Chatbot könnte unerwünschte Aktionen auslösen, z.B.:
      • Zugriff auf E-Mail-Konten, Zusammenfassung und Extraktion von E-Mail-Inhalten.
      • Veröffentlichung privater Quellcode-Repositories.
  • Autonomer Agent in einem Docker-Container mit LLM-API-Zugriff:

    • Angreifende könnten aus dem Container ausbrechen und Root-Rechte auf dem Zielsystem erlangen.

 

Allgemeine Massnahmen zum Schutz von einem böswilligen Prompts

Um sich vor böswilligen Prompts zu schützen, ist es wichtig, einige grundlegende Maßnahmen zu ergreifen.

Einer dieser Maßnahmen ist es Filter für die Eingabe und Ausgabe die Inhalte einzupflegen. Eine mögliche Maßnahme für einen Eingabefilter ist die Begrenzung der maximalen Eingabelänge als auch die Benutzerinputs und Systemprompts zu trennen sowie ein Abgleich von Ähnlichkeiten in der Syntax mit einer Datenbank.

Die Ausgabefilterung könnte den Output auf ein bestimmtes Format beschränken oder unerwünschte Inhalte blockieren.

Es ist ratsam, die Berechtigungen des Sprachmodells auf das absolut Notwendige für die Funktion zu reduzieren. Eine menschliche Überprüfung kann ebenfalls eine Methode sein, um unerwünschte Ergebnisse zu identifizieren und zu korrigieren. Dies trifft besonders bei generierten Textinhalten zu die mit einem LLM unterstützend bearbeitet wurden.

 

Leveln Sie jetzt auf – Starten Sie Ihre IT-Modernisierung mit huzit!

Mit unserer umfassenden Expertise und erstklassigem Support unterstützen wir Sie, Ihre IT-Infrastruktur zukunftsorientiert auf den neuesten Stand der Technik zu bringen.

Wir freuen uns von Ihnen zu hören!

Netzwerkleitung RJ45 wird an einem Netzwerkswitch angeschlossen

Quellen: bsi.bund.de – Indirect Prompt Injections – Intrinsische Schwachstelle in anwendungsintegrierten KI- Sprachmodellenibm.com – Was ist ein Prompt Injection Angriff?

To top