Was ist Prompt Injection? Definition, Beispiele und Abwehr

The TeamSep 7, 20269 minagent-security
Was ist Prompt Injection? Definition, Beispiele und Abwehr

FAQ

Häufige Fragen

Was ist Prompt Injection in einem Satz?

Prompt Injection ist ein Angriff, bei dem ein Text Anweisungen enthält, die ein Sprachmodell als Befehl versteht und ausführt, obwohl sie nicht vom Nutzer oder Betreiber stammen.

Was ist der Unterschied zwischen direkter und indirekter Prompt Injection?

Bei direkter Prompt Injection gibt der Angreifer die Anweisung selbst ein, etwa im Chat. Bei indirekter Prompt Injection steckt die Anweisung in Inhalten, die das Modell verarbeitet: in einer Webseite, einer E-Mail, einem PDF oder der Ausgabe eines Tools. Der Nutzer sieht die Anweisung oft gar nicht.

Ist Prompt Injection dasselbe wie ein Jailbreak?

Nein, aber verwandt. Ein Jailbreak versucht, die Sicherheitsregeln eines Modells auszuhebeln, damit es Inhalte erzeugt, die es verweigern sollte. Prompt Injection lenkt ein Modell in einer Anwendung um, damit es Daten preisgibt oder Aktionen ausführt. Detektoren wie Wolf Defender erkennen beides.

Kann man Prompt Injection vollständig verhindern?

Nein. Solange ein Modell Anweisungen und Daten im selben Kanal verarbeitet, bleibt ein Restrisiko. Deshalb kombiniert man Erkennung im Eingang, Rechtetrennung für Tools, menschliche Freigabe für folgenreiche Aktionen und Überwachung der Ausgaben.

Wie erkennt ein Modell wie Wolf Defender Prompt Injection?

Wolf Defender ist ein Klassifikator, der auf Hunderttausenden Beispielen gelernt hat, wie Injection-Anweisungen strukturiert sind, auch wenn sie verschleiert sind: Unicode-Tricks, Base64, HTML-Kommentare, Umbrüche. Er bewertet einen Text in Millisekunden auf dem Gerät und liefert eine Wahrscheinlichkeit, mit der eine Policy arbeiten kann.