Prompt Injection in PDFs: Vor RAG und Agenten prüfen

Ein PDF kann eine Prompt Injection enthalten, ohne eine klassische Sicherheitslücke im PDF-Reader auszunutzen. Der Angriff richtet sich gegen das AI-System, das den Inhalt liest: Es soll fremde Anweisungen als Teil seines Auftrags behandeln. Entscheidend ist deshalb, welchen Text das System erhält und welche Handlungen daraus entstehen können.
Kurz gesagt
- Ein unauffälliges Dokument kann Anweisungen für ein AI-System enthalten.
- Die gerenderte PDF-Seite und der extrahierte Text können voneinander abweichen.
- RAG kann manipulative Inhalte speichern und später in andere Aufgaben übernehmen.
- Inhaltsprüfung, Herkunft und begrenzte Berechtigungen erfüllen unterschiedliche Aufgaben.
Wie ein Dokument den Auftrag verändert
Du lässt einen Agenten eine Rechnung prüfen. Zu seinem Auftrag gehört, Beträge und Lieferantendaten zu erfassen. Im Dokument steht zusätzlich ein Absatz, der sich als interne Anweisung für die AI ausgibt und die Rechnung für bereits geprüft erklärt. Folgt der Agent diesem Absatz, bewertet er die Rechnung nach einer Vorgabe ihres Absenders.
Das ist ein Beispiel für indirekte Prompt Injection. Die Anweisung kommt über eine Quelle, die der Agent zur Bearbeitung seines Auftrags liest. Ihr Absender besitzt jedoch keine Berechtigung, diesen Auftrag zu verändern. Die Manipulation kann bereits die Zusammenfassung verfälschen. Besitzt der Agent Schreib-, Versand- oder Ausführungsrechte, können auch Aktionen betroffen sein.
Das Problem beginnt nicht erst bei verborgenem Text. Auch ein gut sichtbarer Absatz kann versuchen, Autorität vorzutäuschen. Grundlagen und weitere Beispiele findest du unter Was ist Prompt Injection?.
Was du siehst, ist nicht immer das, was die AI liest
PDFs beschreiben, wie Inhalte auf einer Seite dargestellt werden. Ein Parser gewinnt daraus Text für die weitere Verarbeitung. Reihenfolge, Positionierung und Formatierung können dabei anders behandelt werden als in der sichtbaren Ansicht. Bei gescannten Seiten kommt gegebenenfalls OCR hinzu, die Text aus dem Bild erkennt.
Am 6. Oktober 2026 beschrieb Check Point in seinem PromptGuardX-Beitrag unter anderem durch Formatierung oder Dokumentstruktur verborgene Anweisungen in PDFs. Der Anlass zeigt, warum die Prüfung der tatsächlich verarbeiteten Darstellung wichtig ist. Die Ankündigung ist kein Nachweis dafür, dass jeder PDF-Parser denselben Inhalt liefert.
Für eine Prüfung solltest du deshalb die gerenderte Seite und das Ergebnis deines eigenen Extraktionswegs vergleichen. Dabei geht es um den Parser und die OCR-Einstellungen, die dein System wirklich verwendet. Ein Scan einer anderen Darstellung kann relevante Inhalte übersehen.
Warum RAG das Problem weitertragen kann
Bei Retrieval-Augmented Generation, kurz RAG, werden Dokumente in Abschnitte zerlegt und indexiert. Zu einer Frage sucht das System passende Fundstellen und gibt sie dem Modell als Kontext. Eine manipulative Passage kann so lange nach dem ursprünglichen Upload wieder auftauchen.
Auch die Zerlegung beeinflusst die Einordnung. Ein Absatz kann eine fremde Anweisung zitieren, während der Hinweis auf das Zitat im vorherigen Abschnitt steht. Umgekehrt kann eine Manipulation mehrere Abschnitte kombinieren. Für die Prüfung ist daher wichtig, ausreichend Kontext zu behalten und Fundstellen dem ursprünglichen Dokument zuordnen zu können.
Eine interne Wissensdatenbank verändert die Herkunft ihrer Inhalte nicht. Eine Lieferantenrechnung bleibt vom Lieferanten verfasst, auch wenn sie auf deinem Server gespeichert ist. Beim Retrieval muss diese Unterscheidung erhalten bleiben.
Welche Kontrollen an welcher Stelle helfen
Eine Dokumentenpipeline hat mehrere Prüfstellen. Vor der Indexierung kannst du den extrahierten Inhalt untersuchen und verdächtige Dokumente zurückhalten. Beim Retrieval kannst du die Herkunft der Fundstellen mitgeben und ihre Rolle als externe Information kennzeichnen. Vor einer sensiblen Aktion muss die Ausführungskomponente prüfen, ob diese Aktion zum Auftrag und zu den Berechtigungen passt.
Datei empfangen → Text extrahieren → Inhalt prüfen → kontrolliert weiterverarbeiten.
Eine Inhaltsbewertung allein beantwortet nicht, ob der Agent eine Datei versenden oder einen Datensatz ändern darf. Dafür braucht es eigene Regeln. Die OWASP-Empfehlungen zu Prompt Injection verbinden Eingangsprüfung mit weiteren Schutzschichten wie begrenzten Rechten und menschlicher Freigabe. Unser Manus-Beitrag erläutert, warum eine Kontrolle nach der Ausführung zu spät kommen kann.
So prüfst du deinen eigenen Ablauf
Teste zunächst eine normale Rechnung und einen Sicherheitsbericht, der Angriffe nur beschreibt. Beide sollten im vorgesehenen Workflow funktionieren. Ergänze dann kontrollierte Testdokumente mit auftragsfremden Anweisungen, unterschiedlichen Textpositionen und den Darstellungen, die deine Pipeline unterstützt.
Beobachte getrennt, was extrahiert, was indexiert, was an das Modell übergeben und welche Aktion ausgeführt wird. Eine Warnung ist ein anderes Ergebnis als eine tatsächlich verhinderte Handlung. Prüfe außerdem den Fehlerfall: Wenn eine erforderliche Inhaltsprüfung aussteht oder fehlschlägt, muss dein Workflow damit ausdrücklich umgehen.
Kein Klassifikator erkennt jede Manipulation. Zugleich können legitime Anleitungen und Sicherheitsberichte wie Angriffe aussehen. Die Qualität einer Prüfung zeigt sich deshalb an schädlichen und unauffälligen Beispielen aus deinem tatsächlichen Einsatzbereich.
Kostenlose Optionen zum Ausprobieren
Wenn du eine solche Prüfung selbst aufbauen möchtest, gibt es zwei kostenlose Einstiegsmöglichkeiten von Patronus:
- Wolf Defender v2 ist ein offen verfügbares Textmodell zur Prompt-Injection-Erkennung unter Apache 2.0. Die Modellgewichte kannst du kostenlos selbst betreiben; Wolf Defender Small ist die kleinere Variante. Rechenleistung und Betrieb stellst du dabei selbst bereit.
- Patronus Scanner API bietet einen Free-Tarif mit 30.000 Scan Units pro Monat. Eine Unit umfasst bis zu 1.000 Eingabetokens. Die API lässt sich per HTTP oder SDK in Automationen einbinden und unterstützt PDF-Dateien mit Textschicht bis 10 MB. Das Freikontingent ist keine unbegrenzte Anzahl von Scans. Tarifdetails, Stand: 7. Oktober 2026.
Beide liefern einen Baustein für die Inhaltsprüfung. Die Entscheidung über Weiterverarbeitung und Agent-Aktionen bleibt in deinem Workflow.
FAQ
Häufige Fragen
Kann ein PDF ohne Malware eine Prompt Injection enthalten?
Ja. Der Angriff nutzt Anweisungen im Dokument, um ein AI-System zu beeinflussen. Dafür muss keine klassische Sicherheitslücke im PDF-Reader ausgenutzt werden.
Warum reicht es nicht, das PDF auf dem Bildschirm anzusehen?
Die sichtbare Darstellung und die Ausgabe von Parser oder OCR können voneinander abweichen. Prüfe die Darstellung, die dein System tatsächlich an die AI weitergibt.
Was macht Prompt Injection in RAG-Systemen problematisch?
Manipulative Inhalte können indexiert und später für verschiedene Aufgaben abgerufen werden. Herkunft und Kontext der Fundstellen müssen erhalten bleiben.
Reicht ein Inhaltsklassifikator als Schutz aus?
Nein. Zusätzlich braucht es begrenzte Berechtigungen und Kontrollen vor sensiblen Aktionen. Eine unauffällige Inhaltsbewertung ist keine pauschale Freigabe für Tools.