Wolf Defender v2: Prompt-Injection-Erkennung, die auf dem Laptop läuft

The TeamSep 7, 20268 minthreat-research
Wolf Defender v2: Prompt-Injection-Erkennung, die auf dem Laptop läuft

FAQ

Häufige Fragen

Was ist Wolf Defender?

Wolf Defender ist ein offenes Klassifikationsmodell von Patronus Protect, das Prompt Injection und Jailbreak-Anweisungen erkennt, bevor ein Text ein Sprachmodell erreicht. Es basiert auf mmBERT (ModernBERT-Architektur), versteht Deutsch und Englisch, verarbeitet bis zu 2.048 Token und steht unter Apache 2.0 auf Hugging Face.

Ist Wolf Defender kostenlos?

Ja. Alle Wolf-Defender-Modelle stehen unter Apache-2.0-Lizenz auf Hugging Face. Du kannst sie lokal betreiben, in eigene Produkte einbauen und feintunen. Patronus Protect nutzt intern zusätzlich ein auf dem vollständigen Datensatz trainiertes Modell.

Welche Sprachen erkennt Wolf Defender?

Deutsch und Englisch sind die trainierten und evaluierten Sprachen. Andere Sprachen laufen über das mehrsprachige mmBERT-Backbone, wurden aber nicht gezielt validiert.

Wie schnell ist Wolf Defender auf einer CPU?

Die quantisierten Edge-Builds (ONNX, INT8-Gewichte, INT4-Embeddings) laufen im zweistelligen Millisekundenbereich pro Text auf einer Laptop-CPU. Eine GPU ist nicht nötig. Die Small-Variante ist für genau diesen Einsatz gebaut.

Reicht Wolf Defender allein als Schutz vor Prompt Injection?

Nein. Das Modell ist eine Schicht in einem mehrstufigen Schutz. Für Aktionen mit hoher Tragweite gehören deterministische Policies, Rechtetrennung und eine menschliche Freigabe dazu. Wolf Defender kann Anfragen routen, blockieren, in Quarantäne stellen oder zur Prüfung vorlegen.

Was unterscheidet Wolf Defender vom Wolf Defender Threat Classifier?

Wolf Defender beantwortet die binäre Frage, ob ein Text eine Injection ist. Der Threat Classifier ordnet einen Text einem von sieben Bedrohungstypen zu, zum Beispiel Instruction Override, Zugriff auf Secrets, Tool-Missbrauch oder Exfiltrationsversuch. Beide laufen auf derselben Architektur.