Wolf Defender: unser erstes Security-Modell ist da

Je verbreiteter AI-Systeme werden, desto schneller wächst die Angriffsfläche. Prompt Injection, Datenexfiltration und die Manipulation von AI-Agents sind reale Sicherheitsrisiken, und trotzdem gibt es bislang nur sehr wenige offene Security-Modelle.
Wir sind überzeugt, dass die grundlegenden Werkzeuge der AI-Security offen und zugänglich sein sollten.
Deshalb veröffentlichen wir Wolf Defender, ein Modell zur Erkennung von Prompt Injection, trainiert auf nur etwa 5 Prozent unseres vollständigen Trainingsdatensatzes. Trotz der geringen Größe übertrifft das Modell mehrere bestehende Open-Source-Detektoren in verschiedenen Benchmarks. Unser internes Modell, das in Patronus Protect steckt, ist auf dem kompletten Datensatz trainiert und schneidet noch einmal deutlich besser ab.
Wolf Defender wurde bewusst auf stark augmentierten Daten trainiert, um über den gesamten Bereich der Prompt-Injection-Angriffe hinweg zu generalisieren.
Dazu gehören unter anderem:
-
Unicode- und Homoglyphen-Manipulationen
-
kodierte Injections, etwa per Base64
-
Injections in HTML und Code-Kommentaren
-
strukturelle Wrapper
-
Veränderungen bei Abständen und Groß-/Kleinschreibung
Zusätzlich haben wir gezielt regularisiert, um die verbreitete Verzerrung in Richtung einfacher Trigger-Wörter wie „Ignore previous instructions" abzubauen.
Unser Ziel war kein Detektor, der bekannte Prompts wiedererkennt, sondern einer, der die Struktur von Prompt-Injection-Angriffen lernt.
Wolf Defender basiert auf einem Datensatz, den wir laufend um neue Angriffsmuster erweitern. Unsere Trainings-Pipeline erlaubt es, das Modell schnell an neue Bedrohungen anzupassen.
Wir verstehen diese Veröffentlichung als ersten Schritt zu einem breiteren Ökosystem offener AI-Security-Modelle. Wolf Defender ist eines von mehreren Modellen, die wir veröffentlichen wollen, um AI-Nutzung auf dem Endgerät sicherer und steuerbarer zu machen.
Dieses erste Modell nutzt eine Architektur im ModernBERT-Stil, um den Ansatz zu validieren. Für wirklich effiziente On-Device-Inferenz in der AI-Security haben wir bereits mehrere weitere Ansätze in Entwicklung.
Wir freuen uns, Wolf Defender mit der Community zu teilen und dazu beizutragen, AI-Systeme sicherer zu machen.