Neues AI-Security-Modell: Wolf Defender

In den vergangenen Wochen haben wir versucht, unser Modell weiter zu verbessern und die False-Positive-Rate zu senken.
Die besten Ergebnisse kamen dabei nicht aus einer neuen Architektur, sondern aus besseren Daten.
I. Daten schlagen Modell
Statt neuen Architekturen hinterherzulaufen, haben wir uns auf vier Dinge konzentriert:
-
Bereinigung des Datensatzes
-
Entfernen falsch gelabelter Beispiele
-
bessere Balance der Daten
-
realistische Grenzfälle ergänzen
Allein das hat unser Modell von etwa 0,90 auf 0,95 F1 gebracht.
II. Fehlalarme reduzieren, das eigentliche Problem
Die meisten Prompt-Injection-Detektoren scheitern im Produktivbetrieb an False Positives. Ein Detektor, der harmlose Arbeit blockiert, wird abgeschaltet, und danach schützt er niemanden mehr.
Wir haben das deshalb zum primären Optimierungsziel gemacht.
Beispiel Qualifire-Benchmark:
→ FPR gesenkt von etwa 0,11 auf 0,03
Wichtig dabei: Das wurde nicht durch Training auf Benchmark-Daten erreicht.
Stattdessen haben wir ergänzt:
-
schwierige harmlose Beispiele
-
Prompts, die nach Injection aussehen, aber sicher sind
-
echten Entwickler-Text aus Dokumentation, Issues und Diskussionen
Das zwingt das Modell, den Unterschied tatsächlich zu lernen: zwischen bösartiger Struktur und harmlosem Kontext.
Das Ergebnis
-
Spitzenwerte über die Benchmarks hinweg
-
niedrigste FPR im Vergleich
-
gute Generalisierung über verschiedene Datensätze
Im Durchschnitt liegen wir damit vor bestehenden Open-Weight-Detektoren und sogar vor feingetunten LLM-basierten Lösungen wie Sentinel.
Kleines Modell, große Wirkung
Wir haben zusätzlich eine um 50 Prozent kleinere Variante trainiert: minimaler Leistungsverlust, weiterhin starke Benchmark-Ergebnisse.
Das ist entscheidend, weil es aggressive Quantisierung und damit effizientes Deployment auf dem Endgerät erst möglich macht.
Was als Nächstes kommt
Unser nächster Schritt: die Modellgröße von etwa 500 MB auf unter 250 MB senken, bei gleichbleibender Leistung.
So sollte AI-Security in der Praxis funktionieren:
-
on-device
-
in Echtzeit
-
ohne Cloud-Abhängigkeit
-
ohne dass Daten das System verlassen
Modell
https://huggingface.co/patronus-studio/wolf-defender-prompt-injection
Wir sind überzeugt: Die Zukunft der AI-Security ist lokal, schnell und datengetrieben.