VulnRep: Reproducer-Verified LLM-Based Vulnerability Discovery

Autoren: Mischa Meier, Annika Kuntze, Veit Eysholdt, Christoph Geron, Maxim Shevchishin, Niklas Steffen, Maximilian Leiwig, Julian Steffen, Felix Boes, Matthew Smith, Sergej Dechand

Publikationsort: Detection of Intrusions and Malware, and Vulnerability Assessment - 23rd International Conference, DIMVA 2026, Chania, Greece, July 1-3, 2026, Proceedings

Reihe: Lecture Notes in Computer Science

Verlag: Springer

Jahr: 2026

Die LLM-basierte Schwachstellensuche ist häufig an kommerzielle APIs und umfangreiche Recheninfrastruktur gebunden, was sie für Teams ausschließt, die ihren Code nicht an externe Anbieter übermitteln können. Unser Beitrag zur DIMVA 2026 stellt VulnRep vor, ein leichtgewichtiges Cyber Reasoning System mit mehreren Agenten, das für das gesamte Leistungsspektrum von Modellen ausgelegt ist, von führenden kommerziellen Modellen bis hin zu Open-Weight-Modellen, die vor Ort auf handelsüblicher Hardware laufen.

VulnRep verbindet LLM-gestützte statische Analyse mit dynamischer Verifikation: Ein Analyzer-Agent untersucht Code auf Symbolebene über das Language Server Protocol und identifiziert potenzielle Schwachstellen. Ein Verifier-Agent bestätigt diese, indem er auf Basis vorhandener Test-Harnesses Reproducer erstellt, die Sanitizer auslösen, wodurch Fehlalarme für die von Sanitizern erkennbaren Fehlerklassen ausgeschlossen werden.

Wir evaluieren VulnRep anhand von 14 Schwachstellen aus der nginx-Challenge der AIxCC, reproduzieren 11 von 64 realen OSS-Fuzz-Problemen und analysieren 82 aktive Open-Source-Projekte, wobei wir 2 bislang nicht dokumentierte Probleme in ausgereiften Systemen entdecken.

Proprietäre Modelle erzielen die höchsten Erfolgsraten, doch leistungsfähige Open-Weight-Modelle reproduzieren ebenfalls mehrere Schwachstellen. Damit ist eine vollständig lokale, selbst gehostete Schwachstellensuche praktikabel, wenn eine gewisse Verringerung der Effektivität akzeptabel ist.