Über Erfolgsraten hinaus: Kostenbewusste Evaluation von Angriffssicherheits-Agenten und defensiven Sicherheits-Agentsystemen
Die Bewertung von Sicherheits-Agenten ist oft unvollständig, da sie nur die maximale offensive Leistung unter großzügigen Rechenbudgets misst. In der operativen Sicherheit verbrauchen jede Reasoning-Schritt, Tool-Call oder Telemetrie-Anfrage Budget, was den tatsächlichen Erfolg begrenzt.
Forschungsfrage
Operative Sicherheitsaufgaben wie SOC-Erhebungen skalieren nicht linear mit dem Rechenbudget; sie hängen stärker von diszipliniertem Werkzeuggebrauch und selektiver Anreicherung ab als von roher Reasoning-Kapazität. Aktuelle Benchmarks ignorieren oft die wirtschaftliche Effizienz.
Methodik
Die Autoren evaluieren Sprachmodell-Sicherheits-Agenten auf offensivem Cybench-Testfeld und defensivem Splunk BOTS v1-Erhebungsproblem unter einer Kosten-Erfolg-Linse, um Leistung bei festgelegten Kostenniveaus zu vergleichen.
Zentrale Ergebnisse
- Offensive CTF-Leistung verbessert sich mit zusätzlicher Testzeit-Rechenleistung und skalierte Open-Weight-Modelle können kosteneffizient an Frontline-Proprietärsysteme herankommen.
- Defensives SOC-Erhebungsproblem skaliert nicht auf dieselbe Weise; der Erfolg hängt mehr von diszipliniertem Werkzeuggebrauch ab als vom Rechenbudget allein.
Praktische Bedeutung
Sicherheits-Teams können durch kostebewusste Evaluation besser entscheiden, welche Modelle für ihre spezifischen SOC-Aufgaben praktisch nützlich sind, anstatt nur auf Spitzenleistung zu vertrauen.
Limitationen
- Die Studie konzentriert sich primär auf Cybench und Splunk BOTS; andere operative Umgebungen könnten unterschiedliche Skalierungsmuster zeigen.
- Langfristige Kostenentwicklung über Monate oder Jahre wurde nicht vollständig modelliert, da die Evaluation kurzfristig orientiert ist.
Details
- Original title
- Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents
- Authors
- Paul Kassianik, Blaine Nelson, Yaron Singer
- Publication platform
- arXiv
- Methodology type
- experimental-evaluation
- Paper
- Paper
Warum ist das relevant?
Dieses Forschungsstück ist für AI-Sicherheitspraktiker relevant, weil es zeigt, dass traditionelle Benchmarks oft irreführend sind. Es erklärt den Unterschied zwischen theoretischer Offensive-Kapazität und praktischem operativem Nutzen bei defensiven Agenten.
Quellen
- Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security AgentsBeyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents - externer Link
arXiv cs.CR
Primary Source