Forschung2min Lesezeit

Über Erfolgsraten hinaus: Kostenbewusste Evaluation von Angriffssicherheits-Agenten und defensiven Sicherheits-Agentsystemen

Die Bewertung von Sicherheits-Agenten ist oft unvollständig, da sie nur die maximale offensive Leistung unter großzügigen Rechenbudgets misst. In der operativen Sicherheit verbrauchen jede Reasoning-Schritt, Tool-Call oder Telemetrie-Anfrage Budget, was den tatsächlichen Erfolg begrenzt.

Hohe RelevanzAgent SecurityAI SecurityRed Teaming

Forschungsfrage

Operative Sicherheitsaufgaben wie SOC-Erhebungen skalieren nicht linear mit dem Rechenbudget; sie hängen stärker von diszipliniertem Werkzeuggebrauch und selektiver Anreicherung ab als von roher Reasoning-Kapazität. Aktuelle Benchmarks ignorieren oft die wirtschaftliche Effizienz.

Methodik

Die Autoren evaluieren Sprachmodell-Sicherheits-Agenten auf offensivem Cybench-Testfeld und defensivem Splunk BOTS v1-Erhebungsproblem unter einer Kosten-Erfolg-Linse, um Leistung bei festgelegten Kostenniveaus zu vergleichen.

Zentrale Ergebnisse

  • Offensive CTF-Leistung verbessert sich mit zusätzlicher Testzeit-Rechenleistung und skalierte Open-Weight-Modelle können kosteneffizient an Frontline-Proprietärsysteme herankommen.
  • Defensives SOC-Erhebungsproblem skaliert nicht auf dieselbe Weise; der Erfolg hängt mehr von diszipliniertem Werkzeuggebrauch ab als vom Rechenbudget allein.

Praktische Bedeutung

Sicherheits-Teams können durch kostebewusste Evaluation besser entscheiden, welche Modelle für ihre spezifischen SOC-Aufgaben praktisch nützlich sind, anstatt nur auf Spitzenleistung zu vertrauen.

Limitationen

  • Die Studie konzentriert sich primär auf Cybench und Splunk BOTS; andere operative Umgebungen könnten unterschiedliche Skalierungsmuster zeigen.
  • Langfristige Kostenentwicklung über Monate oder Jahre wurde nicht vollständig modelliert, da die Evaluation kurzfristig orientiert ist.

Details

Original title
Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents
Authors
Paul Kassianik, Blaine Nelson, Yaron Singer
Publication platform
arXiv
Methodology type
experimental-evaluation
Paper
Paper

Warum ist das relevant?

Dieses Forschungsstück ist für AI-Sicherheitspraktiker relevant, weil es zeigt, dass traditionelle Benchmarks oft irreführend sind. Es erklärt den Unterschied zwischen theoretischer Offensive-Kapazität und praktischem operativem Nutzen bei defensiven Agenten.

Quellen