Leistungen Pläne
Über uns
Anmelden

Yaga Benchmark

Beim Pentest mit KI leistet dasselbe Modell weit mehr
mit dem Harness von Yaga als allein.

Ergebnisse von Yaga

Mit dem Harness von Yaga in Kombination mit verschiedenen Modellen sind die Ergebnisse weit besser als die jedes einzelnen Modells.

Ergebnisse von Yaga Liniendiagramm, das den Prozentsatz der von Yaga (kombinierte Modelle) sowie von GPT-5.6, Opus 5, Grok 4.6 und Sonnet 5 allein gelösten Szenarien in den Modi Black Box, Gray Box und White Box vergleicht. Yaga liegt in allen Modi deutlich über allen einzelnen Modellen. 0 20 40 60 80 100 Black Box Gray Box White Box 96.2 97.0 98.8 Yaga Opus 5 GPT-5.6 Grok 4.6 Sonnet 5
Opus 5 GPT-5.6 Grok 4.6 Sonnet 5 Yaga · 4 kombinierte Modelle

Prozentsatz der festen Menge von Szenarien, gelöst pro Testmodus. Fahren Sie mit der Maus über die Punkte, um den genauen Wert zu sehen.

Yaga vs. jedes einzelne Modell

Mit Yaga wird Ihr Pentest weit besser als der jedes einzeln laufenden Modells.

Modell Black Box Gray Box White Box
Yaga · 4 kombinierte Modelle 96.2% 97.0% 98.8%
Opus 5 40.0% 48.9% 61.0%
GPT-5.6 39.5% 48.5% 60.9%
Grok 4.6 39.0% 47.5% 58.7%
Sonnet 5 27.4% 36.5% 49.6%

Interner Benchmark von HackerSec anhand einer festen Menge von Szenarien, gemessen an bestätigten und ausnutzbaren Schwachstellen. Jedes Modell wird allein bewertet, ohne das Harness von Yaga; die kombinierte Linie ist das produktive Yaga, mit den vier Modellen in einer orchestrierten Ausführung.

Yaga v2.7 · Letzte Aktualisierung · 18. August 2026

Wie wir messen

Der Maßstab ist für alle gleich

Jedes Modell führt dieselbe Menge von Szenarien unter denselben Bedingungen aus. Der Maßstab ist für alle identisch, und der Unterschied in den Ergebnissen spiegelt nur die von jedem Modell angewandte Methode wider.

Von einem menschlichen Experten validiert

Im YagaBench wird eine Schwachstelle nur dann gezählt, wenn sie tatsächlich von einem Experten von HackerSec ausgenutzt und bestätigt wurde. Nur was nachgewiesen wurde, zählt.

Das Modell antwortet. Yaga operiert.

Allein antwortet ein Modell nur. Innerhalb des Harness von Yaga erkundet es das Ziel, nutzt echte Schwachstellen aus und weist den Impact nach, wie es ein Pentester tun würde. Orchestriert leistet dieselbe KI weit mehr.

Gemessen mit aktivierten Grenzen

Yaga hat den Benchmark mit denselben Guardrails ausgeführt, die auch in der Kundenumgebung gelten. Die obigen Zahlen stammen aus dem realen Betrieb, nicht aus einem lockereren Modus, der für den Test erstellt wurde.

Szenarien ausgerichtet an OWASP PTES MITRE CWE NIST

Sehen Sie Yaga bei der Arbeit an Ihrem Ziel

Setzen Sie dasselbe Harness in Ihrem Scope ein, mit menschlicher Aufsicht durch HackerSec.