Servicios Planes
Nosotros
Ingresar

Yaga Benchmark

En el pentest con IA, el mismo modelo rinde mucho más
con el harness de Yaga que por sí solo.

Resultados de Yaga

Usando el harness de Yaga combinado con varios modelos, los resultados son muy superiores a los de cualquier modelo aislado.

Resultados de Yaga Gráfico de líneas que compara el porcentaje de escenarios resueltos por Yaga (modelos combinados) y por GPT-5.6, Opus 5, Grok 4.6 y Sonnet 5 por sí solos, en los modos black box, gray box y white box. Yaga se mantiene muy por encima de cada modelo aislado en todos los modos. 0 20 40 60 80 100 Black box Gray box White box 96.2 97.0 98.8 Yaga Opus 5 GPT-5.6 Grok 4.6 Sonnet 5
Opus 5 GPT-5.6 Grok 4.6 Sonnet 5 Yaga · 4 modelos combinados

Porcentaje del conjunto fijo de escenarios resuelto por modo de prueba. Pasa el cursor sobre los puntos para ver el valor exacto.

Yaga vs. cada modelo aislado

Con Yaga, tu pentest queda muy superior al de cualquier modelo corriendo de forma aislada.

Modelo Black box Gray box White box
Yaga · 4 modelos combinados 96.2% 97.0% 98.8%
Opus 5 40.0% 48.9% 61.0%
GPT-5.6 39.5% 48.5% 60.9%
Grok 4.6 39.0% 47.5% 58.7%
Sonnet 5 27.4% 36.5% 49.6%

Benchmark interno de HackerSec sobre un conjunto fijo de escenarios, midiendo vulnerabilidades confirmadas y explotables. Cada modelo se evalúa por sí solo, sin el harness de Yaga; la línea combinada es la Yaga de producción, con los cuatro modelos en una única ejecución orquestada.

Yaga v2.7 · Última actualización · 18 de agosto de 2026

Cómo medimos

La misma vara para todos

Cada modelo ejecuta el mismo conjunto de escenarios, en las mismas condiciones. La vara es idéntica para todos, y la diferencia en los resultados refleja solo el método que cada uno aplica.

Validado por experto humano

En YagaBench, una vulnerabilidad se contabiliza solo cuando fue realmente explotada y confirmada por un especialista de HackerSec. Solo lo comprobado entra en la cuenta.

El modelo responde. Yaga opera.

Solo, un modelo apenas responde. Dentro del harness de Yaga, reconoce el objetivo, explota fallas reales y comprueba el impacto, como un pentester. Orquestada, la misma IA rinde mucho más.

Medido con los límites activos

Yaga ejecutó el benchmark con los mismos guardrails que valen en el entorno de un cliente. Los números de arriba vienen de la operación real, no de un modo más suelto creado para la prueba.

Escenarios alineados con OWASP PTES MITRE CWE NIST

Ve a Yaga operando en tu objetivo

Pon el mismo harness a trabajar en tu alcance, con supervisión humana de HackerSec.