Serviços Planos
Sobre Nós
Entrar

Yaga Benchmark

No pentest com IA, o mesmo modelo rende muito mais
com o harness da Yaga do que sozinho.

Resultados da Yaga

Usando o harness da Yaga combinado com diversos modelos, os resultados são muito superiores aos de qualquer modelo isolado.

Resultados da Yaga Gráfico de linhas comparando o percentual de cenários resolvidos pela Yaga (modelos combinados) e por GPT-5.6, Opus 5, Grok 4.6 e Sonnet 5 sozinhos, nos modos black box, gray box e white box. A Yaga fica bem acima de todos os modelos isolados em todos os modos. 0 20 40 60 80 100 Black box Gray box White box 96.2 97.0 98.8 Yaga Opus 5 GPT-5.6 Grok 4.6 Sonnet 5
Opus 5 GPT-5.6 Grok 4.6 Sonnet 5 Yaga · 4 modelos combinados

Percentual do conjunto fixo de cenários resolvido por modo de teste. Passe o mouse sobre os pontos para ver o valor exato.

Yaga vs. cada modelo isolado

Com a Yaga, seu pentest fica muito superior ao de qualquer modelo rodando isoladamente.

Modelo Black box Gray box White box
Yaga · 4 modelos combinados 96.2% 97.0% 98.8%
Opus 5 40.0% 48.9% 61.0%
GPT-5.6 39.5% 48.5% 60.9%
Grok 4.6 39.0% 47.5% 58.7%
Sonnet 5 27.4% 36.5% 49.6%

Benchmark interno da HackerSec sobre um conjunto fixo de cenários, medindo vulnerabilidades confirmadas e exploráveis. Cada modelo é avaliado sozinho, sem o harness da Yaga; a linha combinada é a Yaga de produção, com os quatro modelos em uma execução orquestrada.

Yaga v2.7 · Última atualização · 18 de agosto de 2026

Como medimos

A régua é a mesma para todos

Cada modelo executa o mesmo conjunto de cenários, nas mesmas condições. A régua é idêntica para todos, e a diferença nos resultados reflete apenas o método aplicado por cada modelo.

Validado por especialista humano

No YagaBench, uma vulnerabilidade é contabilizada apenas quando foi realmente explorada e confirmada por um especialista da HackerSec. Somente o que foi comprovado entra na conta.

O modelo responde. A Yaga opera.

Sozinho, um modelo apenas responde. Dentro do harness da Yaga, ele reconhece o alvo, explora falhas reais e comprova o impacto, como um pentester faria. Orquestrada, a mesma IA rende muito mais.

Medido com os limites ligados

A Yaga executou o benchmark com os mesmos guardrails que valem em ambiente de cliente. Os números acima vêm da operação real, não de um modo mais solto criado para o teste.

Cenários alinhados a OWASP PTES MITRE CWE NIST

Veja a Yaga operando no seu alvo

Coloque o mesmo harness para trabalhar no seu escopo, com supervisão humana da HackerSec.