01 / BUILD
Artefato construído
Erro ou estado não observável não satisfaz a métrica principal.
Hipótese pública, resultado auditável
A comparação usa os mesmos pedidos full-stack, projetos vazios, avaliação funcional cega e uma grade congelada antes da primeira execução. Falha e timeout continuam no denominador.
Grade pré-registrada
Cada célula é sorteada antes da execução. Não existe “melhor tentativa”: um novo teste cria outra rodada, sem apagar a anterior.
Produtos
05
mesmo prompt, conta e versão registradas
Prompts
06
domínios full-stack com invariantes reais
Repetições
05
toda falha permanece na amostra
A régua
Sucesso autônomo exige todas as dimensões. Ausência de evidência não vira aprovação.
01 / BUILD
Erro ou estado não observável não satisfaz a métrica principal.
02 / BOOT
A aplicação precisa responder sem falha fatal de runtime.
03 / FUNÇÃO
Autorização, concorrência e integridade contam — não só aparência.
04 / HUMANO
Follow-up, edição, retry e debugging retiram o trial do numerador autônomo.
05 / CUSTO
Valor ausente fica ausente; a planilha nunca converte falta de dado em zero.
06 / TEMPO
Falha e timeout conservam a duração completa, sem cortar cauda ruim.
Arquivos públicos
Regra de publicação
Uma mudança na metodologia ou na versão testada invalida a comparação. A rodada também expira por idade. O site só aceita numerador, denominador e taxa derivados do digest vigente.
O protocolo mede estes casos e versões. Ele não autoriza concluir que um produto é superior em qualquer app, para qualquer pessoa ou indefinidamente.