Catcher Bench

Observatório de agentes reais

Comparamos agentes end-to-end em cenários reais: o mesmo trabalho, executado por modelos diferentes, com verificação objetiva onde ela se aplica, painel cego e transcript auditável.

Os resultados descrevem esta rodada completa; não isolam, sozinhos, o efeito causal de cada componente da plataforma ou do modelo.

Rodada v2-2026-07-24 Metodologia →
Observatório abstrato com três agentes conectados a modelos e trilhas de evidência auditável
A imagem orienta a leitura; os números abaixo são derivados do artefato público da rodada.

4 agentes reais
cenários distintos

13 modelos
comparados lado a lado

806 conversas julgadas
com mediana do painel

3 juízes cegos
sem identificar o modelo

1230 transcripts públicos
incluindo falhas auditáveis

5 métricas operacionais
custo · tokens · latência · turnos · tool calls

  1. Mesmo cenárioCada modelo recebe as mesmas conversas e critérios.
  2. Verificação objetivaCódigo executado e citações conferidas onde aplicável.
  3. Painel cegoJuízes avaliam sem saber qual modelo respondeu.
  4. Transcripts públicosA conversa completa permanece aberta para auditoria.
Ranking dos modelos por qualidade geral, cenário e custo total na rodada v2-2026-07-24
Modelo · effort Qualidade geral DevIA — Agente de CódigoAdrIA — Clínica de EstéticaMedic — Consultor de Literatura EstéticaConversation Recall — memória de conversas anteriores Custo total
gpt-5.5
medium
9.6
9.6
Entregou
9.4
Entregou
9.7
Entregou
0.0
$6.88
gpt-5.6-sol
medium
9.6
9.7
Entregou
9.1
Entregou
9.9
Entregou
0.0
$6.09
gpt-5.4
medium
9.5
9.5
Entregou
9.1
Entregou
9.8
Entregou
0.0
$3.16
openrouter/moonshotai/kimi-k3
medium
9.1
9.3
Entregou
8.5
Entregou
9.4
Entregou
0.0
$5.98
gpt-5.6-luna
medium
9.1
9.4
Entregou
8.2
Entregou
9.6
Entregou
0.0
$0.84
gpt-5.4-mini
low
9.0
9.1
Entregou
8.7
Entregou
9.1
Entregou
0.0
$0.63
gpt-5.6-terra
medium
9.0
9.5
Entregou
7.7
Com defeitos
9.7
Entregou
0.0
$1.94
MiniMax-M3
8.1
7.9
Com defeitos
8.1
Entregou
8.5
Com defeitos
0.0
$0.0806EST
openrouter/xiaomi/mimo-v2.5
medium
8.0
6.1
Com defeitos
8.7
Entregou
9.3
Entregou
0.0
$0.24
openrouter/z-ai/glm-5.2
medium
7.8
6.2
Com defeitos
8.4
Entregou
8.7
Com defeitos
0.0
$1.11
openrouter/openai/gpt-oss-120b
medium
7.6
9.6
Entregou
6.4
Com defeitos
6.7
Com defeitos
0.0
$0.10
openrouter/deepseek/deepseek-v4-flash
medium
7.5
6.4
Com defeitos
7.3
Com defeitos
8.8
Com defeitos
0.0
$0.36
MiniMax-M2.7
7.5
5.6
Com defeitos
8.1
Entregou
8.8
Com defeitos
0.0
$0.18EST

Qualidade 0–10 (mediana do painel de juízes). Veredito: Entregou = qualidade ≥ 7,5 e ≥ 90% dos testes objetivos; caso contrário Com defeitos. EST = custo estimado (assinatura MiniMax). Effort = nível de raciocínio (a v1 usou o padrão de cada provider: medium nos modelos de raciocínio, low nas variantes mini; MiniMax não expõe esse controle). Tokens e tempo por modelo em cada página de cenário.