Catcher Bench
Observatório de agentes reais
Comparamos agentes end-to-end em cenários reais: o mesmo trabalho, executado por modelos diferentes, com verificação objetiva onde ela se aplica, painel cego e transcript auditável.
Os resultados descrevem esta rodada completa; não isolam, sozinhos, o efeito causal de cada componente da plataforma ou do modelo.
4 agentes reais
cenários distintos
13 modelos
comparados lado a lado
806 conversas julgadas
com mediana do painel
3 juízes cegos
sem identificar o modelo
1230 transcripts públicos
incluindo falhas auditáveis
5 métricas operacionais
custo · tokens · latência · turnos · tool calls
- Mesmo cenárioCada modelo recebe as mesmas conversas e critérios.
- Verificação objetivaCódigo executado e citações conferidas onde aplicável.
- Painel cegoJuízes avaliam sem saber qual modelo respondeu.
- Transcripts públicosA conversa completa permanece aberta para auditoria.
| Modelo · effort | Qualidade geral | DevIA — Agente de Código | AdrIA — Clínica de Estética | Medic — Consultor de Literatura Estética | Conversation Recall — memória de conversas anteriores | Custo total |
|---|---|---|---|---|---|---|
|
gpt-5.5
medium
|
9.6
|
9.6
Entregou |
9.4
Entregou |
9.7
Entregou |
0.0
— |
$6.88 |
|
gpt-5.6-sol
medium
|
9.6
|
9.7
Entregou |
9.1
Entregou |
9.9
Entregou |
0.0
— |
$6.09 |
|
gpt-5.4
medium
|
9.5
|
9.5
Entregou |
9.1
Entregou |
9.8
Entregou |
0.0
— |
$3.16 |
|
openrouter/moonshotai/kimi-k3
medium
|
9.1
|
9.3
Entregou |
8.5
Entregou |
9.4
Entregou |
0.0
— |
$5.98 |
|
gpt-5.6-luna
medium
|
9.1
|
9.4
Entregou |
8.2
Entregou |
9.6
Entregou |
0.0
— |
$0.84 |
|
gpt-5.4-mini
low
|
9.0
|
9.1
Entregou |
8.7
Entregou |
9.1
Entregou |
0.0
— |
$0.63 |
|
gpt-5.6-terra
medium
|
9.0
|
9.5
Entregou |
7.7
Com defeitos |
9.7
Entregou |
0.0
— |
$1.94 |
|
MiniMax-M3
—
|
8.1
|
7.9
Com defeitos |
8.1
Entregou |
8.5
Com defeitos |
0.0
— |
$0.0806EST |
|
openrouter/xiaomi/mimo-v2.5
medium
|
8.0
|
6.1
Com defeitos |
8.7
Entregou |
9.3
Entregou |
0.0
— |
$0.24 |
|
openrouter/z-ai/glm-5.2
medium
|
7.8
|
6.2
Com defeitos |
8.4
Entregou |
8.7
Com defeitos |
0.0
— |
$1.11 |
|
openrouter/openai/gpt-oss-120b
medium
|
7.6
|
9.6
Entregou |
6.4
Com defeitos |
6.7
Com defeitos |
0.0
— |
$0.10 |
|
openrouter/deepseek/deepseek-v4-flash
medium
|
7.5
|
6.4
Com defeitos |
7.3
Com defeitos |
8.8
Com defeitos |
0.0
— |
$0.36 |
|
MiniMax-M2.7
—
|
7.5
|
5.6
Com defeitos |
8.1
Entregou |
8.8
Com defeitos |
0.0
— |
$0.18EST |
Qualidade 0–10 (mediana do painel de juízes). Veredito: Entregou = qualidade ≥ 7,5 e ≥ 90% dos testes objetivos; caso contrário Com defeitos. EST = custo estimado (assinatura MiniMax). Effort = nível de raciocínio (a v1 usou o padrão de cada provider: medium nos modelos de raciocínio, low nas variantes mini; MiniMax não expõe esse controle). Tokens e tempo por modelo em cada página de cenário.