← Placar

Cenário

DevIA — Agente de Código

Agente que escreve pequenos programas Node.js (ESM, sem dependências) a partir de uma spec, corrige bugs plantados, estende código existente, refatora preservando comportamento e faz parsing de dado sujo. Verificação objetiva: o código gerado roda contra a suite de aceitação do gabarito.

Prompt do agente (system)
Você é o DevIA, um engenheiro de software sênior especialista em
JavaScript/Node.js. Você escreve código correto, idiomático e conciso.

Regras de saída:
- Responda com o módulo COMPLETO em UM único bloco ```javascript```.
- Use ESM (export named), apenas a biblioteca padrão do Node (sem npm).
- Respeite EXATAMENTE a API e as mensagens de erro pedidas na tarefa.
- Nada de explicações longas — o código é a entrega.
Rubrica de avaliação
# Rubrica — DevIA (agente de código)

A CORRETUDE é medida objetivamente pela suite executável (fornecida como
referência). Você avalia a QUALIDADE do código, 0–10:

- **Correção observada (peso alto):** se a verificação objetiva reprovou, o teto
  é 5 — código que não passa nos testes não é entrega, por mais bonito que seja.
- **Clareza e estrutura:** nomes, decomposição, ausência de duplicação
  desnecessária, legibilidade.
- **Robustez:** tratamento de bordas e erros conforme a tarefa pede (mensagens
  de erro exatas, validações).
- **Idiomaticidade:** JavaScript/Node moderno e idiomático, sem gambiarra.
- **Aderência à tarefa:** respeitou a API pedida, ESM, sem dependências externas.

10 = passa nos testes E é código que você aprovaria em review sem comentários.
7–8 = passa e é bom, com pequenos reparos. 5 = passa mas feio, ou falha objetiva
com boa intenção. ≤ 3 = não passa e é confuso/incorreto.

Lado a lado

Comparação dos modelos no cenário DevIA — Agente de Código por effort, veredito, qualidade, objetivo, custo, tokens, latência e uso de ferramentas.
ModeloEffortVereditoQualidadeObjetivoCustoTokens (in/out)LatênciaTurns / tools
MiniMax-M3 Com defeitos
7.9
81% $0.0083EST 3.0k / 6.2k 64.0s 8 / 0
MiniMax-M2.7 Com defeitos
5.6
50% $0.0152EST 3.8k / 12k 148.0s 8 / 1
gpt-5.6-sol medium Entregou
9.7
100% $0.39 34k / 7.5k 177.1s 8 / 8
gpt-5.6-terra medium Entregou
9.5
100% $0.19 34k / 7.1k 109.4s 8 / 8
gpt-5.6-luna medium Entregou
9.4
100% $0.0858 34k / 8.6k 111.2s 8 / 8
gpt-5.5 medium Entregou
9.6
100% $0.40 21k / 9.7k 145.6s 8 / 2
gpt-5.4 medium Entregou
9.5
100% $0.27 34k / 12k 152.4s 8 / 8
gpt-5.4-mini low Entregou
9.1
100% $0.0412 17k / 6.3k 47.4s 8 / 0
openrouter/moonshotai/kimi-k3 medium Entregou
9.3
96% $0.25 27k / 12k 334.5s 8 / 1
openrouter/openai/gpt-oss-120b medium Entregou
9.6
100% $0.0096 18k / 52k 553.0s 8 / 0
openrouter/deepseek/deepseek-v4-flash medium Com defeitos
6.4
63% $0.0216 45k / 85k 468.0s 7 / 9
openrouter/xiaomi/mimo-v2.5 medium Com defeitos
6.1
63% $0.0040 19k / 4.4k 43.5s 6 / 1
openrouter/z-ai/glm-5.2 medium Com defeitos
6.2
63% $0.0450 22k / 11k 166.0s 5 / 5

Por conversa

Clique em qualquer resposta para ver a conversa completa (cliente ↔ agente), com tempo, tokens e chamadas de ferramenta por turno.

gen-orcamento

Código correto, legível, validações claras; passa na suite de orçamento.

gen-agenda

Lógica de slots livres correta e clara; passa na suite de agenda.

fix-parcelas

Corrigiu o bug de centavos mantendo a API; passa na suite.

fix-dedup

Normalizou CPF e manteve o registro mais recente; passa na suite.

ext-relatorio

Adicionou os agrupamentos sem quebrar o existente; passa na suite.

ext-validador

Validação de telefone BR e data de nascimento no formato certo; passa na suite.

rev-refactor

Refatorou removendo duplicação/números mágicos SEM alterar comportamento; passa na suite.

data-parser

Parser robusto de CSV sujo com erros por linha; passa na suite.

Transcript do benchmark