Cenário
DevIA — Agente de Código
Agente que escreve pequenos programas Node.js (ESM, sem dependências) a partir de uma spec, corrige bugs plantados, estende código existente, refatora preservando comportamento e faz parsing de dado sujo. Verificação objetiva: o código gerado roda contra a suite de aceitação do gabarito.
Prompt do agente (system)
Você é o DevIA, um engenheiro de software sênior especialista em JavaScript/Node.js. Você escreve código correto, idiomático e conciso. Regras de saída: - Responda com o módulo COMPLETO em UM único bloco ```javascript```. - Use ESM (export named), apenas a biblioteca padrão do Node (sem npm). - Respeite EXATAMENTE a API e as mensagens de erro pedidas na tarefa. - Nada de explicações longas — o código é a entrega.
Rubrica de avaliação
# Rubrica — DevIA (agente de código) A CORRETUDE é medida objetivamente pela suite executável (fornecida como referência). Você avalia a QUALIDADE do código, 0–10: - **Correção observada (peso alto):** se a verificação objetiva reprovou, o teto é 5 — código que não passa nos testes não é entrega, por mais bonito que seja. - **Clareza e estrutura:** nomes, decomposição, ausência de duplicação desnecessária, legibilidade. - **Robustez:** tratamento de bordas e erros conforme a tarefa pede (mensagens de erro exatas, validações). - **Idiomaticidade:** JavaScript/Node moderno e idiomático, sem gambiarra. - **Aderência à tarefa:** respeitou a API pedida, ESM, sem dependências externas. 10 = passa nos testes E é código que você aprovaria em review sem comentários. 7–8 = passa e é bom, com pequenos reparos. 5 = passa mas feio, ou falha objetiva com boa intenção. ≤ 3 = não passa e é confuso/incorreto.
Lado a lado
| Modelo | Effort | Veredito | Qualidade | Objetivo | Custo | Tokens (in/out) | Latência | Turns / tools |
|---|---|---|---|---|---|---|---|---|
| MiniMax-M3 | — | Com defeitos |
7.9
|
81% | $0.0083EST | 3.0k / 6.2k | 64.0s | 8 / 0 |
| MiniMax-M2.7 | — | Com defeitos |
5.6
|
50% | $0.0152EST | 3.8k / 12k | 148.0s | 8 / 1 |
| gpt-5.6-sol | medium | Entregou |
9.7
|
100% | $0.39 | 34k / 7.5k | 177.1s | 8 / 8 |
| gpt-5.6-terra | medium | Entregou |
9.5
|
100% | $0.19 | 34k / 7.1k | 109.4s | 8 / 8 |
| gpt-5.6-luna | medium | Entregou |
9.4
|
100% | $0.0858 | 34k / 8.6k | 111.2s | 8 / 8 |
| gpt-5.5 | medium | Entregou |
9.6
|
100% | $0.40 | 21k / 9.7k | 145.6s | 8 / 2 |
| gpt-5.4 | medium | Entregou |
9.5
|
100% | $0.27 | 34k / 12k | 152.4s | 8 / 8 |
| gpt-5.4-mini | low | Entregou |
9.1
|
100% | $0.0412 | 17k / 6.3k | 47.4s | 8 / 0 |
| openrouter/moonshotai/kimi-k3 | medium | Entregou |
9.3
|
96% | $0.25 | 27k / 12k | 334.5s | 8 / 1 |
| openrouter/openai/gpt-oss-120b | medium | Entregou |
9.6
|
100% | $0.0096 | 18k / 52k | 553.0s | 8 / 0 |
| openrouter/deepseek/deepseek-v4-flash | medium | Com defeitos |
6.4
|
63% | $0.0216 | 45k / 85k | 468.0s | 7 / 9 |
| openrouter/xiaomi/mimo-v2.5 | medium | Com defeitos |
6.1
|
63% | $0.0040 | 19k / 4.4k | 43.5s | 6 / 1 |
| openrouter/z-ai/glm-5.2 | medium | Com defeitos |
6.2
|
63% | $0.0450 | 22k / 11k | 166.0s | 5 / 5 |
Por conversa
Clique em qualquer resposta para ver a conversa completa (cliente ↔ agente), com tempo, tokens e chamadas de ferramenta por turno.
gen-orcamento
Código correto, legível, validações claras; passa na suite de orçamento.
gen-agenda
Lógica de slots livres correta e clara; passa na suite de agenda.
fix-parcelas
Corrigiu o bug de centavos mantendo a API; passa na suite.
fix-dedup
Normalizou CPF e manteve o registro mais recente; passa na suite.
ext-relatorio
Adicionou os agrupamentos sem quebrar o existente; passa na suite.
ext-validador
Validação de telefone BR e data de nascimento no formato certo; passa na suite.
rev-refactor
Refatorou removendo duplicação/números mágicos SEM alterar comportamento; passa na suite.
data-parser
Parser robusto de CSV sujo com erros por linha; passa na suite.