Observabilidade do turno

Veja o que o agente viu, fez e custou.

Reconstrua o prompt montado, as chamadas de ferramenta, a resposta, os tokens, o custo e a latência pelo mesmo run_id. Depois use budgets para impedir surpresa.

Cada execução guarda cost_usd; budgets por conta ou agente interrompem a próxima run com HTTP 402 ao atingir o teto.

run / evidencetraceable
01Prompt montadoInstruções, skills, Brain e memóriainput
02Tool callsArgumentos, duração e resultadoaction
03RespostaTexto e eventos do turnooutput
04Uso e latênciaTokens in/out e tempo totalusage
05Custo + budgetcost_usd e trava no teto402
Cada run liga prompt, ferramentas, resposta, uso, latência, custo e controle de budget.
run_idunidade de reconstrução do turno
cost_usdcusto real ou estimado por run
7 / 30 / 90djanelas de uso e tendência
HTTP 402trava dura quando bate o budget

Caixa-preta custa duas vezes

Você paga pelo turno e depois paga para descobrir por que ele falhou.

Logs separados, tracing incompleto e dashboards de provedor contam pedaços. Operar um agente exige correlacionar o que entrou, o que ele chamou e o que saiu.

Resposta ruim sem causa

Foi prompt, memória, documento, ferramenta ou modelo? Sem reconstrução, a equipe repete tentativa.

Custo sem contexto

Um total mensal não explica qual agente, modelo ou fluxo está consumindo tokens.

Alerta depois do prejuízo

Notificar no fim do mês não impede que uma sequência de runs ultrapasse o limite agora.

Mecanismo

Um identificador conecta decisão, ação e custo.

O run_id agrupa a execução completa; o trace_id acompanha erros pelas camadas. O Console transforma isso numa linha do tempo inspecionável, sem exigir acesso ao servidor.

Do prompt ao centavo

Compare modelos no mesmo agente, abra os tool calls e veja tokens, custo e latência. O budget usa o mesmo metering para decidir se a próxima execução pode começar.

Entender o metering →
run_9f2c
├─ prompt        18.420 tokens
├─ reasoning      9.186 tokens
├─ brain_search     142 ms
├─ response       4.331 tokens
├─ latency         26,6 s
└─ cost_usd       0.0144

budget reached → next run = HTTP 402

Bench como observabilidade pública

Qualidade sem custo não decide produção.

O Catcher Bench publica quality, objective rate, tokens, tool calls, latência e custo por célula. A mesma lógica de evidência existe no Console para os seus agentes.

US$ 19,68 na rodada v1

O dossiê declara custo, modelos por assinatura marcados como estimativa e transcripts para conferir como cada célula chegou ao resultado.

Comparar custo e qualidade

Perguntas frequentes

Medir antes de escalar

O custo é agregado ou por execução?

Cada run registra cost_usd e uso de tokens. O Console agrega por agente, modelo e dia para mostrar tendência sem perder o detalhe.

O budget apenas avisa?

Não. Quando o teto configurado é atingido, a próxima execução é bloqueada com HTTP 402.

Preciso abrir logs de servidor para depurar?

O inspetor de turno reconstrói prompt, ferramentas, resposta, tokens, custo e latência por run_id no Console. Logs continuam úteis para engenharia, mas não são a única interface.

Produção observável

Coloque o custo e a causa no mesmo turno

Crie um agente, rode um fluxo real e abra exatamente o que ele viu, fez e consumiu.