Resposta ruim sem causa
Foi prompt, memória, documento, ferramenta ou modelo? Sem reconstrução, a equipe repete tentativa.
Observabilidade do turno
Reconstrua o prompt montado, as chamadas de ferramenta, a resposta, os tokens, o custo e a latência pelo mesmo run_id. Depois use budgets para impedir surpresa.
Cada execução guarda cost_usd; budgets por conta ou agente interrompem a próxima run com HTTP 402 ao atingir o teto.
Caixa-preta custa duas vezes
Logs separados, tracing incompleto e dashboards de provedor contam pedaços. Operar um agente exige correlacionar o que entrou, o que ele chamou e o que saiu.
Foi prompt, memória, documento, ferramenta ou modelo? Sem reconstrução, a equipe repete tentativa.
Um total mensal não explica qual agente, modelo ou fluxo está consumindo tokens.
Notificar no fim do mês não impede que uma sequência de runs ultrapasse o limite agora.
Mecanismo
O run_id agrupa a execução completa; o trace_id acompanha erros pelas camadas. O Console transforma isso numa linha do tempo inspecionável, sem exigir acesso ao servidor.
Compare modelos no mesmo agente, abra os tool calls e veja tokens, custo e latência. O budget usa o mesmo metering para decidir se a próxima execução pode começar.
Entender o metering →run_9f2c
├─ prompt 18.420 tokens
├─ reasoning 9.186 tokens
├─ brain_search 142 ms
├─ response 4.331 tokens
├─ latency 26,6 s
└─ cost_usd 0.0144
budget reached → next run = HTTP 402Bench como observabilidade pública
O Catcher Bench publica quality, objective rate, tokens, tool calls, latência e custo por célula. A mesma lógica de evidência existe no Console para os seus agentes.
O dossiê declara custo, modelos por assinatura marcados como estimativa e transcripts para conferir como cada célula chegou ao resultado.
Comparar custo e qualidadePerguntas frequentes
Cada run registra cost_usd e uso de tokens. O Console agrega por agente, modelo e dia para mostrar tendência sem perder o detalhe.
Não. Quando o teto configurado é atingido, a próxima execução é bloqueada com HTTP 402.
O inspetor de turno reconstrói prompt, ferramentas, resposta, tokens, custo e latência por run_id no Console. Logs continuam úteis para engenharia, mas não são a única interface.
Produção observável
Crie um agente, rode um fluxo real e abra exatamente o que ele viu, fez e consumiu.