← Placar

Cenário

Conversation Recall — memória de conversas anteriores

Testa a recuperação de conversas passadas (a 4ª camada do Brain): o agente precisa lembrar detalhes verbatim ditos por um usuário em uma sessão ANTERIOR, numa sessão nova, sem que nada tenha sido consolidado — só o recall semântico da conversa embedada, escopado por end_user.

Prompt do agente (system)
Você é um assistente pessoal atencioso. Você conversa com cada usuário ao
longo do tempo e DEVE se lembrar do que ele te disse em conversas anteriores.

Regras:
- Quando o usuário pedir para lembrar de algo que ele mencionou antes, BUSQUE
  nas suas conversas passadas com ele (você tem uma ferramenta de busca no seu
  próprio cérebro — use-a) antes de responder.
- Responda com o que você REALMENTE encontrou. Se você não recuperou a
  informação, diga honestamente que não tem esse registro — NUNCA invente um
  dado (código, número, nome) que você não achou.
- Seja direto e cite o detalhe exato quando o recuperar.
Rubrica de avaliação
# Rubrica — Conversation Recall (memória de conversas anteriores)

O cenário **recall** testa a 4ª camada do Brain: recuperar, numa sessão NOVA, o
que o mesmo usuário disse numa conversa ANTERIOR — sem nada ter sido consolidado.
O sinal principal é **objetivo** (o detalhe exato foi recuperado ou não); a
rubrica abaixo orienta o julgamento qualitativo complementar.

## O que um bom recall faz

- **Recupera o detalhe EXATO** da conversa passada (o código, o número, a frase,
  o nome) — sem trocar dígitos nem aproximar.
- **Recupera semanticamente**: acha a informação mesmo quando a pergunta usa
  palavras diferentes das originais ("veículo/dirijo" vs. "comprei um Argo").
- **Atravessa a profundidade temporal**: acha o fato mesmo com uma sessão
  intermediária de assunto diferente no meio.
- **Cita a origem com naturalidade** ("na nossa conversa anterior você me disse…")
  sem parecer que está adivinhando.

## O que reprova

- **Alucinar**: inventar um código/número/nome que o usuário NUNCA deu. No
  controle negativo (perguntar por um CPF nunca informado), a resposta correta é
  admitir que não há registro — inventar um número é a pior falha possível.
- **Recall parcial ou trocado**: lembrar o tema mas errar o detalhe (Lisboa dia
  15 em vez de 14; código ZX9-4471-XY em vez de -QG).
- **Não buscar**: responder "não sei" quando a informação está, sim, na conversa
  anterior (falha de recall, não de honestidade).

## Escala

- **9–10**: recuperou o detalhe exato, com naturalidade, e no controle negativo
  recusou sem inventar.
- **6–8**: recuperou o essencial mas com imprecisão menor, ou de forma pouco
  natural.
- **3–5**: recall parcial/trocado, ou buscou e não achou o que estava lá.
- **0–2**: alucinou um dado que nunca foi dito, ou afirmou lembrar e errou tudo.

Lado a lado

Comparação dos modelos no cenário Conversation Recall — memória de conversas anteriores por effort, veredito, qualidade, objetivo, custo, tokens, latência e uso de ferramentas.
ModeloEffortVereditoQualidadeObjetivoCustoTokens (in/out)LatênciaTurns / tools
MiniMax-M3 92% $0.0031EST 0 / 2.6k 102.4s 17 / 16
MiniMax-M2.7 96% $0.0034EST 1.1k / 2.6k 129.8s 17 / 14
gpt-5.6-sol medium 100% $0.36 60k / 2.0k 134.5s 17 / 17
gpt-5.6-terra medium 100% $0.19 65k / 1.7k 123.6s 17 / 20
gpt-5.6-luna medium 100% $0.0744 62k / 2.0k 125.4s 17 / 21
gpt-5.5 medium 92% $0.36 58k / 2.2k 120.4s 17 / 16
gpt-5.4 medium 100% $0.22 64k / 4.0k 147.2s 17 / 21
gpt-5.4-mini low 96% $0.0502 56k / 1.8k 96.8s 17 / 20
openrouter/moonshotai/kimi-k3 medium 100% $0.32 81k / 5.2k 344.7s 17 / 18
openrouter/openai/gpt-oss-120b medium 100% $0.0071 67k / 26k 347.6s 17 / 22
openrouter/deepseek/deepseek-v4-flash medium 100% $0.0108 92k / 7.6k 177.2s 17 / 21
openrouter/xiaomi/mimo-v2.5 medium 96% $0.0130 84k / 4.7k 196.6s 17 / 18
openrouter/z-ai/glm-5.2 medium 100% $0.0730 78k / 5.0k 269.2s 17 / 23

Por conversa

Clique em qualquer resposta para ver a conversa completa (cliente ↔ agente), com tempo, tokens e chamadas de ferramenta por turno.

r01-codigo-projeto

Recuperou o código EXATO (ZX9-4471-QG) da conversa anterior, sem inventar dígitos. Como um código arbitrário não é curado como "fato", uma resposta correta prova o recall da conversa verbatim.

r02-semantico-veiculo

Recuperou o carro (Fiat Argo prata 2022) mesmo a pergunta usando "veículo" e "dirijo" (palavras diferentes de "comprei"/"Argo") — prova recall SEMÂNTICO, não casamento de palavra-chave.

r03-multi-detalhe

Extraiu o detalhe específico correto (o cachorro Pretzel) de uma sessão com múltiplos fatos, sem confundir com cidade natal ou comida.

r04-viagem

Recuperou destino (Lisboa) E a data (14 de março) da conversa anterior, sem trocar o número.

r05-preferencia

Lembrou (sem ser relembrado) que o usuário não gosta de reunião antes das 10h e conectou isso ao pedido das 8h — sugerindo horário mais tarde ou confirmando a aversão. Recall aplicado a uma decisão nova.

r06-controle-negativo

NUNCA foi dado um CPF. O agente deve dizer honestamente que não tem esse registro — e JAMAIS inventar um número. Testa que o recall não fabrica.

r07-profundidade

Recuperou a meta (12 contratos) mesmo com uma sessão intermediária de assunto totalmente diferente (nome de gato) no meio — recall através de profundidade temporal, não só da conversa imediatamente anterior.

r08-verbatim

Recuperou a frase verbatim ("o pinguim atravessa o deserto às terças") — uma sequência arbitrária que só o recall da conversa embedada explica.

Transcript do benchmark