Cenário
Conversation Recall — memória de conversas anteriores
Testa a recuperação de conversas passadas (a 4ª camada do Brain): o agente precisa lembrar detalhes verbatim ditos por um usuário em uma sessão ANTERIOR, numa sessão nova, sem que nada tenha sido consolidado — só o recall semântico da conversa embedada, escopado por end_user.
Prompt do agente (system)
Você é um assistente pessoal atencioso. Você conversa com cada usuário ao longo do tempo e DEVE se lembrar do que ele te disse em conversas anteriores. Regras: - Quando o usuário pedir para lembrar de algo que ele mencionou antes, BUSQUE nas suas conversas passadas com ele (você tem uma ferramenta de busca no seu próprio cérebro — use-a) antes de responder. - Responda com o que você REALMENTE encontrou. Se você não recuperou a informação, diga honestamente que não tem esse registro — NUNCA invente um dado (código, número, nome) que você não achou. - Seja direto e cite o detalhe exato quando o recuperar.
Rubrica de avaliação
# Rubrica — Conversation Recall (memória de conversas anteriores)
O cenário **recall** testa a 4ª camada do Brain: recuperar, numa sessão NOVA, o
que o mesmo usuário disse numa conversa ANTERIOR — sem nada ter sido consolidado.
O sinal principal é **objetivo** (o detalhe exato foi recuperado ou não); a
rubrica abaixo orienta o julgamento qualitativo complementar.
## O que um bom recall faz
- **Recupera o detalhe EXATO** da conversa passada (o código, o número, a frase,
o nome) — sem trocar dígitos nem aproximar.
- **Recupera semanticamente**: acha a informação mesmo quando a pergunta usa
palavras diferentes das originais ("veículo/dirijo" vs. "comprei um Argo").
- **Atravessa a profundidade temporal**: acha o fato mesmo com uma sessão
intermediária de assunto diferente no meio.
- **Cita a origem com naturalidade** ("na nossa conversa anterior você me disse…")
sem parecer que está adivinhando.
## O que reprova
- **Alucinar**: inventar um código/número/nome que o usuário NUNCA deu. No
controle negativo (perguntar por um CPF nunca informado), a resposta correta é
admitir que não há registro — inventar um número é a pior falha possível.
- **Recall parcial ou trocado**: lembrar o tema mas errar o detalhe (Lisboa dia
15 em vez de 14; código ZX9-4471-XY em vez de -QG).
- **Não buscar**: responder "não sei" quando a informação está, sim, na conversa
anterior (falha de recall, não de honestidade).
## Escala
- **9–10**: recuperou o detalhe exato, com naturalidade, e no controle negativo
recusou sem inventar.
- **6–8**: recuperou o essencial mas com imprecisão menor, ou de forma pouco
natural.
- **3–5**: recall parcial/trocado, ou buscou e não achou o que estava lá.
- **0–2**: alucinou um dado que nunca foi dito, ou afirmou lembrar e errou tudo.
Lado a lado
| Modelo | Effort | Veredito | Qualidade | Objetivo | Custo | Tokens (in/out) | Latência | Turns / tools |
|---|---|---|---|---|---|---|---|---|
| MiniMax-M3 | — | — | — | 92% | $0.0031EST | 0 / 2.6k | 102.4s | 17 / 16 |
| MiniMax-M2.7 | — | — | — | 96% | $0.0034EST | 1.1k / 2.6k | 129.8s | 17 / 14 |
| gpt-5.6-sol | medium | — | — | 100% | $0.36 | 60k / 2.0k | 134.5s | 17 / 17 |
| gpt-5.6-terra | medium | — | — | 100% | $0.19 | 65k / 1.7k | 123.6s | 17 / 20 |
| gpt-5.6-luna | medium | — | — | 100% | $0.0744 | 62k / 2.0k | 125.4s | 17 / 21 |
| gpt-5.5 | medium | — | — | 92% | $0.36 | 58k / 2.2k | 120.4s | 17 / 16 |
| gpt-5.4 | medium | — | — | 100% | $0.22 | 64k / 4.0k | 147.2s | 17 / 21 |
| gpt-5.4-mini | low | — | — | 96% | $0.0502 | 56k / 1.8k | 96.8s | 17 / 20 |
| openrouter/moonshotai/kimi-k3 | medium | — | — | 100% | $0.32 | 81k / 5.2k | 344.7s | 17 / 18 |
| openrouter/openai/gpt-oss-120b | medium | — | — | 100% | $0.0071 | 67k / 26k | 347.6s | 17 / 22 |
| openrouter/deepseek/deepseek-v4-flash | medium | — | — | 100% | $0.0108 | 92k / 7.6k | 177.2s | 17 / 21 |
| openrouter/xiaomi/mimo-v2.5 | medium | — | — | 96% | $0.0130 | 84k / 4.7k | 196.6s | 17 / 18 |
| openrouter/z-ai/glm-5.2 | medium | — | — | 100% | $0.0730 | 78k / 5.0k | 269.2s | 17 / 23 |
Por conversa
Clique em qualquer resposta para ver a conversa completa (cliente ↔ agente), com tempo, tokens e chamadas de ferramenta por turno.
r01-codigo-projeto
Recuperou o código EXATO (ZX9-4471-QG) da conversa anterior, sem inventar dígitos. Como um código arbitrário não é curado como "fato", uma resposta correta prova o recall da conversa verbatim.
r02-semantico-veiculo
Recuperou o carro (Fiat Argo prata 2022) mesmo a pergunta usando "veículo" e "dirijo" (palavras diferentes de "comprei"/"Argo") — prova recall SEMÂNTICO, não casamento de palavra-chave.
r03-multi-detalhe
Extraiu o detalhe específico correto (o cachorro Pretzel) de uma sessão com múltiplos fatos, sem confundir com cidade natal ou comida.
r04-viagem
Recuperou destino (Lisboa) E a data (14 de março) da conversa anterior, sem trocar o número.
r05-preferencia
Lembrou (sem ser relembrado) que o usuário não gosta de reunião antes das 10h e conectou isso ao pedido das 8h — sugerindo horário mais tarde ou confirmando a aversão. Recall aplicado a uma decisão nova.
r06-controle-negativo
NUNCA foi dado um CPF. O agente deve dizer honestamente que não tem esse registro — e JAMAIS inventar um número. Testa que o recall não fabrica.
r07-profundidade
Recuperou a meta (12 contratos) mesmo com uma sessão intermediária de assunto totalmente diferente (nome de gato) no meio — recall através de profundidade temporal, não só da conversa imediatamente anterior.
r08-verbatim
Recuperou a frase verbatim ("o pinguim atravessa o deserto às terças") — uma sequência arbitrária que só o recall da conversa embedada explica.