Conhecimento com proveniência

Respostas com fonte. Limite quando a fonte não existe.

O Brain combina busca semântica e léxica, funde os candidatos, reordena por relevância e entrega evidência citável ao agente — sob um escopo decidido pelo servidor.

25/25 é evidência operacional forte nos oito modelos testados. Não é prova causal isolada: não houve controle Medic sem Brain.

brain / retrievalgrounded
01PerguntaIntenção + escopo do usuário atualquery
02Denso + léxicoSemântica e termo exato em paralelosearch
03RRF + rerankFusão e reordenação dos candidatosrank
04Contexto com fonteTrechos selecionados e provenancecite
05Responder ou admitir limiteA evidência decide o que pode ser ditoanswer
A pergunta passa por busca densa e léxica, fusão RRF, rerank e seleção de contexto com fonte antes da resposta.
71% → 100%hit@5 no benchmark determinístico
25/25factuais com citação no Medic
8 modelosmesmo corpus de 50 papers reais
qa_firstQ&A destilado + corpus no Brain

Onde RAG quebra

Encontrar algo parecido não basta. A resposta certa pode estar abaixo do corte.

Busca semântica entende significado; busca léxica captura o termo exato. Sem fusão e rerank, uma das duas pode perder justamente o trecho que sustenta a resposta.

Semântica sem termo exato

A busca entende o tema, mas pode rebaixar códigos, nomes próprios e identificadores críticos.

Top-k cedo demais

Se o corte acontece antes de fundir e reordenar candidatos, a evidência certa nunca chega ao modelo.

Resposta sem provenance

Mesmo um texto correto é difícil de auditar quando não aponta o documento e o trecho que o sustentam.

Mecanismo

O Brain deixa o modelo navegar. O servidor mantém o escopo.

Em vez de pré-injetar sempre um bloco grande, o agente chama brain_search e brain_ask quando precisa. Company, agent e end user já estão embutidos na ferramenta.

Mais candidatos antes do corte. Menos palpite depois.

No experimento do hit@5, a configuração híbrida sem rerank acertou 5 de 7 consultas. Com over-fetch e rerank sobre 20 candidatos, fechou 7 de 7.

Abrir o experimento →
query
├─ dense_search  ─┐
├─ lexical_search ├─ RRF
└─ qa_first       ┘
       ↓
  20 candidates
       ↓ rerank
    top 5 + source
       ↓
 answer | abstain

Prova pública

50 papers reais. 25 perguntas factuais. Oito modelos.

Todos os modelos do cenário Medic responderam as 25 perguntas factuais com citação. O mesmo teste também inclui perguntas fora do domínio e armadilhas de estudos inexistentes.

25/25 com citação

Forte evidência operacional de que o conhecimento compartilhado nivelou o factual naquele recorte. O resultado não constitui prova causal isolada sem um controle equivalente sem Brain.

Auditar no Bench

Perguntas frequentes

Grounded não é onisciente

O agente sempre encontra uma resposta?

Não — e isso faz parte do contrato. Quando a base não sustenta a resposta, o agente deve indicar que a informação não consta, em vez de preencher a lacuna com confiança.

25/25 prova que o Brain causou o resultado?

Não. É evidência operacional forte nos oito modelos testados, mas não constitui prova causal isolada porque não houve controle Medic sem Brain.

Qual a diferença entre Brain e RAG pré-injetado?

No Brain, o modelo navega o conhecimento on-demand por ferramentas server-scoped. O prompt não recebe sempre o mesmo bloco pesado antes de cada turno.

Documentos que viram evidência

Dê ao agente uma base que ele consegue consultar e citar

Suba seus documentos, faça perguntas difíceis e abra as fontes usadas em cada resposta.