Agentes RAG para atendimento

Um agente de IA que fala como gente e não inventa.

Construímos e melhoramos agentes de IA para atendimento e conhecimento interno. Cada resposta sai do seu próprio conteúdo, cita a fonte e responde no registro do seu cliente.

O motor por baixo é state of the art: vetorial, léxica e grafo de conhecimento, três vias de recuperação que convergem num único ranking, com modelos de embedding e rerank de primeira linha.

Como a resposta é montada

  1. 01 Permissões
  2. 02 Busca no conteúdo
  3. 03 Ranking único
  4. 04 Documentos ligados
  5. 05 Melhores trechos
  6. 06 Resposta citada
  • Digitro
  • Essilor
  • ConnectMix
  • Unifique
  • BrasilCard
  • Societario Digital

Como contratar

Construímos o seu agente, ou consertamos o que você já roda.

Nos dois formatos o motor é o mesmo, e é o estado da arte em recuperação: vetorial e léxica fundidas por RRF com peso, mais grafo de conhecimento e rerank de primeira linha. O que muda é o ponto de partida, um começa nos seus documentos e o outro no agente que já responde errado.

  • Construção

    Seu agente, construído de ponta a ponta

    Para o time que já decidiu colocar um agente na frente do cliente e quer engenharia, não uma montagem tirada de tutorial.

    Parte de
    Seus documentos e as perguntas que eles precisam responder
    Roda em
    Sua nuvem ou seu próprio hardware
    Você recebe
    Código, testes e runbooks no seu repositório
    Escopo
    Fechado, por escrito, antes de qualquer código

    O que é construído

    • O agente em si: nos seus canais, respondendo a partir dos seus documentos, com a fonte anexada a cada afirmação.
    • A busca por trás dele: palavra exata e sentido buscados juntos, para um código de erro achar a página certa e uma pergunta vaga também.
    • Os testes que o mantêm honesto: as suas perguntas reais, uma baseline junto ao código e um gate que barra a release quando a qualidade cai.
  • Consultoria

    O agente que você já roda, corrigido

    Para o piloto que responde mas responde errado, ou a conta que cresceu mais rápido que o resultado. As mudanças chegam em pull requests que o seu time revisa.

    Parte de
    Seu agente e as perguntas que ele erra
    Medição
    Busca e resposta avaliadas em separado
    Você recebe
    Pull requests, mais os testes que comprovam o ganho
    Escopo
    Fechado, por escrito, antes de qualquer código

    O que costuma mudar

    • A busca primeiro. A maioria das respostas erradas é o trecho errado recuperado, não um modelo que inventou.
    • A voz. Registro, jargão e tamanho de resposta ajustados aos seus clientes, em vez do tom padrão de assistente.
    • A conta. Cache que realmente acerta, um modelo menor na resposta que chega ao cliente, e as etapas rotineiras movidas para código comum.

O que construímos

O que o agente faz, e o que o sustenta.

Quatro ofertas, cada uma rodando em produção hoje. Capacidade sem mecanismo por trás não entra nesta lista.

Um agente de atendimento no seu canal de mensagens e um chat interno sobre o mesmo conteúdo. A resposta que o cliente lê roda de propósito em um modelo pequeno e rápido, e as etapas rotineiras rodam como código comum, que não custa nada por mensagem.

  • Uma chamada de modelo por turno, medida em vez de presumida
  • Toda afirmação carrega a sua fonte, ou não chega ao cliente
  • Áudio transcrito, e silêncio nunca enviado a um modelo pago
  • Uma pessoa confirma qualquer coisa que o agente propõe abrir ou mudar

Comunicação humanizada

Não soar como um robô é engenharia, não sorte.

40% dos consumidores brasileiros dizem que preferem totalmente a interação humana (CX Trends 2026). A maioria dos agentes usa uma voz de marca só com todo mundo; o nosso lê o registro de cada mensagem e responde no mesmo tom.

  1. Comportamento espelho

    O agente acompanha a formalidade, o tamanho de frase e o vocabulário de quem está escrevendo. Mensagem curta e seca recebe resposta curta e seca; formal recebe formal. Na pesquisa isso se chama linguistic style matching, estudado em conversa escrita desde o artigo de Niederhoffer e Pennebaker, de 2002.

  2. As palavras do cliente

    Se o cliente chama de boleto e o seu sistema chama de título, o agente responde na palavra dele e faz a ponte para a sua nos bastidores. Jargão interno fica interno.

  3. Calibrado, e declarado

    Copiar o cliente de perto demais soa instável, não pessoal, então a faixa é limitada: o registro se move, a identidade não. E o cliente é informado de que fala com um agente, nunca deixado para descobrir sozinho.

  4. Ele diz que não sabe

    Quando a evidência é fraca, a saída honesta é não responder. Uma afirmação sem fonte falha na validação antes de o cliente ver, e uma afirmação que cita algo que a busca nunca devolveu é pega e contada.

  5. Ele passa para uma pessoa

    O agente pode propor um ticket. Ele nunca abre. Uma pessoa confirma, o número que o cliente vê é o verdadeiro, e toda recusa fica registrada com motivo.

  6. Uma voz, versionada

    O conjunto de instruções que define como o agente fala é um artefato versionado sob um label de produção, fixado em todo trace. Quando a voz muda, você vê qual versão disse o quê.

Em produção

Últimos sistemas desenvolvidos

O agente que atende no canal do cliente, o motor de recuperação sobre o qual ele roda, a curadoria que governa o que entra no índice, e o assistente que responde e redige sobre um acervo jurídico privado. É esse conjunto que entregamos, em consultoria ou em desenvolvimento.

Sistemas

Um agente de primeiro nível que responde clientes num canal de mensagens a partir da base de conhecimento da própria empresa, mais um chat interno sobre a mesma base para o time. Toda afirmação sai com o id do trecho que a sustenta, e uma verificação determinística confere cada id contra o que a busca devolveu. Quando não confere, a violação fica registrada.

  • Debounce, agrupamento de rajada e serialização por conversa resolvidos numa única consulta de reserva: o cliente manda cinco mensagens seguidas e recebe uma resposta, não cinco.
  • O turno é gravado antes de ser enviado, e a primeira instrução dessa transação verifica se uma pessoa acabou de assumir a conversa, para que ninguém receba resposta de robô depois de um atendente entrar.
  • Escalação em duas fases: o agente propõe o chamado, e a abertura só passa quando o servidor encontra essa proposta anterior no log, ou quando o próprio cliente pediu uma pessoa.
  • agente de atendimento
  • citar antes de escrever
  • fila durável no Postgres
  • escalação em duas fases
  • chat interno por SSE
  • cache de prompt fixado

Segurança e conformidade

O que o seu time de segurança vai perguntar, já respondido

Residência de dados, prompt injection, treino no seu conteúdo, permissões, LGPD e termos de saída. Toda resposta nomeia a arquitetura por trás.

  • Seus dados não saem do seu perímetro

    Entrega dentro do seu próprio ambiente ou on premises é o padrão, não um upgrade. Busca, indexação e o mapa de documentos rodam em um banco que você controla. Para quem não pode tirar os dados do país, isso é arquitetura, não promessa.

  • Conteúdo recuperado é dado, nunca instrução

    Tentativas de injeção são recusadas antes de qualquer busca ou chamada paga de modelo. Trechos recuperados e arquivos enviados entram no prompt cercados como conteúdo inerte, e o tipo da imagem é lido do próprio arquivo, não do que ele diz ser. A OWASP cataloga isso como LLM01.

  • Nenhum treino com os seus dados, escrito em contrato

    A exportação de conteúdo para ferramentas de terceiros vem desligada, e mesmo ligada passa por uma etapa de mascaramento, com o identificador do usuário pseudonimizado na fronteira. A razão arquitetural de isso valer é que não existe para onde o conteúdo ir.

  • Busca ciente de permissão, dita com precisão

    A busca aceita um filtro de tags de acesso e, quando ele existe, aplica nas duas pernas e reconfere em cada documento ligado, descartando os que não têm tags resolvíveis. Ligar isso ao seu provedor de identidade é trabalho de projeto, não um botão que a gente aperta.

  • A regulação, com a data correta

    A LGPD governa isso hoje e nenhuma lei brasileira de IA a substituiu: o PL 2338 ainda é projeto. As cláusulas contratuais padrão da ANPD são obrigatórias desde 23 de agosto de 2025, embora transferências para a União Europeia já possam se apoiar na decisão de adequação da ANPD de janeiro de 2026. Na Europa, os deveres de transparência do artigo 50 valem desde 2 de agosto de 2026, e o Digital Omnibus, Regulamento (UE) 2026/1744, empurrou as obrigações de alto risco para 2027 e 2028.

  • Saída antes da entrada

    O índice é exportável, o conjunto de testes é seu e vive no seu repositório, o gate de qualidade roda no seu CI, e o contrato de ingestão está documentado. Um fornecedor que não pode ser trocado é um risco.

Respostas diretas

Perguntas frequentes

As perguntas que realmente aparecem na primeira conversa.

Quase sempre porque a busca entregou os trechos errados ao modelo, não porque ele alucinou. O que o mercado chama de alucinação é, na maior parte dos casos, recuperação errada. Três falhas diferentes parecem iguais de fora: o trecho certo nunca foi recuperado, foi recuperado e ignorado, ou nada relevante existia e o agente respondeu mesmo assim. Medir isso em separado é a primeira coisa que fazemos, e em geral duas das três estão bem.

Próximo passo

Uma conversa com escopo

Você fala com os engenheiros que fazem o trabalho. Se nenhum dos dois formatos for o primeiro passo certo, espere ouvir isso na conversa.

Bom trazer

  1. As perguntas que o seu agente erra, nas palavras dos seus usuários
  2. Mais ou menos o que é o seu conteúdo: quanto, quais formatos, com que frequência muda
  3. Quem decide a liberação de acesso aos dados

Enviar uma mensagem