Agentes RAG para atendimento
Um agente de IA que fala como gente e não inventa.
Construímos e melhoramos agentes de IA para atendimento e conhecimento interno. Cada resposta sai do seu próprio conteúdo, cita a fonte e responde no registro do seu cliente.
O motor por baixo é state of the art: vetorial, léxica e grafo de conhecimento, três vias de recuperação que convergem num único ranking, com modelos de embedding e rerank de primeira linha.
Como a resposta é montada
- 01 Permissões
- 02 Busca no conteúdo
- 03 Ranking único
- 04 Documentos ligados
- 05 Melhores trechos
- 06 Resposta citada
Degradado: uma via de busca caiu, as outras assumem
Como contratar
Construímos o seu agente, ou consertamos o que você já roda.
Nos dois formatos o motor é o mesmo, e é o estado da arte em recuperação: vetorial e léxica fundidas por RRF com peso, mais grafo de conhecimento e rerank de primeira linha. O que muda é o ponto de partida, um começa nos seus documentos e o outro no agente que já responde errado.
- Construção
Seu agente, construído de ponta a ponta
Para o time que já decidiu colocar um agente na frente do cliente e quer engenharia, não uma montagem tirada de tutorial.
- Parte de
- Seus documentos e as perguntas que eles precisam responder
- Roda em
- Sua nuvem ou seu próprio hardware
- Você recebe
- Código, testes e runbooks no seu repositório
- Escopo
- Fechado, por escrito, antes de qualquer código
O que é construído
- O agente em si: nos seus canais, respondendo a partir dos seus documentos, com a fonte anexada a cada afirmação.
- A busca por trás dele: palavra exata e sentido buscados juntos, para um código de erro achar a página certa e uma pergunta vaga também.
- Os testes que o mantêm honesto: as suas perguntas reais, uma baseline junto ao código e um gate que barra a release quando a qualidade cai.
- Consultoria
O agente que você já roda, corrigido
Para o piloto que responde mas responde errado, ou a conta que cresceu mais rápido que o resultado. As mudanças chegam em pull requests que o seu time revisa.
- Parte de
- Seu agente e as perguntas que ele erra
- Medição
- Busca e resposta avaliadas em separado
- Você recebe
- Pull requests, mais os testes que comprovam o ganho
- Escopo
- Fechado, por escrito, antes de qualquer código
O que costuma mudar
- A busca primeiro. A maioria das respostas erradas é o trecho errado recuperado, não um modelo que inventou.
- A voz. Registro, jargão e tamanho de resposta ajustados aos seus clientes, em vez do tom padrão de assistente.
- A conta. Cache que realmente acerta, um modelo menor na resposta que chega ao cliente, e as etapas rotineiras movidas para código comum.
O que construímos
O que o agente faz, e o que o sustenta.
Quatro ofertas, cada uma rodando em produção hoje. Capacidade sem mecanismo por trás não entra nesta lista.
Um agente de atendimento no seu canal de mensagens e um chat interno sobre o mesmo conteúdo. A resposta que o cliente lê roda de propósito em um modelo pequeno e rápido, e as etapas rotineiras rodam como código comum, que não custa nada por mensagem.
- Uma chamada de modelo por turno, medida em vez de presumida
- Toda afirmação carrega a sua fonte, ou não chega ao cliente
- Áudio transcrito, e silêncio nunca enviado a um modelo pago
- Uma pessoa confirma qualquer coisa que o agente propõe abrir ou mudar
Uma única busca roda por sentido e por palavra exata, e junta os dois rankings. Códigos de erro, nomes de campo e nomes de produto são onde a busca só por sentido falha em silêncio, e são o que o seu usuário digita.
- Busca por sentido e por palavra exata unidas, não misturadas em uma nota só
- Um segundo espaço de busca atrás de um breaker, trocado sem reindexar
- O serviço se recusa a subir se o índice e o modelo discordarem
- Tabelas, blocos de código e diagramas nunca partidos entre trechos
Algumas respostas não estão em um único documento. Montamos o mapa de como o seu conteúdo se referencia a partir dos links e do seu próprio glossário, sem modelo adivinhando, para que o melhor resultado traga o que ele depende.
- Montado a partir dos seus links e glossário, reproduzível e de graça para refazer
- Profundidade fixa com timeout, nunca uma busca sem fim
- Cada documento ligado chega com o motivo de ter sido trazido
- Oferecido só onde a pergunta é realmente multi-documento
Uma tabela de limites publicada e um gate que barra a release quando uma métrica cai. As suas perguntas reais, versionadas ao lado do código, com a baseline commitada para que uma regressão seja um número em vez de uma discussão.
- Avaliado nas suas próprias perguntas, nunca num conjunto de demo
- Busca e resposta medidas em separado, porque falham em separado
- Julgado por um modelo de família diferente da que respondeu
- Tempo por etapa e nota por trecho em toda requisição
Comunicação humanizada
Não soar como um robô é engenharia, não sorte.
40% dos consumidores brasileiros dizem que preferem totalmente a interação humana (CX Trends 2026). A maioria dos agentes usa uma voz de marca só com todo mundo; o nosso lê o registro de cada mensagem e responde no mesmo tom.
-
Comportamento espelho
O agente acompanha a formalidade, o tamanho de frase e o vocabulário de quem está escrevendo. Mensagem curta e seca recebe resposta curta e seca; formal recebe formal. Na pesquisa isso se chama linguistic style matching, estudado em conversa escrita desde o artigo de Niederhoffer e Pennebaker, de 2002.
-
As palavras do cliente
Se o cliente chama de boleto e o seu sistema chama de título, o agente responde na palavra dele e faz a ponte para a sua nos bastidores. Jargão interno fica interno.
-
Calibrado, e declarado
Copiar o cliente de perto demais soa instável, não pessoal, então a faixa é limitada: o registro se move, a identidade não. E o cliente é informado de que fala com um agente, nunca deixado para descobrir sozinho.
-
Ele diz que não sabe
Quando a evidência é fraca, a saída honesta é não responder. Uma afirmação sem fonte falha na validação antes de o cliente ver, e uma afirmação que cita algo que a busca nunca devolveu é pega e contada.
-
Ele passa para uma pessoa
O agente pode propor um ticket. Ele nunca abre. Uma pessoa confirma, o número que o cliente vê é o verdadeiro, e toda recusa fica registrada com motivo.
-
Uma voz, versionada
O conjunto de instruções que define como o agente fala é um artefato versionado sob um label de produção, fixado em todo trace. Quando a voz muda, você vê qual versão disse o quê.
Em produção
Últimos sistemas desenvolvidos
O agente que atende no canal do cliente, o motor de recuperação sobre o qual ele roda, a curadoria que governa o que entra no índice, e o assistente que responde e redige sobre um acervo jurídico privado. É esse conjunto que entregamos, em consultoria ou em desenvolvimento.
Sistemas
Um agente de primeiro nível que responde clientes num canal de mensagens a partir da base de conhecimento da própria empresa, mais um chat interno sobre a mesma base para o time. Toda afirmação sai com o id do trecho que a sustenta, e uma verificação determinística confere cada id contra o que a busca devolveu. Quando não confere, a violação fica registrada.
- Debounce, agrupamento de rajada e serialização por conversa resolvidos numa única consulta de reserva: o cliente manda cinco mensagens seguidas e recebe uma resposta, não cinco.
- O turno é gravado antes de ser enviado, e a primeira instrução dessa transação verifica se uma pessoa acabou de assumir a conversa, para que ninguém receba resposta de robô depois de um atendente entrar.
- Escalação em duas fases: o agente propõe o chamado, e a abertura só passa quando o servidor encontra essa proposta anterior no log, ou quando o próprio cliente pediu uma pessoa.
- agente de atendimento
- citar antes de escrever
- fila durável no Postgres
- escalação em duas fases
- chat interno por SSE
- cache de prompt fixado
O serviço de recuperação sobre o qual os agentes rodam. Uma chamada busca por sentido e por palavra exata no mesmo índice, funde os dois rankings, expande pelo grafo de conhecimento, reordena e devolve os trechos com a nota de cada um. Não chama modelo de linguagem e não escreve nos dados.
- As duas pernas são fundidas por Reciprocal Rank Fusion com peso, e não por média de scores: cada perna vota pela posição, e o peso favorece a palavra exata, onde o vocabulário do próprio cliente é o que importa.
- O grafo é construído por parsers determinísticos, sem extração por modelo: as arestas vêm de wiki-links, do front-matter, do glossário e dos diagramas que já estão no conteúdo.
- Dois espaços de embedding em tabelas separadas, com um breaker movendo o tráfego entre eles e sem reindexação, mais um contrato de índice publicado contra o qual o serviço se recusa a subir quando o formato divergiu.
- busca híbrida
- RRF com peso
- grafo Apache AGE
- pgvector HNSW
- contrato de índice publicado
- circuit breaker
A aplicação onde uma pessoa edita o conteúdo que o agente vai responder, com revisão, diff e histórico. Publicar não é salvar: passa pelo lint do corpus, gera um commit de um arquivo só no git e reindexa apenas o que mudou.
- O lint do corpus é um registro de regras sem parâmetro de bypass na assinatura: erro barra a publicação, e conteúdo com um segredo colado dentro não chega ao índice.
- Uma reindexação paga exige o escopo que o operador realmente viu: a API devolve as quatro classes de mudança separadas, mais um token daquele escopo, e recusa a execução quando o escopo mudou.
- Uma exclusão em massa é recusada antes do primeiro DELETE quando o raio real passa do limite, em vez de ser executada.
- curadoria de corpus
- lint sem bypass
- git como fonte da verdade
- reindexação com escopo
- grafo tipado determinístico
- guarda de raio de exclusão
Um assistente de modo duplo sobre o acervo societário privado de cada empresa: responde a dúvida citando o documento que sustenta a resposta, e redige o documento novo no padrão que a organização já usa. O acervo é o que a governança produz, ou seja atas de assembleia, contratos sociais, estatutos, livros de registro de ações, mandatos e procurações.
- Duas tarefas sobre o mesmo acervo, perguntar e redigir: a resposta cita o documento que a sustenta, e o documento redigido sai no padrão que a organização já usa em vez de um modelo genérico.
- Uma dúvida sobre a legislação societária vigente é respondida em separado de uma dúvida sobre o acervo do próprio cliente, porque uma envelhece com a lei e a outra envelhece com o documento.
- Dados isolados por cliente e sem treinamento externo. Num acervo societário isso não é preferência de arquitetura, é a condição para o acervo entrar no sistema.
- respostas citadas
- redação de documentos
- acervo societário
- padrão da organização
- isolamento por cliente
- sem treinamento externo
Segurança e conformidade
O que o seu time de segurança vai perguntar, já respondido
Residência de dados, prompt injection, treino no seu conteúdo, permissões, LGPD e termos de saída. Toda resposta nomeia a arquitetura por trás.
-
Seus dados não saem do seu perímetro
Entrega dentro do seu próprio ambiente ou on premises é o padrão, não um upgrade. Busca, indexação e o mapa de documentos rodam em um banco que você controla. Para quem não pode tirar os dados do país, isso é arquitetura, não promessa.
-
Conteúdo recuperado é dado, nunca instrução
Tentativas de injeção são recusadas antes de qualquer busca ou chamada paga de modelo. Trechos recuperados e arquivos enviados entram no prompt cercados como conteúdo inerte, e o tipo da imagem é lido do próprio arquivo, não do que ele diz ser. A OWASP cataloga isso como LLM01.
-
Nenhum treino com os seus dados, escrito em contrato
A exportação de conteúdo para ferramentas de terceiros vem desligada, e mesmo ligada passa por uma etapa de mascaramento, com o identificador do usuário pseudonimizado na fronteira. A razão arquitetural de isso valer é que não existe para onde o conteúdo ir.
-
Busca ciente de permissão, dita com precisão
A busca aceita um filtro de tags de acesso e, quando ele existe, aplica nas duas pernas e reconfere em cada documento ligado, descartando os que não têm tags resolvíveis. Ligar isso ao seu provedor de identidade é trabalho de projeto, não um botão que a gente aperta.
-
A regulação, com a data correta
A LGPD governa isso hoje e nenhuma lei brasileira de IA a substituiu: o PL 2338 ainda é projeto. As cláusulas contratuais padrão da ANPD são obrigatórias desde 23 de agosto de 2025, embora transferências para a União Europeia já possam se apoiar na decisão de adequação da ANPD de janeiro de 2026. Na Europa, os deveres de transparência do artigo 50 valem desde 2 de agosto de 2026, e o Digital Omnibus, Regulamento (UE) 2026/1744, empurrou as obrigações de alto risco para 2027 e 2028.
-
Saída antes da entrada
O índice é exportável, o conjunto de testes é seu e vive no seu repositório, o gate de qualidade roda no seu CI, e o contrato de ingestão está documentado. Um fornecedor que não pode ser trocado é um risco.
Respostas diretas
Perguntas frequentes
As perguntas que realmente aparecem na primeira conversa.
Quase sempre porque a busca entregou os trechos errados ao modelo, não porque ele alucinou. O que o mercado chama de alucinação é, na maior parte dos casos, recuperação errada. Três falhas diferentes parecem iguais de fora: o trecho certo nunca foi recuperado, foi recuperado e ignorado, ou nada relevante existia e o agente respondeu mesmo assim. Medir isso em separado é a primeira coisa que fazemos, e em geral duas das três estão bem.
Próximo passo
Uma conversa com escopo
Você fala com os engenheiros que fazem o trabalho. Se nenhum dos dois formatos for o primeiro passo certo, espere ouvir isso na conversa.
Bom trazer
- As perguntas que o seu agente erra, nas palavras dos seus usuários
- Mais ou menos o que é o seu conteúdo: quanto, quais formatos, com que frequência muda
- Quem decide a liberação de acesso aos dados