Busca e RAG em documentos: embeddings, chunking e pgvector

Encontre o trecho certo antes de pedir a resposta ao modelo

Dados revisados em 8 set 2026 · índices da LLM Stats e preços oficiais

Os dados, hoje

O contexto

A maioria dos sistemas RAG que respondem mal não tem problema de modelo, e sim de recuperação: o trecho que contém a resposta nunca chega ao prompt. Por isso vale dividir o sistema em duas partes e avaliar cada uma separadamente. Primeiro, dada uma pergunta, você encontra os trechos certos? Depois, com esses trechos na frente, o modelo responde bem e cita a fonte? Misturar as duas perguntas torna impossível saber o que corrigir.

As decisões de infraestrutura são mais simples do que parecem. O modelo de embeddings é escolhido pela qualidade nos seus documentos e pelo preço por milhão de tokens. Os vetores podem ficar no PostgreSQL com pgvector até volumes bem grandes. E os documentos originais vão para armazenamento de objetos, de onde são reprocessados sempre que você troca de modelo ou de estratégia de chunking, sem depender de cópias soltas.

O que decidir

  1. 1

    Qual modelo de embeddings escolher?

    Compare preço por milhão de tokens e dimensões do vetor, que afetam armazenamento e velocidade de busca. Depois teste dois ou três modelos com os seus documentos e um conjunto de perguntas reais com o trecho correto marcado. Meça o recall nos cinco ou dez primeiros resultados; esse número decide.

  2. 2

    Como divido os documentos?

    Respeite a estrutura: seções, parágrafos, linhas de tabela. Comece com trechos de algumas centenas de tokens com um pouco de sobreposição e inclua em cada um o título do documento e da seção. Mude o tamanho só se a avaliação de recuperação melhorar, não por intuição.

  3. 3

    pgvector ou um banco vetorial dedicado?

    Se você já usa PostgreSQL, o pgvector evita mais um sistema e permite filtrar por metadados com SQL na mesma consulta. Considere um banco dedicado quando medir latência p95 ou consumo de memória do índice que o PostgreSQL não sustenta no seu volume. Compare também custo mensal e esforço de operação.

  4. 4

    Como avalio a recuperação?

    Monte um conjunto de cinquenta a cem perguntas reais, cada uma com o trecho que a responde. Meça o recall nos k primeiros resultados e a posição média do trecho correto. Teste busca híbrida com palavras-chave e reranking. Só com a recuperação boa vale ajustar o prompt de geração.

  5. 5

    Onde guardo os documentos de origem?

    Em armazenamento de objetos, versionados e com um identificador estável que o índice referencie. Assim você reindexa ao trocar de modelo de embeddings e mostra ao usuário o original citado. Estime GB armazenados, leituras por reindexação e egress, se você servir os arquivos.

Erros comuns

  • Ajustar o prompt por semanas quando o trecho certo nunca chega ao contexto.
  • Misturar vetores de dois modelos de embeddings diferentes no mesmo índice.
  • Descartar os documentos originais e ficar só com os vetores, sem poder reindexar.

Ferramentas e comparadores

Guias para aprofundar

Quer uma recomendação para o seu caso?

Conte o seu volume e as opções que você avalia. Respondemos por escrito com os números do seu uso real; sem compromisso.

Pedir consultoria

Nenhum provedor paga pela sua posição. Os índices são da LLM Stats; os preços, da API padrão de cada provedor. Como medimos