Mais econômicos · Embeddings
- 01Voyage 4 LiteVoyage AI$0.02 USD / M tokens
- 02Mistral EmbedMistral AI$0.10 USD / M tokens
- 03Codestral EmbedMistral AI$0.15 USD / M tokens
Encontre o trecho certo antes de pedir a resposta ao modelo
A maioria dos sistemas RAG que respondem mal não tem problema de modelo, e sim de recuperação: o trecho que contém a resposta nunca chega ao prompt. Por isso vale dividir o sistema em duas partes e avaliar cada uma separadamente. Primeiro, dada uma pergunta, você encontra os trechos certos? Depois, com esses trechos na frente, o modelo responde bem e cita a fonte? Misturar as duas perguntas torna impossível saber o que corrigir.
As decisões de infraestrutura são mais simples do que parecem. O modelo de embeddings é escolhido pela qualidade nos seus documentos e pelo preço por milhão de tokens. Os vetores podem ficar no PostgreSQL com pgvector até volumes bem grandes. E os documentos originais vão para armazenamento de objetos, de onde são reprocessados sempre que você troca de modelo ou de estratégia de chunking, sem depender de cópias soltas.
Compare preço por milhão de tokens e dimensões do vetor, que afetam armazenamento e velocidade de busca. Depois teste dois ou três modelos com os seus documentos e um conjunto de perguntas reais com o trecho correto marcado. Meça o recall nos cinco ou dez primeiros resultados; esse número decide.
Respeite a estrutura: seções, parágrafos, linhas de tabela. Comece com trechos de algumas centenas de tokens com um pouco de sobreposição e inclua em cada um o título do documento e da seção. Mude o tamanho só se a avaliação de recuperação melhorar, não por intuição.
Se você já usa PostgreSQL, o pgvector evita mais um sistema e permite filtrar por metadados com SQL na mesma consulta. Considere um banco dedicado quando medir latência p95 ou consumo de memória do índice que o PostgreSQL não sustenta no seu volume. Compare também custo mensal e esforço de operação.
Monte um conjunto de cinquenta a cem perguntas reais, cada uma com o trecho que a responde. Meça o recall nos k primeiros resultados e a posição média do trecho correto. Teste busca híbrida com palavras-chave e reranking. Só com a recuperação boa vale ajustar o prompt de geração.
Em armazenamento de objetos, versionados e com um identificador estável que o índice referencie. Assim você reindexa ao trocar de modelo de embeddings e mostra ao usuário o original citado. Estime GB armazenados, leituras por reindexação e egress, se você servir os arquivos.
Conte o seu volume e as opções que você avalia. Respondemos por escrito com os números do seu uso real; sem compromisso.
Nenhum provedor paga pela sua posição. Os índices são da LLM Stats; os preços, da API padrão de cada provedor. Como medimos
Análises, guias e novos comparativos de tecnologia.