Atendimento ao cliente com IA: custo por conversa, RAG e transbordo

Calcule o custo por conversa sem ficar abaixo do seu piso de qualidade

Dados revisados em 8 set 2026 · índices da LLM Stats e preços oficiais

Os dados, hoje

O contexto

Um assistente de atendimento é avaliado conversa por conversa, não resposta por resposta. Um atendimento típico tem vários turnos, o histórico cresce a cada um e o modelo ainda recebe trechos da sua base de conhecimento. Por isso a métrica que importa é o custo por conversa resolvida, junto com um piso de qualidade definido por você: respostas inaceitáveis por mais baratas que sejam, como inventar uma política de reembolso ou prometer um prazo que não existe.

O desenho que costuma funcionar tem três peças. Uma base de conhecimento indexada com embeddings, para que o modelo responda com as suas políticas e não com suposições. Um modelo escolhido pela qualidade nas suas próprias conversas e pelo preço oficial. E um caminho claro de transbordo para uma pessoa quando o caso pede. Esta página percorre as decisões de cada peça e o que medir antes de colocá-la na frente dos clientes.

O que decidir

  1. 1

    Como calculo o custo por conversa?

    Pegue conversas reais e some, em cada uma, os tokens de entrada de todos os turnos, incluindo prompt de sistema, histórico e trechos recuperados, mais os de saída. Aplique os preços oficiais na calculadora. Divida pelas conversas resolvidas sem transbordo; as transferidas somam ainda o custo do atendente humano.

  2. 2

    Como defino o piso de qualidade?

    Liste as falhas inaceitáveis: inventar políticas, prometer reembolso, pedir dados sensíveis, fugir do assunto. Monte um conjunto de teste com conversas que provoquem essas falhas e exija que o modelo evite todas. Só entre os modelos aprovados compare preço e latência.

  3. 3

    Do que a base de conhecimento precisa?

    Artigos atualizados, cada um com data de revisão e um responsável. Divida por pergunta ou seção, gere embeddings e guarde o link de origem para citar. Meça em que proporção das perguntas reais um trecho relevante é recuperado; se a recuperação falha, nenhum modelo responde bem.

  4. 4

    Quando transferir para uma pessoa?

    Defina regras explícitas: reembolso acima de um valor, reclamação repetida, tom de irritação, assunto jurídico ou pedido do próprio cliente. Passe ao atendente um resumo e o histórico para ele não perguntar tudo de novo. Acompanhe a taxa de transbordo e quantos casos transferidos o bot poderia ter resolvido.

  5. 5

    De quanto contexto o assistente precisa?

    Some prompt de sistema, trechos recuperados e os últimos turnos da conversa. Em conversas longas, resuma os turnos antigos em vez de mandá-los inteiros. Atendimento típico não precisa de uma janela enorme, e pagar por contexto que você não usa encarece cada resposta.

Erros comuns

  • Medir o custo por resposta e não pela conversa completa, com todo o histórico.
  • Lançar o assistente sem uma saída visível para falar com uma pessoa quando o cliente precisa.
  • Indexar artigos desatualizados e culpar o modelo por respostas com informação velha.

Ferramentas e comparadores

Guias para aprofundar

Quer uma recomendação para o seu caso?

Conte o seu volume e as opções que você avalia. Respondemos por escrito com os números do seu uso real; sem compromisso.

Pedir consultoria

Nenhum provedor paga pela sua posição. Os índices são da LLM Stats; os preços, da API padrão de cada provedor. Como medimos

O brief do Codifly

Uma perspectiva mais clara.
Na sua caixa de entrada.

Análises, guias e novos comparativos de tecnologia.

Você pode cancelar a inscrição quando quiser.