Top 3 · Atendimento ao cliente
- 01Gemini 3.8 FlashGoogle$1.50 USD / M tokens
- 02GPT-5.6 TerraOpenAI$4.50 USD / M tokens
- 03GPT-5.6 SolOpenAI$8.00 USD / M tokens
Calcule o custo por conversa sem ficar abaixo do seu piso de qualidade
Um assistente de atendimento é avaliado conversa por conversa, não resposta por resposta. Um atendimento típico tem vários turnos, o histórico cresce a cada um e o modelo ainda recebe trechos da sua base de conhecimento. Por isso a métrica que importa é o custo por conversa resolvida, junto com um piso de qualidade definido por você: respostas inaceitáveis por mais baratas que sejam, como inventar uma política de reembolso ou prometer um prazo que não existe.
O desenho que costuma funcionar tem três peças. Uma base de conhecimento indexada com embeddings, para que o modelo responda com as suas políticas e não com suposições. Um modelo escolhido pela qualidade nas suas próprias conversas e pelo preço oficial. E um caminho claro de transbordo para uma pessoa quando o caso pede. Esta página percorre as decisões de cada peça e o que medir antes de colocá-la na frente dos clientes.
Pegue conversas reais e some, em cada uma, os tokens de entrada de todos os turnos, incluindo prompt de sistema, histórico e trechos recuperados, mais os de saída. Aplique os preços oficiais na calculadora. Divida pelas conversas resolvidas sem transbordo; as transferidas somam ainda o custo do atendente humano.
Liste as falhas inaceitáveis: inventar políticas, prometer reembolso, pedir dados sensíveis, fugir do assunto. Monte um conjunto de teste com conversas que provoquem essas falhas e exija que o modelo evite todas. Só entre os modelos aprovados compare preço e latência.
Artigos atualizados, cada um com data de revisão e um responsável. Divida por pergunta ou seção, gere embeddings e guarde o link de origem para citar. Meça em que proporção das perguntas reais um trecho relevante é recuperado; se a recuperação falha, nenhum modelo responde bem.
Defina regras explícitas: reembolso acima de um valor, reclamação repetida, tom de irritação, assunto jurídico ou pedido do próprio cliente. Passe ao atendente um resumo e o histórico para ele não perguntar tudo de novo. Acompanhe a taxa de transbordo e quantos casos transferidos o bot poderia ter resolvido.
Some prompt de sistema, trechos recuperados e os últimos turnos da conversa. Em conversas longas, resuma os turnos antigos em vez de mandá-los inteiros. Atendimento típico não precisa de uma janela enorme, e pagar por contexto que você não usa encarece cada resposta.
Conte o seu volume e as opções que você avalia. Respondemos por escrito com os números do seu uso real; sem compromisso.
Nenhum provedor paga pela sua posição. Os índices são da LLM Stats; os preços, da API padrão de cada provedor. Como medimos
Análises, guias e novos comparativos de tecnologia.