Top 3 · Atención al cliente
- 01Gemini 3.8 FlashGoogle$1.50 USD / M tokens
- 02GPT-5.6 TerraOpenAI$4.50 USD / M tokens
- 03GPT-5.6 SolOpenAI$8.00 USD / M tokens
Calcula el costo por conversación sin bajar de tu piso de calidad
Un asistente de soporte se juzga conversación por conversación, no respuesta por respuesta. Una charla típica acumula varios turnos, el historial crece con cada uno y el modelo recibe además fragmentos de tu base de conocimiento. Por eso la métrica que importa es el costo por conversación resuelta, junto con un piso de calidad que defines tú: respuestas inaceptables aunque sean baratas, como inventar una política de reembolso o prometer un plazo que no existe.
El diseño que suele funcionar combina tres piezas. Una base de conocimiento indexada con embeddings, para que el modelo responda con tus políticas y no con suposiciones. Un modelo elegido por su calidad en tus propias conversaciones y por su precio oficial. Y un camino claro de escalado a una persona cuando el caso lo pide. Esta página recorre las decisiones de cada pieza y qué medir antes de ponerla frente a clientes.
Toma conversaciones reales y suma en cada una los tokens de entrada de todos los turnos, incluidos prompt de sistema, historial y fragmentos recuperados, más los de salida. Multiplica por precios oficiales en la calculadora. Divide entre conversaciones resueltas sin escalar; las escaladas suman además el costo del agente humano.
Escribe una lista de fallas inaceptables: inventar políticas, prometer reembolsos, pedir datos sensibles, salirse del tema. Construye un conjunto de prueba con conversaciones que provoquen esas fallas y exige que el modelo las evite todas. Solo entre los modelos que aprueban compara precio y latencia.
Artículos actualizados, cada uno con fecha de vigencia y un responsable. Divídelos por pregunta o sección, genera embeddings y guarda el enlace de origen para citarlo. Mide en qué proporción de preguntas reales se recupera un fragmento relevante; si la recuperación falla, ningún modelo responderá bien.
Define reglas explícitas: reembolsos por encima de un monto, quejas repetidas, tono de enojo, temas legales o que el cliente lo pida. Pasa al agente humano un resumen y el historial para que no pregunte todo de nuevo. Mide la tasa de escalado y cuántos casos escalados el bot podría haber resuelto.
Suma prompt de sistema, fragmentos recuperados y los últimos turnos de la conversación. En charlas largas, resume los turnos antiguos en lugar de enviarlos completos. El soporte típico no necesita una ventana enorme, y pagar por contexto que no usas encarece cada respuesta del asistente.
Cuéntanos tu volumen y las opciones que evalúas. Te respondemos por escrito con los números de tu uso real; sin compromiso.
Ningún proveedor paga por su posición. Los índices son de LLM Stats; los precios, de la API estándar de cada proveedor. Cómo medimos
Análisis, guías y nuevas comparativas de tecnología.