Atención al cliente con IA: costo por conversación, RAG y escalado

Calcula el costo por conversación sin bajar de tu piso de calidad

Datos revisados el 8 sep 2026 · índices de LLM Stats y precios oficiales

Los datos, hoy

El contexto

Un asistente de soporte se juzga conversación por conversación, no respuesta por respuesta. Una charla típica acumula varios turnos, el historial crece con cada uno y el modelo recibe además fragmentos de tu base de conocimiento. Por eso la métrica que importa es el costo por conversación resuelta, junto con un piso de calidad que defines tú: respuestas inaceptables aunque sean baratas, como inventar una política de reembolso o prometer un plazo que no existe.

El diseño que suele funcionar combina tres piezas. Una base de conocimiento indexada con embeddings, para que el modelo responda con tus políticas y no con suposiciones. Un modelo elegido por su calidad en tus propias conversaciones y por su precio oficial. Y un camino claro de escalado a una persona cuando el caso lo pide. Esta página recorre las decisiones de cada pieza y qué medir antes de ponerla frente a clientes.

Qué decidir

  1. 1

    ¿Cómo calculo el costo por conversación?

    Toma conversaciones reales y suma en cada una los tokens de entrada de todos los turnos, incluidos prompt de sistema, historial y fragmentos recuperados, más los de salida. Multiplica por precios oficiales en la calculadora. Divide entre conversaciones resueltas sin escalar; las escaladas suman además el costo del agente humano.

  2. 2

    ¿Cómo defino el piso de calidad?

    Escribe una lista de fallas inaceptables: inventar políticas, prometer reembolsos, pedir datos sensibles, salirse del tema. Construye un conjunto de prueba con conversaciones que provoquen esas fallas y exige que el modelo las evite todas. Solo entre los modelos que aprueban compara precio y latencia.

  3. 3

    ¿Qué necesita la base de conocimiento?

    Artículos actualizados, cada uno con fecha de vigencia y un responsable. Divídelos por pregunta o sección, genera embeddings y guarda el enlace de origen para citarlo. Mide en qué proporción de preguntas reales se recupera un fragmento relevante; si la recuperación falla, ningún modelo responderá bien.

  4. 4

    ¿Cuándo derivar a una persona?

    Define reglas explícitas: reembolsos por encima de un monto, quejas repetidas, tono de enojo, temas legales o que el cliente lo pida. Pasa al agente humano un resumen y el historial para que no pregunte todo de nuevo. Mide la tasa de escalado y cuántos casos escalados el bot podría haber resuelto.

  5. 5

    ¿Cuánto contexto necesita el asistente?

    Suma prompt de sistema, fragmentos recuperados y los últimos turnos de la conversación. En charlas largas, resume los turnos antiguos en lugar de enviarlos completos. El soporte típico no necesita una ventana enorme, y pagar por contexto que no usas encarece cada respuesta del asistente.

Errores comunes

  • Medir el costo por respuesta y no por conversación completa con todo su historial.
  • Lanzar el asistente sin una salida visible hacia una persona cuando el cliente la necesita.
  • Indexar artículos obsoletos y culpar al modelo por respuestas que reflejan información vieja.

Herramientas y comparadores

Guías para profundizar

¿Quieres una recomendación para tu caso?

Cuéntanos tu volumen y las opciones que evalúas. Te respondemos por escrito con los números de tu uso real; sin compromiso.

Solicitar asesoría

Ningún proveedor paga por su posición. Los índices son de LLM Stats; los precios, de la API estándar de cada proveedor. Cómo medimos

El brief de Codifly

Una perspectiva más clara.
En tu bandeja de entrada.

Análisis, guías y nuevas comparativas de tecnología.

Puedes darte de baja cuando quieras.