Precios de las APIs de IA en septiembre de 2026: cuánto cuesta cada modelo

Tabla con los precios oficiales de 17 modelos de OpenAI, Anthropic, Google, Mistral, DeepSeek y xAI, por qué la salida pesa más en la factura y un ejemplo mensual calculado.

En este artículo
En 30 segundos

Entre el modelo más barato y el más caro hay 250 veces de diferencia en el precio de salida: estima tu factura con tu propia proporción de entrada y salida, no con el precio de entrada ni con un promedio genérico.

1. Los precios de septiembre, modelo por modelo#

Las APIs de modelos de lenguaje cobran por millón de tokens, con una tarifa para los tokens que envías (entrada) y otra, casi siempre más alta, para los que genera el modelo (salida). La tabla reúne los precios estándar de 17 modelos según el dataset abierto de Codifly, revisado el 8 de septiembre de 2026 contra la página oficial de cada proveedor. Son precios sin caché, sin procesamiento por lotes y sin acuerdos empresariales.

ModeloProveedorEntrada (USD/M)Salida (USD/M)Mezclado 3:1Contexto (tokens)
Ministral 3 · 14BMistral AI$0,20$0,20$0,20256.000
Mistral Small 4Mistral AI$0,15$0,60$0,2625256.000
Codestral · 25.08Mistral AI$0,30$0,90$0,45128.000
GPT-5.6 LunaOpenAI$0,20$1,20$0,451.050.000
DeepSeek V4 FlashDeepSeek$0,44$1,32$0,661.000.000
Mistral Large 3Mistral AI$0,50$1,50$0,75256.000
Gemini 3.8 FlashGoogle$0,75$3,75$1,501.048.576
DeepSeek V4 ProDeepSeek$1,32$3,96$1,981.000.000
Claude Haiku 4.5Anthropic$1,00$5,00$2,00200.000
Grok 4.6xAI$2,00$6,00$3,00500.000
Mistral Medium 3.5Mistral AI$1,50$7,50$3,00256.000
Claude Sonnet 5Anthropic$2,00$10,00$4,001.000.000
GPT-5.6 TerraOpenAI$2,00$12,00$4,501.050.000
GPT-5.6 SolOpenAI$4,00$20,00$8,001.050.000
Claude Opus 5Anthropic$5,00$25,00$10,001.000.000
Claude Fable 5.1Anthropic$10,00$50,00$20,001.000.000
GPT-6 AstraOpenAI$10,00$50,00$20,001.050.000

La dispersión es enorme. La salida más barata cuesta $0,20 por millón (Ministral 3 · 14B) y la más cara, $50 (GPT-6 Astra y Claude Fable 5.1): 250 veces más. En entrada, el rango va de $0,15 (Mistral Small 4) a $10, unas 67 veces. Casi todos los modelos cobran la salida entre 3 y 6 veces más cara que la entrada; Ministral 3 · 14B es la excepción, con la misma tarifa en ambos sentidos.

Dos novedades posteriores a esa revisión: la página de precios de DeepSeek ahora lista deepseek-flash como DeepSeek-V4.1-Flash, a US$0,30 de entrada y US$1,20 de salida por millón en horario pico (la tabla muestra US$0,44 y US$1,32), y Anthropic presenta Claude Opus 5.5, a US$4 y US$20, como su modelo recomendado para la mayoría de las cargas, con Claude Opus 5 entre los modelos legados que siguen disponibles. Antes de presupuestar con esas filas, confirma la tarifa en la página oficial.

Documentación: OpenAI: precios de la API ↗ · Anthropic: modelos y precios de Claude ↗ · Google: precios de la API de Gemini ↗ · DeepSeek: precios de la API ↗ · xAI: Grok 4.6 ↗ · Mistral: Ministral 3 14B ↗ · Mistral: Mistral Small 4 ↗ · Mistral: Codestral 25.08 ↗ · Mistral: Mistral Large 3 ↗ · Mistral: Mistral Medium 3.5 ↗

2. Por qué la salida decide la factura#

En una aplicación típica envías bastante más texto del que recibes: instrucciones del sistema, historial de la conversación, fragmentos recuperados de tus documentos y la pregunta del usuario. Aun así, la salida suele ser la partida más grande, porque cada token generado cuesta varias veces más que uno leído. Con una tarifa de salida cinco veces mayor, 400 tokens de respuesta cuestan lo mismo que 2.000 de contexto.

Por eso el precio de entrada, que es el que más se repite en los anuncios, sirve poco para comparar. Para ordenar modelos con una sola cifra, Codifly usa un precio mezclado que supone 3 tokens de entrada por cada token de salida: (3 × entrada + salida) / 4. Para Claude Sonnet 5 da (3 × $2 + $10) / 4 = $4 por millón; para GPT-5.6 Luna, (3 × $0,20 + $1,20) / 4 = $0,45.

  • El 3:1 es una convención para comparar, no una predicción de tu consumo.
  • Un clasificador que responde una etiqueta puede estar en 50:1; ahí manda el precio de entrada.
  • Un generador de borradores o de código puede acercarse a 1:1 o invertir la proporción; ahí manda el precio de salida.
  • Si el modelo razona antes de responder, revisa en la documentación del proveedor cómo factura esos tokens y mide la salida real en el campo usage de cada respuesta.

La regla práctica: mide la proporción real de tu carga durante una semana, con los contadores de tokens que devuelve la API, y recalcula el ranking con ella. Dos modelos con el mismo precio mezclado pueden separarse bastante cuando tu carga se aleja del 3:1, como ocurre con Grok 4.6 y Mistral Medium 3.5, ambos en $3.

3. Ejemplo calculado: un bot de soporte al mes#

Supongamos un asistente de soporte que atiende 100.000 conversaciones al mes. Cada conversación envía 1.500 tokens de entrada (instrucciones, historial y artículos de ayuda) y recibe 400 tokens de salida. En total son 150 millones de tokens de entrada y 40 millones de salida. El cálculo es directo: tokens de entrada por tarifa de entrada más tokens de salida por tarifa de salida, dividido entre un millón.

python
PRECIOS = {  # USD por millón de tokens: (entrada, salida)
    "Claude Fable 5.1": (10.00, 50.00),
    "Claude Sonnet 5": (2.00, 10.00),
    "Gemini 3.8 Flash": (0.75, 3.75),
    "GPT-5.6 Luna": (0.20, 1.20),
    "Mistral Small 4": (0.15, 0.60),
}

CONVERSACIONES = 100_000
ENTRADA, SALIDA = 1_500, 400  # tokens por conversación

def costo_mensual(precio_entrada: float, precio_salida: float) -> float:
    tokens_entrada = CONVERSACIONES * ENTRADA  # 150 M
    tokens_salida = CONVERSACIONES * SALIDA    # 40 M
    return (tokens_entrada * precio_entrada + tokens_salida * precio_salida) / 1_000_000

for modelo, (entrada, salida) in PRECIOS.items():
    print(f"{modelo:18} ${costo_mensual(entrada, salida):>9,.2f}")
Precios estándar del dataset de Codifly revisado el 2026-09-08. Imprime 3,500.00; 700.00; 262.50; 78.00 y 46.50 USD.
ModeloEntrada (150 M)Salida (40 M)Total al mesPor conversación
Claude Fable 5.1$1.500,00$2.000,00$3.500,00$0,035
Claude Sonnet 5$300,00$400,00$700,00$0,007
Gemini 3.8 Flash$112,50$150,00$262,50$0,002625
GPT-5.6 Luna$30,00$48,00$78,00$0,00078
Mistral Small 4$22,50$24,00$46,50$0,000465

La salida es apenas el 21 % de los tokens, pero representa el 57 % de la factura en Claude Fable 5.1, Claude Sonnet 5 y Gemini 3.8 Flash, y el 61,5 % en GPT-5.6 Luna. Si las respuestas se alargan a 800 tokens, la factura de Claude Sonnet 5 sube de $700 a $1.100 (+57 %); si en cambio se duplica el contexto a 3.000 tokens, sube a $1.000 (+43 %). Recortar respuestas ahorra más que recortar el prompt.

El precio mezclado también da una aproximación: 190 millones de tokens por $4 de Claude Sonnet 5 son $760, un 8,6 % por encima del cálculo exacto. La diferencia existe porque esta carga tiene 3,75 tokens de entrada por cada uno de salida, más que el 3:1 supuesto. Para un presupuesto, usa siempre las dos tarifas por separado.

Documentación: Anthropic: precios de Claude Fable 5.1 y Claude Sonnet 5 ↗ · Google: precios de Gemini 3.8 Flash ↗ · OpenAI: precios de GPT-5.6 Luna ↗ · Mistral: precios de Mistral Small 4 ↗

4. Condiciones que cambian el precio de lista#

La tabla muestra precios estándar y excluye los descuentos por caché y por lotes. Esos descuentos y algunas condiciones de tarifa pueden mover tu factura más que el cambio de modelo, así que vale la pena leerlos en la página de cada proveedor antes de decidir.

  • Lotes: OpenAI y Anthropic documentan un 50 % de descuento para solicitudes asíncronas por su API de lotes. Sirve para clasificaciones, resúmenes o evaluaciones que pueden esperar.
  • Caché de prompts: OpenAI cobra la entrada en caché al 10 % del precio estándar de entrada. Anthropic cobra las lecturas de caché a 0,1 veces el precio base (0,025 veces en Claude Fable 5.1) y las escrituras a 1,25 veces (caché de 5 minutos) o 2 veces (caché de 1 hora).
  • Horario: DeepSeek cobra la mitad fuera de su horario pico, que va de 01:00 a 04:00 y de 06:00 a 10:00 UTC, de lunes a viernes, excepto feriados de China. La tabla usa la tarifa pico.
  • Longitud del prompt: Grok 4.6 cobra $4 de entrada y $12 de salida por millón cuando el prompt supera los 200.000 tokens, el doble de su tarifa base.
  • Cambios anunciados: Google publica los $0,75 y $3,75 de Gemini 3.8 Flash como vigentes hasta el 31 de diciembre de 2026; desde el 1 de enero de 2027 pasan a $1,50 y $7,50.

También hay buenas noticias que no se ven en una tabla: Anthropic confirmó que los $2 y $10 de Claude Sonnet 5, anunciados como precio introductorio, son ahora su precio estándar y que el aumento previsto para el 1 de septiembre no ocurrirá. Registra la fecha en que verificaste cada condición junto con tu presupuesto.

Documentación: OpenAI: lotes y entrada en caché ↗ · Anthropic: caché de prompts y API de lotes ↗ · DeepSeek: tarifas pico y fuera de pico ↗ · xAI: tarifas de Grok 4.6 por longitud del prompt ↗ · Google: cambio de precio de Gemini 3.8 Flash ↗

5. Cómo elegir según la tarea#

El precio es un filtro, no el criterio final. Un modelo barato que falla y obliga a reintentar puede terminar costando más por tarea resuelta. El orden sensato es describir la forma de tu carga, preseleccionar por precio y contexto, y decidir con una evaluación sobre tus propios casos.

Tipo de tareaQué domina la facturaQué mirar primero
Clasificar, extraer o enrutarEntrada: respuestas de pocas decenas de tokensPrecio de entrada y formato estructurado; aquí compiten Mistral Small 4, Ministral 3 · 14B y GPT-5.6 Luna
Chat y soporteSalida y contexto que crece con cada turnoPrecio de salida, caché del historial y límite de longitud de las respuestas
Generación de códigoSalida larga y reintentosCalidad en tus pruebas; Codestral · 25.08 tiene precio bajo pero 128.000 tokens de contexto
Documentos largos y RAGEntrada muy grande por solicitudVentana de contexto y recargos por longitud, como el de Grok 4.6 sobre 200.000 tokens
Agentes con herramientasEntrada: el contexto se reenvía en cada pasoCaché de prompts y tope de pasos por tarea

Para la preselección, el ranking de precio de Codifly ordena los modelos por costo y el ranking de costo-beneficio los cruza con su desempeño. La calculadora de costos de IA hace la cuenta de la sección 3 con tu volumen y tu proporción de entrada y salida, y el comparador de modelos de IA muestra límites y condiciones de cada ficha. Con dos o tres candidatos, ejecuta la evaluación: la guía para elegir un LLM de producción describe el proceso completo.

Para profundizarCómo elegir un LLM para producción sin depender del ranking

Documentación: Anthropic: ventana de contexto de Claude Haiku 4.5 ↗ · Mistral: contexto de Codestral 25.08 ↗

6. Mantén tus cifras al día#

Los precios de las APIs de IA cambian más rápido que casi cualquier otra tarifa de nube: salen modelos nuevos, los anteriores pasan a legado y algunos proveedores anuncian cambios con fecha. Un presupuesto armado en marzo puede estar desfasado en septiembre.

Las cifras de esta guía salen del dataset abierto de precios de APIs de IA de Codifly, publicado en JSON y CSV bajo licencia CC BY 4.0: puedes usarlo en tus notebooks, artículos o productos citando la fuente. Cada fila trae entrada, salida, precio mezclado, ventana de contexto, salida máxima y los enlaces a las páginas oficiales, y el campo reviewed_at indica la fecha de la última revisión. Para mostrar los precios en tu sitio, la página de datos abiertos ofrece un widget embebible que admite idioma, tema y número de modelos.

bash
curl -s https://codifly.co/data/ai-models.json \
  | jq -r '.reviewed_at, (.models | sort_by(.blended_usd_per_mtok) | .[:5][]
      | "\(.name)\t\(.input_usd_per_mtok)\t\(.output_usd_per_mtok)")'
Consulta la fecha de revisión y los cinco modelos con menor precio mezclado. Requiere curl y jq.
  • Automatiza una consulta semanal al dataset y compara reviewed_at con la fecha de tu último presupuesto.
  • Guarda los tokens facturados por modelo y por funcionalidad: sin ese dato no sabrás cuál cambio de precio te afecta.
  • Antes de firmar un compromiso, abre la página oficial del proveedor; el dataset es un punto de partida, no un contrato.

Documentación: Codifly: dataset abierto de precios de APIs de IA (JSON) ↗ · Creative Commons: licencia CC BY 4.0 ↗

Fuentes y alcance

Documentación consultada el 27 de septiembre de 2026. Los ejemplos y criterios de decisión son propuestas editoriales; adáptalos al contrato de tu aplicación y valídalos en tu entorno de pruebas autorizado.

Compara estas opciones

Compara modelos de ia

Revisa tarifas, límites, condiciones y fuentes de cada opción.

Abrir comparador
Asesoría

¿Tu caso es distinto?

Cuéntanos tu contexto y las opciones que estás evaluando. Te respondemos con criterios y fuentes, sin suscripciones automáticas.

Solicita asesoría