O preço de saída varia 250 vezes entre o modelo mais barato e o mais caro: estime a fatura com a sua própria proporção entre entrada e saída, não com o preço de entrada nem com uma média genérica.
1. Os preços de setembro, modelo a modelo#
As APIs de modelos de linguagem cobram por milhão de tokens, com uma tarifa para os tokens que você envia (entrada) e outra, quase sempre mais alta, para os que o modelo gera (saída). A tabela reúne os preços padrão de 17 modelos segundo o dataset aberto da Codifly, revisado em 8 de setembro de 2026 com base na página oficial de cada provedor. São preços sem cache, sem processamento em lote e sem acordos empresariais.
| Modelo | Provedor | Entrada (USD/M) | Saída (USD/M) | Combinado 3:1 | Contexto (tokens) |
|---|---|---|---|---|---|
| Ministral 3 · 14B | Mistral AI | $0,20 | $0,20 | $0,20 | 256.000 |
| Mistral Small 4 | Mistral AI | $0,15 | $0,60 | $0,2625 | 256.000 |
| Codestral · 25.08 | Mistral AI | $0,30 | $0,90 | $0,45 | 128.000 |
| GPT-5.6 Luna | OpenAI | $0,20 | $1,20 | $0,45 | 1.050.000 |
| DeepSeek V4 Flash | DeepSeek | $0,44 | $1,32 | $0,66 | 1.000.000 |
| Mistral Large 3 | Mistral AI | $0,50 | $1,50 | $0,75 | 256.000 |
| Gemini 3.8 Flash | $0,75 | $3,75 | $1,50 | 1.048.576 | |
| DeepSeek V4 Pro | DeepSeek | $1,32 | $3,96 | $1,98 | 1.000.000 |
| Claude Haiku 4.5 | Anthropic | $1,00 | $5,00 | $2,00 | 200.000 |
| Grok 4.6 | xAI | $2,00 | $6,00 | $3,00 | 500.000 |
| Mistral Medium 3.5 | Mistral AI | $1,50 | $7,50 | $3,00 | 256.000 |
| Claude Sonnet 5 | Anthropic | $2,00 | $10,00 | $4,00 | 1.000.000 |
| GPT-5.6 Terra | OpenAI | $2,00 | $12,00 | $4,50 | 1.050.000 |
| GPT-5.6 Sol | OpenAI | $4,00 | $20,00 | $8,00 | 1.050.000 |
| Claude Opus 5 | Anthropic | $5,00 | $25,00 | $10,00 | 1.000.000 |
| Claude Fable 5.1 | Anthropic | $10,00 | $50,00 | $20,00 | 1.000.000 |
| GPT-6 Astra | OpenAI | $10,00 | $50,00 | $20,00 | 1.050.000 |
A dispersão é enorme. A saída mais barata custa $0,20 por milhão (Ministral 3 · 14B) e a mais cara, $50 (GPT-6 Astra e Claude Fable 5.1): 250 vezes mais. Na entrada, a faixa vai de $0,15 (Mistral Small 4) a $10, cerca de 67 vezes. Quase todos os modelos cobram a saída de 3 a 6 vezes mais cara que a entrada; o Ministral 3 · 14B é a exceção, com a mesma tarifa nos dois sentidos.
Duas novidades vieram depois dessa revisão: a página de preços da DeepSeek agora lista o deepseek-flash como DeepSeek-V4.1-Flash, a US$ 0,30 de entrada e US$ 1,20 de saída por milhão no horário de pico (a tabela mostra US$ 0,44 e US$ 1,32), e a Anthropic passou a recomendar o Claude Opus 5.5, a US$ 4 e US$ 20, para a maioria das cargas, com o Claude Opus 5 entre os modelos legados que continuam disponíveis. Antes de orçar com essas linhas, confirme a tarifa na página oficial.
Documentação: OpenAI: preços da API ↗ · Anthropic: modelos e preços do Claude ↗ · Google: preços da API do Gemini ↗ · DeepSeek: preços da API ↗ · xAI: Grok 4.6 ↗ · Mistral: Ministral 3 14B ↗ · Mistral: Mistral Small 4 ↗ · Mistral: Codestral 25.08 ↗ · Mistral: Mistral Large 3 ↗ · Mistral: Mistral Medium 3.5 ↗
2. Por que a saída decide a fatura#
Numa aplicação típica você envia bem mais texto do que recebe: instruções de sistema, histórico da conversa, trechos recuperados dos seus documentos e a pergunta do usuário. Mesmo assim, a saída costuma ser o maior item da conta, porque cada token gerado custa várias vezes mais do que um token lido. Com uma tarifa de saída cinco vezes maior, 400 tokens de resposta custam o mesmo que 2.000 tokens de contexto.
Por isso o preço de entrada, o número que mais aparece nos anúncios, ajuda pouco na comparação. Para ordenar modelos com um único número, a Codifly usa um preço combinado que supõe 3 tokens de entrada para cada token de saída: (3 × entrada + saída) / 4. Para o Claude Sonnet 5 dá (3 × $2 + $10) / 4 = $4 por milhão; para o GPT-5.6 Luna, (3 × $0,20 + $1,20) / 4 = $0,45.
- O 3:1 é uma convenção para comparar, não uma previsão do seu consumo.
- Um classificador que responde com um rótulo pode ficar em 50:1; nesse caso manda o preço de entrada.
- Um gerador de rascunhos ou de código pode chegar perto de 1:1 ou inverter a proporção; nesse caso manda o preço de saída.
- Se o modelo raciocina antes de responder, veja na documentação do provedor como esses tokens são cobrados e meça a saída real no campo usage de cada resposta.
A regra prática: meça a proporção real da sua carga durante uma semana, com os contadores de tokens que a API devolve, e refaça o ranking com ela. Dois modelos com o mesmo preço combinado podem se distanciar bastante quando a carga foge do 3:1, como acontece com o Grok 4.6 e o Mistral Medium 3.5, ambos a $3.
3. Exemplo calculado: um bot de suporte por mês#
Imagine um assistente de suporte que atende 100.000 conversas por mês. Cada conversa envia 1.500 tokens de entrada (instruções, histórico e artigos de ajuda) e recebe 400 tokens de saída. No total, são 150 milhões de tokens de entrada e 40 milhões de saída. A conta é direta: tokens de entrada vezes a tarifa de entrada mais tokens de saída vezes a tarifa de saída, dividido por um milhão.
PRECOS = { # USD por milhão de tokens: (entrada, saída)
"Claude Fable 5.1": (10.00, 50.00),
"Claude Sonnet 5": (2.00, 10.00),
"Gemini 3.8 Flash": (0.75, 3.75),
"GPT-5.6 Luna": (0.20, 1.20),
"Mistral Small 4": (0.15, 0.60),
}
CONVERSAS = 100_000
ENTRADA, SAIDA = 1_500, 400 # tokens por conversa
def custo_mensal(preco_entrada: float, preco_saida: float) -> float:
tokens_entrada = CONVERSAS * ENTRADA # 150 M
tokens_saida = CONVERSAS * SAIDA # 40 M
return (tokens_entrada * preco_entrada + tokens_saida * preco_saida) / 1_000_000
for modelo, (entrada, saida) in PRECOS.items():
print(f"{modelo:18} ${custo_mensal(entrada, saida):>9,.2f}")| Modelo | Entrada (150 M) | Saída (40 M) | Total no mês | Por conversa |
|---|---|---|---|---|
| Claude Fable 5.1 | $1.500,00 | $2.000,00 | $3.500,00 | $0,035 |
| Claude Sonnet 5 | $300,00 | $400,00 | $700,00 | $0,007 |
| Gemini 3.8 Flash | $112,50 | $150,00 | $262,50 | $0,002625 |
| GPT-5.6 Luna | $30,00 | $48,00 | $78,00 | $0,00078 |
| Mistral Small 4 | $22,50 | $24,00 | $46,50 | $0,000465 |
A saída é só 21% dos tokens, mas responde por 57% da fatura no Claude Fable 5.1, no Claude Sonnet 5 e no Gemini 3.8 Flash, e por 61,5% no GPT-5.6 Luna. Se as respostas crescerem para 800 tokens, a fatura do Claude Sonnet 5 sobe de $700 para $1.100 (+57%); se, em vez disso, o contexto dobrar para 3.000 tokens, ela sobe para $1.000 (+43%). Encurtar respostas economiza mais do que encurtar o prompt.
O preço combinado também dá uma aproximação: 190 milhões de tokens a $4 do Claude Sonnet 5 dão $760, 8,6% acima do cálculo exato. A diferença existe porque essa carga tem 3,75 tokens de entrada para cada token de saída, mais do que o 3:1 suposto. Para um orçamento, use sempre as duas tarifas separadamente.
Documentação: Anthropic: preços do Claude Fable 5.1 e do Claude Sonnet 5 ↗ · Google: preços do Gemini 3.8 Flash ↗ · OpenAI: preços do GPT-5.6 Luna ↗ · Mistral: preços do Mistral Small 4 ↗
4. Condições que mudam o preço de tabela#
A tabela mostra preços padrão e exclui os descontos de cache e de lote. Esses descontos, e algumas condições de tarifa, podem mexer mais na sua fatura do que trocar de modelo, então vale a pena lê-los na página de cada provedor antes de decidir.
- Lote: a OpenAI e a Anthropic documentam 50% de desconto para requisições assíncronas enviadas pelas suas APIs de lote. Serve para classificações, resumos ou avaliações que podem esperar.
- Cache de prompts: a OpenAI cobra a entrada em cache a 10% do preço padrão de entrada. A Anthropic cobra as leituras de cache a 0,1 vez o preço base (0,025 vez no Claude Fable 5.1) e as gravações a 1,25 vez (cache de 5 minutos) ou 2 vezes (cache de 1 hora).
- Horário: a DeepSeek cobra metade fora do horário de pico, que vai das 01:00 às 04:00 e das 06:00 às 10:00 UTC, de segunda a sexta, exceto feriados da China. A tabela usa a tarifa de pico.
- Tamanho do prompt: o Grok 4.6 cobra $4 de entrada e $12 de saída por milhão quando o prompt passa de 200.000 tokens, o dobro da tarifa base.
- Mudanças anunciadas: o Google publica os $0,75 e $3,75 do Gemini 3.8 Flash como válidos até 31 de dezembro de 2026; a partir de 1º de janeiro de 2027 passam a $1,50 e $7,50.
Também há boas notícias que não aparecem numa tabela: a Anthropic confirmou que os $2 e $10 do Claude Sonnet 5, anunciados como preço promocional de lançamento, agora são o preço padrão e que o aumento previsto para 1º de setembro não vai acontecer. Registre a data em que você verificou cada condição junto com o orçamento.
Documentação: OpenAI: lote e entrada em cache ↗ · Anthropic: cache de prompts e API de lote ↗ · DeepSeek: tarifas de pico e fora de pico ↗ · xAI: tarifas do Grok 4.6 por tamanho do prompt ↗ · Google: mudança de preço do Gemini 3.8 Flash ↗
5. Como escolher conforme a tarefa#
O preço é um filtro, não o critério final. Um modelo barato que falha e obriga a repetir a chamada pode acabar custando mais por tarefa resolvida. A ordem sensata é descrever o formato da sua carga, pré-selecionar por preço e contexto e decidir com uma avaliação sobre os seus próprios casos.
| Tipo de tarefa | O que domina a fatura | O que olhar primeiro |
|---|---|---|
| Classificar, extrair ou rotear | Entrada: respostas de poucas dezenas de tokens | Preço de entrada e saída estruturada; aqui competem Mistral Small 4, Ministral 3 · 14B e GPT-5.6 Luna |
| Chat e suporte | Saída e contexto que cresce a cada turno | Preço de saída, cache do histórico e limite de tamanho das respostas |
| Geração de código | Saída longa e novas tentativas | Qualidade nos seus testes; o Codestral · 25.08 tem preço baixo, mas 128.000 tokens de contexto |
| Documentos longos e RAG | Entrada muito grande por requisição | Janela de contexto e sobretaxas por tamanho, como a do Grok 4.6 acima de 200.000 tokens |
| Agentes com ferramentas | Entrada: o contexto é reenviado a cada passo | Cache de prompts e limite de passos por tarefa |
Para a pré-seleção, o ranking de preço da Codifly ordena os modelos por custo e o ranking de custo-benefício cruza custo e desempenho. A calculadora de custos de IA faz a conta da seção 3 com o seu volume e a sua proporção entre entrada e saída, e o comparador de modelos de IA mostra limites e condições de cada ficha. Com dois ou três candidatos, rode a avaliação: o guia para escolher um LLM para produção descreve o processo completo.
Para se aprofundarComo escolher um LLM para produção sem depender do ranking
Documentação: Anthropic: janela de contexto do Claude Haiku 4.5 ↗ · Mistral: contexto do Codestral 25.08 ↗
6. Mantenha os números em dia#
Os preços das APIs de IA mudam mais rápido do que quase qualquer outra tarifa de nuvem: surgem modelos novos, os anteriores viram legado e alguns provedores anunciam mudanças com data marcada. Um orçamento montado em março pode estar defasado em setembro.
Os números deste guia vêm do dataset aberto de preços de APIs de IA da Codifly, publicado em JSON e CSV sob licença CC BY 4.0: você pode usá-lo em notebooks, artigos ou produtos desde que cite a fonte. Cada linha traz entrada, saída, preço combinado, janela de contexto, saída máxima e os links para as páginas oficiais, e o campo reviewed_at indica a data da última revisão. Para mostrar os preços no seu site, a página de dados abertos oferece um widget incorporável que aceita idioma, tema e número de modelos.
curl -s https://codifly.co/data/ai-models.json \
| jq -r '.reviewed_at, (.models | sort_by(.blended_usd_per_mtok) | .[:5][]
| "\(.name)\t\(.input_usd_per_mtok)\t\(.output_usd_per_mtok)")'- Automatize uma consulta semanal ao dataset e compare o reviewed_at com a data do seu último orçamento.
- Guarde os tokens faturados por modelo e por funcionalidade: sem esse dado você não saberá qual mudança de preço afeta você.
- Antes de assinar um compromisso, abra a página oficial do provedor; o dataset é um ponto de partida, não um contrato.
Documentação: Codifly: dataset aberto de preços de APIs de IA (JSON) ↗ · Creative Commons: licença CC BY 4.0 ↗
Fontes e escopo
Documentação consultada em 27 de setembro de 2026. Os exemplos e critérios de decisão são propostas editoriais; adapte-os ao contrato da sua aplicação e valide-os no seu ambiente de testes autorizado.
- OpenAI: lote e entrada em cache ↗
- Anthropic: janela de contexto do Claude Haiku 4.5 ↗
- Google: mudança de preço do Gemini 3.8 Flash ↗
- DeepSeek: tarifas de pico e fora de pico ↗
- xAI: tarifas do Grok 4.6 por tamanho do prompt ↗
- Mistral: Ministral 3 14B ↗
- Mistral: preços do Mistral Small 4 ↗
- Mistral: contexto do Codestral 25.08 ↗
- Mistral: Mistral Large 3 ↗
- Mistral: Mistral Medium 3.5 ↗
- Anthropic: cache de prompts e API de lote ↗
- Codifly: dataset aberto de preços de APIs de IA (JSON) ↗
- Creative Commons: licença CC BY 4.0 ↗