Top 3 · Custo-benefício
- 01Gemini 3.8 Flash$1.50 · preço combinado34.0 pts/USD
- 02GPT-5.6 Terra$4.50 · preço combinado11.4 pts/USD
- 03GPT-5.6 Sol$8.00 · preço combinado6.9 pts/USD
Meça tokens por requisição e pague o modelo caro só quando precisar
A conta de IA cresce por três motivos: o modelo escolhido, os tokens por requisição e o número de requisições. Quase sempre se ataca só o primeiro, trocando por um modelo mais barato, quando os outros dois costumam ter tanta folga quanto ou mais. Um prompt de sistema inchado, um histórico reenviado inteiro ou uma resposta mais longa do que alguém lê são pagos em cada chamada, multiplicados por todo o seu tráfego.
Para comparar modelos com um único número usamos o preço combinado, uma mistura dos preços de entrada e de saída numa proporção típica. Os nossos preços são os padrão publicados por cada provedor, sem cache nem desconto de lote. Esses descontos existem e podem reduzir o seu custo real, mas dependem de como o seu tráfego se comporta. Por isso o primeiro passo é medir as suas próprias requisições antes de otimizar qualquer coisa.
Registre por requisição os tokens de entrada e de saída, o modelo usado e a funcionalidade do produto que a originou. Com uma semana de dados você sabe quais funcionalidades concentram o gasto e qual é a proporção real entre entrada e saída. Sem essa base, qualquer otimização é chute.
Classifique as tarefas por dificuldade e mande as simples, como extração, classificação ou respostas curtas, para um modelo barato, deixando o caro para raciocínio complexo. Valide com um conjunto de teste que o barato mantém a qualidade mínima no grupo dele. Acompanhe quantas requisições são escaladas e o custo médio resultante.
O cache de prompt compensa quando muitas requisições repetem um prefixo longo, como instruções ou documentos fixos. O processamento em lote serve para trabalho que tolera horas de espera. Os nossos preços não incluem esses descontos; leia as condições de cada provedor e calcule o seu caso com a parcela de tokens que realmente se repete.
Enxugue o prompt de sistema, resuma o histórico em vez de reenviá-lo inteiro, recupere só os trechos relevantes e limite o tamanho da saída. Mude uma coisa de cada vez e compare a qualidade no seu conjunto de teste e a média de tokens por requisição antes e depois de cada ajuste.
Coloque na calculadora a sua média de tokens de entrada e saída e o volume mensal, e compare candidatos com preços oficiais. Depois rode o novo modelo numa amostra real: a mesma tarefa pode gerar respostas mais longas ou exigir mais tentativas, e isso muda o custo final.
Conte o seu volume e as opções que você avalia. Respondemos por escrito com os números do seu uso real; sem compromisso.
Nenhum provedor paga pela sua posição. Os índices são da LLM Stats; os preços, da API padrão de cada provedor. Como medimos
Análises, guias e novos comparativos de tecnologia.