Calculadora de Custos de APIs de IA ⚡

Simule o consumo de tokens e compare os preços cobrados pelas principais provedoras do mercado (Google, OpenAI, Anthropic, DeepSeek e Meta). Encontre a opção mais custo-benefício para o seu projeto.

Estimativa de Custo Comparado

Melhor Custo-Benefício 🏆

GPT-4o Mini

Provedora: OpenAI • Contexto: 128K tokens

O modelo econômico da família GPT-4 da OpenAI (GPT-4o Mini), ideal para tarefas de baixo custo e alta escala. Preços e janela de contexto atualizados a partir de Agosto de 2026.

Tarifas base (1M tokens):Entrada: R$ 0.87Saída: R$ 3.48
R$ 78,30R$ 0,0783 / reqTotal mensal (1.000 reqs)

DeepSeek V4.1 Flash

Provedora: DeepSeek • Contexto: 1M tokens

Lançado em 10 de setembro de 2026, o DeepSeek V4.1 Flash substitui o DeepSeek V4 Flash (agora aposentado, com chamadas antigas redirecionadas automaticamente) e passou a receber também o tráfego do V4 Pro a partir de 14 de setembro de 2026. Preço aqui reflete o horário fora de pico; no horário de pico (01h-04h e 06h-10h UTC, seg-sex) os preços dobram para US$ 0.30/M entrada e US$ 1.20/M saída. Suporta 1M tokens de contexto e compreensão nativa de imagens.

Tarifas base (1M tokens):Entrada: R$ 0.87Saída: R$ 3.48
R$ 78,30R$ 0,0783 / reqTotal mensal (1.000 reqs)

Mistral Small 4

Provedora: Mistral AI • Contexto: 256K tokens

O modelo otimizado da Mistral AI (Mistral Small 4), que oferece um bom equilíbrio entre desempenho e custo para uma ampla gama de tarefas. Preços e janela de contexto atualizados a partir de Agosto de 2026.

Tarifas base (1M tokens):Entrada: R$ 0.87Saída: R$ 3.48
R$ 78,30R$ 0,0783 / reqTotal mensal (1.000 reqs)

Claude 3 Haiku

Provedora: Anthropic • Contexto: 200K tokens

O modelo mais rápido e econômico da família Claude da Anthropic (Claude 3 Haiku), ideal para tarefas de alto desempenho e baixo custo, com até 200K de contexto. Preços atualizados a partir de Agosto de 2026.

Tarifas base (1M tokens):Entrada: R$ 1.45Saída: R$ 7.25
R$ 145,00R$ 0,15 / reqTotal mensal (1.000 reqs)

Mistral Large 3

Provedora: Mistral AI • Contexto: 128K tokens

O modelo flagship da Mistral AI (Mistral Large 3), com raciocínio avançado e capacidades multimodais. Preços e janela de contexto atualizados a partir de Agosto de 2026.

Tarifas base (1M tokens):Entrada: R$ 2.90Saída: R$ 8.70
R$ 232,00R$ 0,23 / reqTotal mensal (1.000 reqs)

GPT-3.5 Turbo

Provedora: OpenAI • Contexto: 16K tokens

Um modelo econômico e eficiente da OpenAI, otimizado para chat e diversas tarefas de linguagem, com 16K de contexto. Desligamento programado pela OpenAI para 23 de outubro de 2026 (gpt-3.5-turbo-instruct desliga em 28 de setembro de 2026); requisições serão redirecionadas automaticamente após essa data. Preços e janela de contexto atualizados a partir de Agosto de 2026.

Tarifas base (1M tokens):Entrada: R$ 2.90Saída: R$ 8.70
R$ 232,00R$ 0,23 / reqTotal mensal (1.000 reqs)

Llama 3.3 70B Instruct (via Together AI)

Provedora: Meta (via API) • Contexto: 131K tokens

Versão avançada do modelo open-source Llama 3.3 (Llama-3.3-70b-instruct), poderosa via API Together AI. Oferece 131K de contexto. Preços atualizados a partir de Agosto de 2026.

Tarifas base (1M tokens):Entrada: R$ 6.03Saída: R$ 6.03
R$ 361,92R$ 0,36 / reqTotal mensal (1.000 reqs)

Gemini 3.6 Flash

Provedora: Google • Contexto: 1M tokens

O modelo Flash da Google (Gemini 3.6 Flash), otimizado para tarefas de alta frequência e baixo custo, com até 1M de contexto. Desde 13 de agosto de 2026, a Google igualou o preço do 3.6 Flash ao preço introdutório do Gemini 3.7 Flash (corte de 50%); a promoção vale até 31 de dezembro de 2026, quando o preço volta a US$ 1.50/US$ 7.50 por milhão de tokens.

Tarifas base (1M tokens):Entrada: R$ 4.35Saída: R$ 21.75
R$ 435,00R$ 0,44 / reqTotal mensal (1.000 reqs)

Gemini 3.7 Flash

Provedora: Google • Contexto: 1M tokens

Modelo Flash da Google (Gemini 3.7 Flash), lançado em 13 de Agosto de 2026, voltado a codificação e agentes, com 1M de contexto. Em 2 de setembro de 2026 a Google lançou o sucessor Gemini 3.8 Flash, com foco reforçado em engenharia de software e tarefas agênticas, mantendo o mesmo preço promocional de $0.75/M entrada e $3.75/M saída até 31 de Dezembro de 2026 (quando ambos sobem para $1.50/M entrada e $7.50/M saída).

Tarifas base (1M tokens):Entrada: R$ 4.35Saída: R$ 21.75
R$ 435,00R$ 0,44 / reqTotal mensal (1.000 reqs)

Mistral Medium 3.5

Provedora: Mistral AI • Contexto: 262K tokens

O modelo intermediário da Mistral AI (Mistral Medium 3.5), oferecendo um equilíbrio entre inteligência e custo. Preços e janela de contexto atualizados a partir de Agosto de 2026.

Tarifas base (1M tokens):Entrada: R$ 8.70Saída: R$ 43.50
R$ 870,00R$ 0,87 / reqTotal mensal (1.000 reqs)

Claude 3 Sonnet

Provedora: Anthropic • Contexto: 200K tokens

O modelo intermediário da família Claude da Anthropic (Claude 3 Sonnet), um equilíbrio entre inteligência e velocidade para cargas de trabalho empresariais, com 200K de contexto. Preço de $2.00/M entrada e $10.00/M saída tornado permanente pela Anthropic em 11 de Agosto de 2026 (o aumento para $3.00/$15.00 previsto para 1º de Setembro de 2026 foi cancelado).

Tarifas base (1M tokens):Entrada: R$ 11.60Saída: R$ 58.00
R$ 1.160,00R$ 1,16 / reqTotal mensal (1.000 reqs)

Gemini 3.1 Pro

Provedora: Google • Contexto: 200K tokens

O modelo Pro mais recente da Google (Gemini 3.1 Pro), com raciocínio avançado. Preços atualizados a partir de Agosto de 2026 para contextos até 200K tokens (preços diferenciados para contextos maiores).

Tarifas base (1M tokens):Entrada: R$ 11.60Saída: R$ 69.60
R$ 1.276,00R$ 1,28 / reqTotal mensal (1.000 reqs)

GPT-4o

Provedora: OpenAI • Contexto: 128K tokens

O modelo flagship da OpenAI (GPT-4o), com capacidades avançadas e multimodalidade. Preços e janela de contexto atualizados a partir de Agosto de 2026.

Tarifas base (1M tokens):Entrada: R$ 14.50Saída: R$ 58.00
R$ 1.305,00R$ 1,31 / reqTotal mensal (1.000 reqs)

Command A

Provedora: Cohere • Contexto: 256K tokens

O mais novo modelo flagship da Cohere (Command A), com uma janela de contexto de 256K tokens, otimizado para raciocínio avançado, fluxos de trabalho agênticos e capacidades multilingues. Preços e janela de contexto atualizados a partir de Agosto de 2026.

Tarifas base (1M tokens):Entrada: R$ 14.50Saída: R$ 58.00
R$ 1.305,00R$ 1,31 / reqTotal mensal (1.000 reqs)

Command R+

Provedora: Cohere • Contexto: 128K tokens

O modelo flagship da Cohere (Command R+), com uma janela de contexto de 128K tokens e otimizado para raciocínio avançado e fluxos de trabalho agênticos. Preços e janela de contexto atualizados a partir de Agosto de 2026.

Tarifas base (1M tokens):Entrada: R$ 14.50Saída: R$ 58.00
R$ 1.305,00R$ 1,31 / reqTotal mensal (1.000 reqs)

Claude 3 Opus

Provedora: Anthropic • Contexto: 200K tokens

O modelo mais inteligente da família Claude da Anthropic (Claude 3 Opus), construído para raciocínio exigente e trabalho agêntico de longo prazo, com 200K de contexto (capaz de lidar com mais de 1M de tokens). Preços atualizados a partir de Agosto de 2026.

Tarifas base (1M tokens):Entrada: R$ 29.00Saída: R$ 145.00
R$ 2.900,00R$ 2,90 / reqTotal mensal (1.000 reqs)

GPT-4 Turbo

Provedora: OpenAI • Contexto: 128K tokens

O modelo GPT-4 Turbo da OpenAI, que equilibra inteligência e custo, com visão e capacidades de função. Desligamento programado pela OpenAI para 23 de outubro de 2026, com gpt-5.6-sol como substituto recomendado. Preços e janela de contexto atualizados a partir de Agosto de 2026.

Tarifas base (1M tokens):Entrada: R$ 58.00Saída: R$ 174.00
R$ 4.640,00R$ 4,64 / reqTotal mensal (1.000 reqs)

GPT-6 Astra

Provedora: OpenAI • Contexto: 1.05M tokens

Lançado em 3 de setembro de 2026 e, desde 14 de setembro de 2026, modelo padrão do ChatGPT Plus, Pro, Business e Enterprise no chat comum. Primeiro modelo da OpenAI a atingir o nível "Crítico" de capacidade cibernética no Preparedness Framework da empresa. Entrada em cache custa US$ 1.00/M tokens; saída máxima de 128K tokens.

Tarifas base (1M tokens):Entrada: R$ 58.00Saída: R$ 290.00
R$ 5.800,00R$ 5,80 / reqTotal mensal (1.000 reqs)

Como funciona a precificação de APIs de Inteligência Artificial?

A maioria das provedoras de modelos de linguagem de grande porte (LLMs) como OpenAI, Google, Anthropic e DeepSeek utiliza um modelo de cobrança baseado em tokens. Você paga uma tarifa por milhão (1M) de tokens enviados para a API (entrada/prompt) e outra tarifa por milhão de tokens gerados pelo modelo (saída/resposta).

O que é um Token?

Um token é uma fração de palavra. Em média, 100 tokens equivalem a aproximadamente 75 palavras em inglês. Em português e outros idiomas latinos, a contagem de tokens costuma ser ligeiramente maior por conta de acentuações e estrutura silábica.

  • Tokens de Entrada: Incluem o prompt que você digita, instruções do sistema, histórico anterior do chat e quaisquer arquivos ou imagens anexados.
  • Tokens de Saída: É o texto bruto produzido pela IA como resposta final. Geralmente, os tokens de saída são significativamente mais caros do que os de entrada devido ao poder computacional necessário para a geração autorregressiva.

Dicas para economizar custos de API

Se você está desenvolvendo um aplicativo ou integrando IA em seus sistemas internos, os custos podem escalar rapidamente. Aqui estão algumas das melhores práticas para otimização de orçamento:

  1. Use Modelos Compactos (como Gemini 2.5 Flash ou GPT-4o mini): Modelos menores são de 10x a 20x mais baratos que seus equivalentes "Pro/Sonnet" e são excelentes para 90% das tarefas cotidianas de classificação, resumo e formatação de dados.
  2. Implemente Caching de Contexto: Provedoras como DeepSeek e Anthropic oferecem descontos significativos (de até 90%) em tokens de entrada repetidos quando você ativa o cache para prompts longos ou bases de conhecimento estáticas.
  3. Limite o tamanho da resposta: Use o parâmetro max_tokens nas requisições da API para evitar que o modelo se estenda desnecessariamente na resposta, poupando tokens de saída.
  4. Otimize o histórico do chat: Em chats contínuos, limpe ou sumarize as mensagens antigas para evitar reenviar um histórico gigantesco a cada nova interação.

Para escolher o modelo mais adequado além do custo, use o nosso comparador de IAs. Se precisar de ajuda para escrever prompts mais eficientes e reduzir tokens desnecessários, explore a biblioteca de prompts.


Perguntas Frequentes sobre Custos de APIs de IA

Quanto custa a API do ChatGPT?

O GPT-4o mini custa cerca de US$ 0,15 por 1M tokens de entrada e US$ 0,60 por 1M tokens de saída. O GPT-4o custa US$ 2,50/1M de entrada e US$ 10/1M de saída. Use a calculadora acima para simular o custo exato no seu volume.

Como calcular o custo de tokens de uma API de IA?

Multiplique o número estimado de tokens de entrada pelo preço por milhão de tokens de entrada, e faça o mesmo para os tokens de saída. Some os dois valores. Em média, 1.000 palavras em português equivalem a aproximadamente 1.300 tokens.

Qual API de IA é mais barata?

Para tarefas cotidianas, o Gemini 2.5 Flash e o DeepSeek V3 estão entre as opções mais baratas do mercado, custando menos de US$ 0,30 por 1M de tokens de entrada. A calculadora acima compara os preços atuais de todos os principais modelos.

A calculadora de custos de IA é gratuita?

Sim. É 100% gratuita e não exige cadastro. Basta inserir o volume estimado de tokens e ver a comparação de custo entre os modelos na hora.