OpenAI corta preços da API em 80%: o que muda em 2026?
18 August 2026 · Atualizado 18 August 2026

Gabriel Caetano
ARTIFICIAL INTELIGENCE
OpenAI corta preços da API em 80%: o que muda em 2026?
A OpenAI reduziu em 80% o preço da API do GPT-5.6 Luna e em 20% o do Terra. Veja os novos preços de 2026, os modelos com melhor relação custo-benefício, a concorrência e como reduzir ainda mais a sua fatura de IA.

A OpenAI Baixou o Preço em 80%: O Guia Completo 2026 para APIs de IA Mais Baratas
A OpenAI baixou o preço em 80% no GPT-5.6 Luna a 30 de julho de 2026, passando de $1/$6 para $0,20 por milhão de tokens de entrada e $1,20 por milhão de tokens de saída. A empresa reduziu o preço do Terra em 20%, para $2 por milhão de tokens de entrada e $12 por milhão de tokens de saída, e cortou o custo do Luna em 80%, para 20 cêntimos por milhão de tokens de entrada e $1,20 por milhão de tokens de saída. Dito isto, o famoso corte de 80% aplica-se apenas a um nível específico, não a toda a gama, por isso a tua poupança real depende de qual modelo estás efetivamente a usar.
Se constróis com, pagas ou fazes orçamento à volta da OpenAI, esta é uma das mudanças de preços mais relevantes do ano. Segue-se a explicação completa: quais os modelos que ficaram mais baratos, porque é que isto aconteceu, como é que a OpenAI se compara agora com a Google, a Anthropic e o universo open-source, e como espremer cada cêntimo da tua fatura da API. E como as subscrições de IA continuam a ser cobradas mensalmente em dólares, vamos também abordar a forma discreta como a maioria das pessoas perde dinheiro em cada renovação, e como travar isso.
Este guia foi escrito a pensar em programadores individuais, startups atentas aos custos e empresas com cargas de trabalho em produção. Os números importam, por isso verificámo-los face à cobertura mais recente de 2026 ao longo de todo o artigo.
Pagas ChatGPT, Claude ou Gemini todos os meses? A Bleap cobra 0% de taxas de câmbio nas tuas subscrições em USD e dá 20% de cashback fixo nas renovações do Claude, ChatGPT e Gemini, com um cartão Mastercard self-custodial e sem qualquer subscrição própria. (O cashback de 20% aplica-se apenas ao Claude, ChatGPT e Gemini.) Obtém o cartão Bleap →
1. O Que Aconteceu Exatamente? Os Cortes de Preços da OpenAI em 2026 Explicados
O Anúncio Oficial, a Cronologia e os Modelos Afetados
O centro desta história é uma medida única e agressiva. A OpenAI cortou o preço do seu modelo GPT-5.6 Luna em 80% a 30 de julho de 2026, apenas três semanas depois do lançamento público total da família GPT-5.6. O Terra também baixou 20%, enquanto o nível topo de gama, o Sol, ficou inalterado.
O timing é o que fez levantar sobrancelhas em toda a indústria. A OpenAI anunciou que está a reduzir o preço de dois dos seus modelos de inteligência artificial mais recentes, o GPT-5.6 Terra e o GPT-5.6 Luna, cerca de três semanas depois do seu lançamento público. As empresas não costumam mudar o preço de um produto tão depressa, a não ser que o mercado as tenha forçado a isso. A família GPT-5.6 foi lançada a 9 de julho, com o Sol como o modelo principal, o Terra como opção intermédia e o Luna como a opção mais económica, e três semanas é muito pouco tempo para rever esses preços, o que sugere que os valores iniciais não corresponderam ao que a OpenAI esperava face às alternativas que os clientes estavam a avaliar.
A OpenAI apresentou a mudança como uma questão de eficiência, e não de desespero. "A nossa estratégia continua focada em avançar tanto na capacidade como na eficiência, para que cada geração de inteligência consiga realizar mais trabalho a um custo mais baixo", afirmou a OpenAI num comunicado. Estas alterações aplicam-se aos preços da API que os programadores pagam por token. Os planos de consumidor do ChatGPT são um produto separado, com o seu próprio preço mensal.
Os Novos Valores de Preços: Uma Análise Completa do Custo por Token
É exatamente aqui que se encaixa o valor de 80%, e é assim que compara com o resto da gama. Todos os valores são por milhão de tokens no nível padrão, em USD, que é a forma como o preço dos tokens é indicado a nível global.
Modelo | Entrada anterior | Saída anterior | Entrada nova | Saída nova | Redução |
|---|---|---|---|---|---|
GPT-5.6 Luna | $1,00 | $6,00 | $0,20 | $1,20 | 80% |
GPT-5.6 Terra | $2,50 | $15,00 | $2,00 | $12,00 | 20% |
GPT-5.6 Sol | $5,00 | $30,00 | $5,00 | $30,00 | 0% |
GPT-5 | N/D | N/D | $1,25 | $10,00 | N/D |
GPT-4.1 | N/D | N/D | $2,00 | $8,00 | N/D |
GPT-4.1 Mini | N/D | N/D | $0,40 | $1,60 | N/D |
GPT-4.1 Nano | N/D | N/D | $0,10 | $0,40 | N/D |
GPT-4o (legado) | N/D | N/D | $2,50 | $10,00 | N/D |
GPT-4o mini | N/D | N/D | $0,15 | $0,60 | N/D |
o3 (raciocínio) | N/D | N/D | $2,00 | $8,00 | N/D |
o4-mini (raciocínio) | N/D | N/D | $1,10 | $4,40 | N/D |
Os números centrais por detrás do corte são claros. O Luna passa agora a custar $0,20 por milhão de tokens de entrada e $1,20 por milhão de tokens de saída, uma descida em relação aos $1 e $6 anteriores, e os preços do Terra baixaram para $2 por milhão de tokens de entrada e $12 por milhão de tokens de saída, face aos $2,50 e $15 de antes.
Há sempre dois preços a considerar, não um. Os tokens de entrada são o que envias para o modelo: o teu prompt, instruções do sistema, documentos e histórico de conversa. Os tokens de saída são o que o modelo gera como resposta. Na maioria dos modelos, a saída custa várias vezes mais do que a entrada, e é por isso que um modelo tagarela e verboso pode acabar por custar mais do que um modelo conciso, mesmo com a mesma tarifa base.
Vale a pena conhecer o panorama geral. O GPT-4o custa $2,50 por milhão de tokens de entrada e $10 por milhão de saída em 2026, enquanto o GPT-4o mini fica em $0,15/$0,60 e o modelo de raciocínio o3 ronda os $2/$8 depois dos cortes de preço. Os preços mantêm-se em $2/1M de entrada e $8/1M de saída para o GPT-4.1, $0,40/$1,60 para o GPT-4.1 Mini, $0,10/$0,40 para o GPT-4.1 Nano, e o GPT-5 situa-se em $1,25/$10.
Destaque: O que é um token? Um token é um pedaço de texto, aproximadamente 4 carateres ou cerca de três quartos de uma palavra em inglês. A frase que estás a ler tem à volta de 15 tokens. Os preços são apresentados por milhão de tokens porque as cargas de trabalho reais atingem facilmente os milhares de milhões. Como referência aproximada, 1 milhão de tokens equivale a cerca de 750.000 palavras, ou seja, aproximadamente dez romances de tamanho normal.
Que Alterações de Preço Atingiram os 80%, e Quais Não Atingiram
A nuance importante é esta: nem todos os modelos baixaram 80%, e a maioria nem sequer baixou nesta ronda. O valor de 80% pertence especificamente ao Luna, o nível mais barato e mais rápido. O Luna passou de $1/$6 para $0,20/$1,20 por milhão de tokens de entrada/saída, uma redução de 80% tanto no preço de entrada como no de saída, tornando o Luna num dos modelos capazes mais baratos disponíveis por parte de um fornecedor de topo.
O Terra teve um corte significativo, mas mais modesto, de 20%, e o Sol, o modelo topo de gama, manteve o preço. A OpenAI reduziu o custo do seu modelo GPT-5.6 Luna em 80 por cento e baixou os preços do modelo Terra em 20 por cento, não tendo feito qualquer alteração ao preço do Sol, o seu modelo mais avançado.
Então, quanto poupa realmente um utilizador típico? Depende inteiramente de onde se encaixa a sua utilização. Se executar tarefas simples e de grande volume no Luna, a sua fatura acabou de cair cerca de 80%. Se o seu trabalho depende do Sol para raciocínio de ponta, não poupou nada diretamente, embora a jogada inteligente seja muitas vezes transferir o trabalho elegível para os níveis agora mais baratos. A razão pela qual essa mudança funciona é a evolução das capacidades. Segundo a OpenAI, as melhorias no GPT-5.6 permitem que o Luna e o Terra lidem com cargas de trabalho que antes exigiam um modelo premium, o que significa que os clientes conseguem concluir muitas tarefas de IA utilizando sistemas mais baratos sem uma quebra significativa de capacidade.
2. Porque É Que a OpenAI Cortou os Preços de Forma Tão Drástica?
Ganhos de Eficiência de Hardware, a História da Computação
A parte mais impressionante deste corte de preços é a forma como a OpenAI o financiou. A empresa afirma que foi o seu próprio modelo que fez o trabalho de engenharia. Num processo liderado por humanos, o Sol reescreveu e otimizou de forma autónoma kernels de GPU em produção e realizou centenas de experiências para melhorar a geração de tokens; o trabalho ao nível dos kernels reduziu o custo total de servir o modelo em cerca de 20%, e as experiências aumentaram a eficiência da geração de tokens em mais de 15%.
A narrativa pública da OpenAI é que a eficiência do nível topo de gama subsidia os níveis mais económicos. A narrativa interna da OpenAI, partilhada publicamente, é que a stack de inferência otimizada do Sol é precisamente o que financia os cortes no Luna e no Terra: uma melhor eficiência no topo da gama cria margem para competir de forma mais agressiva nos níveis onde está, de facto, o volume de negócio. O princípio geral aqui é simples. À medida que a inferência se torna mais eficiente por consulta, o custo marginal de servir cada token diminui, e, à escala da OpenAI, mesmo uma melhoria de 20% no custo de serviço traduz-se em poupanças absolutas enormes que podem ser repassadas.
A empresa também apresenta isto como o início de um padrão recorrente, e não como um caso isolado. A OpenAI descreve isto como um ciclo autorreforçado: à medida que os seus modelos melhoram no trabalho autónomo, as futuras rondas de poupança de custos poderão surgir mais depressa.
Pressão Concorrencial Intensa da Concorrência
A eficiência é a razão apresentada, mas a concorrência é a pressão por detrás dela. As duas semanas antes da decisão da OpenAI foram bastante movimentadas. A Anthropic lançou o Claude Opus 5 a 24 de julho, a $5/$25 por milhão de tokens de entrada/saída, oferecendo um desempenho próximo do Fable 5 por um custo semelhante ao do seu antecessor, e a Google lançou o Gemini 3.6 Flash a $1,50/$7,50 por milhão de tokens, com uma melhoria de eficiência de 17%, no mesmo mês.
A pressão não vem apenas dos habituais laboratórios norte-americanos. Os modelos chineses de baixo custo já conquistaram uma quota de mercado real. Uma investigação da CNBC publicada a 7 de julho de 2026 revelou que os modelos chineses captaram 46% do uso empresarial de tokens nos EUA na OpenRouter, chegando por vezes a ultrapassar os modelos de origem norte-americana, e o DeepSeek V4 Pro, por exemplo, tem um preço de $0,435/$0,87 por milhão de tokens, beneficiando de um desconto promocional permanente de 75%.
No conjunto, a pressão competitiva vem de todas as direções: rivais premium a igualar capacidades a custos mais baixos, modelos de gama média a competir pelo preço, e modelos abertos ou com desconto a redefinir o que significa "barato". Estas mudanças reforçam a posição da OpenAI face a rivais como a Anthropic, cujos modelos Claude continuam a ser amplamente utilizados mas têm custos de utilização mais elevados, enquanto concorrentes chineses de código aberto, incluindo a Z.ai, elevaram ainda mais a fasquia ao oferecer sistemas de IA capazes a preços substancialmente mais baixos.
Objetivos Estratégicos da OpenAI, Quota de Mercado e Alcance do Ecossistema
Existe uma lógica de conquista de território por trás do corte de preços nos níveis onde a utilização é maior. Modelos de entrada e de gama média mais baratos atraem mais programadores, que criam mais produtos, que trazem mais utilizadores, que geram mais utilização. A OpenAI reformulou os preços da sua gama de IA, baixando significativamente o custo dos seus modelos de entrada e de gama média, à medida que a concorrência no mercado da IA generativa se intensifica e as empresas exigem opções mais acessíveis.
A escala que a OpenAI está a defender é enorme, e esta medida de preços surgiu a par de um marco importante. A OpenAI revelou que os seus modelos alcançam agora mais de mil milhões de utilizadores ativos e mais de dois milhões de empresas, um anúncio que se seguiu às reduções de preço em dois modelos da sua família GPT-5.6.
A sensibilidade ao custo é agora um fator decisivo para os compradores, e não uma questão secundária. A empresa enfrenta pressão para responder a uma base de clientes mais atenta aos custos, onde as empresas têm mostrado menos disposição para implementar modelos dispendiosos sem uma noção clara do retorno do investimento. Os dias do uso ilimitado e despreocupado com custos de IA estão a chegar ao fim. A OpenAI deu o pontapé de saída ao boom da IA com o lançamento do ChatGPT em 2022, levando as empresas a correrem para adotar a tecnologia, e assim nasceu a era do chamado "tokenmaxxing", em que as entidades empregadoras incentivavam os colaboradores a usar o máximo de IA possível sem se preocuparem com os custos.
O Papel das Arquiteturas de Modelos Mais Recentes e Eficientes
Na base de tudo isto está uma marcha constante rumo a designs de modelos mais eficientes. As gerações mais recentes fazem mais por cada unidade de computação, e os níveis "mini" e "nano" são concebidos especificamente para lidar com a maior parte do trabalho do dia a dia a uma fração do custo dos modelos topo de gama. É por isso que um modelo da classe Luna consegue agora absorver tarefas que antes exigiam um modelo premium.
A tendência mais alargada já está em curso há mais de um ano. Os preços dos modelos de fronteira têm vindo a cair de forma generalizada desde o início de 2025, impulsionados por uma combinação de ganhos de eficiência na inferência, melhorias nos modelos de pesos abertos e movimentos competitivos deliberados. A economia por trás disto é real e preocupante: mesmo a estas escalas, os líderes de mercado continuam a gastar avultadas quantias. A empresa opera com prejuízo, continuando a investir no desenvolvimento de modelos e infraestrutura, tendo registado uma receita de 13,07 mil milhões de dólares em 2025 face a um prejuízo líquido de 38,5 mil milhões de dólares. Preços mais baixos aliados a despesas elevadas significam que a narrativa da eficiência não é uma opção de marketing. É a única forma de as contas fazerem sentido.
3. Guia Modelo a Modelo: Qual o Modelo OpenAI que Deve Usar em 2026?
A gama é agora vasta. Aqui fica como pensar sobre cada nível, quanto custa e a quem se destina.
GPT-5.6 Luna, o Novo Campeão da Relação Custo-Benefício
A Luna é o modelo que acabou de se tornar a grande notícia. O preço de input do GPT-5.6 Luna caiu 80% para $0,20 por milhão de tokens, face aos $1 anteriores, enquanto o preço de output desceu para $1,20, dos $6 iniciais.
A $0,20/$1,20, a Luna foi concebida para escala. É a escolha certa para cargas de trabalho de grande volume, estruturadas e sensíveis à latência: classificação, etiquetagem, encaminhamento, análise de sentimento, chat em tempo real e geração simples. A grande novidade desta ronda é que a Luna passa agora a lidar com tarefas que antes exigiam um modelo mais caro, permitindo que muitas equipas se concentrem apenas nela. Se realiza milhões de chamadas por mês em tarefas repetitivas, a Luna é o seu ponto de partida por defeito.
GPT-5.6 Terra, o Nível Intermédio e Equilibrado
A Terra ocupa o meio-termo em termos de preço e desempenho, a $2/$12 após o corte de 20%. É a opção sensata e robusta para tarefas demasiado subtis para a Luna, mas que não justificam o preço de um modelo topo de gama: suporte ao cliente com contexto real, análise de documentos, geração de conteúdos e cargas de trabalho de assistente geral. Na maioria dos pipelines de produção, a Terra é o nível para o qual só deve avançar quando a qualidade de output da Luna não for suficiente.
GPT-5.6 Sol, o Modelo Topo de Gama
A Sol é o modelo mais avançado da família e manteve o preço em $5/$30. Ganhou também uma opção de velocidade. A OpenAI anunciou um novo modo Fast para a Sol na API, que substitui a anterior oferta de Processamento Prioritário, e o modo Fast oferece uma velocidade até 2,5 vezes superior ao processamento padrão. Reserve a Sol para problemas genuinamente difíceis, onde o ganho de precisão ou capacidade é mensurável e compensa o custo extra.
GPT-4.1 e GPT-4o, as Opções de Longa Duração
Muitos sistemas em produção continuam a funcionar com a geração GPT-4, que continua a ser uma excelente opção para trabalhos com contexto extenso. O GPT-4.1 foi lançado como o substituto recomendado pela OpenAI para o GPT-4o: é mais barato, a $2/$8 em vez de $2,50/$10, tem uma janela de contexto de 1 milhão de tokens em vez de 128K, e apresenta melhores resultados nos testes de seguimento de instruções e programação. Na gama mais económica, o GPT-4.1 Nano é um dos modelos capazes mais baratos que existem. Com $0,10 por milhão de tokens de entrada, o GPT-4.1 Nano é um dos modelos capazes mais baratos disponíveis em qualquer lugar. Os utilizadores já existentes do GPT-4o mantêm, geralmente, as condições anteriores. O GPT-4o continua disponível para utilizadores existentes à tarifa antiga de $2,50/1M tokens de entrada e $10/1M tokens de saída.
O GPT-4o mini continua a ser o "cavalo de batalha" para tarefas de grande volume. Com $0,15 por milhão de tokens de entrada e $0,60 por milhão de tokens de saída, o GPT-4o mini é cerca de 17 vezes mais barato que o GPT-4o na entrada, e é a base da maioria das cargas de trabalho de classificação, extração e encaminhamento em grande escala. Em termos práticos, um milhão de chamadas curtas de classificação, com cerca de 500 tokens cada, custa menos de $80 no GPT-4o mini.
o3 e o4-mini, os Modelos de Raciocínio
Os modelos de raciocínio são uma categoria à parte, e os seus preços escondem uma armadilha. Os modelos da série o da OpenAI (o4-mini, o3, o3-pro) foram concebidos para tarefas que exigem raciocínio em múltiplos passos, como matemática, depuração de código complexo e análise científica. O o4-mini, a $1,10/$4,40 por milhão de tokens, oferece a melhor relação qualidade-preço para cargas de trabalho de raciocínio com orçamento limitado. Estes modelos também cobram os tokens de raciocínio interno às taxas de saída, pelo que o custo real pode ser 3 a 10 vezes superior ao preço base, dependendo da complexidade da tarefa.
Essa distinção é essencial de perceber antes de definir o orçamento. Uma única resposta o3 pode consumir entre 5.000 e 20.000 tokens de raciocínio interno, cobrados à taxa de output, pelo que uma tarefa que custa $0,01 no GPT-4o pode custar $0,15 ou mais no o3, apesar de preços à primeira vista semelhantes. A regra prática: para a maioria das cargas de trabalho em produção, o o4-mini oferece a melhor relação custo-benefício na categoria de raciocínio, pelo que convém reservar o o3 e o o3-pro para tarefas em que as avaliações demonstrem um ganho de precisão mensurável.
Tabela Comparativa Rápida: Modelos OpenAI de Relance
Modelo | Input $/1M | Output $/1M | Contexto | Ideal para | Velocidade |
|---|---|---|---|---|---|
GPT-5.6 Luna | $0,20 | $1,20 | 400K | Tarefas simples e de grande volume | O mais rápido |
GPT-5.6 Terra | $2,00 | $12,00 | 1M | Trabalho de produção equilibrado | Rápido |
GPT-5.6 Sol | $5,00 | $30,00 | 1M | Raciocínio de ponta | Opção de modo rápido |
GPT-4.1 | $2,00 | $8,00 | 1M | Contexto longo, programação | Rápido |
GPT-4.1 Nano | $0,10 | $0,40 | 1M | Opção mais económica e capaz | O mais rápido |
GPT-4o mini | $0,15 | $0,60 | 128K | Classificação, encaminhamento | Rápido |
o4-mini | $1,10 | $4,40 | Grande | Raciocínio económico | Moderada |
o3 | $2,00 | $8,00 | Grande | Raciocínio de alta precisão | Mais lenta |
A melhor opção para a maioria das equipas: comece com o Luna ou o GPT-4.1 Nano para volume, passe para o Terra quando a qualidade o exigir, e use o o4-mini para tarefas de raciocínio antes de recorrer ao o3.
Como Escolher o Modelo Certo, um Guia de Decisão
Simplifique com um percurso de decisão curto:
- A tarefa é simples e de grande volume? Use o Luna, o GPT-4.1 Nano ou o GPT-4o mini.
- Requer raciocínio genuíno ou cálculos matemáticos? Use primeiro o o4-mini, e só recorra ao o3 se as avaliações mostrarem uma melhoria real.
- É um trabalho de produção equilibrado com contexto real? Use o Terra ou o GPT-4.1.
- É um problema de fronteira genuinamente difícil? Use o Sol.
- A velocidade em tempo real é fundamental? Use o Luna ou o GPT-4o mini.
A regra de ouro do controlo de custos: comece com o modelo mais barato e só faça upgrade quando a qualidade não for suficiente. A maioria das equipas usa modelos mais potentes do que precisa por defeito, pagando preços de topo por trabalho que um modelo mini resolve perfeitamente.
4. Impacto no Mundo Real: Quanto é Que Pode Realmente Poupar?
As percentagens são abstratas. Aqui está o que os cortes representam em faturas reais. Os preços abaixo usam as taxas atuais de 2026.
Caso de Uso para Programadores: Criar um Chatbot
Imagine um programador independente a gerir um chatbot de apoio ao cliente que processa 5 milhões de tokens por mês, divididos aproximadamente em 3M de input e 2M de output.
Com o preço antigo do Luna ($1/$6), isso equivale a cerca de $3 de input mais $12 de output, ou seja, aproximadamente $15 por mês, ou $180 por ano só no modelo. Com o novo preço do Luna ($0,20/$1,20), fica cerca de $0,60 de input mais $2,40 de output, aproximadamente $3 por mês, ou $36 por ano. Isto representa um corte de 80% no custo base do modelo do bot. Os €144 poupados anualmente são o tipo de dinheiro que financia um melhor sistema de registos ou um mês de alojamento.
Caso de Uso para Startups: Produto SaaS com IA
Considere uma startup SaaS que gere uma funcionalidade de resumo de documentos para 500 clientes empresariais, consumindo cerca de 200 milhões de tokens de input e 40 milhões de tokens de output por mês num modelo de nível intermédio.
Ao mudar essa carga de trabalho de um nível de $2,50/$15 para o Terra a $2/$12, o custo mensal passa de aproximadamente €500 de input e €600 de output para cerca de €400 de input e €480 de output, uma poupança de cerca de €220 por mês, ou €2.640 por ano. Com preços mais baixos, funcionalidades nativas de IA que antes tinham margens negativas tornam-se viáveis, e produtos que só funcionavam em mercados ricos começam a fazer sentido em mercados mais sensíveis ao preço. Este é o efeito silencioso e cumulativo de uma guerra de preços: categorias inteiras de produtos passam a ser rentáveis.
Caso de Uso Empresarial: Ferramentas Internas de IA em Grande Escala
Considere uma empresa com 1.000 colaboradores que usa a API para pesquisa de conhecimento interno, redação de emails e automação de RH, consumindo cerca de 2 mil milhões de tokens de input e 400 milhões de tokens de output por mês, a maioria de uso rotineiro.
Encaminhar a maior parte desse tráfego para o Luna a $0,20/$1,20 em vez de um plano intermédio a $2/$12 é a diferença entre cerca de €4.800 por mês e cerca de €880 por mês. Ao longo de um ano isso são dezenas de milhares de euros, e por colaborador reduz o custo das ferramentas de IA internas para um valor de um único dígito em euros, por pessoa, por mês. O que realmente conta aqui não é apenas o corte de preço. É combinar esse corte com um encaminhamento disciplinado.
Caso de Uso Individual e Freelancer, Utilizadores Intensivos de API
Um programador freelancer ou criador de conteúdo que use a API diretamente pode gastar entre €80 e €150 por mês. Depois dos cortes, e com um pouco de disciplina no encaminhamento, o mesmo resultado pode cair para os €30-€60. O modo batch, a cache e prompts mais curtos (tudo abordado na Secção 6) baixam ainda mais o valor.
Há mais uma alavanca que fica totalmente fora da API. Se também pagar subscrições do ChatGPT, Claude ou Gemini em dólares, um cartão típico acrescenta discretamente uma comissão de transação estrangeira de 2% a 3% em cada renovação. Ao pagar essas subscrições com um cartão Bleap, paga em USD à taxa real, com 0% de comissões cambiais, além de um cashback fixo de 20% nas renovações do Claude, ChatGPT e Gemini. Num pacote mensal de €40 em subscrições de IA, só esse cashback já vale cerca de €96 por ano, sem contar a comissão cambial que deixa de pagar.
Estás a cortar na fatura da API mas continuas a perder dinheiro nas renovações das subscrições? A Bleap oferece 0% de comissões cambiais nas subscrições de IA em USD e um cashback fixo de 20% no Claude, ChatGPT e Gemini, sem qualquer subscrição mensal própria. (O cashback aplica-se apenas a estas três ferramentas.) Obter o cartão Bleap →
5. OpenAI vs. a Concorrência: Será que a OpenAI é Agora Mesmo a Mais Barata?
O corte de 80% tornou a OpenAI muito mais competitiva, mas o título de "mais barata" depende bastante do patamar em questão.
OpenAI vs. Google Gemini: Preço e Desempenho
A Google mostra-se agressiva em todos os patamares e tem uma vantagem estrutural. Os preços da API Gemini vão desde $0,10/$0,40 por milhão de tokens de entrada/saída no Gemini 2.5 Flash-Lite, passando por $0,30/$2,50 no Gemini 3.5 Flash-Lite e $1,50/$7,50 no Gemini 3.6 Flash, até $2/$12 no Gemini 3.1 Pro, sendo o Gemini 2.5 Flash-Lite, a $0,10/$0,40, a tarifa padrão mais baixa atualmente.
Há uma nuance a ter em conta nos orçamentos para os patamares Pro. Nos modelos Pro, assim que um único prompt ultrapassa os 200.000 tokens de contexto, a tarifa de entrada praticamente duplica e a de saída sobe na mesma proporção: no Gemini 3.1 Pro, a entrada passa de $2,00 para $4,00 por milhão, e a saída de $12,00 para $18,00. A verdadeira vantagem do Gemini está no comprimento do contexto. A linha Gemini da Google tem algo que as outras ainda não conseguem igualar: uma janela de contexto de 1 milhão de tokens em todos os modelos, até no mais barato. Onde a OpenAI ganha é na profundidade do ecossistema, na maturidade das ferramentas e na confiança da marca junto de mil milhões de utilizadores. O Gemini costuma vencer no preço puro e duro para trabalhos com documentos extensos.
OpenAI vs. Anthropic Claude: a Alternativa Premium
O Claude continua a ser a escolha preferida das empresas pela qualidade da escrita, fiabilidade em contextos longos e alinhamento de segurança, e lançou modelos novos este verão. A Anthropic lançou o Claude Opus 5 a 24 de julho, a $5/$25 por milhão de tokens de entrada/saída, oferecendo um desempenho próximo do Fable 5 por praticamente o mesmo custo do seu antecessor. No patamar intermédio, o panorama é sensível ao fator tempo. O Claude Sonnet 5 da Anthropic tem uma tarifa de lançamento de $2,00 na entrada e $10,00 na saída por milhão de tokens, válida até 31 de agosto de 2026, altura em que está previsto subir para $3,00 e $15,00.
Essa janela introdutória é importante para a tua comparação. Durante esse período, o Sonnet 5 e o Terra da OpenAI ficam quase ao mesmo nível, mas depois disso a diferença pode aumentar a favor da OpenAI em termos de preço. O Claude custa geralmente mais ao nível topo de gama, e para muitas equipas a qualidade de escrita e raciocínio justifica o valor extra em determinadas cargas de trabalho.
OpenAI vs. Open-Source: a ameaça do nível "gratuito"
Os modelos de pesos abertos e fortemente descontados definem o patamar mínimo para todo o mercado. O DeepSeek V4 Pro, por exemplo, tem um preço de $0,435/$0,87 por milhão de tokens, beneficiando de um desconto promocional permanente de 75%. E têm uma adesão real, não é só balão de ensaio. Os modelos chineses já captaram 46% do uso de tokens empresariais nos EUA no OpenRouter, chegando por vezes a ultrapassar os modelos de origem norte-americana.
Mas "gratuito" raramente é gratuito. Alojar um modelo open-source significa pagar por GPUs, manutenção, disponibilidade, segurança e o tempo de engenharia necessário para o manter em funcionamento. O código aberto ganha genuinamente em volumes muito elevados, tarefas simples ou restrições rígidas de privacidade de dados. A API da OpenAI ganha em rapidez de lançamento, fiabilidade, suporte e custo zero de DevOps. O custo escondido de um modelo "gratuito" é a equipa de que precisas para o manter a funcionar.
Tabela Comparativa de Preços Competitivos
Fornecedor | Modelo | Input $/1M | Output $/1M | Contexto | Ponto forte |
|---|---|---|---|---|---|
OpenAI | GPT-5.6 Luna | $0.20 | $1.20 | 400K | Modelo top de gama mais barato para alto volume |
OpenAI | GPT-5.6 Terra | $2.00 | $12.00 | 1M | Cavalo de batalha equilibrado para produção |
OpenAI | GPT-4.1 Nano | $0.10 | $0.40 | 1M | Modelo OpenAI capaz mais barato |
Gemini 3.1 Pro | $2.00 | $12.00 | 1M | Contexto de 1M, raciocínio forte | |
Gemini 3.6 Flash | $1.50 | $7.50 | 1M | Equilíbrio preço-desempenho intermédio | |
Gemini 2.5 Flash-Lite | $0.10 | $0.40 | 1M | Tarifa padrão mais baixa | |
Anthropic | Claude Opus 5 | $5.00 | $25.00 | 1M | Raciocínio e escrita premium |
Anthropic | Claude Sonnet 5 | $2.00* | $10.00* | 1M | Gama intermédia, preço de lançamento |
DeepSeek | V4 Pro | $0.435 | $0.87 | Grande | Preços com desconto agressivo |
Mistral | Large 3 | Varia | Varia | 256K | Opção europeia |
*Preço promocional de lançamento do Claude Sonnet 5; o preço de lançamento da Anthropic para o Claude Sonnet 5 volta ao valor padrão de $3,00/1M de tokens de entrada e $15,00/1M de tokens de saída a partir de 1 de setembro de 2026. Note também que o Mistral tem um contexto máximo de 256K no Large 3 e no Small 4, sem opção de 1M.
O Veredito, Onde a OpenAI Está em 2026
Depois dos cortes, a OpenAI é altamente competitiva, mas nem sempre a mais barata em absoluto. O Gemini bate-a nos contextos longos e nos níveis mais baixos, o DeepSeek bate-a no preço puro e simples, e o Claude cobra um valor premium pela qualidade. A verdadeira vantagem da OpenAI está no pacote completo: a confiança da marca junto de mil milhões de utilizadores e dois milhões de empresas, ferramentas maduras, fine-tuning, fiabilidade e suporte empresarial. A estratégia mais pragmática para a maioria das equipas é usar a OpenAI como opção predefinida e depois direcionar cargas de trabalho específicas para alternativas onde a relação preço-desempenho claramente as favoreça.
6. Como Maximizar as Suas Poupanças nos Custos da API da OpenAI
O corte de 80% é uma dádiva, mas as maiores poupanças continuam a vir da forma como utiliza a API. As quatro alavancas comprovadas juntas fazem a maior parte do trabalho. As quatro maiores alavancas são o prompt caching (até 90% de desconto em tokens de input repetidos), a Batch API (50% de desconto para tarefas não urgentes), o encaminhamento de tarefas simples para um modelo mini em vez de um modelo completo, e a redução dos prompts de sistema, e, combinadas, estas medidas cortam habitualmente a fatura da API em produção em 50-70% sem alterar a qualidade dos resultados.
Escolha o Modelo Certo para Cada Tarefa
Esta é, isoladamente, a alavanca com maior impacto. Encaminhar trabalho simples para o Luna ou para um nível mini em vez de um modelo topo de gama poupa cerca de 80% nessas chamadas. Construa um pequeno router que classifica os pedidos recebidos e envia cada um para o modelo mais barato capaz de o tratar: classificação e extração para o Luna ou GPT-4o mini, geração geral para o Terra ou GPT-4.1, e raciocínio genuíno apenas para o o4-mini ou o o3. A maioria das equipas que audita o seu tráfego descobre que grande parte dele nunca precisou de um modelo premium.
Utilize a Compressão de Prompts e a Otimização de Tokens
Compressão de prompts significa eliminar instruções redundantes, contexto repetido e conteúdo dispensável dos seus prompts. Prompts de sistema demasiado extensos e contexto duplicado são faturados em cada chamada individual, pelo que reduzi-los tem um efeito cumulativo rápido em milhões de pedidos. Existem ferramentas e bibliotecas para automatizar este processo, e as poupanças típicas situam-se entre 20% e 40%. Uma revisão manual rápida, eliminando instruções repetidas e tornando os exemplos mais concisos, costuma por si só recuperar uma quantidade surpreendente.
Aproveite os Preços de Input em Cache
Se as tuas chamadas partilham um prefixo estável, um prompt de sistema fixo, uma base de conhecimento ou um bloco de instruções longo, o prompt caching aplica um desconto significativo a esses tokens de entrada repetidos. Ativa o prompt caching estruturando os prompts com o conteúdo estável primeiro, com até 90% de desconto nos tokens de entrada repetidos. Este é o truque com maior impacto para pipelines RAG e chatbots com prompts de sistema estáticos. Coloca tudo o que é constante no início do prompt e a informação variável do utilizador no final, e a parte fixa é servida por uma fração do preço.
Usa a Batch API para Workloads Que Não São em Tempo Real
Tudo o que não precisa de uma resposta instantânea deve passar pela Batch API. Usa a Batch API para workloads que não são em tempo real, com 50% de desconto em tudo. Processamento de documentos em massa, enriquecimento noturno de dados, geração de conteúdo em grande escala e análises offline são todos casos perfeitos. A contrapartida é a latência, já que os trabalhos em lote podem demorar horas a devolver resultados, mas para trabalho agendado isso não é problema e o desconto de 50% está garantido.
Monitoriza e Audita a Tua Utilização de Tokens
Não podes cortar o que não consegues ver. Usa o painel de utilização da OpenAI juntamente com uma ferramenta de observabilidade de terceiros para acompanhar a despesa por funcionalidade e por modelo. Define limites rígidos de utilização e alertas para evitar surpresas na fatura, e procura os culpados do costume: pedidos duplicados, janelas de contexto descontroladas, tentativas repetidas que se acumulam e resultados que ninguém lê. Um único loop mal configurado pode duplicar silenciosamente uma fatura, por isso os alertas são um seguro barato.
Paga de Forma Mais Inteligente pelas Subscrições à Volta da Tua Stack de API
Há uma alavanca de custos que está completamente fora do teu código. A maioria das equipas combina a utilização da API com subscrições pagas para consumidores, ChatGPT Plus ou Pro para a equipa, além de lugares no Claude e no Gemini, tudo faturado mensalmente em USD. Um cartão comum acrescenta uma taxa de transação estrangeira de 2% a 3% em cada uma dessas renovações, o que é puro desperdício.
Ao pagar essas subscrições com um cartão Bleap, pagas em USD à taxa real, ou seja, 0% de taxas de câmbio, e ganhas 20% de cashback fixo nas renovações do Claude, ChatGPT e Gemini. É um Mastercard self-custodial que podes usar em qualquer lugar onde a Mastercard seja aceite, sem qualquer subscrição mensal própria. Para uma pequena equipa que gaste €200 por mês nestas três ferramentas, os 20% de cashback valem cerca de €480 por ano, além das taxas de câmbio que deixas de pagar. Nota que os 20% de cashback se aplicam especificamente ao Claude, ChatGPT e Gemini. Para outras ferramentas de IA faturadas em USD, o benefício é a isenção de taxas de câmbio (0%).
Fine-Tuning vs. Prompt Engineering: o que Poupa Mais?
Por vezes, a decisão mais económica a longo prazo é fazer fine-tuning a um modelo mais pequeno em vez de sobrecarregar um modelo grande com prompts few-shot elaborados em cada chamada. O fine-tuning tem um custo inicial, mas se permitir substituir um modelo topo de gama por uma versão mini em grande escala, as poupanças contínuas em inferência podem compensar rapidamente esse investimento. O ponto de equilíbrio depende do volume. Como regra geral, o fine-tuning tende a fazer sentido quando estás a lidar com um volume mensal de tokens elevado e constante numa tarefa repetitiva, em que o prompt engineering por si só te obriga a pagar preços de modelo topo de gama por um trabalho que um modelo mini afinado conseguiria fazer.
7. O Que os Cortes de Preços Significam para a Indústria de IA, Implicações Mais Amplas
A IA Está a Tornar-se Infraestrutura, Tal Como Aconteceu com a Cloud Compute Antes Dela
Existe um paralelo histórico evidente. Na década de 2010, a AWS cortou os preços do EC2 e do S3 dezenas de vezes à medida que a escala reduzia os custos marginais, e a computação em nuvem passou de um serviço premium a um bem essencial acessível a todos. A inferência de IA está a seguir a mesma curva. O corte de 80% na Luna, financiado por ganhos de eficiência, é um exemplo perfeito desse ciclo virtuoso: mais escala, mais eficiência, preços mais baixos, mais utilização.
A expectativa razoável é que os preços das APIs de ponta continuem a cair de forma significativa, ano após ano, até ao final da década de 2020, porque as mesmas forças que geraram este corte continuam a acelerar. A publicação técnica da equipa descreve o trabalho de auto-otimização como o início de um ciclo de retroalimentação e não como um exercício pontual, com os engenheiros da OpenAI a escreverem que, à medida que os modelos melhoram e conseguem trabalhar de forma mais autónoma, a capacidade da empresa de acelerar os ganhos de eficiência acelera ainda mais, uma dinâmica composta. Para as startups nativas de IA, isto significa barreiras de entrada mais baixas e uma iteração mais rápida a cada ano.
Democratização da IA: Quem Beneficia Mais?
Os grandes vencedores são aqueles para quem o preço era a barreira. Programadores independentes e startups autofinanciadas podem agora usar em produção funcionalidades de IA que antes davam prejuízo. Equipas em mercados emergentes e sensíveis ao preço, onde os orçamentos tornavam a IA de ponta inacessível, podem agora construir com os mesmos modelos que qualquer outra empresa. E os negócios já estabelecidos podem alargar a IA a tarefas internas de menor valor que nunca justificavam preços premium. Quando o nível mais barato e competente custa 0,20 USD por milhão de tokens de entrada, "é demasiado caro para experimentar" deixa de ser um motivo para não avançar.
O reverso da medalha é a pressão sobre as margens em toda a indústria. Esta mudança pode acelerar a adoção de modelos e o uso de cloud, mas também levanta questões sobre se os ganhos de eficiência conseguem compensar a menor receita por token. Para os utilizadores, no entanto, a direção é inequivocamente positiva: mais capacidade, a preços mais baixos, com maior disponibilidade.
Estás a aproveitar uma IA mais barata mas continuas a pagar o preço cheio nas tuas subscrições? A Bleap dá-te 0% de comissões de câmbio na faturação em USD de IA e 20% de cashback fixo nas renovações do Claude, ChatGPT e Gemini, com um Mastercard self-custodial, sem qualquer subscrição própria. Pede já o cartão Bleap →
Conclusão: A IA mais barata já chegou, por isso paga-a com inteligência
A manchete é simples e real: a OpenAI baixou o preço em 80% no GPT-5.6 Luna a 30 de julho de 2026, sustentada por ganhos de eficiência e impulsionada pela guerra de preços de IA mais feroz de sempre. Mas os detalhes importam tanto quanto a manchete. Esses 80% aplicam-se a apenas um escalão, a maior parte da tua poupança vem de um encaminhamento inteligente de modelos, caching e processamento em lote, e a OpenAI está agora altamente competitiva, sem ser sempre a mais barata.
Para quem constrói produtos com IA em 2026, o plano de jogo é claro. Começa pelo modelo mais barato que cumpra a função, encaminha de forma deliberada, faz caching de forma agressiva, agrupa tudo o que puderes em lote, e auditar sem descanso. Faz isso e podes reduzir uma fatura de produção entre 50% e 70%, além do corte já anunciado.
Depois, fecha a última lacuna. As subscrições de IA que envolvem a tua stack de API, ChatGPT, Claude e Gemini, são faturadas mensalmente em USD, e um cartão normal tira 2% a 3% de cada renovação. Paga-as com a Bleap: 0% de comissões de câmbio na faturação em USD, 20% de cashback fixo nessas três ferramentas, e um Mastercard self-custodial sem qualquer subscrição mensal própria. Modelos mais baratos aliados a um pagamento mais inteligente é como fazes a guerra de preços de 2026 trabalhar verdadeiramente a favor da tua carteira.
Perguntas Frequentes
A OpenAI baixou mesmo os preços em 80%?
Sim, num modelo específico. A OpenAI anunciou uma redução de 20% no preço do Terra e de 80% no custo do Luna. O valor de 80% aplica-se ao GPT-5.6 Luna, o seu nível mais barato e rápido, que caiu de $1/$6 para $0,20/$1,20 por milhão de tokens de entrada/saída. O nível topo de gama, Sol, manteve-se inalterado.
Quando é que aconteceu o corte de preços da OpenAI?
O corte foi anunciado a 30 de julho de 2026. A OpenAI baixou o preço do seu modelo GPT-5.6 Luna em 80% nessa data, apenas três semanas após o lançamento público completo da família GPT-5.6.
Qual é o modelo mais barato da OpenAI em 2026?
Entre a gama atual, o GPT-5.6 Luna, a $0,20/$1,20, e o GPT-4.1 Nano, a $0,10/$0,40, são as opções mais baratas e ainda assim competentes. O GPT-4.1 Nano, a $0,10 por milhão de tokens de entrada, é um dos modelos capazes mais baratos disponíveis no mercado. Qual deles é o mais indicado para si depende das necessidades de contexto e do tipo de tarefa.
Porque é que a OpenAI baixou os preços de forma tão agressiva?
A razão oficial é a eficiência, mas a razão de fundo é a concorrência. A OpenAI atribuiu as reduções às melhorias de eficiência conseguidas durante o desenvolvimento interno do GPT-5.6, incluindo o papel do modelo na otimização de software de produção e na melhoria da descodificação especulativa. Ao mesmo tempo, rivais como a Anthropic e a Google lançaram modelos competitivos semanas antes, e modelos chineses de baixo custo têm conquistado uma fatia significativa do mercado empresarial.
A OpenAI é agora mais barata do que a Google Gemini ou a Anthropic Claude?
Depende do nível em causa. O Gemini costuma ser mais barato em contexto longo e nos preços de entrada, com tarifas a partir de cerca de $0,10/$0,40 no seu nível mais económico. O Claude é tipicamente mais caro, com o Opus 5 a $5/$25. O Luna da OpenAI, a $0,20/$1,20, é altamente competitivo para trabalho de grande volume, mas não há um único fornecedor que seja o mais barato em todas as categorias.
Quanto é que posso realmente poupar na minha fatura da API da OpenAI?
Para além do corte na tabela de preços, a otimização disciplinada é que faz mesmo a diferença. Combinadas, a colocação em cache de prompts, a Batch API, o encaminhamento entre modelos e a redução dos prompts de sistema reduzem frequentemente uma fatura de API de produção em 50-70% sem alterar a qualidade dos resultados. A alavanca mais importante é encaminhar tarefas simples para um nível mais barato.
O que são "tokens de raciocínio" e porque custam mais?
Os modelos de raciocínio geram um raciocínio interno oculto que é cobrado às taxas de output. Estes modelos faturam os tokens de raciocínio interno às taxas de output, pelo que os custos reais podem ser 3 a 10 vezes superiores ao preço base, consoante a complexidade da tarefa. É por isso que uma resposta do o3 pode custar muito mais do que o preço anunciado sugere, e porque o o4-mini costuma ser a opção de raciocínio com melhor custo-benefício.
Como é que a Bleap ajuda a reduzir os custos com IA?
A Bleap não vende modelos de IA. É uma empresa fintech de cartões que muda a forma como pagas as tuas subscrições de IA. Os planos de IA são faturados mensalmente em USD, e a maioria dos cartões acrescenta uma taxa cambial de 2% a 3% em cada renovação. Com a Bleap, pagas em USD à taxa real, sem qualquer taxa cambial (0%), e ainda recebes 20% de cashback fixo nas renovações do Claude, ChatGPT e Gemini. É um Mastercard self-custodial, sem subscrição mensal própria. O cashback de 20% aplica-se apenas a estas três ferramentas; para outras ferramentas de IA faturadas em USD, o benefício é a isenção de taxa cambial (0%).
Os preços da IA vão continuar a descer em 2026 e depois?
A tendência aponta fortemente nesse sentido. Os preços dos modelos de fronteira têm vindo a cair de forma generalizada desde o início de 2025, impulsionados por uma combinação de ganhos de eficiência na inferência, melhorias nos modelos open-weight e movimentos competitivos deliberados. Com os ganhos de eficiência a acumularem-se e a concorrência a intensificar-se, é amplamente esperado que surjam mais cortes em todo o setor.
Uma forma mais inteligente de gastar, enviar, ganhar e negociar

- Artificial Inteligence








