A OpenAI lista o GPT-5.6 Sol por US$ 4 a cada 1 milhão de tokens de entrada e US$ 20 por 1 milhão de tokens de saída no contexto curto padrão. A cobrança é feita por tokens — pequenos blocos de texto processados pelo modelo — e não por uma mensalidade única de uso da API.

OpenAI reduz o preço da API do GPT-5.6 Sol

Quanto custa a API do GPT-5.6 Sol

Para uma solicitação curta padrão, a entrada custa US$ 4 por 1 milhão de tokens e a saída custa US$ 20 por 1 milhão de tokens. Em termos práticos, você paga separadamente pelo conteúdo enviado ao modelo e pelo texto que ele gera.

A tabela de tarifas fica assim:

Tipo de solicitaçãoEntradaEntrada em cacheGravação de cacheSaída
Contexto curto padrãoUS$ 4 / 1 milhão de tokensUS$ 0,40 / 1 milhão de tokensUS$ 5 / 1 milhão de tokensUS$ 20 / 1 milhão de tokens
Contexto longoUS$ 8 / 1 milhão de tokensUS$ 0,80 / 1 milhão de tokensUS$ 10 / 1 milhão de tokensUS$ 30 / 1 milhão de tokens

As tarifas são denominadas em dólares americanos. Não há, para este caso, uma conversão específica para reais que permita calcular o valor final em BRL sem considerar o câmbio e as condições de cobrança da conta usada.

Cache e contexto longo têm tarifas próprias

Entrada em cache é o conteúdo que a aplicação reaproveita em chamadas posteriores. Quando uma parte do contexto já foi armazenada para reutilização, a leitura custa US$ 0,40 por 1 milhão de tokens no contexto curto padrão, bem menos que uma entrada comum. A gravação desse cache, porém, aparece separadamente na tabela e custa US$ 5 por 1 milhão de tokens.

O contexto longo não usa automaticamente os mesmos US$ 4 e US$ 20. Para esse tipo de solicitação, a OpenAI lista US$ 8 por 1 milhão de tokens de entrada e US$ 30 por 1 milhão de tokens de saída. É uma diferença importante para aplicações que enviam documentos extensos, históricos grandes ou instruções muito compridas.

Há ainda um possível acréscimo de 10% para processamento regional em modelos elegíveis lançados a partir de 5 de março de 2026. A aplicação desse adicional depende do endpoint e das condições específicas do serviço.

A economia depende do tipo de token

As tarifas padrão anteriores informadas para o GPT-5.6 Sol eram de US$ 5 por 1 milhão de tokens de entrada e US$ 30 por 1 milhão de tokens de saída. Com a mudança, a entrada caiu 20%, enquanto a saída caiu aproximadamente 33,3%.

Isso não significa que todo aplicativo ficou 33,3% mais barato — nem que toda conta terá exatamente 20% de economia. O resultado depende da proporção entre tokens de entrada e de saída:

  • uma aplicação que envia muito contexto e recebe respostas curtas será mais influenciada pela tarifa de entrada;
  • uma aplicação que pede respostas longas sentirá mais a redução na tarifa de saída;
  • chamadas com conteúdo reutilizado podem se beneficiar das tarifas específicas de cache, desde que o fluxo realmente use esse mecanismo.

A conta certa, portanto, não é aplicar um único percentual ao gasto total. É separar entrada, saída, leitura de cache, gravação de cache e tipo de contexto.

API não é o mesmo que assinatura do ChatGPT

O preço por token do GPT-5.6 Sol é uma tarifa de uso da API para desenvolvedores. Ele não é o preço de uma assinatura do ChatGPT e não deve ser usado como se fosse um medidor direto dos limites de planos como Pro, Plus ou Business.

Essa diferença importa porque a API serve para integrar o modelo a aplicativos, automações e serviços próprios, enquanto uma assinatura do ChatGPT é um produto de uso separado. Pagar menos por milhão de tokens na API não transforma essa tarifa em crédito mensal de uma assinatura.

O mesmo cuidado vale para estimativas de custo por tarefa. Um aplicativo pode gastar quantidades muito diferentes de tokens conforme o tamanho do contexto, o número de tentativas, o volume da resposta e o uso de cache. O preço do modelo é apenas uma parte da conta; o desenho do fluxo determina o resultado final.

O que muda para quem desenvolve

Para quem usa o GPT-5.6 Sol em produção, a mudança reduz principalmente o custo das respostas geradas e melhora a previsibilidade de aplicações com alto volume de saída. Mas a comparação só faz sentido se todas as chamadas usarem a mesma modalidade de contexto e se as tarifas de cache forem contabilizadas separadamente.

Antes de estimar o orçamento, vale separar quatro números: tokens enviados, tokens gerados, tokens lidos do cache e tokens gravados no cache. Depois, confira se a aplicação está no contexto curto padrão ou no contexto longo. Misturar essas categorias é o jeito mais rápido de chegar a uma conta bonita — e errada.

O ponto central é simples: o GPT-5.6 Sol ficou mais barato na API padrão, mas o valor real para cada projeto continua dependendo de como ele envia, reaproveita e recebe tokens.