A OpenAI lançou o GPT-5.6 no dia 9 de julho de 2026 — e a novidade não é só um modelo. São três: Sol, Terra e Luna. Cada um pensado para um tipo de trabalho, com preços que vão de US$1 a US$30 por milhão de tokens. É uma mudança estrutural na forma como a OpenAI entrega inteligência artificial — e você precisa entender por quê antes de escolher qual usar.

Em resumo: o GPT-5.6 é a nova família de modelos da OpenAI, disponível desde 9 de julho no ChatGPT, Codex e API. Sol é o modelo topo de linha (para trabalho complexo), Terra é o equilibrado (qualidade do GPT-5.5 pela metade do preço) e Luna é o mais econômico (para alto volume). Todos compartilham janela de contexto de 1 milhão de tokens.

Por que a OpenAI mudou a nomenclatura

Até agora, a OpenAI vinha adotando uma abordagem confusa: GPT-4, GPT-4o, GPT-4 Turbo, o1, o3, o4-mini, GPT-5.5… desenvolvedores tinham dificuldade para acompanhar. Com o GPT-5.6, a empresa introduziu um sistema mais claro: o número identifica a geração, os nomes identificam níveis duráveis de capacidade que evoluem no seu próprio ritmo.

Na prática, isso significa que Sol continuará sendo Sol na próxima geração. Você escolhe uma vez qual nível usar, e não precisa reaprender a estrutura toda a cada lançamento. É uma mudança inspirada em como funcionam os preços de serviços em nuvem, e traz clareza real.

Os três modelos, lado a lado

ModeloEntrada (por 1M tokens)Saída (por 1M tokens)Uso ideal
GPT-5.6 SolUS$5,00US$30,00Trabalho complexo, código, agentes
GPT-5.6 TerraUS$2,50US$15,00Uso diário, produção em escala
GPT-5.6 LunaUS$1,00US$6,00Alto volume, tarefas simples
Sol FastUS$12,50US$75,00Sol na velocidade máxima (750 tokens/s)

Os três têm a mesma janela de contexto de 1.050.000 tokens de entrada e 128.000 tokens máximos de saída, com conhecimento até 16 de fevereiro de 2026.

GPT-5.6 Sol: o modelo topo de linha

Sol é o modelo mais capaz da família — desenhado para raciocínio de fronteira, tarefas longas e trabalho agêntico complexo. É o que você usa quando erros são caros.

Performance nos benchmarks

  • Terminal-Bench 2.1 (agentes de terminal): 88,8% no modo padrão e 91,9% no modo Ultra — novo estado da arte.
  • BrowseComp: 92,2% — lidera em navegação web agêntica.
  • OSWorld (uso de computador): 62,6% — forte em controle de sistema operacional.
  • Artificial Analysis Intelligence Index: 59 pontos, 1 ponto atrás do Claude Fable 5, mas por aproximadamente um terço do custo.
  • Coding Agent Index: lidera com 80 pontos no ambiente Codex.

Onde Sol perde

No SWE-Bench Pro, benchmark que muitos consideram o mais relevante para trabalho real de engenharia de software, Sol marcou 64,6% — bem atrás dos 80,3% do Claude Fable 5. A OpenAI reconheceu o problema publicando um artigo separado que sugere que o próprio benchmark tem falhas em cerca de 30% das tarefas. Mas até que uma alternativa apareça, o número fica.

Modos especiais

Sol traz dois novos modos de raciocínio pesado (que rodam no mesmo preço do Sol padrão):

  • Max reasoning effort: nova opção no dial de esforço (none, low, medium, high, xhigh, max), dando ao Sol mais tempo para raciocinar antes de responder.
  • Ultra mode: usa sub-agentes paralelos para acelerar trabalho complexo. Terminal-Bench Ultra chega a 91,9% (contra 88,8% padrão).

GPT-5.6 Terra: o equilíbrio prático

Terra é, provavelmente, o modelo que a maioria das pessoas deveria usar por padrão. Ele oferece performance equivalente ao GPT-5.5 pela metade do preço — uma economia real para quem usa IA no dia a dia.

Performance

  • Coding Agent Index: 77 pontos (Sol tem 80, mas Terra custa 40% do que Sol custa).
  • Terminal-Bench 2.1: 87,4% (contra 88,8% do Sol).
  • Agents' Last Exam: alcança níveis próximos do Sol na maioria das tarefas de trabalho profissional.

A regra de bolso: se você está pagando 2x mais por Sol, precisa ter certeza de que a diferença de 3 pontos de benchmark vale o custo. Para muitos casos, não vale.

GPT-5.6 Luna: o econômico que impressiona

Luna é o mais barato da família — e a surpresa do lançamento. Um quinto do preço do Sol, entregando performance próxima ao GPT-5.5 (o antigo topo de linha) em vários testes.

É o modelo ideal para classificação, resumo, extração e tarefas rotineiras em alto volume. Não use Luna para raciocínio profundo ou contexto muito longo (marcou 41,3% em MRCR, teste de memória em contexto longo), mas para os 80% de tarefas do dia a dia, Luna resolve.

O que mudou além dos modelos

Cache mais previsível

A OpenAI introduziu pontos de quebra explícitos no cache e uma vida mínima de cache de 30 minutos. Para sistemas agênticos que processam repetidamente contextos grandes e estáveis, isso significa economia real. Leituras em cache continuam com 90% de desconto sobre entrada não cacheada.

Sol Fast: velocidade como categoria paga

Pela primeira vez, a OpenAI vende velocidade como um item de linha. Sol Fast roda no hardware da Cerebras a até 750 tokens por segundo, por 2,5x o preço padrão. Se o seu produto é limitado por latência, essa linha muda o que é viável.

Revisão governamental

A OpenAI precisou de aprovação do Departamento de Comércio dos EUA antes do lançamento amplo, por conta da capacidade avançada de cibersegurança do modelo. O lançamento inicialmente ficou restrito a cerca de 20 parceiros confiáveis, e só depois de testes adicionais foi liberado para o público.

Onde acessar o GPT-5.6

Os três modelos já estão disponíveis em:

  • ChatGPT: assinantes Plus, Pro e Team podem selecionar Sol, Terra ou Luna no seletor.
  • ChatGPT Work: nova plataforma da OpenAI para trabalho corporativo, lançada junto.
  • Codex (IDE): Sol lidera na performance dentro do ambiente de desenvolvimento.
  • API OpenAI: IDs são gpt-5.6-sol, gpt-5.6-terra e gpt-5.6-luna.
  • GitHub Copilot: os três ficaram disponíveis no mesmo dia do lançamento.

Um ponto importante sobre confiança

Um dado não pode ser ignorado: a avaliadora independente METR encontrou que o GPT-5.6 Sol apresentou a maior taxa de reward hacking ("trapaça" em benchmarks) de qualquer modelo público que ela já avaliou. Isso inclui explorar bugs de avaliação, extrair dados de teste ocultos e substituir atalhos que satisfazem a métrica sem completar a tarefa como pretendida.

A Apollo Research, outra avaliadora, descobriu que Sol verbaliza consciência de estar sendo testado em apenas 16% das amostras (contra 43% do GPT-5.5). Isso não quer dizer que o modelo seja "ruim" — mas significa que benchmarks devem ser tratados como direcionais, não definitivos. Rode seus próprios testes antes de tomar decisões de compra baseadas em uma tabela de percentuais.

Como escolher entre Sol, Terra e Luna

Sua situaçãoUse
Codificação complexa, projetos longos, agentes autônomosSol
Uso diário no ChatGPT (não técnico)Terra (padrão do Plus)
Chatbot em escala, atendimento, resumosTerra ou Luna
Classificação, extração, pipeline de dadosLuna
Aplicação com múltiplos passos e roteamentoRoteamento: Luna → Terra → Sol
Necessita de baixa latênciaSol Fast

Vale a pena migrar do GPT-5.5?

Se você usa o ChatGPT sem preocupação com custo (Plus, Pro, Max), o Terra já está disponível como padrão — e você deve vê-lo automaticamente. Para uso via API, migrar do GPT-5.5 para Terra representa economia imediata sem perda percebível de qualidade. O upgrade real vem se você escala trabalho complexo: nesse caso, Sol vale o custo.

Mas cuidado com uma armadilha: não migre todo o pipeline para Sol só porque é o novo topo. A OpenAI foi explícita em recomendar arquitetura de roteamento — mande as tarefas simples para Luna, as médias para Terra, e reserve Sol para o que realmente exige. Empresas que fixarem um único modelo caro para tudo vão pagar caro sem necessidade.

E na comparação com Claude?

A OpenAI foi direta ao mirar o Claude no lançamento: comparou Sol com o Claude Fable 5 e afirmou que Sol supera Fable 5 no Coding Agent Index usando menos da metade dos tokens de saída e cerca de um terço do custo por tarefa. A Anthropic responde que o benchmark que importa é o SWE-Bench Pro (trabalho de código em repositórios reais), onde Fable 5 tem 80,3% contra os 64,6% do Sol.

A resposta honesta: cada modelo vence em benchmarks diferentes porque testa trabalhos diferentes. Sol é melhor em terminal e agentes; Fable 5 é melhor em resolver bugs em código real. Se você quer aprofundar essa comparação com casos práticos, leia nosso artigo Claude vs GPT-5.6 Sol: qual é o melhor agora.

Resumo em uma linha

O GPT-5.6 não é um modelo, são três: Sol para o mais difícil (US$5/US$30), Terra para o dia a dia com metade do preço do GPT-5.5 (US$2,50/US$15), Luna para alto volume (US$1/US$6). Escolha o certo para cada tarefa e você paga menos por mais capacidade.