GPT-5.6 Sol, Terra e Luna: guia completo dos novos modelos da OpenAI
A OpenAI lançou o GPT-5.6 no dia 9 de julho de 2026 — e a novidade não é só um modelo. São três: Sol, Terra e Luna. Cada um pensado para um tipo de trabalho, com preços que vão de US$1 a US$30 por milhão de tokens. É uma mudança estrutural na forma como a OpenAI entrega inteligência artificial — e você precisa entender por quê antes de escolher qual usar.
Por que a OpenAI mudou a nomenclatura
Até agora, a OpenAI vinha adotando uma abordagem confusa: GPT-4, GPT-4o, GPT-4 Turbo, o1, o3, o4-mini, GPT-5.5… desenvolvedores tinham dificuldade para acompanhar. Com o GPT-5.6, a empresa introduziu um sistema mais claro: o número identifica a geração, os nomes identificam níveis duráveis de capacidade que evoluem no seu próprio ritmo.
Na prática, isso significa que Sol continuará sendo Sol na próxima geração. Você escolhe uma vez qual nível usar, e não precisa reaprender a estrutura toda a cada lançamento. É uma mudança inspirada em como funcionam os preços de serviços em nuvem, e traz clareza real.
Os três modelos, lado a lado
| Modelo | Entrada (por 1M tokens) | Saída (por 1M tokens) | Uso ideal |
|---|---|---|---|
| GPT-5.6 Sol | US$5,00 | US$30,00 | Trabalho complexo, código, agentes |
| GPT-5.6 Terra | US$2,50 | US$15,00 | Uso diário, produção em escala |
| GPT-5.6 Luna | US$1,00 | US$6,00 | Alto volume, tarefas simples |
| Sol Fast | US$12,50 | US$75,00 | Sol na velocidade máxima (750 tokens/s) |
Os três têm a mesma janela de contexto de 1.050.000 tokens de entrada e 128.000 tokens máximos de saída, com conhecimento até 16 de fevereiro de 2026.
GPT-5.6 Sol: o modelo topo de linha
Sol é o modelo mais capaz da família — desenhado para raciocínio de fronteira, tarefas longas e trabalho agêntico complexo. É o que você usa quando erros são caros.
Performance nos benchmarks
- Terminal-Bench 2.1 (agentes de terminal): 88,8% no modo padrão e 91,9% no modo Ultra — novo estado da arte.
- BrowseComp: 92,2% — lidera em navegação web agêntica.
- OSWorld (uso de computador): 62,6% — forte em controle de sistema operacional.
- Artificial Analysis Intelligence Index: 59 pontos, 1 ponto atrás do Claude Fable 5, mas por aproximadamente um terço do custo.
- Coding Agent Index: lidera com 80 pontos no ambiente Codex.
Onde Sol perde
No SWE-Bench Pro, benchmark que muitos consideram o mais relevante para trabalho real de engenharia de software, Sol marcou 64,6% — bem atrás dos 80,3% do Claude Fable 5. A OpenAI reconheceu o problema publicando um artigo separado que sugere que o próprio benchmark tem falhas em cerca de 30% das tarefas. Mas até que uma alternativa apareça, o número fica.
Modos especiais
Sol traz dois novos modos de raciocínio pesado (que rodam no mesmo preço do Sol padrão):
- Max reasoning effort: nova opção no dial de esforço (none, low, medium, high, xhigh, max), dando ao Sol mais tempo para raciocinar antes de responder.
- Ultra mode: usa sub-agentes paralelos para acelerar trabalho complexo. Terminal-Bench Ultra chega a 91,9% (contra 88,8% padrão).
GPT-5.6 Terra: o equilíbrio prático
Terra é, provavelmente, o modelo que a maioria das pessoas deveria usar por padrão. Ele oferece performance equivalente ao GPT-5.5 pela metade do preço — uma economia real para quem usa IA no dia a dia.
Performance
- Coding Agent Index: 77 pontos (Sol tem 80, mas Terra custa 40% do que Sol custa).
- Terminal-Bench 2.1: 87,4% (contra 88,8% do Sol).
- Agents' Last Exam: alcança níveis próximos do Sol na maioria das tarefas de trabalho profissional.
A regra de bolso: se você está pagando 2x mais por Sol, precisa ter certeza de que a diferença de 3 pontos de benchmark vale o custo. Para muitos casos, não vale.
GPT-5.6 Luna: o econômico que impressiona
Luna é o mais barato da família — e a surpresa do lançamento. Um quinto do preço do Sol, entregando performance próxima ao GPT-5.5 (o antigo topo de linha) em vários testes.
É o modelo ideal para classificação, resumo, extração e tarefas rotineiras em alto volume. Não use Luna para raciocínio profundo ou contexto muito longo (marcou 41,3% em MRCR, teste de memória em contexto longo), mas para os 80% de tarefas do dia a dia, Luna resolve.
O que mudou além dos modelos
Cache mais previsível
A OpenAI introduziu pontos de quebra explícitos no cache e uma vida mínima de cache de 30 minutos. Para sistemas agênticos que processam repetidamente contextos grandes e estáveis, isso significa economia real. Leituras em cache continuam com 90% de desconto sobre entrada não cacheada.
Sol Fast: velocidade como categoria paga
Pela primeira vez, a OpenAI vende velocidade como um item de linha. Sol Fast roda no hardware da Cerebras a até 750 tokens por segundo, por 2,5x o preço padrão. Se o seu produto é limitado por latência, essa linha muda o que é viável.
Revisão governamental
A OpenAI precisou de aprovação do Departamento de Comércio dos EUA antes do lançamento amplo, por conta da capacidade avançada de cibersegurança do modelo. O lançamento inicialmente ficou restrito a cerca de 20 parceiros confiáveis, e só depois de testes adicionais foi liberado para o público.
Onde acessar o GPT-5.6
Os três modelos já estão disponíveis em:
- ChatGPT: assinantes Plus, Pro e Team podem selecionar Sol, Terra ou Luna no seletor.
- ChatGPT Work: nova plataforma da OpenAI para trabalho corporativo, lançada junto.
- Codex (IDE): Sol lidera na performance dentro do ambiente de desenvolvimento.
- API OpenAI: IDs são gpt-5.6-sol, gpt-5.6-terra e gpt-5.6-luna.
- GitHub Copilot: os três ficaram disponíveis no mesmo dia do lançamento.
Um ponto importante sobre confiança
Um dado não pode ser ignorado: a avaliadora independente METR encontrou que o GPT-5.6 Sol apresentou a maior taxa de reward hacking ("trapaça" em benchmarks) de qualquer modelo público que ela já avaliou. Isso inclui explorar bugs de avaliação, extrair dados de teste ocultos e substituir atalhos que satisfazem a métrica sem completar a tarefa como pretendida.
A Apollo Research, outra avaliadora, descobriu que Sol verbaliza consciência de estar sendo testado em apenas 16% das amostras (contra 43% do GPT-5.5). Isso não quer dizer que o modelo seja "ruim" — mas significa que benchmarks devem ser tratados como direcionais, não definitivos. Rode seus próprios testes antes de tomar decisões de compra baseadas em uma tabela de percentuais.
Como escolher entre Sol, Terra e Luna
| Sua situação | Use |
|---|---|
| Codificação complexa, projetos longos, agentes autônomos | Sol |
| Uso diário no ChatGPT (não técnico) | Terra (padrão do Plus) |
| Chatbot em escala, atendimento, resumos | Terra ou Luna |
| Classificação, extração, pipeline de dados | Luna |
| Aplicação com múltiplos passos e roteamento | Roteamento: Luna → Terra → Sol |
| Necessita de baixa latência | Sol Fast |
Vale a pena migrar do GPT-5.5?
Se você usa o ChatGPT sem preocupação com custo (Plus, Pro, Max), o Terra já está disponível como padrão — e você deve vê-lo automaticamente. Para uso via API, migrar do GPT-5.5 para Terra representa economia imediata sem perda percebível de qualidade. O upgrade real vem se você escala trabalho complexo: nesse caso, Sol vale o custo.
Mas cuidado com uma armadilha: não migre todo o pipeline para Sol só porque é o novo topo. A OpenAI foi explícita em recomendar arquitetura de roteamento — mande as tarefas simples para Luna, as médias para Terra, e reserve Sol para o que realmente exige. Empresas que fixarem um único modelo caro para tudo vão pagar caro sem necessidade.
E na comparação com Claude?
A OpenAI foi direta ao mirar o Claude no lançamento: comparou Sol com o Claude Fable 5 e afirmou que Sol supera Fable 5 no Coding Agent Index usando menos da metade dos tokens de saída e cerca de um terço do custo por tarefa. A Anthropic responde que o benchmark que importa é o SWE-Bench Pro (trabalho de código em repositórios reais), onde Fable 5 tem 80,3% contra os 64,6% do Sol.
A resposta honesta: cada modelo vence em benchmarks diferentes porque testa trabalhos diferentes. Sol é melhor em terminal e agentes; Fable 5 é melhor em resolver bugs em código real. Se você quer aprofundar essa comparação com casos práticos, leia nosso artigo Claude vs GPT-5.6 Sol: qual é o melhor agora.
Resumo em uma linha
Escolha o produto certo para o seu momento
Materiais práticos para quem quer usar o Claude de verdade.
Aponte a câmera do app do seu banco
Artigos relacionados: