Grok 4.5: o modelo da xAI treinado com dados reais do Cursor
A xAI lançou o Grok 4.5 em 8 de julho de 2026, chamando-o de "modelo Opus-class, mas mais rápido, mais eficiente em tokens e mais barato". É o primeiro modelo da xAI treinado especificamente para código e trabalho agêntico — e o primeiro fruto visível da aquisição do Cursor pela SpaceX por US$60 bilhões, anunciada em junho.
A conexão com o Cursor muda o jogo
Em meados de junho de 2026, a SpaceX (controladora da xAI) adquiriu o Cursor — um dos editores de código com IA mais usados do mundo — por aproximadamente US$60 bilhões. Essa aquisição é o motivo pelo qual o treinamento do Grok 4.5 incorporou dados reais de sessões de desenvolvedores do Cursor: rastros de debug, diffs de múltiplos arquivos, correções de usuários — não apenas código estático de repositórios públicos.
Isso captura como desenvolvedores realmente iteram sobre um problema, trocam de contexto entre arquivos, e tomam decisões de múltiplas etapas dentro de projetos reais — um tipo de dado de treinamento diferente do que a maioria dos modelos usa.
Ficha técnica
| Especificação | Detalhe |
|---|---|
| Arquitetura | Mixture-of-Experts, fundação V9 de 1,5 trilhão de parâmetros |
| Janela de contexto | 500 mil tokens |
| Preço entrada | US$2,00 por milhão de tokens |
| Preço saída | US$6,00 por milhão de tokens |
| Entrada em cache | US$0,50 por milhão de tokens |
| Velocidade | ~80 tokens por segundo |
| Disponível em | Grok Build, Cursor (todos os planos), API xAI, add-ins Office, OpenRouter |
| Disponibilidade na UE | Não disponível no lançamento; esperado para meados de julho |
Benchmarks: onde ganha e onde perde
Segundo dados publicados pela própria xAI e verificados de forma independente pela Artificial Analysis. Os números da tabela abaixo vêm da tabela oficial da xAI — vale saber que valores reportados pelos próprios fabricantes podem variar levemente entre fontes (a Anthropic, por exemplo, reporta 80,3% para o Fable 5 no SWE-Bench Pro, e a xAI reporta 80,4% para o mesmo modelo):
| Benchmark | Grok 4.5 | Fable 5 | Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 83,3% | 84,3% | 78,9% | 83,4% |
| SWE-Bench Pro | 64,7% | 80,4% | 69,2% | 58,6% |
| DeepSWE 1.1 | 53% | 70% | 59% | 67% |
| SWE Marathon (pass@1) | 29,0% | 24,0% | 26,0% | ~ |
No Índice de Inteligência da Artificial Analysis (independente), Grok 4.5 marca 54 pontos e fica em 4º lugar geral — atrás de Fable 5, Opus 4.8 e GPT-5.5, mas lidera com folga em uso agêntico de ferramentas.
O verdadeiro destaque: eficiência de tokens
O número mais impressionante não é benchmark de inteligência — é eficiência. No SWE-Bench Pro, o Grok 4.5 resolve tarefas usando em média 15.954 tokens de saída, contra 67.020 do Opus 4.8 — uma diferença de 4,2 vezes menos tokens para resultado comparativamente próximo. Isso significa que o custo real por tarefa completada fica muito mais baixo do que o preço por token sozinho sugere.
No Coding Agent Index da Artificial Analysis, rodando no Grok Build, o custo por tarefa é de US$2,49, contra US$5,07 do GPT-5.5 no Codex e US$11,80 do Fable 5 no Claude Code.
O aviso importante: alucinação subiu
A Artificial Analysis também identificou um ponto de atenção: no Índice AA-Omniscience, a precisão do Grok 4.5 subiu de 35% para 52% em relação à geração anterior — mas a taxa de alucinação também saltou de 25% para 54%. Em outras palavras: o modelo sabe mais, mas também está mais confiante quando erra. É um trade-off real que vale considerar antes de confiar cegamente nas respostas.
Onde acessar
- Cursor: já disponível em todos os planos, desde o lançamento.
- Grok Build: modelo padrão do ambiente de agentes da xAI.
- API xAI: model ID
grok-4.5, compatível com formato OpenAI (Responses API e Chat Completions). - Add-ins Microsoft Office: Word, Excel e PowerPoint já têm integração.
- Gateways: OpenRouter, Vercel, Cloudflare, Snowflake, Databricks Mosaic.
Vale a pena para o seu trabalho?
Se você já usa o Cursor para programar, o Grok 4.5 é uma opção de zero atrito para testar hoje mesmo, sem custo adicional no plano atual. Para quem avalia por custo por tarefa resolvida (não só preço por token), o Grok 4.5 é uma das opções mais baratas do mercado em 2026, com desempenho competitivo, especialmente em uso agêntico e ferramentas de terminal.
Para trabalho que exige resolver bugs complexos em repositórios reais (SWE-Bench Pro), Claude Fable 5 ainda mantém vantagem clara — 15,7 pontos à frente.
Resumo em uma linha
Escolha o produto certo para o seu momento
Materiais práticos para quem quer usar o Claude de verdade.
Aponte a câmera do app do seu banco
Artigos relacionados: