noticias

SpaceXAI Lança Grok 4.6: Modelo para Agentes de Longa Duração Empata com GPT-5.6 Sol e Chega ao Cursor por US$ 2 por Milhão de Tokens

SpaceXAI lança o Grok 4.6, modelo para agentes e codificação de longa duração que empata com o GPT-5.6 Sol e já roda no Cursor.

Por Redação Turbina IA17 de agosto de 20269 min de leitura
SpaceXAI Lança Grok 4.6: Modelo para Agentes de Longa Duração Empata com GPT-5.6 Sol e Chega ao Cursor por US$ 2 por Milhão de Tokens

Em 12 de agosto, a SpaceXAI — nome que a xAI adotou após a fusão com a empresa de foguetes de Elon Musk — colocou o Grok 4.6 no ar com um número específico em destaque: 500 mil tokens de contexto, suficientes para o modelo acompanhar uma tarefa de programação ou pesquisa por horas sem perder o fio da meada. Não é um modelo maior. É um ajuste fino sobre o Grok 4.5, e a aposta da empresa é que isso baste para encostar no topo da corrida agêntica.

Resposta Rápida (TL;DR): O Grok 4.6 é o novo modelo de topo da SpaceXAI, lançado em 12 de agosto de 2026 para tarefas agênticas de longa duração e codificação. Ele empata com o GPT-5.6 Sol no Artificial Analysis Intelligence Index (61 pontos), fica atrás do Fable 5 Max da Anthropic (62) e já está disponível no Cursor, no Grok Build e via API a US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de saída.

O que a SpaceXAI mudou em relação ao Grok 4.5

Diferente dos saltos anteriores da família Grok, o 4.6 não nasceu de um modelo-base maior. Segundo a SpaceXAI, a equipe investiu em uma etapa suplementar de treinamento mais longa, regerou as trajetórias de fine-tuning supervisionado e aplicou reforço por reinforcement learning em ambientes agênticos — ou seja, o modelo praticou tarefas de várias etapas repetidamente antes do lançamento, em vez de simplesmente crescer em parâmetros.

O resultado prático, de acordo com a cobertura do MarkTechPost, é um modelo pensado para trabalho de conhecimento estendido: programação assistida por agente, pesquisa em várias etapas e tarefas visuais mais ambiciosas. O Grok 4.6 também ganhou um nível de esforço de raciocínio inédito, batizado de "xhigh", acima da escada que o Grok 4.5 já oferecia — um botão a mais para quem quer trocar velocidade por profundidade de raciocínio em problemas difíceis.

A disponibilidade já é ampla: o modelo está integrado ao Cursor, um dos editores de código com IA mais usados por desenvolvedores, além do Grok Build (ferramenta própria da SpaceXAI) e da API pública. O preço de lançamento é US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de saída — para quem quer estimar o custo real de uma sessão longa de codificação com agente, a Calculadora de Custos do Turbina IA converte esses valores para o consumo esperado em reais.

Imagem ilustrativa sobre SpaceXAI Lança Grok 4.6: Modelo para Agentes de Longa Duração Empata com GPT-5.6 Sol e Chega ao Cursor por US$

Como o Grok 4.6 se compara a GPT-5.6 Sol, Fable 5 e Kimi K3

O número que a SpaceXAI mais repetiu no anúncio foi o do Artificial Analysis Intelligence Index, um composto de nove benchmarks que virou referência informal para comparar modelos de fronteira. Ali, o Grok 4.6 cravou 61 pontos — exatamente o mesmo score do GPT-5.6 Sol, da OpenAI. Segundo a reportagem da VentureBeat, esse empate coloca o modelo como o terceiro melhor do mundo no índice, superando o chinês Kimi K3 e ficando atrás apenas do Fable 5 Max, da Anthropic, que soma 62 pontos.

Modelo Score no Artificial Analysis Intelligence Index
Fable 5 Max (Anthropic) 62
Grok 4.6 (SpaceXAI) 61
GPT-5.6 Sol (OpenAI) 61
Grok 4.5 High (SpaceXAI) 56

A diferença de cinco pontos entre o Grok 4.5 High e o 4.6 é o que a empresa está vendendo como prova de que o ajuste fino agêntico funcionou sem precisar de um modelo-base maior — e, por tabela, mais caro de rodar.

Nos benchmarks de código, o quadro é misto

É aqui que o marketing encontra a realidade. No DeepSWE v1.1, benchmark de engenharia de software que simula tarefas reais de correção e implementação em repositórios, o Grok 4.6 pontuou 65,9% — um salto considerável frente aos 54% do Grok 4.5, mas ainda atrás dos 73% do GPT-5.6 Sol Max, segundo os números publicados pelo MarkTechPost. Ou seja: o modelo da OpenAI continua na frente quando o teste é resolver bugs de verdade em bases de código complexas.

Por outro lado, o Grok 4.6 liderou o GDPVal-AA v2, avaliação voltada a trabalho de conhecimento (redação de relatórios, análise, tarefas administrativas complexas), com 1.753 pontos — a melhor marca entre os modelos testados nessa categoria. Também registrou ganhos no CursorBench e no FrontierCode, dois benchmarks mais recentes e menos padronizados que medem desempenho dentro de fluxos de trabalho de codificação assistida, segundo o TestingCatalog.

Na prática, isso sugere um modelo mais equilibrado do que especializado: bom o bastante em código para competir, mas não o líder isolado; forte o suficiente em tarefas de conhecimento geral para se destacar. Para quem acompanha o Monitor de Modelos do Turbina IA, esse tipo de perfil "quase líder em tudo, líder em pouco" tem se repetido a cada nova rodada de lançamentos das grandes labs — a corrida está mais apertada do que qualquer anúncio isolado sugere.

Imagem ilustrativa sobre SpaceXAI Lança Grok 4.6: Modelo para Agentes de Longa Duração Empata com GPT-5.6 Sol e Chega ao Cursor por US$

O peso do nome SpaceXAI na disputa

O rebatismo de xAI para SpaceXAI não é só cosmético. A fusão entre a startup de IA de Elon Musk e a fabricante de foguetes consolidou caixa, infraestrutura de dados e — argumento que Musk já vinha repetindo publicamente — a promessa de treinar modelos com capacidade computacional em escala orbital no longo prazo. Quando a empresa lançou o Grok 4.5, em julho, o próprio Musk classificou o modelo como "de classe Opus", numa comparação direta com a linha topo da Anthropic, segundo reportagem do TechCrunch na época. O Grok 4.6 chega um mês depois como a resposta rápida da empresa à pressão competitiva: em vez de esperar o próximo ciclo de treinamento de um modelo-base maior, a SpaceXAI preferiu extrair mais desempenho do que já tinha rodando.

Essa velocidade de iteração — quatro versões numeradas do Grok em pouco mais de um ano, contando 4.3, 4.5 e agora 4.6 — também é uma resposta ao ritmo chinês. O Kimi K3, da Moonshot AI, vinha ganhando espaço justamente por entregar desempenho competitivo a um custo de treinamento menor, pressionando as três grandes labs americanas a mostrar que conseguem evoluir sem esperar o ciclo completo de uma nova arquitetura.

O que isso muda para quem programa no Brasil

Para desenvolvedores e times de produto no Brasil, a notícia relevante não é o placar do benchmark — é a opção a mais na hora de escolher qual modelo alimenta o agente de codificação do dia a dia. Com o dólar pesando no orçamento de qualquer time que paga API em dólar, um modelo que empata em qualidade com o GPT-5.6 Sol mas custa US$ 2 de entrada e US$ 6 de saída por milhão de tokens — valores próximos aos praticados pelos concorrentes diretos — amplia o leque de opções sem necessariamente encarecer a conta no fim do mês.

Na prática, quem já usa Cursor não precisa migrar de ferramenta para experimentar o Grok 4.6: basta trocar o modelo selecionado dentro do próprio editor. É um teste de baixo risco, o tipo de decisão que vale simular antes de aplicar num fluxo de trabalho em produção, comparando custo por tarefa e não só o preço nominal por token.

Por que a SpaceXAI apostou em duração em vez de tamanho

O nome do lançamento já entrega a estratégia: "long-running agents". Modelos de fronteira vinham sendo vendidos por parâmetros e por pontuação em benchmarks estáticos, mas o mercado de ferramentas de codificação — Cursor, Devin, GitHub Copilot — mudou o critério que importa: quanto tempo um agente consegue trabalhar sozinho, em várias etapas, sem se perder ou repetir erros.

Uma janela de 500 mil tokens ajuda porque permite manter mais contexto de um repositório inteiro, um histórico de conversa longo ou uma cadeia de ferramentas chamadas em sequência — mas só é útil se o modelo também sustentar coerência ao longo desse período, o que é exatamente o que o treinamento de reforço em ambientes agênticos tenta resolver. É a mesma lógica por trás do salto do GDPVal-AA v2: tarefas de conhecimento mais longas recompensam consistência, não só picos de inteligência.

Para desenvolvedores que já usam Cursor no dia a dia, a chegada do Grok 4.6 como opção de modelo dentro do editor significa mais uma alternativa de custo-benefício a testar lado a lado com GPT-5.6 Sol e Fable 5 — vale comparar diretamente no Comparador de IAs antes de trocar o modelo padrão de um fluxo de trabalho em produção.

Perguntas Frequentes

O que é o Grok 4.6 e quando foi lançado?

O Grok 4.6 é o novo modelo de topo da SpaceXAI (antiga xAI), lançado em 12 de agosto de 2026. Ele é uma versão de pós-treinamento sobre o Grok 4.5, otimizada para agentes de longa duração, codificação e tarefas de conhecimento, com janela de contexto de 500 mil tokens.

O Grok 4.6 é melhor que o GPT-5.6 Sol?

Depende da tarefa. No índice geral de inteligência da Artificial Analysis, os dois empatam com 61 pontos. Em benchmarks específicos de codificação, como o DeepSWE v1.1, o GPT-5.6 Sol Max ainda lidera (73% contra 65,9% do Grok 4.6). Já em avaliações de trabalho de conhecimento, como o GDPVal-AA v2, o Grok 4.6 fica à frente.

Onde já é possível usar o Grok 4.6?

O modelo está disponível no editor de código Cursor, na ferramenta própria da SpaceXAI chamada Grok Build e via API, a partir de US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de saída.

Fontes e Referências

Editor responsávelRafael Menezes

Editor do Turbina IA. Acompanha diariamente os lançamentos de modelos, ferramentas e tendências de Inteligência Artificial para explicar o tema de forma acessível em português. O conteúdo é produzido pela redação com auxílio de IA e curadoria editorial, sempre apoiado em fontes oficiais. Conheça a redação.

Leia Também Recomendados