A SpaceXAI apresentou o Grok 4.7, um modelo maior projetado para programação, trabalho de conhecimento e tarefas complexas que podem levar várias horas. O lançamento é relevante porque testes da empresa e independentes indicam desempenho agêntico mais forte, embora os resultados variem conforme o ambiente de execução e a carga de trabalho.
O Grok 4.7 obteve 46,3% no CursorBench 4.0, à frente do GPT-5.6 Sol, mas atrás do Fable 5.1.
A SpaceXAI apresentou o Grok 4.7 com um modelo-base maior do que o Grok 4.6 e uma etapa mais longa de aprendizado por reforço. Os desenvolvedores afirmaram que o modelo lida melhor com contextos longos, verifica suas respostas mais cuidadosamente e é otimizado para uso no Grok Build.
O Grok 4.7 está disponível por meio do Cursor, Grok Build, da API e de várias plataformas de terceiros. Custa US$ 2 por 1 milhão de tokens de entrada e US$ 6 por 1 milhão de tokens de saída. Uma versão Fast opera duas vezes mais rápido e custa o dobro.
Desempenho em benchmarks e preços
Nos testes publicados pela SpaceXAI, o Grok 4.7 obteve 46,3% no CursorBench 4.0, ante 40,4% para o Grok 4.6. O GPT-5.6 Sol marcou 41,7%, enquanto o Fable 5.1 liderou com 51,8%.
No DeepSWE v1.1, o Grok 4.7 obteve 71%, em comparação com 72,7% para o GPT-5.6 Sol e 70% para o Fable 5.1. Em tarefas baseadas em terminal, o Grok 4.7 registrou 38%, ante 20,3% para o Grok 4.6, 37,3% para o GPT-5.6 Sol e 57,9% para o Fable 5.1.
O Grok 4.7 obteve 64% no EEBench, que abrange tarefas de engenharia elétrica, superando ambos os concorrentes na tabela da SpaceXAI. Ficou atrás deles no HealthBench Professional.
A SpaceXAI listou o GPT-5.6 Sol a US$ 4 por 1 milhão de tokens de entrada e US$ 20 por 1 milhão de tokens de saída, enquanto o Fable 5.1 custava US$ 10 e US$ 50, respectivamente. O preço menor do Grok não se traduz em liderança em todos os benchmarks, mas reforça a posição do modelo em cargas de trabalho intensivas em computação.
Salvaguardas de cibersegurança
A SpaceXAI afirmou que reformulou completamente os mecanismos de proteção do Grok 4.7. No teste HackerBench v0.3 da empresa, o modelo permitiu 3,3% dos prompts que a SpaceXAI classifica como cenários perigosos de uso dual. Os desenvolvedores afirmaram que o sistema também busca evitar bloquear trabalhos legítimos de profissionais de segurança.
Alguns parceiros receberam acesso ao Grok 4.7 para testes fechados de red team. A própria SpaceXAI publicou esses resultados, o que significa que eles não constituem uma avaliação independente.
Avaliações independentes mostram resultados mistos
A Artificial Analysis informou que o Grok 4.7 obteve 46 pontos em seu Intelligence Index, dois pontos a mais do que o Grok 4.6. A plataforma identificou progresso particularmente relevante em tarefas agênticas de longa duração. Em seu Coding Agent Index, a combinação do Grok 4.7 com o Grok Build obteve 56 pontos, em comparação com 47 para a versão anterior.
A melhora veio acompanhada de maior uso de recursos. No modo xhigh, o Grok 4.7 gerou cerca de 81.000 tokens de saída por tarefa do Intelligence Index, mais do que o dobro da quantidade usada pela versão anterior em um modo comparável. A Artificial Analysis afirmou que os principais ganhos se concentraram no trabalho agêntico, enquanto as mudanças em alguns outros testes foram pequenas.
A Vals AI informou um resultado menos favorável. O Grok 4.7 obteve 54,2% e ficou em 24º lugar em sua suíte de testes, abaixo dos 59,2% e da 14ª colocação do Grok 4.6. As maiores melhorias apareceram em tarefas jurídicas e médicas. A diferença em relação às conclusões da Artificial Analysis ilustra como as avaliações podem depender da metodologia e dos cenários testados.
A empresa de cibersegurança XBOW também testou o Grok 4.7 após receber acesso antecipado. Em um ambiente padrão, o modelo teve desempenho ligeiramente inferior ao do Grok 4.6 em vários testes de segurança ofensiva e, às vezes, precisou de mais iterações para alcançar o resultado pretendido.
O desempenho melhorou quando a XBOW utilizou o Grok Build. Em uma suíte de testes, os sistemas executados nesse ambiente elevaram o número de problemas identificados corretamente de 42, com o Grok 4.6, para 68, com o Grok 4.7.
A XBOW concluiu que a característica distintiva do Grok 4.7 não era a capacidade de resolver classes fundamentalmente novas de tarefas, mas seu desempenho mais eficiente dentro de uma infraestrutura agêntica adequada. A empresa ainda classificou sua qualidade em segurança ofensiva abaixo dos sistemas mais fortes que havia testado.
No geral, as primeiras avaliações independentes indicam progresso em trabalho agêntico de longo prazo e programação, ao mesmo tempo que mostram que as vantagens do Grok 4.7 não são universais e podem depender da cadeia de ferramentas, do nível de raciocínio e da carga de trabalho.
Fonte: HODL Press
