SpaceXAI presenta Grok 4.7 para programación y tareas de varias horas

6 Min Read

SpaceXAI ha presentado Grok 4.7, un modelo de mayor tamaño diseñado para programación, trabajo de conocimiento y tareas complejas que pueden llevar varias horas.

El lanzamiento es relevante porque pruebas de la empresa e independientes indican un mejor rendimiento agéntico, aunque los resultados varían según el entorno de ejecución y la carga de trabajo. Grok 4.7 obtuvo un 46,3% en CursorBench 4.0, por delante de GPT-5.6 Sol pero por detrás de Fable 5.1.

SpaceXAI presentó Grok 4.7 con un modelo base de mayor tamaño que Grok 4.6 y una etapa más larga de aprendizaje por refuerzo. Los desarrolladores afirmaron que el modelo maneja mejor los contextos largos, verifica sus resultados con mayor exhaustividad y está optimizado para su uso en Grok Build.

Grok 4.7 está disponible a través de Cursor, Grok Build, la API y varias plataformas de terceros. Cuesta 2 dólares por 1 millón de tokens de entrada y 6 dólares por 1 millón de tokens de salida. Una versión Fast funciona al doble de velocidad y cuesta el doble.

Rendimiento en benchmarks y precios

En las pruebas publicadas por SpaceXAI, Grok 4.7 obtuvo un 46,3% en CursorBench 4.0, frente al 40,4% de Grok 4.6. GPT-5.6 Sol obtuvo un 41,7%, mientras que Fable 5.1 lideró con un 51,8%.

En DeepSWE v1.1, Grok 4.7 obtuvo un 71%, frente al 72,7% de GPT-5.6 Sol y el 70% de Fable 5.1. En tareas basadas en terminal, Grok 4.7 registró un 38%, frente al 20,3% de Grok 4.6, el 37,3% de GPT-5.6 Sol y el 57,9% de Fable 5.1.

Grok 4.7 obtuvo un 64% en EEBench, que cubre tareas de ingeniería eléctrica, superando a ambos competidores en la tabla de SpaceXAI. Quedó por detrás de ellos en HealthBench Professional.

SpaceXAI fijó el precio de GPT-5.6 Sol en 4 dólares por 1 millón de tokens de entrada y 20 dólares por 1 millón de tokens de salida, mientras que Fable 5.1 costaba 10 y 50 dólares, respectivamente. El menor precio de Grok no se traduce en liderazgo en todos los benchmarks, pero refuerza la posición del modelo en cargas de trabajo con uso intensivo de computación.

Salvaguardas de ciberseguridad

SpaceXAI afirmó que renovó por completo los mecanismos de protección de Grok 4.7. En la prueba HackerBench v0.3 de la empresa, el modelo permitió el 3,3% de los prompts que SpaceXAI clasifica como escenarios peligrosos de doble uso. Los desarrolladores afirmaron que el sistema también busca evitar bloquear el trabajo legítimo de profesionales de la seguridad.

Algunos socios recibieron acceso a Grok 4.7 para pruebas cerradas de red team. SpaceXAI publicó esos resultados por sí misma, lo que significa que no constituyen una evaluación independiente.

Las evaluaciones independientes muestran resultados dispares

Artificial Analysis informó que Grok 4.7 obtuvo 46 puntos en su Intelligence Index, dos puntos más que Grok 4.6. La plataforma identificó avances especialmente destacados en tareas agénticas de larga duración. En su Coding Agent Index, la combinación de Grok 4.7 y Grok Build obtuvo 56 puntos, frente a los 47 de la versión anterior.

La mejora vino acompañada de un mayor uso de recursos. En el modo xhigh, Grok 4.7 generó alrededor de 81.000 tokens de salida por tarea del Intelligence Index, más del doble de la cantidad utilizada por la versión anterior en un modo comparable. Artificial Analysis afirmó que las principales mejoras se concentraron en el trabajo agéntico, mientras que los cambios en algunas otras pruebas fueron menores.

Vals AI informó de un resultado menos favorable. Grok 4.7 obtuvo un 54,2% y ocupó el puesto 24 en su conjunto de pruebas, frente al 59,2% y el puesto 14 de Grok 4.6. Las mayores mejoras aparecieron en tareas jurídicas y médicas. La diferencia con las conclusiones de Artificial Analysis ilustra cómo las evaluaciones pueden depender de la metodología y de los escenarios analizados.

La empresa de ciberseguridad XBOW también probó Grok 4.7 después de recibir acceso anticipado. En un entorno estándar, el modelo rindió ligeramente por debajo de Grok 4.6 en varias pruebas de seguridad ofensiva y, en ocasiones, necesitó más iteraciones para lograr el resultado previsto.

El rendimiento mejoró cuando XBOW utilizó Grok Build. En un conjunto de pruebas, los sistemas ejecutados en ese entorno aumentaron el número de problemas correctamente identificados de 42 con Grok 4.6 a 68 con Grok 4.7.

XBOW concluyó que la característica distintiva de Grok 4.7 no era su capacidad para resolver clases fundamentalmente nuevas de tareas, sino su rendimiento más eficiente dentro de una infraestructura agéntica adecuada. La empresa siguió situando su calidad de seguridad ofensiva por debajo de los sistemas más sólidos que había probado.

En conjunto, las primeras evaluaciones independientes indican avances en trabajo agéntico de largo horizonte y programación, al tiempo que muestran que las ventajas de Grok 4.7 no son universales y pueden depender de la cadena de herramientas, el nivel de razonamiento y la carga de trabajo.

Fuente: HODL Press

SpaceXAI presenta Grok 4.7 para programación y tareas de varias horas

SpaceXAI presentó Grok 4.7, un modelo para programación y tareas complejas que obtuvo 46,3% en CursorBench 4.0, según pruebas publicadas por la empresa.

6 Min Read
CoinFerenceX y The Best Event lanzarán una cumbre conjunta Web3 en Singapur

CoinFerenceX y The Best Event celebrarán una cumbre conjunta de Web3 los días 5 y 6 de octubre de 2026 en Gardens by the Bay, Singapur, con más de 4.000…

4 Min Read
SlowMist advierte que DarkSword ataca monederos cripto de usuarios de iPhone

SlowMist advirtió que atacantes usan enlaces maliciosos abiertos en Safari para explotar DarkSword contra propietarios de billeteras de criptomonedas en iPhone; la adaptación a iOS 26.5 no ha sido confirmada…

3 Min Read
Cronos busca quemar 228M+ CRO; todo beneficio de productos, a recompras

La red Cronos vota dos propuestas, con cierre el 3 de octubre, para quemar 228 millones de CRO, destinar ingresos de productos a recompras y financiar recompensas de staking con…

4 Min Read
Analista acusa a Kalshi de inflar artificialmente los volúmenes de negociación

Beni acusó a Kalshi de inflar artificialmente el volumen de ETH-PERP, mientras la empresa rechazó la interpretación y los documentos citados no prueban operaciones de lavado.

6 Min Read