SpaceXAI hat Grok 4.7 vorgestellt, ein größeres Modell für Programmierung, Wissensarbeit und komplexe Aufgaben, die mehrere Stunden dauern können. Die Veröffentlichung ist bedeutsam, weil Tests des Unternehmens und unabhängige Tests auf eine stärkere agentische Leistung hindeuten, die Ergebnisse jedoch je nach Laufzeitumgebung und Arbeitslast variieren.
Grok 4.7 erzielte bei CursorBench 4.0 46,3 % und lag damit vor GPT-5.6 Sol, aber hinter Fable 5.1.
SpaceXAI stellte Grok 4.7 mit einem größeren Basismodell als Grok 4.6 und einer längeren Phase des Reinforcement Learning vor. Die Entwickler erklärten, das Modell handhabe lange Kontexte besser, prüfe seine Ausgaben gründlicher und sei für den Einsatz in Grok Build optimiert.
Grok 4.7 ist über Cursor, Grok Build, die API und mehrere Plattformen von Drittanbietern verfügbar. Es kostet 2 US-Dollar pro 1 Million Eingabetokens und 6 US-Dollar pro 1 Million Ausgabetokens. Eine Fast-Version läuft doppelt so schnell und kostet doppelt so viel.
Benchmark-Leistung und Preisgestaltung
In den von SpaceXAI veröffentlichten Tests erzielte Grok 4.7 bei CursorBench 4.0 46,3 %, nach 40,4 % für Grok 4.6. GPT-5.6 Sol erreichte 41,7 %, während Fable 5.1 mit 51,8 % führte.
Bei DeepSWE v1.1 erzielte Grok 4.7 71 %, verglichen mit 72,7 % für GPT-5.6 Sol und 70 % für Fable 5.1. Bei terminalbasierten Aufgaben erreichte Grok 4.7 38 %, gegenüber 20,3 % für Grok 4.6, 37,3 % für GPT-5.6 Sol und 57,9 % für Fable 5.1.
Grok 4.7 erzielte bei EEBench, das Aufgaben aus der Elektrotechnik abdeckt, 64 % und übertraf damit beide Wettbewerber in der Tabelle von SpaceXAI. Bei HealthBench Professional lag es hinter ihnen.
SpaceXAI gab für GPT-5.6 Sol 4 US-Dollar pro 1 Million Eingabetokens und 20 US-Dollar pro 1 Million Ausgabetokens an, während Fable 5.1 jeweils 10 und 50 US-Dollar kostete. Der niedrigere Preis von Grok bedeutet nicht, dass das Modell bei jedem Benchmark führend ist, stärkt jedoch seine Position bei rechenintensiven Arbeitslasten.
Cybersicherheits-Schutzmechanismen
SpaceXAI erklärte, die Schutzmechanismen von Grok 4.7 vollständig überarbeitet zu haben. Im HackerBench-v0.3-Test des Unternehmens ließ das Modell 3,3 % der Prompts zu, die SpaceXAI als gefährliche Dual-Use-Szenarien einstuft. Die Entwickler erklärten zudem, das System solle legitime Arbeit von Sicherheitsexperten möglichst nicht blockieren.
Einige Partner erhielten Zugang zu Grok 4.7 für geschlossene Red-Team-Tests. SpaceXAI veröffentlichte diese Ergebnisse selbst, weshalb sie keine unabhängige Bewertung darstellen.
Unabhängige Bewertungen zeigen gemischte Ergebnisse
Artificial Analysis berichtete, dass Grok 4.7 in seinem Intelligence Index 46 Punkte erzielte, zwei Punkte mehr als Grok 4.6. Die Plattform stellte besonders bemerkenswerte Fortschritte bei langen agentischen Aufgaben fest. In ihrem Coding Agent Index erzielte die Kombination aus Grok 4.7 und Grok Build 56 Punkte, verglichen mit 47 Punkten für die vorherige Version.
Die Verbesserung ging mit einem höheren Ressourcenverbrauch einher. Im xhigh-Modus erzeugte Grok 4.7 pro Intelligence-Index-Aufgabe rund 81.000 Ausgabetokens, mehr als doppelt so viele wie die vorherige Version in einem vergleichbaren Modus. Artificial Analysis erklärte, die wichtigsten Fortschritte hätten sich auf agentische Arbeit konzentriert, während die Veränderungen in einigen anderen Tests geringfügig gewesen seien.
Vals AI berichtete über ein weniger günstiges Ergebnis. Grok 4.7 erzielte 54,2 % und belegte in dessen Testsuite Platz 24, nach 59,2 % und Platz 14 für Grok 4.6. Die größten Verbesserungen zeigten sich bei juristischen und medizinischen Aufgaben. Die Abweichung von den Ergebnissen von Artificial Analysis verdeutlicht, dass Bewertungen von der Methodik und den getesteten Szenarien abhängen können.
Das Cybersicherheitsunternehmen XBOW testete Grok 4.7 ebenfalls, nachdem es frühen Zugang erhalten hatte. In einer Standardumgebung blieb das Modell in mehreren Tests zur offensiven Sicherheit leicht hinter Grok 4.6 zurück und benötigte bisweilen mehr Iterationen, um das beabsichtigte Ergebnis zu erzielen.
Die Leistung verbesserte sich, als XBOW Grok Build einsetzte. In einer Testsuite stieg die Zahl der korrekt identifizierten Probleme bei Systemen in dieser Umgebung von 42 mit Grok 4.6 auf 68 mit Grok 4.7.
XBOW kam zu dem Schluss, dass das Unterscheidungsmerkmal von Grok 4.7 nicht seine Fähigkeit sei, grundlegend neue Aufgabenklassen zu lösen, sondern seine effizientere Leistung innerhalb geeigneter agentischer Infrastruktur. Das Unternehmen stufte seine Qualität bei offensiver Sicherheit weiterhin unter den stärksten von ihm getesteten Systemen ein.
Insgesamt deuten die frühen unabhängigen Bewertungen auf Fortschritte bei langfristiger agentischer Arbeit und Programmierung hin, zeigen jedoch auch, dass die Vorteile von Grok 4.7 nicht universell sind und von der Toolchain, dem Reasoning-Level und der Arbeitslast abhängen können.
Quelle: HODL Press
