SpaceXAI发布了 Grok 4.7,这是一款更大型的模型,面向编程、知识工作以及可能耗时数小时的复杂任务。此次发布之所以重要,是因为公司测试和独立测试均显示其 AI智能体性能有所增强,不过结果会因运行环境和工作负载而异。
Grok 4.7 在 CursorBench 4.0 上取得 46.3%的得分,领先 GPT-5.6 Sol,但落后于 Fable 5.1。
SpaceXAI 发布的 Grok 4.7 采用了比 Grok 4.6 更大的基础模型,并经历了更长的强化学习阶段。开发者称,该模型能更好地处理长上下文、更全面地检查输出结果,并针对在 Grok Build 中使用进行了优化。
Grok 4.7 可通过 Cursor、Grok Build、API 以及多个第三方平台使用。其价格为每 100 万输入 token 2 美元、每 100 万输出 token 6 美元。Fast 版本的运行速度是其两倍,价格也为两倍。
基准测试表现与定价
在 SpaceXAI 公布的测试中,Grok 4.7 在 CursorBench 4.0 上得分为 46.3%,高于 Grok 4.6 的 40.4%。GPT-5.6 Sol 得分为 41.7%,Fable 5.1 则以 51.8%领先。
在 DeepSWE v1.1 上,Grok 4.7 得分为 71%,GPT-5.6 Sol 为 72.7%,Fable 5.1 为 70%。在基于终端的任务中,Grok 4.7 得分为 38%,而 Grok 4.6 为 20.3%,GPT-5.6 Sol 为 37.3%,Fable 5.1 为 57.9%。
Grok 4.7 在涵盖电气工程任务的 EEBench 上得分为 64%,在 SpaceXAI 的表格中超过两款竞争模型。但在 HealthBench Professional 上,其得分落后于这两款模型。
SpaceXAI 列出的 GPT-5.6 Sol 价格为每 100 万输入 token 4 美元、每 100 万输出 token 20 美元;Fable 5.1 的价格则分别为 10 美元和 50 美元。Grok 较低的价格并不意味着它在每项基准测试中都处于领先地位,但这增强了其在计算密集型工作负载中的竞争力。
网络安全防护措施
SpaceXAI 表示,其已全面改造 Grok 4.7 的保护机制。在该公司的 HackerBench v0.3 测试中,模型允许通过的提示词中,有 3.3%被 SpaceXAI 归类为危险的双重用途场景。开发者称,该系统也力求避免阻断安全专业人员的合法工作。
部分合作伙伴获得了 Grok 4.7 的访问权限,以进行封闭式红队测试。SpaceXAI 自行公布了这些结果,因此它们不构成独立评估。
独立评估结果不一
Artificial Analysis 报告称,Grok 4.7 在其 Intelligence Index 中获得 46 分,比 Grok 4.6 高 2 分。该平台指出,其在长程 AI智能体任务上的进步尤其显著。在其 Coding Agent Index 中,Grok 4.7 与 Grok Build 的组合获得 56 分,而上一版本为 47 分。
这种提升伴随着更高的资源使用量。在 xhigh 模式下,Grok 4.7 每项 Intelligence Index 任务生成约 8.1 万个输出 token,超过上一版本在可比模式下用量的两倍。Artificial Analysis 表示,主要提升集中在 AI智能体工作上,而在其他一些测试中的变化较小。
Vals AI 报告了较不利的结果。Grok 4.7 在其测试套件中获得 54.2%,排名第 24 位,低于 Grok 4.6 的 59.2%得分和第 14 位排名。最大的改进出现在法律和医疗任务中。与 Artificial Analysis 的结果存在差异,说明评估结果可能取决于方法论及所测试的场景。
网络安全公司 XBOW 也在获得提前访问权限后测试了 Grok 4.7。在标准环境中,该模型在多项进攻性安全测试中的表现略逊于 Grok 4.6,并且有时需要更多次迭代才能实现预期结果。
当 XBOW 使用 Grok Build 时,性能有所提升。在一套测试中,在该环境中运行的系统将正确识别的问题数量从使用 Grok 4.6 时的 42 个提高至使用 Grok 4.7 时的 68 个。
XBOW 的结论是,Grok 4.7 的区别性特征并非能够解决从根本上属于新类别的任务,而是在合适的 AI智能体基础设施中表现得更高效。该公司仍将其进攻性安全质量排在其测试过的最强系统之下。
总体而言,早期独立评估显示,Grok 4.7 在长程 AI智能体工作和编程方面有所进步,同时也表明其优势并不具有普遍性,且可能取决于工具链、推理等级和工作负载。
来源:HODL Press
