SpaceXAI推出Grok 4.7,用于编程和多小时任务

阅读约 16 分钟

SpaceXAI发布了 Grok 4.7,这是一款更大型的模型,面向编程、知识工作以及可能耗时数小时的复杂任务。此次发布之所以重要,是因为公司测试和独立测试均显示其 AI智能体性能有所增强,不过结果会因运行环境和工作负载而异。

Grok 4.7 在 CursorBench 4.0 上取得 46.3%的得分,领先 GPT-5.6 Sol,但落后于 Fable 5.1。

SpaceXAI 发布的 Grok 4.7 采用了比 Grok 4.6 更大的基础模型,并经历了更长的强化学习阶段。开发者称,该模型能更好地处理长上下文、更全面地检查输出结果,并针对在 Grok Build 中使用进行了优化。

Grok 4.7 可通过 Cursor、Grok Build、API 以及多个第三方平台使用。其价格为每 100 万输入 token 2 美元、每 100 万输出 token 6 美元。Fast 版本的运行速度是其两倍,价格也为两倍。

基准测试表现与定价

SpaceXAI 公布的测试中,Grok 4.7 在 CursorBench 4.0 上得分为 46.3%,高于 Grok 4.6 的 40.4%。GPT-5.6 Sol 得分为 41.7%,Fable 5.1 则以 51.8%领先。

在 DeepSWE v1.1 上,Grok 4.7 得分为 71%,GPT-5.6 Sol 为 72.7%,Fable 5.1 为 70%。在基于终端的任务中,Grok 4.7 得分为 38%,而 Grok 4.6 为 20.3%,GPT-5.6 Sol 为 37.3%,Fable 5.1 为 57.9%。

Grok 4.7 在涵盖电气工程任务的 EEBench 上得分为 64%,在 SpaceXAI 的表格中超过两款竞争模型。但在 HealthBench Professional 上,其得分落后于这两款模型。

SpaceXAI 列出的 GPT-5.6 Sol 价格为每 100 万输入 token 4 美元、每 100 万输出 token 20 美元;Fable 5.1 的价格则分别为 10 美元和 50 美元。Grok 较低的价格并不意味着它在每项基准测试中都处于领先地位,但这增强了其在计算密集型工作负载中的竞争力。

网络安全防护措施

SpaceXAI 表示,其已全面改造 Grok 4.7 的保护机制。在该公司的 HackerBench v0.3 测试中,模型允许通过的提示词中,有 3.3%被 SpaceXAI 归类为危险的双重用途场景。开发者称,该系统也力求避免阻断安全专业人员的合法工作。

部分合作伙伴获得了 Grok 4.7 的访问权限,以进行封闭式红队测试。SpaceXAI 自行公布了这些结果,因此它们不构成独立评估。

独立评估结果不一

Artificial Analysis 报告称,Grok 4.7 在其 Intelligence Index 中获得 46 分,比 Grok 4.6 高 2 分。该平台指出,其在长程 AI智能体任务上的进步尤其显著。在其 Coding Agent Index 中,Grok 4.7 与 Grok Build 的组合获得 56 分,而上一版本为 47 分。

这种提升伴随着更高的资源使用量。在 xhigh 模式下,Grok 4.7 每项 Intelligence Index 任务生成约 8.1 万个输出 token,超过上一版本在可比模式下用量的两倍。Artificial Analysis 表示,主要提升集中在 AI智能体工作上,而在其他一些测试中的变化较小。

Vals AI 报告了较不利的结果。Grok 4.7 在其测试套件中获得 54.2%,排名第 24 位,低于 Grok 4.6 的 59.2%得分和第 14 位排名。最大的改进出现在法律和医疗任务中。与 Artificial Analysis 的结果存在差异,说明评估结果可能取决于方法论及所测试的场景。

网络安全公司 XBOW 也在获得提前访问权限后测试了 Grok 4.7。在标准环境中,该模型在多项进攻性安全测试中的表现略逊于 Grok 4.6,并且有时需要更多次迭代才能实现预期结果。

当 XBOW 使用 Grok Build 时,性能有所提升。在一套测试中,在该环境中运行的系统将正确识别的问题数量从使用 Grok 4.6 时的 42 个提高至使用 Grok 4.7 时的 68 个。

XBOW 的结论是,Grok 4.7 的区别性特征并非能够解决从根本上属于新类别的任务,而是在合适的 AI智能体基础设施中表现得更高效。该公司仍将其进攻性安全质量排在其测试过的最强系统之下。

总体而言,早期独立评估显示,Grok 4.7 在长程 AI智能体工作和编程方面有所进步,同时也表明其优势并不具有普遍性,且可能取决于工具链、推理等级和工作负载。

来源:HODL Press

CoinFerenceX与The Best Event将在新加坡联合推出Web3峰会

CoinFerenceX与The Best Event定于2…

阅读约 10 分钟
慢雾警告DarkSword攻击瞄准iPhone用户加密钱包

SlowMist称,DarkSword攻击诱导iPhone加…

阅读约 6 分钟
Cronos寻求销毁超2.28亿枚CRO,产品利润全用于回购

Cronos正就两项CRO提案投票,拟销毁2.28亿枚CRO…

阅读约 7 分钟
比特币在Coinbase负溢价下升至8.5万美元

CryptoQuant称,比特币升破8万美元及1年均线,复苏…

阅读约 8 分钟
以太坊上涨;币安提币创三年新高,钱包数创纪录达2.07亿

据Santiment称,以太坊9月18日升破2630美元,非…

阅读约 7 分钟